text-embedding-3-large API 国内调用与价格(2026)
参考价按当前渠道倍率折算、含服务费,实际以定价页实时显示为准;不同档位的渠道来源与稳定性不同,高稳定需求建议选官转档位(逆向与官转的区别)。数据更新于 2026-08-25。
做 RAG,第一步不是选对话模型,而是选嵌入模型——检索质量的上限在这里就定了。text-embedding-3-large 是 OpenAI 当前最强的文本嵌入模型,输出 3072 维向量,是 RAG 知识库与语义检索的默认选择。站内累计调用已超 150 万次、共 12 个渠道档位,是嵌入类模型的绝对主力。
一个常被忽略的特性:API 支持 dimensions 参数,可把 3072 维降到 1024 甚至 256 维,在存储成本与检索精度间自行取舍,降维后精度衰减平缓。
| 上下文窗口 | 8191 tokens(单条输入上限) |
|---|
价格详情
| 价目 | 每 1M tokens | 相当于官方 |
|---|---|---|
| 官方基准价 | $0.13 | — |
| 本站最低参考价 | $0.0066 | 约 0.5 折 |
同系列模型价格对比
| 模型 | 本站最低参考(输入) | 相当于官方 |
|---|---|---|
| gpt-4o | $0.296/1M | 约 1.2 折 |
| gpt-4o-mini | $0.0178/1M | 约 1.2 折 |
| gpt-4.1 | $0.237/1M | 约 1.2 折 |
| gpt-4.1-mini | $0.0474/1M | 约 1.2 折 |
| gpt-5 | $0.0529/1M | 约 0.4 折 |
| gpt-5-mini | $0.0106/1M | 约 0.4 折 |
| gpt-5-nano | $0.0025/1M | 约 0.5 折 |
| gpt-5.1 | $0.0529/1M | 约 0.4 折 |
适用场景
- RAG 知识库:文档切块后向量化入库,检索召回配合 gpt-5.1 或 Claude 系模型生成答案;
- 语义搜索:替代关键词匹配,召回"问法不同、意思相同"的内容;
- 文本聚类与去重:工单归类、相似内容合并;
- 推荐与匹配:简历-职位、商品-查询等语义匹配。
接入代码
from openai import OpenAI
client = OpenAI(
api_key="sk-你的令牌",
base_url="https://v2.cloudmist.cloud/v1"
)
emb = client.embeddings.create(model="text-embedding-3-large", input="要向量化的文本")
print(len(emb.data[0].embedding))选型与接入建议
与 text-embedding-3-small 怎么选:small 维度更低、单价更低,千万级以上文档的海量索引可优先考虑;large 精度更高,中英混合或法律医疗代码等专业语料建议直接用 large。另注意嵌入模型不能混用:不同模型(乃至不同降维配置)的向量不在同一空间,换模型必须整库重建索引,选型时一次定好。接入用 OpenAI SDK 的 embeddings 接口,base_url 填 https://v2.cloudmist.cloud/v1,LangChain、LlamaIndex 原生支持;多档渠道可选,详见下方价格表。
常见问题
国内如何调用 text-embedding-3-large?
在本站注册并创建 API Key,OpenAI 兼容 SDK 把 base_url 改为 https://v2.cloudmist.cloud/v1(Claude Code 填 https://v2.cloudmist.cloud,不带 /v1),模型名填 text-embedding-3-large 即可,国内网络直连,支持支付宝/微信人民币充值。
text-embedding-3-large 通过中转站调用什么价格?
本站参考价输入 $0.0066/1M tokens、输出 $0.0066/1M tokens 起(约 0.5 折),提供 12 个渠道档位,价格与稳定性各有侧重,实际以站内定价页实时显示为准。
3072 维给向量库的压力太大,能降维吗?
能。调用时传 dimensions 参数即可直接输出低维向量,例如 1024 或 256 维,该模型训练时就为截断做了优化,降维后精度衰减平缓。多数业务降到 1024 维几乎无感,向量库的存储与检索开销能降一大截。
什么情况该用 text-embedding-3-small 而不是 large?
预算敏感、语料以通用中英文为主、量级在千万条以上时,small 性价比更突出;检索精度要求高、语料专业性强(法律、医疗、代码)或多语言混杂时,建议直接上 large,避免召回质量拖累整条 RAG 链路。
项目中途换嵌入模型的代价是什么?
全量重建:旧向量与新模型的向量空间不兼容,所有历史文档要重新嵌入并重建索引,且入库端与查询端必须始终用同一模型、同一维度配置。所以嵌入模型建议在项目早期锁定,后续轻易不动。
单条文本有长度限制吗,长文档怎么处理?
单条输入上限 8191 token,超长文档需先切块再嵌入。切块大小建议在 256-1024 token 之间按检索粒度调整,块间保留约 10% 的重叠,有助于跨段落语义的召回。