🎉 新版站点已上线 — 新用户请在 v2.cloudmist.cloud 注册使用,本站教程均以新站地址为准 · 老用户账号已迁移完成,用原用户名/邮箱 + 原密码可直接登录 新站(登不上请在用户名后加 _82350),原站余额可继续在 api.cloudmist.cloud 用完,新站需重建令牌并改用新站 base_url
首页 › 模型库 › gemini-2.5-flash-lite

gemini-2.5-flash-lite API 国内调用与价格(2026)

云雾API 运营团队 · 数据来自站内实时价目 · 更新于 2026-08-25
模型类型对话 · 识图
计费方式按量(tokens)
官方基准(输入)$0.10/1M
本站最低参考(输入)$0.0076/1M
相当于官方约 0.8 折
可选渠道档位12 档
站内累计调用2697 万 次

参考价按当前渠道倍率折算、含服务费,实际以定价页实时显示为准;不同档位的渠道来源与稳定性不同,高稳定需求建议选官转档位(逆向与官转的区别)。数据更新于 2026-08-25。

2697 万次——这是 gemini-2.5-flash-lite 在云雾API 的累计调用量,全站第一,把一众旗舰模型甩在身后。一个名字里带 lite 的模型跑成流量冠军,说明了一件事:生产环境里大部分 AI 调用,要的不是最聪明的模型,而是够用、够快、单价足够低的模型。

flash-lite 是 Google 2025年6月为 Gemini 2.5 系列补上的最后一块拼图:全系里单价最低、延迟最低的档位。它砍掉的是深度推理能力,保住的都是关键项——识图能力还在,超长上下文还在,思考模式默认关闭但可以按需开启。换句话说,它不是残血版,而是把"跑量任务用不到的部分"精准切掉的量产版。

站内为它开放 gemini 与 openai 双端点、12 个渠道档位,多档渠道可选,详见下方价格表。调用量大的用户尤其值得把各档位差价算清楚,量到千万级,月账单能差出一大截。

上下文窗口1,000,000 tokens
知识截止2025年1月

价格详情

价目输入 /1M tokens输出 /1M tokens相当于官方
官方基准价$0.10$0.40—
本站最低参考价$0.0076$0.0304约 0.8 折

该模型支持提示词缓存,缓存命中部分按输入价约 10% 计费,长系统提示词场景可显著降本。

同系列模型价格对比

模型本站最低参考(输入)相当于官方
gemini-2.5-pro$0.0951/1M约 0.8 折
gemini-2.5-flash$0.0228/1M约 0.8 折
gemini-3-flash-preview$0.0381/1M约 0.8 折
gemini-3.1-pro-preview$0.152/1M约 0.8 折
gemini-3.5-flash$0.114/1M约 0.8 折
gemini-3.7-flash$0.0571/1M约 0.8 折
gemini-3.1-flash-image-preview$0.0118/次约 0.7 折
veo3.1$0.592/次约 8.5 折

适用场景

它的主场,是所有"单次调用很便宜、但一天要调几十万次"的场景:

接入代码(OpenAI 兼容)

任何 OpenAI SDK 只改 base_url 一行即可切换到中转接口,模型名填 gemini-2.5-flash-lite:

from openai import OpenAI

client = OpenAI(
    api_key="sk-你的令牌",
    base_url="https://v2.cloudmist.cloud/v1"
)
resp = client.chat.completions.create(
    model="gemini-2.5-flash-lite",
    messages=[{"role": "user", "content": "你好"}]
)
print(resp.choices[0].message.content)

curl、Node.js 及更多客户端写法见 base_url 配置详解。

选型与接入建议

选型的核心问题只有一个:你的任务是"判断题"还是"论述题"。判断题(分类、抽取、翻译、格式转换)用 flash-lite,质量差距小、成本差距大;论述题(理解、推理、创作)从 gemini-2.5-flash 起步,硬骨头再上 gemini-2.5-pro。一个实用的落地路径:先全量跑 lite,把人工抽检出的 badcase 类型整理出来,只把这部分流量切给 flash——很多团队最后发现,八成流量留在 lite 上完全没问题。

至于 Gemini 3 系的几个速度档(gemini-3-flash-preview、gemini-3.5-flash、gemini-3.7-flash),它们是更新一代的 flash,能力更强但定位不同:3 系目前还没有出现对标 lite 的极低价档,"量大管饱"这个生态位上,flash-lite 暂时没有替代者。

接入:OpenAI 兼容 SDK 的 base_url 填 https://v2.cloudmist.cloud/v1,模型名 gemini-2.5-flash-lite;Cursor、NextChat、沉浸式翻译等客户端均可接入。高并发场景做好重试与退避,零散请求尽量批次化合并,进一步摊薄成本。

常见问题

国内如何调用 gemini-2.5-flash-lite?

在本站注册并创建 API Key,OpenAI 兼容 SDK 把 base_url 改为 https://v2.cloudmist.cloud/v1(Claude Code 填 https://v2.cloudmist.cloud,不带 /v1),模型名填 gemini-2.5-flash-lite 即可,国内网络直连,支持支付宝/微信人民币充值。

gemini-2.5-flash-lite 通过中转站调用什么价格?

本站参考价输入 $0.0076/1M tokens、输出 $0.0304/1M tokens 起(约 0.8 折),提供 12 个渠道档位,价格与稳定性各有侧重,实际以站内定价页实时显示为准。

调用量全站第一,是不是代表它质量最好?

不是,代表它的成本结构最适合跑量。全站第一反映的事实是:分类、翻译、抽取这类高频简单任务占了生产调用的大头,而这类任务用 lite 和用旗舰,结果差异很小、账单差异很大。质量维度上它确实是 2.5 系列的末档,别拿它写深度分析报告。

flash-lite 也能开思考模式?

能。它默认关闭思考,但支持通过 thinkingBudget 按需开启,给一点预算就能在难样本上做浅层推理。实践中建议只对路由到"疑难"分支的请求开思考——全量开启会吃掉 lite 的价格优势,那种情况不如直接换 gemini-2.5-flash。

哪些任务坚决不该交给 lite?

三类:需要多步推理的,如数学、代码调试、方案分析;对文字质量有要求的创作类,如文案、长文写作;识图里的细节判断类,如读复杂报表、审工程图。这三类任务上 lite 的错误率会明显上升,省下的 token 钱不够付返工成本。

在沉浸式翻译里配它有什么要点?

沉浸式翻译支持自定义 OpenAI 兼容接口:把接口地址指向 https://v2.cloudmist.cloud/v1,填入云雾API 密钥,模型名写 gemini-2.5-flash-lite 即可。整页翻译的请求量非常大,lite 的单价和响应速度在这个场景里优势最直接,适当调低并发数可以避免触发限流。

注册即送免费测试额度

一个 API Key 调用 Claude、GPT、Gemini、DeepSeek 等 200+ 大模型,国内直连、人民币充值。

立即注册,领测试额度 →
相关内容
本站为云雾API 注册、登录与充值入口站点 · 模型与价格以控制台实时数据为准 · 更新于 2026-08-25
Claude、GPT、Gemini 等名称为各自权利人商标,本站为独立第三方 API 中转/聚合服务,与上述厂商无隶属或授权关系。