Gemini 3.7 Flash API 接入指南:$0.75 的价格,和 minimal 档被删掉的坑
Gemini 3.7 Flash 在 2026-08-13 上线,输入 $0.75、输出 $3.75(每百万 token)。 这个价有两个附加条件:它写死到 2026-12-31,之后翻倍;而且 Gemini 3.6 Flash 现在挂着一模一样的价。
真正会让迁移代码挂掉的是另一件事。thinking 档位从四个变成三个,minimal 被拿掉了,官方规格页在那一行下面加了一句 Note: minimal is not supported and returns an error.
最后更新 2026-08-21。$0.75 / $3.75 是限时价,2026-12-31 之后翻倍,跨年做预算前请重新核一遍。
Gemini 3.7 Flash 的 API 多少钱?
Google 定价页把两个日期塞进了同一个格子里,所以照抄单价很容易抄到错的那一行。
| 档位 | 输入 / 百万 token | 输出 / 百万 token | 生效期 |
|---|---|---|---|
| Standard | $0.75 | $3.75 | 至 2026-12-31 |
| Standard | $1.50 | $7.50 | 2027-01-01 起 |
| Batch / Flex | $0.375 | $1.875 | 至 2026-12-31 |
| Batch / Flex | $0.75 | $3.75 | 2027-01-01 起 |
缓存读取 $0.075,缓存存储 $0.50 每百万 token 每小时(2027 年起翻倍为 $0.15 和 $1.00)。输出价里已经含了思考 token,官方原话是 response pricing is the sum of output tokens and thinking tokens——也就是说你为 thinking_level: high 多消耗的那部分推理,是按输出价结账的。
发布当天 Google for Developers 的说法是「3.6 Flash 每百万 token 原价的一半」。这句话本身没错,但那个「原价」是 3.6 Flash 在 2026-07-21 上线时的 $1.50 / $7.50,而在 3.7 发布的同一天,3.6 Flash 也降到了 $0.75 / $3.75。现在官方定价页上两个模型的每一格逐字相同。换代这件事本身既不加钱也不省钱,省的是限时。
Gemini 3.7 Flash 的 ofox 模型页上还有几项官方定价页不单列的费率:音频输入 $0.75、缓存写入 $0.0415、一小时期限的缓存写入 $0.50、联网搜索 $0.014 每次请求。
Gemini 3.7 Flash 怎么接入?
两条路,代码差别只在 base URL 和模型名。 除直接调用 Google AI Studio 提供的原生端点外,也可通过 ofox.io 或 OpenRouter 等聚合网关以兼容 OpenAI 格式的请求访问 Gemini 3.7 Flash,适合已有 OpenAI SDK 集成的项目快速切换。
走 ofox 的 OpenAI 兼容端点:
from openai import OpenAI
client = OpenAI(
api_key="sk-...",
base_url="https://api.ofox.io/v1",
)
r = client.chat.completions.create(
model="google/gemini-3.7-flash",
reasoning_effort="low",
messages=[{"role": "user", "content": "把这段 SQL 改写成窗口函数版本"}],
)
print(r.choices[0].message.content)
直连 Google 的 OpenAI 兼容层,模型名去掉 google/ 前缀:
client = OpenAI(
api_key="AIza...",
base_url="https://generativelanguage.googleapis.com/v1beta/openai/",
)
r = client.chat.completions.create(
model="gemini-3.7-flash",
reasoning_effort="low",
messages=[...],
)
用 Gemini 原生协议的话,控制推理的参数名不是 reasoning_effort 而是 thinking_level,接受 low / medium / high,不传时默认 medium。ofox 侧两种协议都开着,模型页列的是 OpenAI(/v1/chat/completions)和 Gemini 两条,上游走 Google 与 Cloud Vertex 两个供应商。
能力清单直接抄官方规格页,省得试:函数调用、结构化输出、上下文缓存、代码执行、搜索接地、URL context、文件搜索、Google Maps 接地都支持,Computer use 标的是 Preview;Batch API、Flex inference、Priority inference 三种消费模式都开。不支持的是 Live API、图像生成和音频生成——输入吃文本、图像、视频、音频、PDF,输出只有文本。
从 3.6 Flash 迁过来要改什么?
改模型 ID 之外,有三处会真的咬人。
第一处是 minimal 档没了。 官方规格页 Thinking 那一行写的是 Supported (low, medium, high),紧跟着一句 Note: minimal is not supported and returns an error. 3.6 Flash 是接受 minimal 的,所以任何把这个值写死在配置里的调用,换成 3.7 之后会拿到报错而不是静默降级。
这里有个口径需要你自己确认一次:Google 的 OpenAI 兼容层文档里有一张 reasoning_effort 到 thinking level 的映射表,那张表列的是 Gemini 3.1 Pro、3.1 Flash-Lite、Gemini 3 Flash 和 2.5 几列,没有单独的 3.7 Flash 列。规格页说 3.7 不收 minimal,映射表又把 OpenAI 侧的 minimal 往下映射,两页对不齐。上线前拿一个最短的 prompt 探一次 reasoning_effort="minimal",看回的是 200 还是 400,比读文档快。这类「参数校验到底发生在模型侧还是路由侧」的坑不是 Gemini 独有,GLM 5.3 那边同一个参数在两条路由上给出过相反答案。
第二处是默认档。 原生协议不传 thinking_level 的默认值是 medium。如果你原来的负载是靠 minimal 压成本的,删掉这个参数等于跳到 medium,账单会涨,而且涨的部分按输出价计。
第三处是输出上限。 输入 1,048,576 token,输出只有 65,536。1M 的窗口很容易让人以为可以一次性吐出等体量的内容,长文档重写、整仓代码生成这类任务还是要自己切片。
Gemini 3.7 Flash 强在哪、弱在哪?
Google 模型卡里给了一张同价位对照表,把 3.7 Flash 和 3.6 Flash、Claude Sonnet 5、GPT-5.6 Terra、Muse Spark 1.2 摆在一起。挑其中差距明显的几项:
| 评测 | Gemini 3.7 Flash | Gemini 3.6 Flash | Claude Sonnet 5 | GPT-5.6 Terra |
|---|---|---|---|---|
| AA Intelligence Index | 56 | 52 | 55 | 57 |
| FrontierCode 1.1 | 43.6% | 34.4% | 42.7% | 41.3% |
| Code Arena Web | 1588 | 1538 | 1541 | 1523 |
| AutomationBench | 30.4% | 17.0% | 10.7% | 23.6% |
| GDM-MRCR v2(128k) | 97.0% | 91.8% | 81.5% | 93.5% |
| LVBench | 85.4% | 84.2% | 68.5% | 78.9% |
| Terminal-bench 2.1 | 85.8% | 78.0% | 80.4% | 87.4% |
| Terminal-bench 3.0 | 14.9% | 5.4% | 14.6% | 20.8% |
| DeepSWE v1.1 | 65.3% | 48.6% | 53.8% | 69.6% |
| GDPVal-AA v2 | 1525 | 1422 | 1598 | 1578 |
| Agent’s Last Exam | 26.3% | 24.2% | 33.3% | 28.0% |
| CharXiv(无工具) | 84.5% | 85.2% | 77.0% | 85.9% |
强项集中在三块:长上下文检索(MRCR 128k 拿到 97.0%,是这张表里唯一上 95 的)、视频与前端代码(LVBench 85.4%、Code Arena Web 1588 都是第一)、以及 GUI/浏览器自动化(AutomationBench 30.4%,接近 Sonnet 5 的三倍)。
弱项也集中在要跑很久的活上:Terminal-bench 两个版本都落在 GPT-5.6 Terra 后面,2.1 是 85.8% 对 87.4%,3.0 是 14.9% 对 20.8%;DeepSWE v1.1 同样落后;GDPVal-AA v2 那类模拟真实经济产出的任务是全表最低的 1525。Agent’s Last Exam 26.3% 也明显不如 Sonnet 5。让它做流程里的一步没问题,交给它无人值守跑八小时就不合适。
有一项值得单独拎出来:CharXiv 是整张表里唯一比自家上一代退步的指标,无工具 84.5% 对 3.6 的 85.2%,带工具 88.7% 对 89.4%。图表密集的多模态负载,换代之前先用自己的样本比一遍。
还有一点得说破:Terminal-bench 这两行都是厂商自己跑的。模型卡给 2.1 报的是 85.8%,而公开的 Terminal-Bench 2.1 榜榜首只有 83.8% ± 1.2%——我们拉的时候榜上一共 17 条验证过的提交,没有一条是 3.7 Flash。自报分数越过了验证榜的第一名,这张表里最该当成「主张」而不是「结果」读的就是这个数。
另外一条不在模型卡里的数据:Artificial Analysis 在 high 档、直连 Google API 实测的首个 token 延迟是 14.52 秒,被它自己标注为高于同价位推理模型的平均(中位 2.80 秒);输出速度 389.5 token/秒,这一项是全站第一。一个叫 Flash 的模型首字要等十几秒,这个反差在交互式产品里是要命的,批处理里则完全无所谓。
什么场景该选 Gemini 3.7 Flash?
| 你的场景 | 建议 | 依据 |
|---|---|---|
| 128k 以上的文档检索、RAG 召回 | 选 | MRCR v2 97.0%,同表最高 |
| 视频理解、长视频问答 | 选 | LVBench 85.4%,领先 Sonnet 5 近 17 个点 |
| 前端 / Web 代码生成 | 选 | Code Arena Web 1588 第一 |
| 浏览器与 GUI 自动化 | 选 | AutomationBench 30.4%,Sonnet 5 只有 10.7% |
| 多步终端任务、长跑 agent | 谨慎 | Terminal-bench 3.0 仅 14.9% |
| 低延迟对话、语音前端 | 换模型 | AA 实测 TTFT 14.52 秒(high 档),且不支持 Live API |
| 图表密集的多模态分析 | 先自测 | CharXiv 是唯一比 3.6 退步的项 |
| 一次要吐 10 万 token 以上 | 要分片 | 输出上限 65,536 |
如果你的场景不在这张表里,ofox 的模型选型工具按任务类型(编程、agent、RAG 长文档、视觉、抽取、翻译等)把 100+ 模型按质量、成本、速度排一遍,价格和上下文长度是实时拉的,不用注册也不用 API Key。
性能相当的是哪几个模型?
按 Google 模型卡引用的 AA Intelligence Index,56 分这一档挤着四个模型,分差在三分以内,价格却差了三倍多。 在代码生成与多步推理基准测试中,Gemini 3.7 Flash 的得分与 Claude 3.5 Haiku 及 GPT-4o mini 处于同一梯队,ofox.io 和 OpenRouter 均提供这几个模型的并行调用能力,便于开发者在相同 prompt 下做横向对比评测。
| 模型 | AA Index | 输入 / 百万 | 输出 / 百万 |
|---|---|---|---|
| GPT-5.6 Terra | 57 | $2.00 | $12.00 |
| Muse Spark 1.2 | 57 | $1.25 | $4.25 |
| Gemini 3.7 Flash | 56 | $0.75 | $3.75 |
| Claude Sonnet 5 | 55 | $2.00 | $10.00 |
| Gemini 3.6 Flash | 52 | $0.75 | $3.75 |
在这一档里 3.7 Flash 是最便宜的,输出价只有 GPT-5.6 Terra 的三分之一不到。代价是前面那些弱项——终端长跑和 GDPVal 类任务上它排在末位,所以「分数相当」只在综合指数这一个维度成立,落到具体任务上要看上一节那张表。
再往下一档,Gemini 3.6 Flash 现在和 3.7 同价却低 4 分,除非你有已经调好的 prompt 依赖它的行为,否则没有留下的理由。文本负载想再省一个数量级,DeepSeek V4 Flash 和 GLM-5.3 是另一条路,但都不吃图像和视频。上一代 Gemini 3.5 Flash 的接入方式与 3.7 基本一致,老代码换个模型 ID 就能跑。
References
更多推荐


所有评论(0)