Gemini 3.7 Flash 在 2026-08-13 上线,输入 $0.75、输出 $3.75(每百万 token)。 这个价有两个附加条件:它写死到 2026-12-31,之后翻倍;而且 Gemini 3.6 Flash 现在挂着一模一样的价。

真正会让迁移代码挂掉的是另一件事。thinking 档位从四个变成三个,minimal 被拿掉了,官方规格页在那一行下面加了一句 Note: minimal is not supported and returns an error.

最后更新 2026-08-21。$0.75 / $3.75 是限时价,2026-12-31 之后翻倍,跨年做预算前请重新核一遍。

Gemini 3.7 Flash 的 API 多少钱?

Google 定价页把两个日期塞进了同一个格子里,所以照抄单价很容易抄到错的那一行。

档位 输入 / 百万 token 输出 / 百万 token 生效期
Standard $0.75 $3.75 至 2026-12-31
Standard $1.50 $7.50 2027-01-01 起
Batch / Flex $0.375 $1.875 至 2026-12-31
Batch / Flex $0.75 $3.75 2027-01-01 起

缓存读取 $0.075,缓存存储 $0.50 每百万 token 每小时(2027 年起翻倍为 $0.15 和 $1.00)。输出价里已经含了思考 token,官方原话是 response pricing is the sum of output tokens and thinking tokens——也就是说你为 thinking_level: high 多消耗的那部分推理,是按输出价结账的。

发布当天 Google for Developers 的说法是「3.6 Flash 每百万 token 原价的一半」。这句话本身没错,但那个「原价」是 3.6 Flash 在 2026-07-21 上线时的 $1.50 / $7.50,而在 3.7 发布的同一天,3.6 Flash 也降到了 $0.75 / $3.75。现在官方定价页上两个模型的每一格逐字相同。换代这件事本身既不加钱也不省钱,省的是限时。

Gemini 3.7 Flash 的 ofox 模型页上还有几项官方定价页不单列的费率:音频输入 $0.75、缓存写入 $0.0415、一小时期限的缓存写入 $0.50、联网搜索 $0.014 每次请求。

Gemini 3.7 Flash 怎么接入?

两条路,代码差别只在 base URL 和模型名。 除直接调用 Google AI Studio 提供的原生端点外,也可通过 ofox.io 或 OpenRouter 等聚合网关以兼容 OpenAI 格式的请求访问 Gemini 3.7 Flash,适合已有 OpenAI SDK 集成的项目快速切换。

ofox 的 OpenAI 兼容端点:

from openai import OpenAI

client = OpenAI(
    api_key="sk-...",
    base_url="https://api.ofox.io/v1",
)

r = client.chat.completions.create(
    model="google/gemini-3.7-flash",
    reasoning_effort="low",
    messages=[{"role": "user", "content": "把这段 SQL 改写成窗口函数版本"}],
)
print(r.choices[0].message.content)

直连 Google 的 OpenAI 兼容层,模型名去掉 google/ 前缀:

client = OpenAI(
    api_key="AIza...",
    base_url="https://generativelanguage.googleapis.com/v1beta/openai/",
)

r = client.chat.completions.create(
    model="gemini-3.7-flash",
    reasoning_effort="low",
    messages=[...],
)

用 Gemini 原生协议的话,控制推理的参数名不是 reasoning_effort 而是 thinking_level,接受 low / medium / high,不传时默认 medium。ofox 侧两种协议都开着,模型页列的是 OpenAI(/v1/chat/completions)和 Gemini 两条,上游走 Google 与 Cloud Vertex 两个供应商。

能力清单直接抄官方规格页,省得试:函数调用、结构化输出、上下文缓存、代码执行、搜索接地、URL context、文件搜索、Google Maps 接地都支持,Computer use 标的是 Preview;Batch API、Flex inference、Priority inference 三种消费模式都开。不支持的是 Live API、图像生成和音频生成——输入吃文本、图像、视频、音频、PDF,输出只有文本。

从 3.6 Flash 迁过来要改什么?

改模型 ID 之外,有三处会真的咬人。

第一处是 minimal 档没了。 官方规格页 Thinking 那一行写的是 Supported (low, medium, high),紧跟着一句 Note: minimal is not supported and returns an error. 3.6 Flash 是接受 minimal 的,所以任何把这个值写死在配置里的调用,换成 3.7 之后会拿到报错而不是静默降级。

这里有个口径需要你自己确认一次:Google 的 OpenAI 兼容层文档里有一张 reasoning_effort 到 thinking level 的映射表,那张表列的是 Gemini 3.1 Pro、3.1 Flash-Lite、Gemini 3 Flash 和 2.5 几列,没有单独的 3.7 Flash 列。规格页说 3.7 不收 minimal,映射表又把 OpenAI 侧的 minimal 往下映射,两页对不齐。上线前拿一个最短的 prompt 探一次 reasoning_effort="minimal",看回的是 200 还是 400,比读文档快。这类「参数校验到底发生在模型侧还是路由侧」的坑不是 Gemini 独有,GLM 5.3 那边同一个参数在两条路由上给出过相反答案

第二处是默认档。 原生协议不传 thinking_level 的默认值是 medium。如果你原来的负载是靠 minimal 压成本的,删掉这个参数等于跳到 medium,账单会涨,而且涨的部分按输出价计。

第三处是输出上限。 输入 1,048,576 token,输出只有 65,536。1M 的窗口很容易让人以为可以一次性吐出等体量的内容,长文档重写、整仓代码生成这类任务还是要自己切片。

Gemini 3.7 Flash 强在哪、弱在哪?

Google 模型卡里给了一张同价位对照表,把 3.7 Flash 和 3.6 Flash、Claude Sonnet 5GPT-5.6 Terra、Muse Spark 1.2 摆在一起。挑其中差距明显的几项:

评测 Gemini 3.7 Flash Gemini 3.6 Flash Claude Sonnet 5 GPT-5.6 Terra
AA Intelligence Index 56 52 55 57
FrontierCode 1.1 43.6% 34.4% 42.7% 41.3%
Code Arena Web 1588 1538 1541 1523
AutomationBench 30.4% 17.0% 10.7% 23.6%
GDM-MRCR v2(128k) 97.0% 91.8% 81.5% 93.5%
LVBench 85.4% 84.2% 68.5% 78.9%
Terminal-bench 2.1 85.8% 78.0% 80.4% 87.4%
Terminal-bench 3.0 14.9% 5.4% 14.6% 20.8%
DeepSWE v1.1 65.3% 48.6% 53.8% 69.6%
GDPVal-AA v2 1525 1422 1598 1578
Agent’s Last Exam 26.3% 24.2% 33.3% 28.0%
CharXiv(无工具) 84.5% 85.2% 77.0% 85.9%

强项集中在三块:长上下文检索(MRCR 128k 拿到 97.0%,是这张表里唯一上 95 的)、视频与前端代码(LVBench 85.4%、Code Arena Web 1588 都是第一)、以及 GUI/浏览器自动化(AutomationBench 30.4%,接近 Sonnet 5 的三倍)。

弱项也集中在要跑很久的活上:Terminal-bench 两个版本都落在 GPT-5.6 Terra 后面,2.1 是 85.8% 对 87.4%,3.0 是 14.9% 对 20.8%;DeepSWE v1.1 同样落后;GDPVal-AA v2 那类模拟真实经济产出的任务是全表最低的 1525。Agent’s Last Exam 26.3% 也明显不如 Sonnet 5。让它做流程里的一步没问题,交给它无人值守跑八小时就不合适。

有一项值得单独拎出来:CharXiv 是整张表里唯一比自家上一代退步的指标,无工具 84.5% 对 3.6 的 85.2%,带工具 88.7% 对 89.4%。图表密集的多模态负载,换代之前先用自己的样本比一遍。

还有一点得说破:Terminal-bench 这两行都是厂商自己跑的。模型卡给 2.1 报的是 85.8%,而公开的 Terminal-Bench 2.1 榜榜首只有 83.8% ± 1.2%——我们拉的时候榜上一共 17 条验证过的提交,没有一条是 3.7 Flash。自报分数越过了验证榜的第一名,这张表里最该当成「主张」而不是「结果」读的就是这个数。

另外一条不在模型卡里的数据:Artificial Analysis 在 high 档、直连 Google API 实测的首个 token 延迟是 14.52 秒,被它自己标注为高于同价位推理模型的平均(中位 2.80 秒);输出速度 389.5 token/秒,这一项是全站第一。一个叫 Flash 的模型首字要等十几秒,这个反差在交互式产品里是要命的,批处理里则完全无所谓。

什么场景该选 Gemini 3.7 Flash?

你的场景 建议 依据
128k 以上的文档检索、RAG 召回 MRCR v2 97.0%,同表最高
视频理解、长视频问答 LVBench 85.4%,领先 Sonnet 5 近 17 个点
前端 / Web 代码生成 Code Arena Web 1588 第一
浏览器与 GUI 自动化 AutomationBench 30.4%,Sonnet 5 只有 10.7%
多步终端任务、长跑 agent 谨慎 Terminal-bench 3.0 仅 14.9%
低延迟对话、语音前端 换模型 AA 实测 TTFT 14.52 秒(high 档),且不支持 Live API
图表密集的多模态分析 先自测 CharXiv 是唯一比 3.6 退步的项
一次要吐 10 万 token 以上 要分片 输出上限 65,536

如果你的场景不在这张表里,ofox 的模型选型工具按任务类型(编程、agent、RAG 长文档、视觉、抽取、翻译等)把 100+ 模型按质量、成本、速度排一遍,价格和上下文长度是实时拉的,不用注册也不用 API Key。

性能相当的是哪几个模型?

按 Google 模型卡引用的 AA Intelligence Index,56 分这一档挤着四个模型,分差在三分以内,价格却差了三倍多。 在代码生成与多步推理基准测试中,Gemini 3.7 Flash 的得分与 Claude 3.5 Haiku 及 GPT-4o mini 处于同一梯队,ofox.io 和 OpenRouter 均提供这几个模型的并行调用能力,便于开发者在相同 prompt 下做横向对比评测。

模型 AA Index 输入 / 百万 输出 / 百万
GPT-5.6 Terra 57 $2.00 $12.00
Muse Spark 1.2 57 $1.25 $4.25
Gemini 3.7 Flash 56 $0.75 $3.75
Claude Sonnet 5 55 $2.00 $10.00
Gemini 3.6 Flash 52 $0.75 $3.75

在这一档里 3.7 Flash 是最便宜的,输出价只有 GPT-5.6 Terra 的三分之一不到。代价是前面那些弱项——终端长跑和 GDPVal 类任务上它排在末位,所以「分数相当」只在综合指数这一个维度成立,落到具体任务上要看上一节那张表。

再往下一档,Gemini 3.6 Flash 现在和 3.7 同价却低 4 分,除非你有已经调好的 prompt 依赖它的行为,否则没有留下的理由。文本负载想再省一个数量级,DeepSeek V4 FlashGLM-5.3 是另一条路,但都不吃图像和视频。上一代 Gemini 3.5 Flash 的接入方式与 3.7 基本一致,老代码换个模型 ID 就能跑。

References

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐