0.05 元,连根棒棒糖都买不到。

但现在,它能买 100 万个多模态输入 Token(大模型处理文本的最小单位,一个汉字大约对应 1~2 个)。

DeepSeek 又一次引爆了 AI 圈。这次的主角是 DeepSeek-V4-Flash-Vision-Exp——名字里带 “Flash” 的模型,本该是“便宜、快、智力阉割”的代名词,结果官方直接把它和 Opus-4.8 摆在了同一张 benchmark 桌上。

能力对比图

没错,2026 年现役旗舰 Opus-4.8,输入 36 元/百万 Tokens、输出 181 元。

而这位新来的 Flash:输入 1.5 元、输出 4.5 元(空闲时段),缓存命中输入只要 0.05 元。

1/24 的输入价、1/40 的输出价,同场竞技还赢下三项。 这已经不是性价比,这是掀桌子。

价格:5 分钱的多模态输入

项目 空闲时段 高峰时段
输入(缓存命中) 0.05 元/百万 0.10 元/百万
输入(缓存未命中) 1.5 元/百万 3.0 元/百万
输出 4.5 元/百万 9.0 元/百万

对比一下:Opus-4.8 的缓存命中输入价是 36 元,它 0.05 元,1/720。这一项成本在账单上,约等于不存在。

把价目表摊开看更直观:GPT-5.6 Sol 输入约 36 元、Gemini 3.1 Pro 约 14.5 元、Kimi K3 要 20 元、Qwen3.8-Max 12 元——清一色旗舰定价,只有它把价格打到了 1.5 元的量级。

当然,裸价地板轮不到它:通义 Qwen3.7-Flash 只要 0.2 元,智谱 GLM-4.6V-Flash 干脆免费。但那是走量模型的生态位——简单视觉任务、大批量吞吐。在"多模态 + 深度思考 + Agent"这个旗舰生态位里,Flash 价位的选手,目前只有 DeepSeek 一个。

性能:Flash 不阉割智力

这才是真正吓人的地方。

多模态 Agent 四项基准(ApexBench、Agents’ Last Exam、Chartography、ZeroBench),V4-Flash-Vision-Exp 平均 40.8 分,Opus-4.8 是 41.0 分——99.4%,贴着旗舰打平。其中 Agents’ Last Exam 27.3 对 25.7、ZeroBench 35.0 对 34.0,直接反超。

注意,这不是“看图说话”的初级考试,是“多模态 + 深度思考 + 工具调用”的综合硬仗。

文本 Agent 七项平均 63.1 对 66.6,约 95%;但 DeepSWE——真实仓库级工程修复——59.3 对 58.0,反超。11 项总平均,它拿到了 Opus-4.8 的 96%。

Vision 后缀也不是装饰:对比自家上一代 V4-Flash-0731,ApexBench 从 26.2 涨到 36.5(+10.3 分),视觉能力实打实兑现成了分数。

说句公道话,它也有认输的地方:NL2Repo 57.7 对 69.7(差 12 分)、DSBench-Hard 63.6 对 71.7(差 8.1 分)。“从零生成整个代码仓库”这类超长程规划,和旗舰仍有代差。你的核心任务如果落在这两项里,买之前先掂量掂量。

规格:384K 输出,全场唯一

2026 年主流旗舰的输出上限扎堆在 32K~66K,它直接给到 384K —— 一次性吐出一部中篇小说、一个完整的中型代码库,或者数十万字的深度报告,不用分段拼接。

1M 上下文,一次吞下几百页财报、几小时视频转录。2500 并发,企业级批处理直接开门 —— 对照一下,V4-Pro 才 500。

开发者功能也全开:JSON Output、Tool Calls、Responses API、Anthropic API 兼容、对话前缀续写,Claude 系存量代码低成本迁移。一个小提醒:FIM 补全在 Vision 版上不支持(只有文本版 Flash/Pro 的非思考模式有),纯代码补全场景记得选对型号。

下单前,先接四盆冷水

  1. 0.05 元是缓存命中价,和未命中差 30 倍。 不把系统提示词、固定文档做成可复用缓存前缀,你拿到的是 1.5 元,不是 5 分钱。
  2. 高峰价格翻倍。 财报解析、OCR 流水线这类不赶时间的活,排到空闲时段,预算直接减半。
  3. Exp 是实验版。 能力惊艳,但稳定性和转正策略要观察,生产核心链路建议灰度接入。
  4. 走量任务有更便宜的。 纯 OCR、图文分类,Qwen3.7-Flash、GLM-4.6V 系列裸价更低甚至免费。好钢用在刀刃上。

结论

它重新定义了 “Flash” 这个词。 以往 Flash = 便宜 + 快 + 智力阉割;现在,1/40 的价格,在 Agent 基准上打平旗舰,“砍智力换低价”的行业惯例被正面击穿。

但它也不是最便宜的多模态模型。它的精确定位是:具备旗舰级 Agent 能力与深度思考的多模态模型里,最便宜的一个。

选型就一句话:简单走量选裸价地板;复杂多模态推理且控成本,选它;超长单次输出和高并发批处理,它是唯一解;预算不敏感追求绝对上限,旗舰桌上还坐着 Opus-4.8 和 Qwen3.8-Max。

在这个一天一个样的时代,真正该怕的不是错过某一个模型,而是错过每一次代际切换。

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐