梁圣再次引来AI核爆!DeepSeek-V4-Flash-Vision-Exp 发布,0.05元每百万Token的多模态大模型!!!
0.05 元,连根棒棒糖都买不到。
但现在,它能买 100 万个多模态输入 Token(大模型处理文本的最小单位,一个汉字大约对应 1~2 个)。
DeepSeek 又一次引爆了 AI 圈。这次的主角是 DeepSeek-V4-Flash-Vision-Exp——名字里带 “Flash” 的模型,本该是“便宜、快、智力阉割”的代名词,结果官方直接把它和 Opus-4.8 摆在了同一张 benchmark 桌上。

没错,2026 年现役旗舰 Opus-4.8,输入 36 元/百万 Tokens、输出 181 元。
而这位新来的 Flash:输入 1.5 元、输出 4.5 元(空闲时段),缓存命中输入只要 0.05 元。
1/24 的输入价、1/40 的输出价,同场竞技还赢下三项。 这已经不是性价比,这是掀桌子。
价格:5 分钱的多模态输入
| 项目 | 空闲时段 | 高峰时段 |
|---|---|---|
| 输入(缓存命中) | 0.05 元/百万 | 0.10 元/百万 |
| 输入(缓存未命中) | 1.5 元/百万 | 3.0 元/百万 |
| 输出 | 4.5 元/百万 | 9.0 元/百万 |
对比一下:Opus-4.8 的缓存命中输入价是 36 元,它 0.05 元,1/720。这一项成本在账单上,约等于不存在。
把价目表摊开看更直观:GPT-5.6 Sol 输入约 36 元、Gemini 3.1 Pro 约 14.5 元、Kimi K3 要 20 元、Qwen3.8-Max 12 元——清一色旗舰定价,只有它把价格打到了 1.5 元的量级。
当然,裸价地板轮不到它:通义 Qwen3.7-Flash 只要 0.2 元,智谱 GLM-4.6V-Flash 干脆免费。但那是走量模型的生态位——简单视觉任务、大批量吞吐。在"多模态 + 深度思考 + Agent"这个旗舰生态位里,Flash 价位的选手,目前只有 DeepSeek 一个。
性能:Flash 不阉割智力
这才是真正吓人的地方。
多模态 Agent 四项基准(ApexBench、Agents’ Last Exam、Chartography、ZeroBench),V4-Flash-Vision-Exp 平均 40.8 分,Opus-4.8 是 41.0 分——99.4%,贴着旗舰打平。其中 Agents’ Last Exam 27.3 对 25.7、ZeroBench 35.0 对 34.0,直接反超。
注意,这不是“看图说话”的初级考试,是“多模态 + 深度思考 + 工具调用”的综合硬仗。
文本 Agent 七项平均 63.1 对 66.6,约 95%;但 DeepSWE——真实仓库级工程修复——59.3 对 58.0,反超。11 项总平均,它拿到了 Opus-4.8 的 96%。
Vision 后缀也不是装饰:对比自家上一代 V4-Flash-0731,ApexBench 从 26.2 涨到 36.5(+10.3 分),视觉能力实打实兑现成了分数。
说句公道话,它也有认输的地方:NL2Repo 57.7 对 69.7(差 12 分)、DSBench-Hard 63.6 对 71.7(差 8.1 分)。“从零生成整个代码仓库”这类超长程规划,和旗舰仍有代差。你的核心任务如果落在这两项里,买之前先掂量掂量。
规格:384K 输出,全场唯一
2026 年主流旗舰的输出上限扎堆在 32K~66K,它直接给到 384K —— 一次性吐出一部中篇小说、一个完整的中型代码库,或者数十万字的深度报告,不用分段拼接。
1M 上下文,一次吞下几百页财报、几小时视频转录。2500 并发,企业级批处理直接开门 —— 对照一下,V4-Pro 才 500。
开发者功能也全开:JSON Output、Tool Calls、Responses API、Anthropic API 兼容、对话前缀续写,Claude 系存量代码低成本迁移。一个小提醒:FIM 补全在 Vision 版上不支持(只有文本版 Flash/Pro 的非思考模式有),纯代码补全场景记得选对型号。
下单前,先接四盆冷水
- 0.05 元是缓存命中价,和未命中差 30 倍。 不把系统提示词、固定文档做成可复用缓存前缀,你拿到的是 1.5 元,不是 5 分钱。
- 高峰价格翻倍。 财报解析、OCR 流水线这类不赶时间的活,排到空闲时段,预算直接减半。
- Exp 是实验版。 能力惊艳,但稳定性和转正策略要观察,生产核心链路建议灰度接入。
- 走量任务有更便宜的。 纯 OCR、图文分类,Qwen3.7-Flash、GLM-4.6V 系列裸价更低甚至免费。好钢用在刀刃上。
结论
它重新定义了 “Flash” 这个词。 以往 Flash = 便宜 + 快 + 智力阉割;现在,1/40 的价格,在 Agent 基准上打平旗舰,“砍智力换低价”的行业惯例被正面击穿。
但它也不是最便宜的多模态模型。它的精确定位是:具备旗舰级 Agent 能力与深度思考的多模态模型里,最便宜的一个。
选型就一句话:简单走量选裸价地板;复杂多模态推理且控成本,选它;超长单次输出和高并发批处理,它是唯一解;预算不敏感追求绝对上限,旗舰桌上还坐着 Opus-4.8 和 Qwen3.8-Max。
在这个一天一个样的时代,真正该怕的不是错过某一个模型,而是错过每一次代际切换。
更多推荐


所有评论(0)