DeepSeek给Agent装了“原装眼睛“:社区外挂一星期,官方亲手拆了
昨天我们聊完"社区给 DeepSeek 补眼睛"——ModLens 这些插件,用外部视觉模型当翻译,帮纯文本的 DeepSeek 看懂图片。
结果今天下午,DeepSeek 官方就把"原装眼睛"掏出来了。
8月21日,DeepSeek 上线了 V4 系列首个视觉模型 DeepSeek-V4-Flash-Vision-Exp,开放 API 澎湃。

时间线是这样的:
- 一周前,DeepSeek 自己"看不见"图。GitHub 讨论区里"怎么让 DeepSeek 看图"成了高频问题,上传图片直接报错
MODEL_DOES_NOT_SUPPORT_IMAGES36氪; - 这一周,社区忙坏了。桥接 Qwen-VL 的、写 vision bridge 插件的、做 dsh-deepseek-vision 的……大家抢着给 DeepSeek 装"假眼";
- 今天,官方真眼到了。
更绝的是,昨天大家刚在文章里夸完社区插件多好用,今天就发现——官方这套"原装眼睛",直接抄了社区的后路。
这事值得掰开讲。
先复盘:社区这一周是怎么"装眼睛"的
DeepSeek 的 V4 系列模型是纯文本的。模型目录里被声明成输入模态只有 text,图片甚至进不了会话,Agent 自然也没法处理。
但 DeepSeek 自己刚开源了 Harness——一个高度插件化的 Agent 运行时。Agent 能调终端、改文件、跑代码、调外部工具,偏偏面对最常见的截图、网页图片、报错界面时,只能干瞪眼 36氪。

这个尴尬局面,社区用一周填上了。
主流方案是"桥接":在 DeepSeek 前面再接一个 Qwen-VL 之类的视觉模型,先把图片翻译成文字描述,再交给 DeepSeek 推理。最出名的 ModLens 就是干这个的——把图片解析成结构化 JSON(OCR 文字 + 版面布局 + 语义内容),喂给 DeepSeek,让它"借别人的眼睛"看世界 阿里云开发者社区。
聪明,但绕路。
多了一层外部调用,多了一份延迟和成本,还把自己的视觉能力托付给了别的公司。这就像一个人没有眼睛,雇了个秘书每天帮他念——能用,但总归隔着一层。
社区也知道这是权宜之计。所以当 Harness 的 RC.8 更新里出现"模型适配器支持配置原生图片请求"时,不少开发者第一反应都是:官方的视觉模型是不是要来了? 36氪
有人甚至直接从 Harness 的代码和配置里,扒出了 deepseek-v4-flash-vision-exp 这个还没官宣的模型名 36氪。
果然,今天下午,官方正式官宣。
官方"原装眼睛":纯文本不降级,视觉大幅跃升
先看硬数据。
纯文本能力不降级。 在 Agent、推理、世界知识等纯文本任务上,Vision-Exp 与 V4-Flash 正式版基本持平 DeepSeek官方更新日志。这是最关键的信号——加上视觉,没有拖累原本的文本推理。
视觉能力大幅跃升。 在需要视觉理解的 Agent Benchmark 上,多模态 Agent 能力已接近 Anthropic 的 Opus-4.8 DeepSeek官方更新日志。
具体到跟 Opus-4.8 的对比,其实是互有胜负 网易科技:
- 领先:DeepSWE(59.3 vs 58.0)、Agents' Last Exam(27.3 vs 25.7)、ZeroBench(35.0 vs 34.0)
- 追平:Terminal Bench 2.1(83.9 vs 85.0)、Toolathlon-Verified(75.9 vs 76.2)、Chartography(64.3 vs 65.0)
- 落后:NL2Repo(57.7 vs 69.7)、DSBench-Hard(63.6 vs 71.7),差 8-12 分
"接近 Opus-4.8"这个说法,在代码 Agent 的复杂任务上其实还差着一截,但"互有胜负"这四个字,对于刚补上视觉第一天的模型来说,已经很能打了。

跟自家 V4-Flash 比更能看出视觉的增量:ApexBench 从 26.2 涨到 36.5,Agents' Last Exam 从 25.2 涨到 27.3 网易科技。而且官方特别说明,旧版 V4-Flash 在这两个基准里是直接忽略多模态元素的——所以这个涨幅,实打实来自"能看见"。
外挂 vs 原生:官方怎么"抄后路"的
官方原装眼睛,跟社区外挂的区别,不只是"不用借别家模型"这么简单。
第一刀:同价。 图片按 token 折算,一张图最多占 384 tokens,价格与 V4-Flash 完全一致 澎湃。缓存命中的价格,空闲和高峰时段分别只要 0.05 元和 0.10 元每百万 token 36氪。
这意味着什么?多模态不溢价。 行业里多模态能力通常是收费理由——OpenAI、Anthropic 的视觉模型普遍比纯文本贵。DeepSeek 直接把视觉能力做到和文本一个价。
这招太熟了。R1 当年打推理溢价,DSH 开源打 Agent 外壳溢价,现在多模态继续不溢价——DeepSeek 的每一次出手,都在重复同一个动作:把某个被视作"溢价点"的东西,打成地板价。
第二刀:Files API 同步上线,还免费。 图片上传一次,之后通过 file_id 在不同请求里反复引用,不用重复上传 DeepSeek官方更新日志。对要反复分析同一批截图、图表的工作流来说,省的是实打实的带宽和麻烦。
第三刀:直接进 Harness。 同一天发布的 v0.1.1-rc.1,模型适配器直接新增了 V4-Flash-Vision-Exp 选项,支持原生图片请求;/goal、/plan 命令支持图文混合输入,@菜单能引用文件和会话 澎湃。开箱即用。
社区用一周搭的桥,官方用"原生+同价+免费工具链"一套组合拳,轻飘飘地接走了。
当然,这样说有点委屈社区——ModLens 那批插件的价值并没有消失:它证明了需求、试出了方向、也留下了"给纯文本模型补能力"的方法论。某种意义上,社区这周是在替 DeepSeek 做免费的需求探测和市场验证。
而这,可能正是 DeepSeek 想要的。
真正的变化:Agent 第一次能"看见自己的活儿"了
但如果你只把这件事理解成"DeepSeek 终于能看图了",那就漏掉了最核心的东西。
注意官方放出的三个演示案例——都不是"看图说话"这种基础任务 OSCHINA:
- 给高净值客户做商业定制的西藏自驾游 PPT——要野性、粗粝、有实拍质感,一个月行程、藏南藏北、三种定价方案;
- 按"黑蓝深海 + 玻璃 UI + ASCII 像素"等视觉要求,重构 DeepSeek Harness 官网——多轮交互式创作;
- 制作带黏土怪物动效的前端 Mini Demo。
这三个任务的共同点是:模型要先看懂图片、页面结构和设计意图,再调用工具产出 PPT 或代码。
用深科技的话说——现实中的 Agent 很多时候并不只在文本和代码之间工作,它需要读网页布局、判断按钮位置、理解截图和图表、查看自己生成出来的 PPT 或网页效果,再根据视觉结果继续修改 DeepTech深科技。
这才是"视觉"对 Agent 的真正意义:不是让它会看照片,是让它能看见自己的工作结果,形成执行闭环。
以前 Agent 生成一个 PPT,自己看不见长什么样,只能"盲写"。写完对不对、丑不丑、排版乱不乱,它不知道。现在它能看了——看完不满意,还能改。
从"单向输出"到"闭环执行",这才是视觉带给 Agent 的质变。
但别急,"Exp"两个字说明一切
这款模型带着"Exp"(实验)后缀,是有原因的。
DeepSeek 没有公布参数规模,没有发布技术报告,也没有给视觉 Benchmark 36氪。
更耐人寻味的是架构猜测:DeepSeek 此前有独立的 DeepSeek-OCR 产品线,而普通 V4-Flash 到 7 月底仍只支持文本输入。有分析认为,Vision-Exp 很可能不是重新训练一个从底层统一处理文本和视觉的模型,而是把已有的视觉编码、OCR 或图像理解模块,接到了 V4-Flash 前面,再由后者完成推理和生成 36氪。
如果是这种架构,它和 Gemini、GPT 这类强调统一多模态训练的模型,本质上还是有区别的——更像"外挂转正",而不是"原生进化"。
还有个仓促的细节:今天早些时候,有开发者实测发现这个模型最初接收 image_url 时仍返回 expected 'text',直到官方模型表和视觉接口陆续更新后才恢复 36氪。
这哪是"憋大招"的样子,这是抢时间补位。
但换个角度想,DeepSeek 为什么要抢这个时间?
因为它在补齐 Agent 拼图的最后一块感知入口。回看这条时间线:4月底 V4 发布(无视觉)→ 7月31日 V4-Flash 转正(Agent 特化)→ 8月13日 V4-Pro GA + Harness 开源 → 8月19日 RC.8 埋多模态接口 → 8月21日官方视觉模型落地。每一步,都在往"Agent 能用、好用、闭环"的方向推。
V4 负责模型能力,Harness 负责接入真实任务,视觉负责让 Agent 理解屏幕上的世界 DeepTech深科技。三块拼图,今天算是齐了。
写在最后:社区当探测器,官方来收网
把昨天那篇和今天这篇连起来看,有个特别值得玩味的画面:
社区替 DeepSeek 装了一周"假眼",DeepSeek 在今天亲手摘下来,换上了"原装真眼"。
这不一定是谁在算计谁,但它确实构成了一套高效的生态打法:开源框架先把"缺什么"暴露给社区,社区用插件快速验证需求和方向,官方看准了再出手,用"原生+同价"一步到位。

社区验证需求,官方收割成果——这是"一切皆插件"这套玩法里,官方和社区最默契的一次配合。
而对整个行业来说,今天真正的信号是:多模态,也不再是溢价的理由了。
推理的溢价,R1 打掉了;外壳的溢价,DSH 打掉了;现在视觉的溢价,也正在被打掉。DeepSeek 还是那个 DeepSeek——永远在告诉市场,你以为贵的东西,其实可以很便宜。
至于那双"原装眼睛"到底是不是从社区外挂"转正"来的,DeepSeek 不会说。
但它已经用行动证明了:在一个把一切都做成插件的世界里,最快长出器官的方式,是先让全世界帮你长一遍。
我是词元,下期我们聊聊:DeepSeek 的视觉模型直接对标 Opus-4.8,但多模态这条路,统一训练和"外挂转正"到底哪条才是终局?
更多推荐



所有评论(0)