9 月 6 日,DeepSeek 在 Hugging Face 上线了 DeepSeek-V4-Flash-Vision-Exp,这是 V4 家族首款实验性多模态模型。模型采用 MIT 许可证开源,总参数量 305B,基于 V4-Flash-0731 底座接入视觉编码器。官方定位相当反直觉:这双眼睛不给人类看图,专供 Agent 使用。Agent 读的是网页截图、软件界面与图表,读完接着调工具干活。多模态在这里不是问答能力,而是智能体的传感通道。

把这句话放进当下 Agent 技术栈里读,分量立刻出来了。模型负责推理与工具调用,Harness 负责持续执行,Vision 补的是观察屏幕的最后一块输入。过去一年各家把多模态当答题能力训练,问答榜单刷了一轮又一轮。DeepSeek 把视觉定义成传感通道,评测对象从答题换成任务完成率。这个转向比参数规模更值得关心。

从一个具体任务说起:Agent 需要的视觉不是描述,是行动依据

设想一个常见运维场景:值班工程师把监控截图丢给 Agent,要求处理页面报错。传统视觉问答模型给出的是一段漂亮的图片描述,报错框什么颜色、布局如何工整。真正能干活的答案必须读出服务名、错误码和发生时间,再决定调哪个接口。描述给人看,结构化字段给程序用,两种产出的管线走向完全不同。

Vision-Exp 的设计目标正是后者。官方示例里,Agent 拿到截图或界面图像后,直接把识别结果转成工具参数。执行动作在终端、浏览器或代码仓库里,视觉只是流水线第一站。多模态在这里是传感器而不是显示器,像素流的终点是一次请求。管线的价值,取决于识别结果能不能被下游工具消费。

这也是模型选眼睛而非嘴作落点的原因。看图说话的收益上限是内容创作与无障碍服务,赛道拥挤且天花板明显。读界面、图表、仪表盘的能力,直接对接办公自动化与运维巡检。训练目标从生成描述改成支撑决策,评测基准也从描述类换成任务集。整个技术栈的位面,因此完全不同。

从工程视角看,感知、决策、执行这个闭环里,感知一直是最薄弱的一段。工具调用与多步规划被各类协议反复打磨,视觉输入却停留在贴图问答阶段。视觉编码器一旦能输出可执行的结构化信息,闭环就真正转起来了。这正是 Vision-Exp 把多模态 Agent 当成主赛道的产业逻辑,也是它区别于问答模型的地方。

参数规模值得注意:305B 总参量决定了这不是端侧模型。目标场景是云端 Agent 服务与自动化平台,吃的是数据中心算力。企业可以自部署,可以调远程服务,也可以先验证流程,再把高频路径迁到自建集群。权重、接口与量化版三条路并行,接入成本被压到最低。这种灵活性,闭源旗舰那里买不到。

社区的反应速度,从侧面印证了这个需求真实存在且相当迫切。上线当天,模型页面上已经出现 7 个面向 llama.cpp、LM Studio 与 Ollama 的量化版本。本地跑通的最小门槛,在一天之内就迅速铺开了。多模态模型通常因视觉算子特殊而量化困难,这次适配明显更快。说明架构选型在工程友好度上做了功课。

还有一个容易忽略的细节:接口版本与开源权重是同一套模型。8 月 21 日接口先上线,图片按 Token 计费,十天后的开源版本原样沿用这套口径。也就是说,接口灰度阶段积累的真实调用分布,已在训练与适配中沉淀完毕。开源版本上线即可复用这条验证过的链路,不必等社区重新踩坑。

接下来的章节按使用顺序展开,事实全部来自官方仓库与当日报道。先拆权重包里有什么,最小复现路径长什么样。再读官方跑分,看加了眼睛之后纯文本能力有没有掉。然后复盘先接口后权重十天时间差里的商业账。最后给一段可运行的接线代码,把模型接进你的工具循环。

权重包里有什么:从视觉编码器到 DFlash Attention 的最小复现路径

先看权重包的清单,这次交付的完整性超出多数人的预期。包内含权重、Tokenizer 与 Prompt Encoding 参考实现,输入输出契约一应俱全。还有一份最小化 PyTorch 推理实现,覆盖视觉、注意力与专家网络五个核心模块。具体包括视觉编码器、Aligner、DFlash Attention、MoE 与 Hyper-Connections。能不能本地复现,从猜谜变成了读文档,每个模块都有代码可对照。

架构上走的是语言底座加外挂视觉的经典路线。V4-Flash-0731 的语言主干不动,前面接视觉编码器把图像切块编码。中间用 Aligner 做模态对齐,把视觉特征翻译成模型能消费的序列。相比从零预训练原生多模态,这条路线的工程风险小得多。语言能力也能完整继承,底座已有的推理水平不打折。

继承的收益在跑分里看得清楚,视觉分支几乎是免费加装的。纯文本基准 Terminal Bench 2.1 从 82.7 涨到 83.9,加装视觉后不降反升。软件工程基准 DeepSWE 从 54.4 涨到 59.3,增量接近五个百分点。这说明视觉分支没有抢占语言主干的参数容量,训练配比上做了隔离。Aligner 的设计把模态间相互干扰,压到了可接受范围之内。

注意力与层间连接两个模块名值得单独说清楚。前者是注意力的高效变体,负责控制长序列推理的计算开销。后者改进层间连接方式,让深层网络的信息流动绕开纯串行路径。两者在语言版底座里已经过验证,视觉版直接复用成熟组件。新增模块的调参风险因此显著降低。

MoE 结构是 305B 总参量能够高效运行的关键。稀疏激活意味着每次推理只调用一部分专家参数。显存占用与计算量远低于同规模的稠密模型,服务成本随之下降。对部署方来说,单节点多卡即可承载服务,不必为视觉单独备资源。视觉编码器的开销相对主干,几乎是可以忽略的量级。

Prompt Encoding 参考实现是包里最容易被低估的资产。多模态模型的真实表现对提示词格式高度敏感。图像序列插入的位置、指令措辞的模板,都会显著影响输出质量。多轮对话里视觉上下文的保留策略,同样是决定成败的细节。官方给出参考实现,等于把调优试错成本一次性降到了零。

最小化推理实现还有审计价值,常被跑分视角忽略。企业把视觉数据喂给模型前,最关心数据流向与处理边界。有可读的实现,安全团队可以逐行确认图像如何被编码。哪些中间态会离开进程边界,也从此有了核对依据。对金融与医疗这类行业,这份代码比跑分更能决定能否上生产。

MIT 许可证把商用门槛降到了最低。可以修改、可以商用、可以闭源二次分发,只需保留版权声明。对比部分开源模型附加的用途限制与审批条款,这份许可近乎零摩擦。想把视觉 Agent 做成产品的团队,法务侧几乎不需要额外论证。结合量化版的快速跟进,本地部署生态已经全部就位。

权重包逐项拆完,可以得到一个务实的判断。这不是冲榜式的发布,而是面向工程落地的完整交付。从参考实现到许可证,每个环节都在降低不确定感。视觉开源最难啃的不是模型,而是周边配套的成熟度。下一节看跑分,重点不在分数有多高。真正值得读的,是分数之间的结构性信息。

分数怎么读:加了眼睛之后,纯文本 Agent 为什么没掉分

官方跑分里最值得反复看的是两组对比。一组是加装视觉前后的自家对比,回答视觉分支是不是免费的。另一组是与 Claude Opus 4.8 的横向对比,回答多模态 Agent 的天花板在哪。官方表述相当克制,只说多模态 Agent 能力接近 Opus 4.8,没有宣称全面超越。这份克制本身就有信息量,说明对差距点心里有数。

基准V4-Flash-Vision-Exp纯文本底座Claude Opus 4.8
Terminal Bench 2.183.982.7
DeepSWE59.354.458.0
ApexBench Pass@136.5
Agents' Last Exam27.325.7
ZeroBench Pass@535.034.0
NL2Repo57.769.7

DeepSWE 这一项最能说明视觉加成的真实价值。纯文本底座 54.4,加装视觉后 59.3,反超 Opus 4.8 的 58.0。软件工程 Agent 拿到界面截图或图表后,可以处理纯文本版本根本无法处理的任务分支。典型场景是核对前端渲染结果,或者读取监控面板上的指标曲线。这五个点的增量,是新增输入通道解锁的任务空间。

另两项长程 Agent 基准,则是贴身缠斗的格局。长程评测 Agents' Last Exam 上拿到 27.3,对 Opus 4.8 的 25.7,领先一点六分。抽象推理基准 ZeroBench Pass@5 则是 35.0 对 34.0,幅度同样一个多点。长程 Agent 基准的分数分布通常很陡,一点五分背后可能是数十道任务的胜负反转。差距不大说明双方在同一能力档位,真正的分化要等对方补齐视觉再看。

唯一的明显失分项,落在 NL2Repo 这个基准上。它考察从自然语言需求出发,在真实代码仓库里完成改造。这项任务里长程文本推理与代码检索的权重极高,视觉帮不上忙。57.7 对 69.7,落后十二分,是六项基准里唯一的明显落差。官方没有回避这项差距,技术报告里保留了完整的对比数据。

六项基准放在一起读,结构相当清晰。视觉加成的任务领先或反超,长程文本推理仍有差距。短程任务则是贴身缠斗,胜负在三到五个点之间摇摆。这不是一条全面领先的曲线,而是一次目标明确的差异化交付。资源集中在自家技术栈最需要的输入通道上,取舍得非常聪明。

对选型者的启示,从这些数字里可以读得直接。如果 Agent 负载以界面操作、图表核对、截图巡检为主,能力结构高度匹配。如果核心链路是大型代码仓库的深度改造,现有旗舰仍然更稳。基准分数只有挂在自己的任务分布上,才有真正的参考意义。单看总分做决策,大概率会选错方向。

还要提醒一句评测口径。这些分数来自官方技术报告,Agent 类基准对工具框架极其敏感。重试策略、提示词模板与沙箱配置,都可能带来几个点的偏移。第三方复现的结果与官方数字有出入,是这一类评测的常态。把它当能力地图而不是产品承诺,等真实工作流的数据再做判断。

先卖接口再开源:十天时间差背后的数据回流账

跑分之外,这次发布的时间线里还藏着更值得玩味的商业节奏。8 月 21 日模型先在 DeepSeek 官方接口上线,当时只能调用,不给权重。开发者可以同时输入文字和图片,图片部分按 Token 单独计费。十天后权重正式开放,本地部署与二次开发随之解锁。先卖接口再开源,这个顺序本身就是策略。

这十天的时间差,是典型的市场试探期。接口阶段能观察到真实调用分布:谁在用、传什么图、失败率多高。Token 消耗结构与高频任务类型,也在账单里一目了然。这些数据回流到训练与工程侧,权重开放时模型已经过真实流量验证。开源不再是冒险,而是把验证过的资产交出去。

对 DeepSeek 来说,视觉数据的获取成本远高于文本。截图、界面、图表需要采集、清洗与对齐标注,且高度依赖真实场景。接口阶段的付费调用既是收入,也是数据飞轮的入口。用户为完成任务上传的界面图像,正是模型最需要的训练素材。这个循环在权重开放后,依然可以经由接口侧延续。

反观闭源阵营的节奏,对比就更清楚了。旗舰多模态能力通常只通过接口释放,权重永不落地。企业要自部署,只能等官方放出的瘦身版本。把 305B 完整权重以 MIT 交出,等于把多模态 Agent 从订阅服务变成可私有化的基础设施。两种路线没有绝对优劣,但给市场留的选择空间完全不同。

除了数据飞轮,还有一层生态账要算清楚。权重开放之后,本地推理框架的适配会自发涌现出来。七个量化版本就是证据,从容器到桌面端全都有人接。生态把部署成本打下来,接口把使用门槛降下去。两头挤压的是闭源中间态,只能调用拿不到权重的模型空间被逐步蚕食。

十天的灰度差,还规避了发布即翻车的风险。多模态模型上线初期,最常见的是读图幻觉与格式错乱。计费口径的争议与量化精度的问题,也需要真实的账单周期来暴露。这些问题在接口灰度期就能暴露并修复,带着方案迎接社区。发布节奏本身,就是产品质量工程的一部分。

这套先接口后权重的打法,用在多模态上意义不同。视觉输入的数据敏感度远高于文本,界面截图常含商业信息。企业客户对截图上传到谁的服务器,向来极其在意。开源权重提供私有化选项,接口提供低门槛入口。两条路径覆盖了从个人开发者到大型企业的全部信任档位。

把跑分结构与商业节奏合起来看,结论已经水到渠成。能力上做差异化交付,节奏上让数据回流,商业上两条腿走路。这次发布的每一个环节,都经过了相当刻意的设计。剩下的问题是开发者怎么把它接进自己的系统。下一节给一段可运行的代码,从加载模型到读截图出结论。

最后一笔账,留给部署者按自己的流量去算。305B 权重的显存占用、量化版本的精度损失、视觉分支的额外延迟,都是真实成本。这些成本要和接口的 Token 账单放在一起比较。流量大、图像密、合规严的场景,优先选择自部署。长尾调用与突发峰值走接口混合调度,是当前性价比最高的姿势。

接线方式:把 Vision-Exp 接进你自己的工具循环

接线从加载模型开始,下面这段代码在本地可以直接跑通。它用 Hugging Face transformers 的标准接口,加载仓库里的模型权重。再配合 Pillow 读入一张监控面板截图,构造图文混合的消息后调用生成。trust_remote_code 选项会加载仓库自带的自定义模型模块。这也是官方最小推理实现与主流训练框架对接的标准方式。

from transformers import AutoProcessor, AutoModelForCausalLM
from PIL import Image
import torch

MODEL_ID = "deepseek-ai/DeepSeek-V4-Flash-Vision-Exp"
processor = AutoProcessor.from_pretrained(MODEL_ID, trust_remote_code=True)
model = AutoModelForCausalLM.from_pretrained(
    MODEL_ID, torch_dtype=torch.bfloat16, device_map="auto",
    trust_remote_code=True,
)

shot = Image.open("dashboard_error.png")
messages = [{
    "role": "user",
    "content": [
        {"type": "image", "image": shot},
        {"type": "text", "text": (
            "读出截图里报错的服务名、错误码和最早发生时间,"
            "并给出下一步应执行的运维命令。只输出结构化结论。"
        )},
    ],
}]

text = processor.apply_chat_template(messages, tokenize=False,
                                     add_generation_prompt=True)
inputs = processor(text=[text], images=[shot], return_tensors="pt").to(model.device)
out = model.generate(**inputs, max_new_tokens=256)
print(processor.decode(out[0][inputs["input_ids"].shape[1]:],
                       skip_special_tokens=True))

提示词写法直接决定产出能否被下游消费。示例里要求只输出结构化结论,就是把注意力钉在字段抽取上。服务名、错误码、时间戳、建议命令,四个字段独立可解析。下游是工单系统就要求固定键名,下游是终端就要求单条命令。产出格式与消费方对齐,是视觉 Agent 落地的第一原则。

生产环境还要处理图片预处理的成本问题。分辨率与切片策略,直接决定图像 Token 的数量规模。一张四倍分辨率的截图按原始尺寸送入,账单会远超预期。合理做法是按任务裁剪关键区域,只送报错区加图例。视觉输入的 Token 账本要当作一等公民来管理,这是多模态时代的新手艺。

更完整的集成方式,是把视觉调用封装成一个工具。让规划层决定何时读图,读图结果作为观察写回会话状态。结构化的观察再触发后续工具调用,形成完整的感知闭环。这套封装与工具协议服务器的模式天然契合。包成一个读图工具挂载,视觉能力立刻变成可复用组件。

失败路径同样需要设计,这是演示与生产的分界线。读图置信度低、字段缺失或与上下文矛盾时,必须触发重试。必要时换分辨率重传,或者直接升级给人工处理。最忌讳把幻觉字段直接送进执行层,让错误动作落地。输入校验与输出仲裁这些脏活,才是生产稳定性的分水岭。

如果暂时没有本地算力,接口路径的接法完全同构。把本地推理替换为网络调用,图片按编码字符串或链接传入。计费口径不变,图像部分按 Token 折算入账。开发期用接口快速迭代提示词与管线,验证业务价值。之后再决定是否迁到自部署权重,两端代码结构一致迁移成本近乎零。

眼睛长出来之后:量化生态与技术栈的最后一块拼图

最后回到生态位,看这次发布补齐的完整拼图。Vision-Exp 补上视觉输入后,DeepSeek 的技术栈完成三件套闭环。模型负责推理与工具调用,运行框架负责持续执行任务。视觉模块负责读取屏幕上的信息,三层各自独立又互相咬合。一个能看着屏幕干活的通用 Agent 形态,每一层都已在开源侧可见。

这一定位把多模态竞争从答题榜拉回了任务场。当各家还在榜单小数点后缠斗时,计分方式已经变了。真正的分水岭是谁的视觉输入能稳定支撑多步工具调用。评测体系能不能对齐真实工作流,是另一条隐性门槛。只按答题能力堆料的模型,会发现自己站在了错误的赛场上。

量化生态的推进速度,同样值得开发者持续盯住。上线当天就有七个量化版本,覆盖容器、桌面端三大主流推理框架。多模态模型因视觉算子特殊而量化困难,这次适配明显更快。这说明架构在工程友好度上,做了非常明确的选择。接下来几周,端侧蒸馏版本大概率会出现。

对国产技术栈的意义,从清单里同样可以直接读出。视觉 Agent 的开源选项此前长期空缺,闭源旗舰又贵又不可私有化。这次以 MIT 许可补上的,正是最稀缺的一格。结合此前执行层与框架的开源节奏,从感知到推理每个部件都可自持。国内团队搭全栈 Agent,第一次可以全程不依赖闭源件。

能力边界也要讲清楚,免得选型时出现期望错位。NL2Repo 一项落后十二分,说明长程代码推理仍是明显短板。视觉分支解决的是输入问题,改变不了推理深度的上限。评测数据全部来自官方报告,第三方复现偏移是常态。305B 的部署门槛也决定了,轻量场景要等蒸馏与量化生态成熟。

给开发者的行动清单,其实可以压缩得很短。先跑通文中最小代码,验证自己的截图任务能否被稳定读出。再把读图封装成工具挂进现有框架,观察任务完成率的变化。最后按 Token 账本,决定接口与自部署的流量配比。三步走完,这双眼睛是否值得留在管线里,答案会自己浮出来。

从 8 月 21 日接口上线到 9 月 6 日权重开放,十六天走完了完整交付。多模态 Agent 从线上服务变成了人人可部署的开源资产。眼睛长给谁看,这个问题现在有了明确答案。给那些不需要漂亮描述、只需要下一步可执行动作的智能体。像素到工具调用之间的这条路,从此有了开源的铺路石。

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐