一、两条路各是什么

路径一:DeepSeek V4-Flash-Vision-Exp(云端平价 API)

  • 首次在 API 开放图像输入,调用时把模型设为 deepseek-v4-flash-vision-exp,请求里带 image_url 即可传图
  • 纯文本能力与 V4-Flash 正式版持平,视觉理解按官方口径补上后,多模态 Agent 能力接近 Opus-4.8(Agents’ Last Exam / ZeroBench 口径,厂商/媒体报道,待独立复核)
  • DeepSeek Harness 同步支持图片附件持久化与图文混合输入,适合做多模态 Agent 工作流
  • 优点:零部署、按量付费、DeepSeek 一贯的平价定位;缺点:数据出本机

路径二:Meta Muse Glimmer(本地开源模型)

  • Apache-2.0 协议,30B 多模态,专为常驻本地 Agent 工作流打造(编码 Agent、LLM-as-a-Judge、函数调用)
  • 4-bit 量化把内存占用从约 55GB 压到 18-20GB,单张 24GB/32GB 消费级显卡可跑;Mac 用 MLX 引擎(Ollama muse-glimmer:30b-mlx
  • 支持 low/medium/high/xhigh 四档可控推理强度,简单任务用低档省电
  • 优点:数据不出机器、无 API 费用、可离线;缺点:30B 规模能力低于云端旗舰,复杂任务要降低预期

二、开发者怎么选:一张决策表

场景选云端(DeepSeek)选本地(Muse Glimmer)
数据敏感度低(公开/可脱敏素材)高(医疗、财务、客户隐私)
调用频率偶发、波动大高频常驻、持续推理
硬件无(任何机器)有 24GB+ 显存或 24GB+ 内存 Mac
成本结构按量付费、无前期一次硬件投入、边际成本低
离线性需联网完全离线

三、两个现实提醒

  1. 基准数字先打折再看:DeepSeek「接近/超过 Opus-4.8」与 Muse Glimmer 的能力描述,目前都主要是厂商/媒体报道口径,没有拿到手里的第三方独立复核。选型前用自己的典型图片(票据、截图、海报)各跑一轮,比看基准分数有用。
  2. 「能看图」只是第一步:真正的 Agent 能力在「看图之后干什么」——理解→决策→调用工具→执行→校验。两条路径现在都只补齐了第一环,后面的执行层仍要自己搭(参考上一期 OpenAI 开源 Codex Harness 的思路)。

四、结论

「看图 Agent」的门槛,正在同时被云端平价化和本地开源化两条路拉低。对独立开发者:轻量场景先接 DeepSeek 验证需求,跑通了再评估是否需要本地自持;对做便携打包、离线工具、隐私敏感场景的从业者,Muse Glimmer 是当前「消费级硬件可跑」的现成选择。

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐