DeepSeek 上线多模态 + Meta 开源 Muse Glimmer:「看图 Agent」的门槛被两条路同时拉低
·
一、两条路各是什么
路径一:DeepSeek V4-Flash-Vision-Exp(云端平价 API)
- 首次在 API 开放图像输入,调用时把模型设为
deepseek-v4-flash-vision-exp,请求里带image_url即可传图 - 纯文本能力与 V4-Flash 正式版持平,视觉理解按官方口径补上后,多模态 Agent 能力接近 Opus-4.8(Agents’ Last Exam / ZeroBench 口径,厂商/媒体报道,待独立复核)
- DeepSeek Harness 同步支持图片附件持久化与图文混合输入,适合做多模态 Agent 工作流
- 优点:零部署、按量付费、DeepSeek 一贯的平价定位;缺点:数据出本机
路径二:Meta Muse Glimmer(本地开源模型)
- Apache-2.0 协议,30B 多模态,专为常驻本地 Agent 工作流打造(编码 Agent、LLM-as-a-Judge、函数调用)
- 4-bit 量化把内存占用从约 55GB 压到 18-20GB,单张 24GB/32GB 消费级显卡可跑;Mac 用 MLX 引擎(Ollama
muse-glimmer:30b-mlx) - 支持 low/medium/high/xhigh 四档可控推理强度,简单任务用低档省电
- 优点:数据不出机器、无 API 费用、可离线;缺点:30B 规模能力低于云端旗舰,复杂任务要降低预期
二、开发者怎么选:一张决策表
| 场景 | 选云端(DeepSeek) | 选本地(Muse Glimmer) |
|---|---|---|
| 数据敏感度 | 低(公开/可脱敏素材) | 高(医疗、财务、客户隐私) |
| 调用频率 | 偶发、波动大 | 高频常驻、持续推理 |
| 硬件 | 无(任何机器) | 有 24GB+ 显存或 24GB+ 内存 Mac |
| 成本结构 | 按量付费、无前期 | 一次硬件投入、边际成本低 |
| 离线性 | 需联网 | 完全离线 |
三、两个现实提醒
- 基准数字先打折再看:DeepSeek「接近/超过 Opus-4.8」与 Muse Glimmer 的能力描述,目前都主要是厂商/媒体报道口径,没有拿到手里的第三方独立复核。选型前用自己的典型图片(票据、截图、海报)各跑一轮,比看基准分数有用。
- 「能看图」只是第一步:真正的 Agent 能力在「看图之后干什么」——理解→决策→调用工具→执行→校验。两条路径现在都只补齐了第一环,后面的执行层仍要自己搭(参考上一期 OpenAI 开源 Codex Harness 的思路)。
四、结论
「看图 Agent」的门槛,正在同时被云端平价化和本地开源化两条路拉低。对独立开发者:轻量场景先接 DeepSeek 验证需求,跑通了再评估是否需要本地自持;对做便携打包、离线工具、隐私敏感场景的从业者,Muse Glimmer 是当前「消费级硬件可跑」的现成选择。
更多推荐


所有评论(0)