DeepSeek Harness 终于能看图了:DSH Vision Toolkit 多模态视觉插件体验
最近我一直在折腾 DeepSeek Harness。
它有一个很明显的问题:
模型写代码、调用工具都很强,但如果模型本身是纯文本模型,它就“看不见”。
比如你给它:
- 一张报错截图;
- 一个网页设计稿;
- 一张聊天记录长截图;
- 一个手绘 UI 草图;
- 一个按钮、Logo 或图标;
它其实并不知道图片里是什么。

而我最近发现了一个很有意思的 DeepSeek Harness 插件:
DSH Vision Toolkit
GitHub:
https://github.com/Anionex/dsh-vision-toolkit
它做的事情很直接:
给 DeepSeek Harness 里的纯文本模型装上一双“眼睛”。
而且不是简单的“图片转文字”,它实际上做了一整套面向 Agent 的视觉工具。
一、最简单的理解:让 DeepSeek Harness 可以直接看图
安装以后,在 DSH Web 里可以直接粘贴图片,然后继续问模型。
比如:
帮我看看这个报错是什么原因?
或者:
这个网页哪里有问题?
甚至:
按照这张图帮我还原一个 HTML 页面。
对于用户来说,交互体验已经非常接近普通的多模态模型。
更有意思的是,项目目前默认提供了免费的视觉服务,README 中说明安装后无需单独填写 API Key,每台机器每天有一定的免费图片额度。
所以安装完成以后,基本就可以直接用。
二、安装也很简单
如果你已经安装好了 DeepSeek Harness,Web Profile 可以直接执行:
dsh plugin --profile web add @anionex/dsh-vision-toolkit
如果你使用 Headless:
dsh plugin --profile headless add @anionex/dsh-vision-toolkit
DSH Desktop 也支持:
dsh plugin --profile desktop add @anionex/dsh-vision-toolkit
安装完成以后重启对应的 DSH,在设置里的 Vision Toolkit 中就可以测试视觉模型是否正常。
从使用门槛上来说,这一点我觉得做得非常好。
不是让你自己部署一堆模型、Python 环境、OCR 服务,然后配置半天。
而是:
安装插件
↓
粘贴图片
↓
直接提问
这才比较符合 Agent 插件应该有的体验。
三、它并不只是“识图”
一开始看到这个项目,我以为它就是给 DeepSeek Harness 接一个视觉模型。
真正看完以后发现,它做得比这个深很多。
目前插件提供了 10 个视觉工具。
包括:
| 工具 | 用途 |
|---|---|
vision_glance |
图片理解、OCR、多图对比 |
vision_ground |
找到指定元素的位置 |
vision_detect |
检测按钮、图标、页面元素 |
vision_crop |
裁剪指定区域 |
vision_trace |
图片图形转 SVG |
vision_pixel_diff |
两张图片像素级差异对比 |
vision_long_screenshot_ocr |
长截图 OCR |
vision_extract_foreground |
去背景、提取前景 |
vision_dominant_colors |
获取主要颜色 |
vision_html_screenshot |
将 HTML 渲染成截图 |
这就意味着,它解决的并不只是:
“图片里面有什么?”
而是进一步解决:
“图片里的东西在哪里?”
以及:
“我接下来应该怎么操作它?”
这对 AI Agent 来说,区别非常大。
四、我觉得最有意思的是:截图还原前端
程序员应该都遇到过这种情况。
产品丢给你一张图:
按照这个做一下。
以前我们可能会自己量边距、看字体、找颜色、找图片。
现在可以直接让 Agent:
按照这张截图还原成 HTML。
DSH Vision Toolkit 不只是看一下图片,然后让模型“凭感觉”写代码。
它实际上设计了一套完整流程:
理解截图
↓
识别页面结构
↓
提取视觉元素
↓
生成 HTML / CSS
↓
渲染页面
↓
再次截图
↓
与原图进行 Pixel Diff
↓
继续修改
项目内置的 vision_pixel_diff 可以计算实现页面和参考图之间的视觉差异,并生成差异区域、热力图等结果。
这已经有一点:
AI 自己写前端 → 自己截图 → 自己检查 → 自己修改
的意思了。
相比传统的“截图转代码”,我觉得这种闭环更加重要。
五、还可以处理长截图
另一个很实用的功能是:
vision_long_screenshot_ocr
比如你给 AI 一张特别长的:
- 微信聊天记录;
- 网页截图;
- 日志截图;
- 文档截图;
- 后台页面;
普通视觉模型很容易出现遗漏。
这个工具会对长图进行分段处理,然后再按照顺序组合内容。
项目的 Skill 甚至专门考虑了:
- 聊天双方;
- 时间戳;
- 引用;
- 截图重叠区域;
- OCR 边界;
这些问题。
所以它不是简单调用一次 OCR API。
而是把“怎么让 Agent 正确读取长截图”做成了一套 SOP。
这一点我挺喜欢。
六、甚至可以让 AI 操作 GUI
还有一个方向我觉得更值得关注:
视觉定位。
比如你告诉 Agent:
找到右上角的登录按钮。
它可以返回类似:
x1, y1, x2, y2
这样的原始图片像素坐标。
然后这个坐标还能继续交给:
裁剪
↓
点击
↓
截图
↓
再次识别
↓
确认操作结果
所以未来结合浏览器自动化、桌面自动化,其实就可以形成:
看屏幕
↓
找到按钮
↓
点击
↓
重新看屏幕
↓
判断有没有成功
这已经不是传统意义上的 OCR 了。
而是在给 Agent 增加 Visual Grounding + GUI Agent 能力。
七、为什么我觉得这个项目值得关注?
我最近越来越明显感觉到:
大模型本身只是 Agent 的“大脑”。
真正决定 Agent 能干多少事情的,越来越取决于外面的工具。
比如:
大模型
+
MCP
+
Skill
+
浏览器
+
Shell
+
数据库
+
视觉
+
文件系统
最后组合起来,才是完整的 Agent。
DeepSeek Harness 本身非常适合干这个事情。
因为它并不一定要求模型自己拥有所有能力。
模型不会看图?
那就:
装一个视觉 Skill。
模型不会操作数据库?
再给它一个 Data Agent。
模型没有长期记忆?
再装 Memory 插件。
这也是我最近越来越喜欢 DeepSeek Harness 的一个原因:
一切皆插件。
八、它和直接用多模态模型有什么区别?
有人可能会问:
那我为什么不直接用 GPT、Gemini、Claude 这种本身就能看图的模型?
当然可以。
但是这里有一个区别。
普通多模态模型解决的是:
模型可以理解图片
DSH Vision Toolkit 更像是在解决:
Agent 如何完成视觉任务
例如:
识图
只是第一步。
后面还有:
定位
裁剪
OCR
转 SVG
页面还原
截图
像素对比
再次修改
所以它实际上把视觉能力做成了一套 Agent Toolchain。
而不只是给模型增加一个 Vision API。
我觉得这是这个项目真正有意思的地方。
九、几个我比较推荐的玩法
安装以后,我建议直接试下面几个。
1. 看报错截图
分析这张截图里的报错,告诉我最可能的问题,以及应该先检查什么。
2. 截图还原网页
使用 vision-skills,根据这张截图还原一个 HTML 页面。
3. 手绘 UI 转网页
把这张手绘草图实现成一个可以运行的前端页面。
4. 提取图标
把图片里的这个图标单独提取出来,并转换成 SVG。
5. 长截图 OCR
完整读取这张聊天记录长截图,按照人物和时间顺序整理成 Markdown。
这些都比单纯问:
这张图片是什么?
更能体现它的价值。
十、最后
我之前一直觉得 DeepSeek Harness 很像一个:
还没有装完插件的操作系统。
刚安装的时候,你可能觉得它就是一个 CLI 或者 AI Agent。
但是插件越来越多以后,你会发现完全不是这么回事。
今天可以装视觉:
dsh-vision-toolkit
明天可以加:
Memory
Database
TUI
Desktop
Browser
MCP
最后一个原本只会输出文字的大模型,就开始慢慢拥有:
眼睛、记忆、工具,以及操作真实世界的能力。
这可能才是 Agent 真正有意思的地方。
项目地址:
https://github.com/Anionex/dsh-vision-toolkit
如果你最近也在折腾 DeepSeek Harness,这个插件我觉得非常值得装上试一下。
以前 DeepSeek 只会“想”,现在终于可以让它先“看”一眼了。
更多推荐


所有评论(0)