最近我一直在折腾 DeepSeek Harness。

它有一个很明显的问题:

模型写代码、调用工具都很强,但如果模型本身是纯文本模型,它就“看不见”。

比如你给它:

  • 一张报错截图;
  • 一个网页设计稿;
  • 一张聊天记录长截图;
  • 一个手绘 UI 草图;
  • 一个按钮、Logo 或图标;

它其实并不知道图片里是什么。

在这里插入图片描述

而我最近发现了一个很有意思的 DeepSeek Harness 插件:

DSH Vision Toolkit

GitHub:

https://github.com/Anionex/dsh-vision-toolkit

它做的事情很直接:

给 DeepSeek Harness 里的纯文本模型装上一双“眼睛”。

而且不是简单的“图片转文字”,它实际上做了一整套面向 Agent 的视觉工具。


一、最简单的理解:让 DeepSeek Harness 可以直接看图

安装以后,在 DSH Web 里可以直接粘贴图片,然后继续问模型。

比如:

帮我看看这个报错是什么原因?

或者:

这个网页哪里有问题?

甚至:

按照这张图帮我还原一个 HTML 页面。

对于用户来说,交互体验已经非常接近普通的多模态模型。

更有意思的是,项目目前默认提供了免费的视觉服务,README 中说明安装后无需单独填写 API Key,每台机器每天有一定的免费图片额度。

所以安装完成以后,基本就可以直接用。


二、安装也很简单

如果你已经安装好了 DeepSeek Harness,Web Profile 可以直接执行:

dsh plugin --profile web add @anionex/dsh-vision-toolkit

如果你使用 Headless:

dsh plugin --profile headless add @anionex/dsh-vision-toolkit

DSH Desktop 也支持:

dsh plugin --profile desktop add @anionex/dsh-vision-toolkit

安装完成以后重启对应的 DSH,在设置里的 Vision Toolkit 中就可以测试视觉模型是否正常。

从使用门槛上来说,这一点我觉得做得非常好。

不是让你自己部署一堆模型、Python 环境、OCR 服务,然后配置半天。

而是:

安装插件
↓
粘贴图片
↓
直接提问

这才比较符合 Agent 插件应该有的体验。


三、它并不只是“识图”

一开始看到这个项目,我以为它就是给 DeepSeek Harness 接一个视觉模型。

真正看完以后发现,它做得比这个深很多。

目前插件提供了 10 个视觉工具

包括:

工具 用途
vision_glance 图片理解、OCR、多图对比
vision_ground 找到指定元素的位置
vision_detect 检测按钮、图标、页面元素
vision_crop 裁剪指定区域
vision_trace 图片图形转 SVG
vision_pixel_diff 两张图片像素级差异对比
vision_long_screenshot_ocr 长截图 OCR
vision_extract_foreground 去背景、提取前景
vision_dominant_colors 获取主要颜色
vision_html_screenshot 将 HTML 渲染成截图

这就意味着,它解决的并不只是:

“图片里面有什么?”

而是进一步解决:

“图片里的东西在哪里?”

以及:

“我接下来应该怎么操作它?”

这对 AI Agent 来说,区别非常大。


四、我觉得最有意思的是:截图还原前端

程序员应该都遇到过这种情况。

产品丢给你一张图:

按照这个做一下。

以前我们可能会自己量边距、看字体、找颜色、找图片。

现在可以直接让 Agent:

按照这张截图还原成 HTML。

DSH Vision Toolkit 不只是看一下图片,然后让模型“凭感觉”写代码。

它实际上设计了一套完整流程:

理解截图
↓
识别页面结构
↓
提取视觉元素
↓
生成 HTML / CSS
↓
渲染页面
↓
再次截图
↓
与原图进行 Pixel Diff
↓
继续修改

项目内置的 vision_pixel_diff 可以计算实现页面和参考图之间的视觉差异,并生成差异区域、热力图等结果。

这已经有一点:

AI 自己写前端 → 自己截图 → 自己检查 → 自己修改

的意思了。

相比传统的“截图转代码”,我觉得这种闭环更加重要。


五、还可以处理长截图

另一个很实用的功能是:

vision_long_screenshot_ocr

比如你给 AI 一张特别长的:

  • 微信聊天记录;
  • 网页截图;
  • 日志截图;
  • 文档截图;
  • 后台页面;

普通视觉模型很容易出现遗漏。

这个工具会对长图进行分段处理,然后再按照顺序组合内容。

项目的 Skill 甚至专门考虑了:

  • 聊天双方;
  • 时间戳;
  • 引用;
  • 截图重叠区域;
  • OCR 边界;

这些问题。

所以它不是简单调用一次 OCR API。

而是把“怎么让 Agent 正确读取长截图”做成了一套 SOP。

这一点我挺喜欢。


六、甚至可以让 AI 操作 GUI

还有一个方向我觉得更值得关注:

视觉定位。

比如你告诉 Agent:

找到右上角的登录按钮。

它可以返回类似:

x1, y1, x2, y2

这样的原始图片像素坐标。

然后这个坐标还能继续交给:

裁剪
↓
点击
↓
截图
↓
再次识别
↓
确认操作结果

所以未来结合浏览器自动化、桌面自动化,其实就可以形成:

看屏幕
↓
找到按钮
↓
点击
↓
重新看屏幕
↓
判断有没有成功

这已经不是传统意义上的 OCR 了。

而是在给 Agent 增加 Visual Grounding + GUI Agent 能力。


七、为什么我觉得这个项目值得关注?

我最近越来越明显感觉到:

大模型本身只是 Agent 的“大脑”。

真正决定 Agent 能干多少事情的,越来越取决于外面的工具。

比如:

大模型
+
MCP
+
Skill
+
浏览器
+
Shell
+
数据库
+
视觉
+
文件系统

最后组合起来,才是完整的 Agent。

DeepSeek Harness 本身非常适合干这个事情。

因为它并不一定要求模型自己拥有所有能力。

模型不会看图?

那就:

装一个视觉 Skill。

模型不会操作数据库?

再给它一个 Data Agent。

模型没有长期记忆?

再装 Memory 插件。

这也是我最近越来越喜欢 DeepSeek Harness 的一个原因:

一切皆插件。


八、它和直接用多模态模型有什么区别?

有人可能会问:

那我为什么不直接用 GPT、Gemini、Claude 这种本身就能看图的模型?

当然可以。

但是这里有一个区别。

普通多模态模型解决的是:

模型可以理解图片

DSH Vision Toolkit 更像是在解决:

Agent 如何完成视觉任务

例如:

识图

只是第一步。

后面还有:

定位
裁剪
OCR
转 SVG
页面还原
截图
像素对比
再次修改

所以它实际上把视觉能力做成了一套 Agent Toolchain

而不只是给模型增加一个 Vision API。

我觉得这是这个项目真正有意思的地方。


九、几个我比较推荐的玩法

安装以后,我建议直接试下面几个。

1. 看报错截图

分析这张截图里的报错,告诉我最可能的问题,以及应该先检查什么。

2. 截图还原网页

使用 vision-skills,根据这张截图还原一个 HTML 页面。

3. 手绘 UI 转网页

把这张手绘草图实现成一个可以运行的前端页面。

4. 提取图标

把图片里的这个图标单独提取出来,并转换成 SVG。

5. 长截图 OCR

完整读取这张聊天记录长截图,按照人物和时间顺序整理成 Markdown。

这些都比单纯问:

这张图片是什么?

更能体现它的价值。


十、最后

我之前一直觉得 DeepSeek Harness 很像一个:

还没有装完插件的操作系统。

刚安装的时候,你可能觉得它就是一个 CLI 或者 AI Agent。

但是插件越来越多以后,你会发现完全不是这么回事。

今天可以装视觉:

dsh-vision-toolkit

明天可以加:

Memory
Database
TUI
Desktop
Browser
MCP

最后一个原本只会输出文字的大模型,就开始慢慢拥有:

眼睛、记忆、工具,以及操作真实世界的能力。

这可能才是 Agent 真正有意思的地方。

项目地址:

https://github.com/Anionex/dsh-vision-toolkit

如果你最近也在折腾 DeepSeek Harness,这个插件我觉得非常值得装上试一下。

以前 DeepSeek 只会“想”,现在终于可以让它先“看”一眼了。

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐