周六我给大家推荐 DeepSeek Harness 插件的时候,社区里还只有 911 个插件。
到今天再打开一看,已经 6214个了。两天时间,直接长到了原来的 6 倍多。

这几千个插件现在已经有人开始做排行榜了。今天我就挑目前dshfind 评分榜第一的插件来看看。
它叫dsh-vision-toolkit,干的事情特别直接。
给 DeepSeek Harness 里的纯文本模型装上一双“眼睛”。

项目开发者 Anionex 也是 DeepSeek Harness 的内测用户。

而且视觉这件事,他已经折腾了一段时间。
Anionex 此前还开源了 agent-vision-toolkit,专门解决纯文本 Coding Agent 处理图片的问题,覆盖图片问答、前端 UI 还原和 GUI 自动化,并在 Codex、Claude Code、Pi、OpenCode 等 Agent 中做过适配。

dsh-vision-toolkit 可以看作这套思路在 DeepSeek Harness 里的进一步延伸。
01
视觉能力可以放在 Harness 层,
让纯文本模型也能图片问答
如果你的 DeepSeek Harness 配置的模型是DeepSeek-V4-Flash或者DeepSeek V4 Pro,把图片直接粘贴进聊天框是无法发送的,因为这两模型都不支持多模态输入,导致我们在处理一些需要分析图片的任务就不太方便。

dsh plugin --profile web add @anionex/dsh-vision-toolkit还需要在 设置→视觉工具 里接入一个兼容 OpenAI 接口的视觉 API,配置视觉模型对应的 API Key、Base URL 和模型名。

可以填一个 Aihubmix 的 Key(可免费申请,还有 Gemini 免费额度)


传统方案通常是让视觉模型一次性描述整张图片,再把一大段描述交给主模型。这样容易混入与当前任务无关的信息,也可能遗漏真正需要关注的细节。
dsh-vision-toolkit 使用了“图像问答”机制。
主模型可以围绕同一张图片反复提问,每次只获取当前任务需要的信息,而不是一次得到一段泛泛的图片描述。
例如还原一张网页截图时,模型可以先询问页面的整体布局,再分别查看导航栏、内容卡片和按钮的样式,遇到看不清的局部还可以继续裁剪、放大和追问。
这样得到的信息更聚焦。

从手绘稿到可用界面案例
dsh-vision-toolkit 提供了十种视觉工具,既有图片问答、OCR 和元素定位,也有裁剪、取色、素材提取、网页截图和像素对比。
这些视觉工具是按需加载的,只有看图时才会加入模型,可以避免平时占用太多上下文。

02
总结
它绕了个弯,用视觉模型做翻译层,把图片转成文本再喂给主模型,再结合其他配套工具,让 DeepSeek 这帮纯文本选手不但能看图,在 UI 还原等实战场景中还能干得更好。
END
关注+星标,获取AI前沿进展与优质开源项目
夜雨聆风