乐于分享
好东西不私藏

DeepSeek Harness插件暴涨6000+!dshfind榜一插件实测来了!

DeepSeek Harness插件暴涨6000+!dshfind榜一插件实测来了!
智猩猩AI整理
编辑:没方

周六我给大家推荐 DeepSeek Harness 插件的时候,社区里还只有 911 个插件

到今天再打开一看,已经 6214个了。两天时间,直接长到了原来的 6 倍多。

这几千个插件现在已经有人开始做排行榜了。今天我就挑目前dshfind 评分榜第一的插件来看看。

它叫dsh-vision-toolkit,干的事情特别直接。

给 DeepSeek Harness 里的纯文本模型装上一双“眼睛”。

项目开发者 Anionex 也是 DeepSeek Harness 的内测用户。

而且视觉这件事,他已经折腾了一段时间。

Anionex 此前还开源了 agent-vision-toolkit,专门解决纯文本 Coding Agent 处理图片的问题,覆盖图片问答、前端 UI 还原和 GUI 自动化,并在 Codex、Claude Code、Pi、OpenCode 等 Agent 中做过适配。

dsh-vision-toolkit 可以看作这套思路在 DeepSeek Harness 里的进一步延伸。

01

视觉能力可以放在 Harness 层,

让纯文本模型也能图片问答

如果你的 DeepSeek Harness 配置的模型是DeepSeek-V4-Flash或者DeepSeek V4 Pro,把图片直接粘贴进聊天框是无法发送的,因为这两模型都不支持多模态输入,导致我们在处理一些需要分析图片的任务就不太方便。

dsh-vision-toolkit 安装指令:
dsh plugin --profile web add @anionex/dsh-vision-toolkit
安装完成并重启。

还需要在 设置→视觉工具 里接入一个兼容 OpenAI 接口的视觉 API,配置视觉模型对应的 API Key、Base URL 和模型名。

可以填一个 Aihubmix 的 Key(可免费申请,还有 Gemini 免费额度)

保存设置后,无需手动切换模型,就可以在 DeepSeek Harness直接粘贴图片提问,体验和原生多模态模型一样。

传统方案通常是让视觉模型一次性描述整张图片,再把一大段描述交给主模型。这样容易混入与当前任务无关的信息,也可能遗漏真正需要关注的细节。

dsh-vision-toolkit 使用了“图像问答”机制。

主模型可以围绕同一张图片反复提问,每次只获取当前任务需要的信息,而不是一次得到一段泛泛的图片描述。  

例如还原一张网页截图时,模型可以先询问页面的整体布局,再分别查看导航栏、内容卡片和按钮的样式,遇到看不清的局部还可以继续裁剪、放大和追问。

这样得到的信息更聚焦。

从手绘稿到可用界面案例

dsh-vision-toolkit 提供了十种视觉工具,既有图片问答、OCR 和元素定位,也有裁剪、取色、素材提取、网页截图和像素对比。

这些视觉工具是按需加载的,只有看图时才会加入模型,可以避免平时占用太多上下文。

02

总结

dsh-vision-toolkit能站上dshfind 评分榜第一,是因为它解决了一个很实在的痛点:纯文本模型看不了图。

它绕了个弯,用视觉模型做翻译层,把图片转成文本再喂给主模型,再结合其他配套工具,让 DeepSeek 这帮纯文本选手不但能看图,在 UI 还原等实战场景中还能干得更好。

END

关注+星标,获取AI前沿进展与优质开源项目