乐于分享
好东西不私藏

你的 AI 编程助手终于能「看」了——这个开源工具让纯文本模型长出眼睛

你的 AI 编程助手终于能「看」了——这个开源工具让纯文本模型长出眼睛

你有没有遇到过这种情况:用 DeepSeek 写代码,想让它看一张截图理解 UI 设计,结果它说"抱歉,我不支持图片输入"?

说实话,这大概是纯文本模型用户最烦的瞬间了。明明 DeepSeek 写代码又快又好,但一到需要看图的时候就得切回 Claude 或 GPT,来回切换,上下文全丢。

好消息是,有人把这个问题解决了。

agent-vision-toolkit 是一个上周刚开源的项目,短短 6 天就拿到了 332 颗星。它做的事很简单:让 DeepSeek、GLM、Kimi 这些纯文本模型也能"看"图片。

怎么做到的呢?它本质上是一套命令行工具加一个 Skill,agent 在需要看图的时候,调用这些工具分析图片,把结果转成文字描述喂给模型。模型看不到图本身,但能看到图的详细描述,效果还不错。

具体能干什么?几个典型场景:

截图问代码。你给 DeepSeek 一张 UI 设计稿,它能直接生成对应的前端代码。长截图里的文字,它也能逐行 OCR 识别出来。前端还原更是一绝,给一张网站截图,它能把页面结构、颜色、布局都还原成代码。

如果你用的是 Codex 或 Claude Code,它还有个无缝模式,通过本地代理拦截图片请求,自动调用视觉工具分析,你完全感觉不到背后是纯文本模型在工作。这个体验跟原生多模态模型几乎没区别。

你可能会问,为什么不直接用多模态模型?答案很简单:省钱。DeepSeek 的 API 价格只有 GPT-4 的几十分之一,编程能力也不输。现在有了视觉能力,就不需要为了偶尔看几张图去切贵模型了。

安装也很简单,一句话:

git clone https://github.com/Anionex/agent-vision-toolkit

然后告诉你的 agent"安装这个 skill",它就会自动配置好。支持的 agent 包括 Codex、Claude Code、Pi、OpenCode,基本上覆盖了主流选择。


顺便再推荐一个搭配使用的工具:Peter Yang 的 human-review。

这个工具解决的是另一个痛点:AI 生成的内容,最后那 10% 的打磨怎么搞?在聊天框里说"把第三段改成 X,删掉第四张卡片,CTA 重写",agent 改完你还得逐行检查它有没有理解对。

human-review 的做法很巧妙:它在浏览器里打开你的 HTML 或 Markdown 文件,你可以直接编辑文字、拖拽调整图片大小、选中某段文字留下评论,就像在 Google Docs 里批注一样。改完后点一下 Send to agent,所有修改一次性发给 agent 执行。安装同样简单,直接告诉 agent 安装这个 skill 就行。


这两个工具放在一起特别搭:一个让你的 agent 能看见世界,一个让你能优雅地给 agent 提修改意见。说实话,AI 编程这一年最大的变化不是模型变强了,而是工具链越来越成熟了。

下次你的 DeepSeek 再说"我看不了图",你就有办法了。