DeepSeek Harness ,简称 DSH ,前阵子开源了,官方表示,把一切能力都做成插件, 36 氪和 DoNews 那阵子都在写。上一篇文章我拿它装插件试了两三天,今天不聊别人家的,聊我自己写的。
它叫 DSH-local-toolsbar , 2026 年 8 月公开的, MIT ,一个把图片 OCR 、看图问答、文本翻译、语音转写、语音合成全做成本地的插件,仓库里配置说明都写齐了。
起因很俗:一张截图。十一点多,我想让 AI 读它。里面是会议纪要,两百来字。点开几个 OCR 网页:第一个要注册,第二个要上传,第三个倒是能识别——图片先过它服务器,免费额度用完按次收钱,一个比一个不地道。
那张图里有人名、数字,还有客户的报价,我把网页全关了。
云端 AI 的账,我越算越亏。
钱是一笔。 OCR 按次、 ASR 按时长、翻译按 token ,单看都不贵,架不住高频。一天读十张图、转三小时会、翻五十段英文,月底账单教你做人。说难听点,所谓免费额度就是把你拉进去的鱼饵,割韭菜的前奏——图都喂进去了,收费才开始。这操作挺恶心人的。我受够了每张图都先过一道别人家的服务器。
隐私是另一笔。图片和录音比文字敏感得多。报价单、内部会议、合同截图,传出去那一刻,就不再只属于你了。服务商的隐私政策写得很周全——出了事,赔不了你什么。托网盘转一道那套,早就不靠谱了。
还有一笔更气人的:断网。高铁上、客户会议室里、回老家的路上,网络一抽风,这些"AI 能力"当场变砖,烦得很。花钱买的能力,得挑信号好的地方才能用,太扯了。
也有人会说,买个会员不就完了。是能解决——但会员救不了断网,也解决不了"客户数据不许出本机"这种硬要求。好吧,会员能解决一部分,硬要求解决不了。

可本机明明装着 Windows 自带的 OCR 引擎,明明跑得动本地语音模型。凭什么非得绕一圈别人的服务器,这逻辑真扯。
说白了,本机能干的事非要上云,这账我算不过来。
Harness 的插件体系是现成的:宿主开一个 webServer 桥,插件把工具注册进去,浏览器再通过同源接口把图片、音频、文本送进桥里,由宿主落盘之后调用本机能力,整条链路中间不经过任何一台别人的服务器,断网也能跑,剩下的事就是搬砖,一块砖一块砖往里搬。
搬了几天,六个工具一个个亮起来的时候,说实话,有点小激动。
工具六个:
| 工具 | 作用 | 背后是什么 |
|---|---|---|
| local_ocr | 图片识别 | Windows 内置 WinRT OCR |
| local_vision | 看图问答、复杂 OCR | PaddleOCR-VL-1.6 约 1GB |
| local_translate | 中英日翻译 | Qwen3.6-35B-A3B |
| local_speech_asr | 音视频转写 | faster-whisper CPU |
| local_speech_tts | 文字转语音 | Kokoro-82M / MeloTTS |
| local_speech_status | 健康、音色清单 | 本地语音服务 |

分工上分得清:千帆 OCR 是 OCR 专用,不兼职翻译,翻译一律走 A3B ,一个模型干一件事,省得抢显存。
底层全是现成的开源项目——识别是 PaddlePaddle 的 PaddleOCR-VL ,语音是 Systran 的 faster-whisper 和 hexgrad 的 Kokoro ,翻译是阿里的 Qwen3.6 系列,我做的事说白了就是把它们拧到一个插件里,不指望它们互相认识,只求各自干好那份,别在同一个请求里互相拖后腿。
按钮四个:输入框一个「 OCR 」按钮,选图即插文字;一个「🎤」按钮,说完就转字;消息气泡下一个「🔊」,朗读 AI 回复,再点停;选中文字会浮出「译」,气泡里原文译文来回切。
文档里提到,语音服务只开回环、带 token 、无 CORS 。技术栈全在本机:模型跑 127.0.0.1:1234 ,语音服务在 127.0.0.1:18761 。图片、音频、文本,没有一个字节出得了你的机器,连语音 token 都只认本机回环。
细节上花了点心思。混排文本自动分段选音色:中文走 zf_xiaoxiao ,英文走 af_bella (语速 0.9 ,听着自然些),日文走 jf_alpha ,中英日混一段丢进去,它先按语言切成三段、各配各的嗓门,出来不串味。
想看图问答还有个偷懒用法:在模型选择器里切到 LM Studio 视觉路由,直接把图拖进输入框。切来切去,够折腾的。
六个工具,四个按钮,一张 API key 都不用填,数据也一步都出不了这台机器。
像攒机。 DSH 是主板, LM Studio 是显卡,语音服务是声卡,插件是把它们插起来的排线。钱花在看得见的地方,数据不外流。
会攒机的人一看就懂,声卡插哪条槽、显卡接哪根线,脑子里过一遍就明白。不会的,往下看,照着五步走也能跑起来。

装它五步, PowerShell 环境,装到崩溃一次你就知道难在哪了。

就这么简单。
坑,提前说。
内存预警:两个模型常驻大约吃掉 22GB 内存。 16GB 的机器别硬上翻译模型,单用 OCR 那套没问题。
坑都在 README 里写明了。最大一个:视觉投影器 mmproj 文件必须和主模型同目录,命名为"主模型名-mmproj.gguf"。错一个字符, LM Studio 把模型当纯文本加载,你贴图进去它装瞎,蠢到家了。这个坑我第一版文档里自己栽过——准确说,是先被它坑了一轮,才补进文档的。
装好之后怎么叫它干活?给几个例子,不然一上手就傻眼。
{"image_path":"C:/Users/you/Desktop/a.png"}
{"file_path":"C:/Users/you/Desktop/m.mp3","language":"zh"}
{"text":"你好,世界","targetLang":"en"}
另外,几个小账先算清:首次加载慢, A3B 要一两分钟, OCR 模型十到六十秒,之后就快了;韩语音色没装,输入谚文会直接提示——这个坑我还没填; pnpm store 冲突,换个 --store-dir 就好。这些细节少一条,你装的时候就要多花一个晚上。
配置都在一个 yaml 里: visionModel 、 translateModel 、 englishSpeed , speechToken 留空就读 token 文件。离线是真的: OCR 、视觉、翻译、 ASR 、 TTS ,没一个字节上云,只有头回下模型要联网,走 hf-mirror 。
缺点也照说。
热血归热血,账得算清。
第一,只支持 Windows , OCR 那条链路焊死在系统 WinRT 和 PowerShell 5.1 上,绕不过去,换个平台就得重写半边。 Mac 用户暂时没戏,挺失望的。
第二,门槛不低: LM Studio 加 22GB 内存,机器不行就带不动。轻用户会被劝退,挺尴尬。没有 22GB 内存,就只用 OCR 和看图,翻译模型别硬塞。
第三,一个人写的,测试覆盖不厚,出 bug 是常态,被吐槽我也认, issue 我尽量修。翻译模型 22GB ,下载挂一阵子,惨是惨了点, hf-mirror 速度整挺好。
定位很诚实:这是给愿意折腾、又在意数据不出本机的人准备的,不是全家桶。值不值得装,取决于你有多烦云端 API ,也取决于你愿不愿意折腾这一回。选择权在你。
仓库: https://github.com/99kevindk/DSH-local-toolsbar , star 、 issue 、 PR 都欢迎。
如果你也装了,下一件事你最想让它干吗?评论区说说,或者直接去仓库开个 issue 。
夜雨聆风