AI工具实测 — 每周一个让你效率翻倍的开源工具
本地 Agent · 万物皆插件 · 40+模型可换 · 全程可审计
点击文末「阅读原文」直接使用 AI 专家 / 捞仔 AI 小站
🔔 关注「AI-For-Precision-Health」— 每天一篇AI科研实操干货
食品 · 医药 · 器械 · AI工具 · 科研Skill,全周期科研 AI 指南
你以为 Agent 框架之争是产品之争?错——这是第一次有人把 Agent 的发动机、底盘、方向盘,全部做成螺栓件,开源摆给你看。
93k★ 开源首周 GitHub 星标 | 159 个 内置 Cordis 插件,全可拆装 | 40+ 模型提供商可挂载 |
▸ 为什么值得关注:DeepSeek Harness(CLI 名 dsh)2026 年 8 月 13 日以 MIT 协议开源,是迄今唯一一个"连 Agent 循环本身都可替换"的开源框架——Claude Code 闭源、Codex 只开源客户端。官方公式 Model + Harness = Agent,把 Agent 拆成"能换的大脑"和"能换的手脚"。
▸ 科研场景:本地跑不传数据、40+ 模型随意切换(用 DeepSeek Flash 跑文献调研、切 Fable 写代码)、全程轨迹可审计(科研可复现刚需)、Code 模式批量工具调用省 50%+ token。
▸ 上手门槛:Node.js 22.19+,一条命令 npx @deepseek-ai/dsh web 浏览器即用。
创作来源说明:本文由 AI 辅助生成,数据来自 DeepSeek 官方 GitHub 仓库、Composio 8 框架横评、AusPia/AIBacon 等实测报道,已交叉核验;内容仅用于科研工具参考,不构成采购建议。
本节结论:DeepSeek Harness 不是又一个 AI 聊天框,而是一个 Agent 运行时——它把"模型、工具、记忆、循环"全部做成可换的插件,科研工作者第一次能亲手拆开 Agent 看内部机制。
图2|DeepSeek Harness 三层架构

▲ 图2|三层架构:模型层(可换)+ Cordis 内核(插件中枢)+ 工作区(你的数据)
Model + Harness = Agent
DeepSeek 给 Agent 下了一个新定义。传统认知里,"Agent = 一个能自动干活的 AI",是个黑箱。Harness 把它拆成三层:
核心是 Cordis(一个 MIT 协议、2022 年就有、4 万星标都不到的微内核框架)——它只做一件事:挂载插件、卸载插件、解插件之间的依赖。所有 Agent 能力都坐在 Cordis 之上,没有任何一个"特权内核"。
科研怎么用:把 DeepSeek 的模型适配器换成 OpenAI/Anthropic/本地 Ollama,把工具集换成 PubChem/UniProt/自定义脚本,把循环换成"先审稿再写回复"的研究流程——不用改源码,改配置文件即可。
为什么要用 Cordis 而不是自造内核
DeepSeek 没自己写框架,而是复用了 Cordis(Koishi 聊天机器人社区用了 4 年的插件系统)。好处是:插件生态是"借来的",不是"从零搭"。截至 8 月 13 日开源当日,内部测试期间已有数百个社区插件被构建。
本节结论:选哪种模式,直接决定 token 消耗和可复现性。科研场景建议先用 Standard 模式跑通流程,再换 Code 模式省 token,审计用 Trajectory 视图。
反直觉的细节:Minimal 模式的存在说明这不只是个产品,还是个"测量仪器"。DeepSeek 把自己的内部评测 rig 一并开源——科研里讲究"控制变量",Minimal 让你只换模型、不动框架,量化模型本身的差异。
本节结论:Composio 在 8 月 10 日做的横评(早于 Harness 开源)表明:同一个模型换不同框架,任务通过率差 20 个百分点、单次成本差 7 倍——"用哪个 Agent 框架"和"用哪个模型"一样重要。
图1|Composio 8 框架横评:同一 DeepSeek V4-Flash 模型

▲ 图1|Composio 8 框架横评(数据来源:Composio 2026-08-10 推文,DeepSeek V4-Flash × 30 个真实多步任务)
Composio 横评的三个结论
① 框架比模型重要。同一模型(DeepSeek V4-Flash)跑 30 个真实多步任务,Pi Agent 67% 通过 vs OpenCode 47%,差了 20 个百分点。
② 成本差 7 倍。Pi Agent 每任务 $0.028 vs Claude Code $0.195——不是模型贵,是框架调用方式不同。
③ 时间差 2.2 倍。Claude Code 中位完成时间 122.7s vs Oh My Pi 272.4s。
科研怎么用这个数据:做实验前先跑 Minimal 模式对齐,再切 Code 模式省 token。Composio 横评本身就是一个"先测框架、再上数据"的科研范式。
本节结论:装 Harness(Step 1-3)→ 挂模型(Step 4-5)→ 跑任务(Step 6-8),全程纯 💻,本地运行不传数据,15 分钟搞定第一篇 AI 辅助综述。
Step 1 💻 装 Node.js
输入:电脑空。
AI 动作:手动装 Node.js(v22.19+ 或 v24+,去 nodejs.org 下 LTS)。
输出:命令行敲 node -v 显示 v22.19 以上。
人审:确认版本号 ≥ v22.19.0。
失败处理:版本不够 → 重新下载 LTS;装不上 → 用 nvm 管理器装(https://github.com/coreybutler/nvm-windows)。
Step 2 💻 装 DeepSeek Harness
输入:已装 Node.js。
AI 动作:命令行敲 npx @deepseek-ai/dsh web。
输出:浏览器自动打开 http://127.0.0.1:3080,看到 dsh 工作界面。
人审:确认网页能打开、无报错。
失败处理:端口被占 → 用 npx @deepseek-ai/dsh web --port 3081 换端口。
Step 3 💻 创建工作区
输入:dsh Web UI。
AI 动作:新建一个工作区,指向你的科研目录(比如 D:\papers\mRNA)。
输出:dsh 能读写该目录下的所有文件。
人审:确认目录里只有科研数据,不含敏感文件(凭据、密钥、患者数据)。dsh 权限默认只操作指定工作区,圈外访问需逐次弹窗批准。
失败处理:目录太大 → 用子目录;权限弹窗太多 → 先做 Minimal 模式跑通流程。
Step 4 💻 挂载模型
输入:你的 API Key(DeepSeek 或 OpenAI 或 Anthropic)。
AI 动作:Settings → Models → Add provider,选 DeepSeek 或 Anthropic 或 OpenAI,填 Key。
输出:路由立即生效,无需重启。
人审:确认模型能正常对话(发一句 hello 测试)。
失败处理:Key 无效 → 去对应官网重新生成;网络不通 → 检查代理。
Step 5 💻 选模式
输入:工作区已就绪。
AI 动作:开新会话,选 Standard 模式(科研默认)。
输出:会话启动,AI 可读写工作区文件。
人审:确认模式正确。
失败处理:选错 → 关闭会话重来。
Step 6 💻 跑文献调研
输入:一个研究问题,比如"mRNA 疫苗 mRNA-1273 的稳定性影响因素"。
AI 动作:贴问题 → 触发 Web 搜索插件(自动)→ 下载 PDF(若有浏览器插件)→ 分析 → 生成综述。
输出:一篇带引用的综述草稿,落在工作区 /literature-review.md。
人审:逐条核对引用是否真实、结论是否有出处;重点看"AI 说所以是"的句子。
失败处理:引文造假 → 删除该段落;结论模糊 → 追问 AI 具体数据。
Step 7 💻 审计每一步
输入:已跑完的会话。
AI 动作:打开 Trajectory(轨迹视图),逐字节看 AI 每一步做了什么——系统提示、工具调用、输入输出 token 全可展开。
输出:一份可复现的操作记录。
人审:这是科研可复现的关键——审稿人可以看 Trajectory 验证 AI 的路径。
失败处理:Trajectory 打不开 → 确认 dsh 版本 ≥ 0.1.0-rc.6。
Step 8 💻 换模型做对照实验
输入:同一工作区、同一问题。
AI 动作:Settings → Models,把 DeepSeek V4-Flash 换成 Anthropic Fable,重跑一次。
输出:两份不同模型产出的综述。
人审:比较两份结果:引用是否一致、结论是否冲突——这就是"模型可控实验"。
失败处理:换模型报错 → 确认该模型 API Key 正确。
没有 GPU / 想省钱怎么办:Harness 本身不吃算力,费用全在模型 API 上。用 DeepSeek V4-Flash(0.5 元/百万 token 输入)跑文献调研,单次任务大约 2-3 分钱;要省更多,用 Code 模式批量调用工具,token 可以省一半。
本节结论:三家中只有 Harness 把源码全摊开(MIT),其他两家要么闭源要么只开源客户端。科研要"可审计、可复现、可换脑",Harness 是首选。
| MIT 全开源 | ||||
怎么挑
科研场景优先 Harness——数据不出本机、可换便宜模型跑批量、可审计可复现。已经深度用 Claude Code 的团队不用立刻换,但新项目建议试 Harness 做对照。
已用 crewAI 做 Agent 协作的团队可以保留 crewAI,用 Harness 做"底层运行时",两层叠着用(Harness 装工具、crewAI 做编排)。
⚠️ 两个坑先说
① 是 v0.1 开发者预览。官方明确提示会有破坏兼容性的变更,没有 tag 版本。正式项目生产环境建议再等等稳定版。
② 凭据对 AI 无边界。工作区内放 API Key、密钥,AI 可以读到。生产环境请勿在本机工作区存放密钥,用一个专门的"无密钥目录"做日常任务。
核心结论
▸ Agent 框架之争开始了。DeepSeek Harness 是第一次有人把 Agent 的所有螺栓件做成可换、MIT 开源、本地运行——它和 Claude Code、Codex 同台竞技。
▸ 框架比模型重要。同一模型换框架,通过率差 20 个点、成本差 7 倍、时间差 2.2 倍。科研选工具别只看模型参数。
▸ 本地 + 可审计 = 科研刚需。Harness 的轨迹视图让你每一步都看得见、可复现——这正是科研最缺的东西。
▸ 今天就能试。一条命令 npx @deepseek-ai/dsh web,挂上 DeepSeek Flash,15 分钟跑第一篇 AI 综述。
参考资料
[1] DeepSeek AI. deepseek-harness. GitHub, 2026-08-13, MIT 协议. https://github.com/deepseek-ai/deepseek-harness
[2] Composio. "DeepSeek V4-Flash × 8 Harness Benchmark". 官方推文, 2026-08-10. 数据见 Aetos / ChooseAI 报道.
[3] DeepSeek AI. "DeepSeek Harness: 万物皆插件" 官网. https://deepseekharness.io/zh/
[4] Aibacon. "DeepSeek's Claude Code Rival Is MIT". https://aibacon.net/posts/deepseek-harness-v0-1-mit-open-source-agent-harness-cordis-plugins.html
[5] AusPia. "What is DeepSeek Harness: A Beginner's Guide". https://auspia.ai/blog/what-is-deepseek-harness
[6] 腾讯云开发者社区. "DeepSeek Harness 是什么?为什么开源后这么火?一文梳理", 2026-08-14.
夜雨聆风