
这两天 AI 圈被一个叫 DeepSeek Harness(以下简称DSH)的新工具彻底刷屏了。
发布才 12 个小时,GitHub 直接冲上 5 万 star,比之前增长最快的开源项目还猛 80 倍——连马斯克点赞那种节奏。
它到底是个啥?一句话讲明白:模型是脑子,Harness 是手脚。
以前 AI 只能跟你"聊天",有了 Harness,AI 能直接"干活"——自动写代码、画图、做表格,甚至现场给自己造个新工具。
DeepSeek 这次把整个 Agent 框架都开源了,MIT 协议,随便用、随便改、随便商用。 圈内直接喊出"Agent 界的安卓"这个口号。
网上的文章大多还是太专业,今天我把它的 4 个神级功能通过更加通俗的语言尝试一下讲透。
· · ·
一、轨迹模式Trajectory:给 AI 装上行车记录仪
你有没有这种感觉:让 AI 干活,出了错想问它"你到底哪一步搞砸了?" 它只会回你一句"我不知道诶"。
DeepSeek Harness 直接解决这个痛点。
第一,AI 看到的、想到的、调用的每一个工具,全部录像。
第二,这份日志只增不改,随时可以回放。
第三,工具调用是橙色、上下文是绿色,一眼就能分清。
举个“栗子”:你让 AI 帮你写个爬虫,它调用了 3 个工具、改了 5 个文件、查了 2 次文档。出 bug 时你点开轨迹,每一步清清楚楚——"哦原来它在第 3 步选错了 API"。 再也不用对着黑盒抓狂。DSH不只录"工具调用和文件改动",还录 subagent scheduling 和 context injection——也就是子 Agent 派发和上下文注入本身也是可追溯的。这对排查"AI 为什么突然改变了主意"特别有用,因为很多时候错误不是出在工具调用本身,而是出在上下文被注入了什么。
这件事对金融、医疗、法律这种强合规场景意义重大。AI 干过什么,必须能
查。
· · ·
二、实时 Token 仪表盘:给 AI 装上油耗表
你用 AI 最怕什么?跑了一晚上,醒来发现账户被刷爆。
DSH 直接把"计价器"怼到屏幕最下方。 每一步花了多少钱、跑了多少 token、缓存命中率多少,全部实时显示,一目了然。
具体能看到 4 项数据:
1、这一轮几步、每步耗时几秒(源码有 step 时间戳)。
2、输入 token 多少、输出 token 多少(标准 LLM usage 字段)。
3、缓存命中率——这是省钱关键,内测期大多能跑到 99% 以上(多次实测)。
4、模型思考过程与最终输出的 token 分布。
有内测大佬说:"我真没咋关注过这个仪表盘,感谢梁叔叔。"
但要注意,8 月 17 日起 DeepSeek 模型 API 要涨价,V4 Pro模型高峰期输出价直接27 元/百万 token。 这DSH的仪表盘更有用了。
· · ·
三、100+ 插件:把 AI 改成你想要的样子
最惊艳的设计来了——DSH 喊出一个口号:"一切皆插件"。
什么意思?模型、工具、技能、会话、界面、审批策略……全是插件。 甚至连 AI 怎么思考的主循环都能换。
官方已经内置 100 多个插件,社区开发者更疯,几天就造了 300 多个。
给大家看几个有意思的:
1、Windows XP 复古皮肤——让 AI 界面回到 2003 年。
2、大肥鱼表情包插件——干完活自动发个表情。
3、DSH-OpenPencil——对话里直接画设计稿。
4、ModLens——给纯文本模型加上视觉能力。
5、DSH-better-sidebar——VS Code 式工作台。
能做到一切皆插件,主要还是因为DSH基于的是Cordis元框架(Cordis 是个"造框架的框架",设计目标是把插件系统从"加载器"升级为"时空可组合的运行时"),对比一下:Codex 和 Claude Code 都是 Rust 写死的单体核心,设计哲学是"打磨默认体验"而不是"摊开给你换",你只能在外面挂件。 DSH 呢?主干都能换,想怎么魔改就怎么魔改。 商业护城河决定设计取向。 Claude Code 和 Codex 的核心资产是"开箱即用的产品体验"——把循环、上下文管理、安全策略打磨成黑盒,让用户越省事越好。如果把这些全拆成插件开放,等于自废武功。Anthropic 和 OpenAI 的商业模式建立在"封闭循环+订阅费"上,开源 Harness 等于把护城河捐给生态。
这就像 iPhone 和安卓的区别。DSH 赌的是——开放生态,赢者通吃。
· · ·
四、创造模式Creator mode:AI 现场给自己造器官
这才是 DSH 最炸裂的功能,也是最让极客上头的部分。
DSH 创造模式让 AI 真正成为了你的'实习生'——你说'做一个只读代码的安全审计 Agent',它会一步步带你检查当前 runtime 装了哪些插件、试跑 Cordis 插件、把它们拼成新的 preset,全程在内存里安全试验,不用动生产。
再举个栗子:你对 DSH 说:"帮我做个只读代码、不能改文件的安全审计 Agent"。 它会做这 5 步:
1、检查自己身上有哪些能力。
2、发现没有"只读约束"这个能力。
3、现场写一个插件。
4、装到自己正在运行的流程里。
5、用这个新能力接着干活。
具体到只读约束,Creator mode 通常会复用文件读写工具的'权限开关'或'审批策略'插件组合,而不是从零写新插件——这也是 Cordis '服务/事件'机制的精髓:用配置组合代替代码开发。
社区把这种'插件可热插拔、配置可组合'的特性叫做'自进化软件的雏形'——虽然 v0.1 还远远达不到真正的自演化,但它打开了一扇门。
业内推测 DeepSeek 在下一盘大棋:如果未来 Harness 的插件生态真的长起来,官方可能从海量 Agent 实例的魔改里筛选优秀插件反哺主线——届时社区贡献就能让飞轮真正转起来。不过截至 v0.1,DeepSeek 官方页面只承诺了'与全球开发者共同探索智能边界',并未公布具体筛选机制。
实话实说,对普通用户这个功能现在还不太能用上。 但 6 到 12 个月后,这可能是改变游戏规则的功能。
· · ·
写在最后
DeepSeek Harness 是不是 Agent 界的安卓?现在下结论还太早。
但有一点是确定的—— 模型公司亲自下场做"壳"这件事,从 Claude Code 开始,到 Codex、到 DSH,已经变成了一个新战场。
谁能把生态跑起来,谁就能定义下一代 AI 应用的入口。
DSH 的 4 个杀手锏,押的是"开放"和"自进化"两条路。 这条路能不能走通,6-12 个月后我们回头看。
参考文献:
https://www.deepseek.com/harness/
· · ·
欢迎关注「马丁的杂货铺」,专注 AI 与科技前沿观察。
夜雨聆风