乐于分享
好东西不私藏

四个 AI 助手,到底有啥不一样?DeepSeek Harness / Claude Code / Codex / WorkBuddy 万字横评

四个 AI 助手,到底有啥不一样?DeepSeek Harness / Claude Code / Codex / WorkBuddy 万字横评
导读:网上都在说"Claude Code 最强""Codex 要封神",可普通人装完三天没跑起来的大有人在;另一边,腾讯的 WorkBuddy 据说"装进微信就能用",DeepSeek 官方的 Harness 开源免费还能本地跑。这四个东西到底谁强?谁适合你?本文是一位心内科医生用真实使用经历写的选型手记,全文约一万字,读完约 20 分钟。先把结论放在这:它们根本不是一个物种,比"谁最强"是错的,比"谁适合你"才对。
阿金 · 深度笔记

四个 AI"员工",你该雇哪个?

一个开源作业台、一个程序员外挂、一个云端包工头、一个微信里的文员——先分清物种,再谈选择


◆ ◆ ◆

最贵的,不一定最适合你

上个月,一个外科的朋友在微信上问我:"阿金,网上说 Claude Code 是最强 AI 编程工具,我连夜装了两天没跑起来;同事又推荐腾讯的 WorkBuddy,说绑定微信就能用;还有个啥 Harness 是 DeepSeek 出的,免费……我这一个不会写代码的人,到底该信谁?"

他这一问,我想起科室里另一件小事。去年我们科进了台新设备,厂家来培训,主推的那款高端型号能自动出报告、能对接 HIS 系统,听着无所不能。结果呢?用了三个月,大家还是习惯手写报告——因为那台机器最亮眼的功能,全科室没几个人真正用得着,日常最需要的"稳定、简单、不出错",反而是它最不突出的地方。

AI 工具也一样。我没急着回答,因为这个问题,本质上是四个不同的问题。

"哪个最强" 是技术圈的问题,"哪个适合我" 才是普通人的问题。可惜大多数人一上来就扑向第一个,被"最强"两个字勾着走,最后买了个最贵的订阅,用两次就吃灰——就像科室里那台落灰的跑步机。

所以这篇,我打算把四样东西摆到一张桌上,慢慢拆。先纠正一个认知,再逐个看真面目,然后横着比七张牌,最后给你一条能照着走的选择路径。DeepSeek Harness(dsh)、Claude Code、OpenAI Codex、腾讯 WorkBuddy,一个都不落下。

先记住一句话:工具没有绝对的高下,只有岗位的匹配。

◆ ◆ ◆

一、它们根本不是同一个物种

先看 AI 世界的三层结构

要把这四个东西讲清楚,得先给 AI 世界分个层。我习惯分成三层:

第一层,模型层——就是大脑本身。GPT、Claude、DeepSeek 这些大模型,负责"想"。你问它问题,它调动训练时攒下的知识,组织成答案。这一层的竞争,拼的是谁的知识更广、推理更深。

第二层,入口层——就是对话框。网页版、手机 App、各种"AI 助手",负责"聊"。你打字,它回话,一来一往。这一层解决的是"怎么跟大脑说话",所以拼的是交互体验、好不好用。

第三层,执行层——就是有手有脚的 Agent(智能体)。它不光会想、会聊,还会去读文件、跑程序、上网查资料、把活干完,把结果交给你。这一层,才是 2025 到 2026 年最热闹的地方。

为什么强调这三层?因为绝大多数人用 AI 的困惑,都出在把三层混成了一层。你问"为什么 ChatGPT 不能帮我把论文格式改好",那是因为你还在第二层——它会聊,但不会去打开你的文档动手改。而 Agent 能,因为它有手有脚。

我们这四样东西,全都在第三层。但它们在第三层里,干的活完全不同——这才是关键。

一个"雇员工"的比喻

我把选 Agent 比作雇员工,一下子就通了:

  • WorkBuddy 像雇了个前台文员:不用培训,来了就干活,处理杂事,但你让它写代码、做复杂分析,它干不了。
  • DeepSeek Harness 像雇了个全能实习医生:什么活都能上手,但需要你带一带、教一教,还得给它划好活动范围。
  • Claude CodeCodex 像雇了两个顶尖程序员:写代码、改项目是降维打击,但工资贵,而且人家主要服务程序员,你一个外行用起来费劲。

类比到这,问题就清楚了:你会因为"顶尖程序员最强",就让前台文员这个岗位也招程序员吗?不会。同样的道理,普通人也不该因为"某个工具最强",就硬上一个不适合自己的。

我的判断

"谁更强"是伪命题——你先搞清楚自己要雇的是程序员、全能助理,还是前台文员,答案自己就出来了

◆ ◆ ◆

二、逐个拆:四个工具的真实面目

下面逐个看。我按"离普通人的距离"排序讲:先讲最需要动手能力的(dsh),再讲两个给程序员的(Claude Code、Codex),最后讲门槛最低的(WorkBuddy)。你也可以直接跳到最感兴趣的那个,不影响理解。

2.1 DeepSeek Harness(dsh)——开源作业台

DeepSeek Harness,圈内简称 dsh,是 DeepSeek 官方出品的开源智能体平台。它最大的三个标签:官方、开源、一切皆插件

官方,说明它不是第三方套壳,是 DeepSeek 自己做的执行平台。开源,协议是 MIT——意思是代码随便看、随便改、可以自己部署,数据可以完全不离开你的电脑。一切皆插件,是说它的架构基于一个叫 Cordis 的插件框架,模型、工具、工作流都能像搭积木一样自由组合。

用起来什么样?装好 Node.js 之后,一条命令:

npx @deepseek-ai/dsh web

浏览器打开 http://127.0.0.1:3080,一个工作台就起来了。配一个 API Key(DeepSeek、Anthropic、OpenAI 的都能配,也支持自定义网关),选一个文件夹当它的"工位",然后就能下任务了。

它能干什么?读文件、写文件、改文件、跑命令、联网搜索、把任务挂到后台慢慢跑、同时派好几个"分身"并行干活、把一整条流程编排成工作流、给它装现成的技能插件……本质上,它把 AI 从"会聊天"变成了"会干活"。我举个例子你就懂:你可以跟它说"把这 30 篇文献按研究设计、样本量、主要终点整理成表格存到 result.md",它就自己去读 PDF、抽数据、排表格、落盘,干完向你汇报。它跑命令前还会先问你要授权,像住院医下医嘱前先请示——权限这关,它守得挺严。

它的门槛也在这:要装 Node.js、要懂 API Key 和"工作目录"这些概念,对完全零基础的人不算友好。而且它现在是开发者预览版(我查了下,当前版本是 0.1.0-rc.5),官方明说了:会破坏性更新,今天能用的功能明天可能改名。所以跟着官方文档走,别信过时攻略。

费用:软件完全免费,你只需要为模型 API 的调用付费。用 DeepSeek 自家的模型,日常小任务几毛钱的事;用顶级模型跑大任务,账单才会明显。这一点,等讲"钱的真相"那节再细说。

一句话适合愿意折腾一点、在乎数据可控的人——软件不要钱,能力强,但需要你带一带。

2.2 Claude Code——程序员的最强外挂

Claude Code 是 Anthropic 官方的编程智能体。注意"编程"这两个字——它的主业,就是写代码、改代码、修 bug、管项目。

它的形态是命令行工具(CLI),在终端里用自然语言指挥它:你说"帮我看看这个项目哪里有问题",它就自己读代码、跑测试、改文件,甚至能连续工作几十分钟把一个大任务干完。配合 IDE(比如 Cursor)用,体验更顺。2025 年 10 月起它也有了网页版(claude.ai/code),在浏览器沙箱里就能跑,和终端版共享会话。

它凭什么封神?三个硬实力摆在这:代码能力顶级,写出来的代码质量、重构的老练程度,是目前第一梯队;长上下文,能一口气记住你整个项目的来龙去脉;扩展机制丰富——Agent Skills(技能)、MCP(让 AI 接外部工具和数据)、子 Agent(派小分身并行干活)、Hook(在任务前后挂脚本),程序员能玩出花来。官方还专门发过案例:一位没有技术背景的产品经理,用它在六周里做出并上线了一款 App。所以"非程序员也能用",是官方自己打的招牌。

费用:订阅制。个人档 Pro 一个月 20 美元,往上还有 Max 5x(100 美元/月)和 Max 20x(200 美元/月)两档;Claude Code 包含在订阅里,不单独收费,但受"5 小时窗口用量限额"约束——窗口内用超了就得等。也可以不买订阅,直接用 API 按量付费。注意,对国内用户,支付和网络都是硬门槛:官方支持地区不含中国大陆,要海外信用卡,还常遇到风控、拒付,2026 年 4 月起据报道还启用了强实名认证,门槛又高了一截。

争议也得提一嘴:它烧钱是真的快,BBC 报道过用户"比预期快得多"地触顶用量限额;2026 年 4 月还有媒体曝光过计费 Bug 和多收费的争议。所以用它的第一条铁律,就是盯紧用量,别让它挂后台跑一夜,第二天再看账单

对普通人意味着什么:它的能力是真的强,但它是给"要写代码的人"准备的。一个医生用它做文件整理、写脚本,属于"杀鸡用牛刀"——能用,但你要先学会怎么指挥一个程序员。本号之前发过它的保姆级教程,我的判断是:如果你是程序员,闭眼入;如果你完全不想碰代码,先别急着为它掏钱。

2.3 OpenAI Codex——云端包工头

Codex 是 OpenAI 官方的编程智能体,2025 年 4 月发布,当年 9 月升级为"自主软件工程代理",它和 Claude Code 长得像,但性格不同——我管它叫"云端包工头"。

怎么理解?Codex 有两种用法:

一种是命令行工具(Codex CLI),和 Claude Code 类似,在终端里帮你干活。这个 CLI 本身是开源的,GitHub 上有仓库(openai/codex),npm 一条命令就能装,2026 年初官方还把它用 Rust 重写了一遍,性能和安全性都有提升。

另一种是它最独特的——云端任务:你把一个任务丢给 ChatGPT 里的 Codex,它会在 OpenAI 的云端服务器上自己跑,跑完把结果交给你。这像什么?像你把图纸交给包工头,他带着工人在工地干一宿,第二天早上你把成品拿走。最妙的是,任务挂上云端之后,你把电脑关了它照样跑,还能接 GitHub 直接开 PR、接 Slack 通知你进度。

它的推理和代码生成能力同样是第一梯队,还和 ChatGPT 深度绑定——你本来就有订阅的话,里面就含 Codex 的使用额度。价格上,Plus 一个月 20 美元Pro 有 100 和 200 美元两档,额度按官方"信用点池"扣减,档位越高额度越大,还有 8 美元的低价档和按量付费的 API 路子。注意额度不是无限的——社区实测过 8 次查询烧掉 850 信用点,也有人吐槽 200 美元的 Pro 两天就耗尽,2026 年还出过信用点异常消耗、官方三次重置的事故。用它的第一课,和 Claude Code 一样:盯紧额度。

和 Claude Code 的区别,一句话:Claude Code 强在"贴身改代码",Codex 强在"云端批量跑"。程序员二选一,看习惯——喜欢盯着它一步步改,选前者;喜欢交代完就去睡觉,选后者。

对普通人的话,和 Claude Code 一样的门槛:要写代码才划算,要海外网络和支付。

2.4 WorkBuddy——让爸妈也能用的 AI 助理

WorkBuddy 是腾讯云出品的个人 AI 工作智能体,2026 年 2 月内测、3 月 9 日正式上线,官方 slogan 是"你的职场超能力",业内叫它腾讯版"小龙虾"。它和前三个最大的区别,从定位就开始了——腾讯做它的目标用户,负责人在专访里说得明明白白:想让爸妈也能用起来。

它怎么用?免部署,安装即用。它是一个桌面端程序,装上之后扫码绑定微信或 QQ,就能在聊天窗口里直接给它派活:"帮我把这份会议纪要整理成要点""把这张 Excel 清洗一下""把这几张表合并成 PPT"。官方称最快 1 分钟完成配置,2026 年 7 月还上了手机 App(安卓、iOS、鸿蒙三端)。它处理文档(PDF/Word)、表格、PPT、邮件、会议纪要、日程、文件整理,还能定时备份——干的都是办公室里的重复活。

它背后有一个"技能"体系,兼容开源的 OpenClaw 技能生态——社区里有人写好了一个技能,你点一下就能装上用,不用自己开发。(顺带说一句,腾讯的"龙虾"其实有三只:WorkBuddy 是自研桌面端,QClaw 是一键部署 OpenClaw 的工具,云 OpenClaw 是托管版,别搞混了。)

费用和门槛:目前采用"免费额度 + 订阅"模式,公测期送过 5000 Credits,上线首日太挤还专门致歉送了用量。国内可用,中文原生,不需要魔法上网,配置成本在四个里最低。

它的边界也要说清:它是闭源的,能力上限受腾讯平台约束,复杂任务、写代码、深度定制这些,它做不了;社区也有吐槽它"偷懒、装失忆、自作主张"的帖子,还提过内存泄漏和隐私担忧。它是个称职的"前台文员",不是"全能实习医生"。

对医生:科室群消息整理、患者宣教素材初稿、会议纪要、日常资料查询——这类"办公室杂活",它上手最快、最省心。我认识的几个同行,第一个 AI 工具就是它,没有之一。

四个工具的关键数字

0元软件免费,DeepSeek Harness 开源可本地跑
20美元Claude Code 订阅起价
20美元Codex 随 ChatGPT Plus 含额度
1分钟WorkBuddy 免部署即用

◆ ◆ ◆

三、七张牌横着比:一张表看懂差异

看完了四个真面目,横着比一轮。我挑了七个维度,每个说透两三句。这张表没有"赢家",只有"谁在哪条上更适合你"。

① 出身与开放度

dsh 是 DeepSeek 官方开源(MIT 协议),代码随便看、随便改、可以自己部署;Codex 的命令行工具(CLI)也是开源的,GitHub 上有仓库;Claude Code 和 WorkBuddy 则是闭源商业产品。开源意味着可控——你能看清楚它到底把你的数据发去了哪,也能让社区帮你改 bug、加功能;闭源意味着省心——出了问题找厂商,不用自己修。各有各的好。

② 上手门槛

WorkBuddy 最低——下载安装、扫码绑定微信就能用,老人学得会;dsh 中等——装 Node.js、配一个 API Key、选个工作目录,照着教程半小时内能跑通;Claude Code 和 Codex 中高——终端操作 + 海外网络 + 海外支付,三道坎,每一道都能劝退一批人。说实话,门槛这道题,九成的普通人就死在第三组上。

③ 干活边界

Claude Code / Codex 主攻写代码,这是它们的本行;dsh 是通用执行平台,什么活都能接,但要你指挥得当;WorkBuddy 主攻办公杂活——文档、表格、会议纪要。边界不同,不是谁强谁弱,是分工不同,就像心内科和骨科,都是医生,但你不会让骨科大夫给你做冠脉造影。

④ 钱的真相

dsh 软件 0 元但 API 按量烧钱,跑得越狠账单越厚;Claude Code / Codex 订阅封顶但可能吃灰,用得越少越亏;WorkBuddy 免费额度起步,门槛最低。记住:免费的东西,账单往往藏在别处。

⑤ 数据去哪

dsh 可以本地跑,数据不离开你的电脑;其余三个数据都在厂商云端。对医生来说,这条尤其重要——病例数据能不能出医院,是红线问题;哪怕脱敏,我也建议敏感数据别上云。

⑥ 技能与扩展

Claude Code 有 Skills / MCP,扩展深度最深;Codex 背靠 OpenAI 全家桶;WorkBuddy 兼容 OpenClaw 技能市场,装技能像装 App;dsh 一切皆插件,自由度最高。扩展能力的丰富程度,决定了这个工具你能用多深、走多远。

⑦ 国内可用性

WorkBuddy 原生中文免魔法,国内直接下载;dsh 本地部署,网络不是问题;Claude Code 和 Codex 要过网络和支付两道关,还得应付风控和实名。别小看这条,多少人的"最强工具",卡死在支付上。

七张牌打完了,你看出来没有?没有哪个工具在七条上全赢——这恰恰说明它们不是竞争对手,是互补的。你的任务,是找到"自己最在意的两三条"上最强的那个。

◆ ◆ ◆

四、钱的真相:免费的东西,账单藏在哪?

聊钱,是最容易让普通人踩坑的地方。我把它拆成三句话。

第一句:免费,不等于不要钱。

dsh 软件不要钱,但每次干活都在烧模型 API 的 token。我见过有人把它挂后台跑一宿批量任务,第二天一看账单,肉疼。Claude Code 和 Codex 的订阅额度看着是"包月",但重度用起来照样能提前耗尽——社区里"200 美元两天烧完"的帖子不是段子。用之前先估算,小任务随便跑,大任务先掂量。

第二句:订阅,是给重度用户准备的。

Claude Code 一个月 20 美元起,Codex 随 ChatGPT 订阅含额度。你天天用、往死里用,订阅划算;你一周用两次,那就是给厂商送钱。给你算笔账:一个月 20 美元,折合人民币一百四五十块,够吃好几顿好的了——如果它一个月帮你省下的时间不值这个数,就别买。我的建议是:先用免费额度或按量把流程跑通,确定自己真的天天用了,再上订阅。

第三句:最贵的,往往不是工具,是你的时间。

很多人的真实成本,是花了三个晚上装一个根本用不上的工具。还有一层更隐蔽的成本:学一个工具的时间。普通人学一个新工具,从陌生到顺手,少说一两个晚上——这个投入,比 20 美元贵多了。所以选工具要"少而精",别广撒网。时间比订阅费贵多了,这句话我写稿时又默念了一遍。

◆ ◆ ◆

五、普通人的选择路径:三类人,三套方案

讲了这么多,落到实操。先问自己三个问题,答案就藏在这三个问题里:

要不要写代码? 这里的"写代码"是广义的——包括"想不想让 AI 帮你写个自动化的脚本"。要,就去 Claude Code / Codex 里二选一;不要,往下走。

愿不愿意折腾? 愿意花半小时装环境、配 Key、看教程,dsh 适合你;连这半小时都不想花,WorkBuddy 就是为你准备的。这不是懒,是匹配——你还有更值得花时间的事。

预算多少? 零预算起步——dsh(软件免费)+ 国产模型 API,几毛钱能跑小任务;愿意月付——再考虑订阅。先有需求,再掏钱,顺序别反。

顺着走,就是三套方案:

方案 A:完全不碰代码、只想省事(大部分人)→ WorkBuddy。下载安装,绑定微信就能用,先跑起来,建立"原来 AI 真能替我干活"的体感,比什么都重要。别管别人说它"不如程序员工具强"——你的目标是省事,不是写代码。

方案 B:有点动手能力、在乎数据可控 → DeepSeek Harness。软件免费、本地可跑、能力强,值得花半小时入门。本号之前发过保姆级教程,照着走就行。它可能不是四个里"最聪明"的,但它是四个里"最听你的"。

方案 C:程序员、或想认真学编程 → Claude Code 或 Codex。一个贴身改代码,一个云端批量跑,二选一,别都上。想省事一点就 Claude Code,想要"关电脑也能跑"就 Codex。

再多说一句:这三个方案不是终身制。先按现在的状态选,用熟了再升级。今天我选 A,明年我可能就想去 B——没关系,工具是楼梯,不是终点。

如果你看完还是纠结,我给你一个"作弊"办法:把这四个工具名分别写进搜索引擎,搜"XX 入门教程",哪个教程你能一字不差看完且不犯困,就选哪个。工具这东西,你愿意学它,比它本身多强更重要。

这周就能做的三步(可带走)

1拿出一张纸,写下你每周最烦的三件重复活
2对着三类方案,把每件活对号入座到工具
3选一个工具,跑一个 10 分钟的小任务,感受"会干活"和"会聊天"的区别

◆ ◆ ◆

六、我的选择:一个医生的真实工具链

写到这里,该交代我自己的答案了。我四个都在用,但分工完全不同——每个工具干它最擅长的活,这才叫人机协同。

本地数据相关的,我用 dsh。 比如分析我科上个月的 DRG 数据——这种涉及内部数据的活,我绝不会往云上丢。dsh 本地跑,数据不出电脑,我心里踏实。文献整理、批量文件处理,也是它的活:丢给它 30 篇 PDF,让它按"研究设计—样本量—主要终点"抽成表,早上起来结果已经躺在文件夹里。它干的活不炫,但都是我每天要面对的真活。

写文章、做内容,我用对话式 AI 加本地工作流。 你现在看到的这篇公众号文章,就是"AI 起草 + 我逐句改 + 本地脚本排版"的产物。公众号排版那套流水线,我把它做成了半自动——AI 写初稿,脚本转格式、检测"AI 味"、校验合规,最后进草稿箱,我人工过目再发。你看到的不是一篇文章,是一条流水线。我这么做的原因很实际:医生的时间是碎的,能自动化一分是一分。

办公室杂活,我交给 WorkBuddy 这类工具。 会议纪要、资料初稿、科室群里的零碎问题——不值得动用大工具,前台文员干这个正好。别小看这些杂活,它们吃掉的时间,比你想的多得多。

Claude Code 和 Codex,我用得最少,但它们是"上限"。 当我想做点真正复杂的自动化——比如给自己写个小工具、改造一套流程——它们就是那个能帮我实现的"顶尖程序员"。我在学,但我知道那不是普通医生的主战场。我把它们当"进修课",不当天天用的"门诊室"。

说句实话:工具越多,越要克制。我的原则是——每个工具先跑通一个真实任务,再决定要不要留下它。没跑通任务的工具,一律卸载。

◆ ◆ ◆

七、别被"最强"绑架

最后泼几盆冷水,每盆都是身边真实见过的坑。

第一盆:跟风买最贵的订阅,是普通人最大的浪费。 "Claude Code 最强"没错,但你一个月就打开三次,这 20 美元就是沉没成本。跑步机效应,在 AI 工具上重演得淋漓尽致。买之前先问自己:这个月,我已经为它想好三个要干的任务了吗?想不出来,就别买。

第二盆:把"最强"当"最适合",会自我怀疑。 装了两天没跑起来,不是你笨,是工具本来就不是给你设计的。装不上的工具,不是你的问题,是匹配问题。就像你让一个骨科大夫去进修心内科手术,不是他不行,是方向不对。

第三盆:一次装四个,等于一个都没用好。 工具是练出来的,不是装出来的。先用一个工具把一件真事干成,再谈扩军。我见过最夸张的同事,手机里五个 AI App,最后常用的还是微信自带的那个。

第四盆,给同行特别提醒:数据这条线,谁都不能碰。 不管用哪个工具,患者的真实信息一个字都不能进公共云——哪怕脱敏,也要反复确认。开源本地工具(比如 dsh)在这点上天然有优势,但前提是你能管住自己的手——别把装着全院数据的文件夹整个丢给它。

工具是手段,你要干的活才是目的。这句话,值得贴在显示器上。

◆ ◆ ◆

写在最后

回到开头那个外科朋友的问题。我现在会这么回他:先别管谁最强,先告诉我,你每天最烦的是哪件重复的事?

是整理资料,就去试试 WorkBuddy;是想自己掌控、愿意花半小时折腾,就去装 dsh;是想学编程,再考虑 Claude Code 或 Codex。AI 时代不缺更强的工具,缺的是知道自己要干什么的人。

这四个工具,我还会继续用下去,也会继续把真实的使用过程写给你看。毕竟我这个公众号,从一开始就是"一个医生用人机协同干活"的直播现场——装什么工具、踩什么坑、省了多少时间、烧了多少钱,我都会如实记下来。

如果你看完这篇还是不知道怎么选,也没关系。本周先做一件事就够:把那个外科朋友的问题,拿来问问自己——"我最烦的重复活是哪件?"想清楚了,再来找我,我们下一篇接着聊怎么让 AI 把它接走。

与各位共勉。

留言告诉我:你最烦的重复活是哪件?

关注「阿金的AI学习」,每周两篇医生视角的 AI 实战笔记

点赞收藏转发

(作者注:本文为个人 AI 工具使用体验与公开资料整理,不构成任何诊疗建议;涉及价格、版本、功能的信息以各官方最新发布为准。文中示例任务均为脱敏/虚构场景,涉及患者信息请遵守医院数据管理规定。)