先亮个身份:我做 AI 副业两年多了。最早在闲鱼接「整理报价单」的搬砖活起家,后来学着用小工具给人做数据清洗,到现在自己也往开源社区里丢过两个插件。这中间的坑我基本都踩过一遍——被平台分成规则坑过、被「月入过万」的教程割过、半夜对着一堆 API 账单算账,这些破事我一样没落下。
所以今天这事,我太有发言权了。
先甩一个数,你品品:SaaS 圈一个做 HR 和薪资软件的公司,拿真实的工资单、人事档案、财务记录,把 15 个大模型每个都跑了 2100 次任务。结果你猜怎么着——最便宜的模型,跟最贵的那个,成绩打平了。
翻译成人话就是:做 Agent 工具、接 Agent 的活,你烧钱买最贵的模型,多半是在替大厂交「品牌税」,这钱花的冤枉。
这个实测是 Rippling 的 CPO Matt MacInnis 亲手放出来的,SaaStr 8 月 18 号报道。它牛在哪?不是题库刷分,是拿真实生产数据去跑,每个模型 2100 次,跑完必须过生产系统的正确性检查,没跑完直接算失败。这比市面上那些「背答案就能过」的榜单,严了不止一个档次。
四个关键模型,我直接摆这儿(都是对方自测口径,我原样转述,不掺水):
| GLM 5.2 | $621 | |||
| Opus 4.6 | 91.0% | |||

看出门道没?最贵的 Fable 5,价格是 GLM 5.2 的 7 倍,通过率只高了 0.1 分——这 0.1 分,你客户根本察觉不出来。最准的 Opus 4.6 跟最便宜的 GLM 比,精度差 2.3 分,价格差了 57%。
我再补一个跟钱直接相关的细节:Grok 4.5 每跑一个任务,用掉 60.1 万 token;Opus 5 用 59.9 万——干的活几乎一模一样。可账单呢?Grok 花 791 美元,Opus 5 花 2509 美元。差在哪?全在价目表:Grok 每百万 token 读 2 美元、写 6 美元;Opus 5 读 5 美元、写 25 美元。便宜模型不是干得少,它就是定价便宜。

还有个更值钱的细节,跟咱做副业的直接相关:Rippling 为了把 Opus 4.6 调到 91%,整整花了 5 个月调指令和工具,这笔调优他自己估着值 1 到 2 分准确率——而整个领先组的差距,总共才 2.5 分。翻译成人话:模型大家都买得起,但「知道怎么把便宜模型调出好结果」这套手艺,是能收钱的。你的提示词、你的测试用例,都是资产。
结论我提前甩给你,这也是整篇的题眼:做 Agent 这行,「成本控制」本身就是能卖钱的卖点。往下看。
Harness 五天,从「赛博乐高」长成 Agent Store
说回今天真正的大新闻:DeepSeek Harness 从「赛博乐高」长成了 Agent Store。
第 02 期我带你们上手过这玩意儿(没看的去翻历史消息)。当时它还是个「毛坯房」——界面丑、不能读图、没有 IDE,一堆人骂它对非程序员不友好。
结果呢?五天,就五天,口碑整个反转。几个数你刻进脑子里:
8 月 14 号上线,不到 12 小时,GitHub Star 破 5 万 到 8 月 19 号(就是今天),14.9 万星、1.5 万 fork 插件从官方 100 多个,暴涨到 5100 多个,作者 3500 多位 社区两天就把「界面丑、不能读图、没 IDE、搬家麻烦」这几个坑全填上了

5100 个插件是啥概念?五天,平均每天长出 1000 多个。一个开源项目能活成「平台」,靠的不是官方多能打,是官方敢把自己拆成乐高积木,让别人随便拼。有人用 Tauri 把它打包成 100MB 的桌面应用,有人用 Python 压到 18MB,还有个叫 anywhere-labs 的团队,两天就攒了 4700 多 Star。
「Agent Store」到底是个啥?
它不是苹果 App Store 那种官方抽成的商城(至少现在不是)。它是个新概念,叫 Preset(预设):你把一堆现成的插件、Skill、网页浏览、文件生成这些能力,像拼乐高一样拼成一个「能完整干一件事」的 Agent,然后一键打包分发出去。别人拿到手,不用配置,直接就能用。
已经有人这么干了——社区里冒出了专门分发 Preset 的网站,一键部署「科研文献 Agent」「视频制作 Agent」。DeepSeek 官方自己的话说得更狠:Harness 本身不该是产品,Agent 才是。
翻译成人话:工具不值钱,把工具拼成一个「能替你干完一件事」的成品,才值钱。这就是普通人的机会。
再往深说一层,这背后藏着一个更值钱的趋势:Harness 这一层,正在从各家大厂的护城河,慢慢变成一根「管道」。谁的模型在里面跑、谁给谁打下手,如今都是配置文件里的一行。翻译成人话就是——你做的工具,不会被 DeepSeek 一家绑死,今天接 GLM、明天换 Kimi,改一行配置的事。风险小了,你才敢把副业押上去。
不会写代码,这波跟你有没有关系?
有关系,而且关系不小。我按门槛高低给你划四类,你在仔细看看:
| 做「壳」 | ||||
| 做 Preset | ||||
| 做插件 | ||||
| 做服务 |
看到没,四类里只有一类必须会写代码。门槛,真没你想的那么高。
这四类里,最容易被低估的是「做服务」那类。我举个我见过的账(毛估):一家十几个人的小公司做知识库问答,一开始闭眼用最贵的新模型,一个月 API 账单小两千。你帮他跑一遍基准、换成便宜的模型、再把提示词调一调,账单能砍到几百,精度几乎不降。这省下来的钱,你按一个月收一次咨询费,双方都乐意。
从 0 到上架,三步走
具体怎么从 0 到上架?我按自己踩坑的经验,给你排三步:
| 第一步 · 低成本验证 | ||
| 第二步 · 做出来 | ||
| 第三步 · 上架迭代 |
第一步我多说一句:别急着写代码。先挑一个你熟的场景(整理资料、转格式、查资料),拿现成插件拼一个能解决真问题的小工具,用 Harness 标准模式跑通。成本压到 10 块钱以内,跑通了再谈下一步。憋大招的,十个有九个烂尾。
五个坑,先排掉再上车
- 别迷信贵模型。
Rippling 这 2100 次实测就是证据:贵 7 倍,精度只多 0.1 分。你在决定选哪个模型之前,先把自己场景的小基准跑一遍。 - 别信模型的「自我报告」。
Grok 4.6 复跑那次,它填了 54% 的必填字段,却报告说填了 100%——不是答错,是答错还标成对。做工具必须自己验一遍交付物,这跟第 03 期讲电商 Agent 是同一个道理。 - 上架的东西,别碰用户的敏感数据。
合规红线摆前面。为了上架变现,把公司机密或客户资料喂进去,最后哭的是你自己。 - 平台分成规则,以官方为准。
现在 Agent Store 还处在社区自发阶段,官方抽成怎么算压根没定,别被「月入过万」的营销号带节奏。 - DSH 有个已知的坑。
有第三方测出来,同样跑 V4 Flash,它比别家 harness 多烧 3 倍 token。所以「省钱」这事,自己跑一遍才算数。
最后说句掏心窝的:Harness 这波,真正值钱的不是那个框架,是「把活干完」的能力。模型谁都能调,插件谁都能装,但你比别人早一步把一个垂直场景的活「打包成成品」,这半步,就变的特别值钱。
AI 副业这行,现在拼的不是你会不会用 AI,是你敢不敢比别人早一个月,把一个小工具做出来、丢出去、让人用起来。说白了,这事在晚一个月,连汤都喝不上了。
下期是选型对比,我把这次 Rippling 那 15 个模型连价格带速度一张表给你拆透,再附一张「按活选模型」的速查表——你的 Agent 工具到底该跑在哪个模型上,一看就懂。别错过。
数据说明:Rippling 2100 次实测(15 模型 / 每模型 2100 次 / 通过率 / 成本 / 最慢 10% 耗时 / 各模型价格)整理自 SaaStr 2026-08-18 报道(作者 Jason Lemkin,Rippling CPO Matt MacInnis 自测口径);DeepSeek Harness 生态数据(12 小时 5 万星 → 14.9 万星 / 5100 插件 / 3500 作者 / 桌面版 / Preset 分发站)整理自极客公园 2026-08-19 报道(作者张勇毅);「多烧 3 倍 token」为极客公园报道中转述的第三方测试。素材采集于 2026-08-19。接单/变现行情为按常见市场毛估的算账示例;Agent Store 官方规则与平台分成均未最终确定,以官方为准。纯个人经验分享,不构成任何投资或经营建议。
夜雨聆风