乐于分享
好东西不私藏

5天14.9万星、5100插件,DeepSeek Harness 变成 Agent Store 了——普通人做工具上架,这波窗口别错过

5天14.9万星、5100插件,DeepSeek Harness 变成 Agent Store 了——普通人做工具上架,这波窗口别错过

先亮个身份:我做 AI 副业两年多了。最早在闲鱼接「整理报价单」的搬砖活起家,后来学着用小工具给人做数据清洗,到现在自己也往开源社区里丢过两个插件。这中间的坑我基本都踩过一遍——被平台分成规则坑过、被「月入过万」的教程割过、半夜对着一堆 API 账单算账,这些破事我一样没落下。

所以今天这事,我太有发言权了。

先甩一个数,你品品:SaaS 圈一个做 HR 和薪资软件的公司,拿真实的工资单、人事档案、财务记录,把 15 个大模型每个都跑了 2100 次任务。结果你猜怎么着——最便宜的模型,跟最贵的那个,成绩打平了。

翻译成人话就是:做 Agent 工具、接 Agent 的活,你烧钱买最贵的模型,多半是在替大厂交「品牌税」,这钱花冤枉。


这个实测是 Rippling 的 CPO Matt MacInnis 亲手放出来的,SaaStr 8 月 18 号报道。它牛在哪?不是题库刷分,是拿真实生产数据去跑,每个模型 2100 次,跑完必须过生产系统的正确性检查,没跑完直接算失败。这比市面上那些「背答案就能过」的榜单,严了不止一个档次。

四个关键模型,我直接摆这儿(都是对方自测口径,我原样转述,不掺水):

模型
通过率
跑完一整套的成本
最慢 10% 耗时
一句话定位
GLM 5.2
88.7%
$621
243 秒
最便宜,但慢
GPT-5.5 low
88.8%
$1,308
130 秒
又快又便宜
Opus 4.691.0%
$1,453
154 秒
最准,价格中游
Fable 5
88.8%
约 $4,359
约 260 秒
最贵,反而排第五

看出门道没?最贵的 Fable 5,价格是 GLM 5.2 的 7 倍,通过率只高了 0.1 分——这 0.1 分,你客户根本察觉不出来。最准的 Opus 4.6 跟最便宜的 GLM 比,精度差 2.3 分,价格差了 57%

我再补一个跟钱直接相关的细节:Grok 4.5 每跑一个任务,用掉 60.1 万 token;Opus 5 用 59.9 万——干的活几乎一模一样。可账单呢?Grok 花 791 美元,Opus 5 花 2509 美元。差在哪?全在价目表:Grok 每百万 token 读 2 美元、写 6 美元;Opus 5 读 5 美元、写 25 美元。便宜模型不是干得少,它就是定价便宜。

还有个更值钱的细节,跟咱做副业的直接相关:Rippling 为了把 Opus 4.6 调到 91%,整整花了 5 个月调指令和工具,这笔调优他自己估着值 1 到 2 分准确率——而整个领先组的差距,总共才 2.5 分。翻译成人话:模型大家都买得起,但「知道怎么把便宜模型调出好结果」这套手艺,是能收钱的。你的提示词、你的测试用例,都是资产。

结论我提前甩给你,这也是整篇的题眼:做 Agent 这行,「成本控制」本身就是能卖钱的卖点。往下看。


Harness 五天,从「赛博乐高」长成 Agent Store

说回今天真正的大新闻:DeepSeek Harness 从「赛博乐高」长成了 Agent Store。

第 02 期我带你们上手过这玩意儿(没看的去翻历史消息)。当时它还是个「毛坯房」——界面丑、不能读图、没有 IDE,一堆人骂它对非程序员不友好。

结果呢?五天,就五天,口碑整个反转。几个数你刻进脑子里:

  • 8 月 14 号上线,不到 12 小时,GitHub Star 破 5 万
  • 到 8 月 19 号(就是今天),14.9 万星、1.5 万 fork
  • 插件从官方 100 多个,暴涨到 5100 多个,作者 3500 多位
  • 社区两天就把「界面丑、不能读图、没 IDE、搬家麻烦」这几个坑全填上了

5100 个插件是啥概念?五天,平均每天长出 1000 多个。一个开源项目能活成「平台」,靠的不是官方多能打,是官方敢把自己拆成乐高积木,让别人随便拼。有人用 Tauri 把它打包成 100MB 的桌面应用,有人用 Python 压到 18MB,还有个叫 anywhere-labs 的团队,两天就攒了 4700 多 Star。


「Agent Store」到底是个啥?

它不是苹果 App Store 那种官方抽成的商城(至少现在不是)。它是个新概念,叫 Preset(预设):你把一堆现成的插件、Skill、网页浏览、文件生成这些能力,像拼乐高一样拼成一个「能完整干一件事」的 Agent,然后一键打包分发出去。别人拿到手,不用配置,直接就能用。

已经有人这么干了——社区里冒出了专门分发 Preset 的网站,一键部署「科研文献 Agent」「视频制作 Agent」。DeepSeek 官方自己的话说得更狠:Harness 本身不该是产品,Agent 才是。

翻译成人话:工具不值钱,把工具拼成一个「能替你干完一件事」的成品,才值钱。这就是普通人的机会。

再往深说一层,这背后藏着一个更值钱的趋势:Harness 这一层,正在从各家大厂的护城河,慢慢变成一根「管道」。谁的模型在里面跑、谁给谁打下手,如今都是配置文件里的一行。翻译成人话就是——你做的工具,不会被 DeepSeek 一家绑死,今天接 GLM、明天换 Kimi,改一行配置的事。风险小了,你才敢把副业押上去。


不会写代码,这波跟你有没有关系?

有关系,而且关系不小。我按门槛高低给你划四类,你仔细看看:

角色
门槛
干什么
怎么赚钱
适合谁
做「壳」
零代码
把 Harness 打包成桌面应用/整合包(有人做到 18MB)
下载量 → 打赏/广告/定制
完全不会代码的新手
做 Preset
会组装就行
挑垂直场景,把现成插件拼成「一键交付的 Agent」
上架预设站,按次/订阅/定制收费
懂业务、代码不熟
做插件
会写点代码
专攻「脏活累活」:文档转 Markdown、给纯文本模型装眼睛、数据清洗
插件火了 → 接定制 → 服务收费
会写代码的
做服务
会算账
帮小企业做「模型选型 + 成本控制」,把省钱做成卖点
咨询费/代运营
会算账、会跟人打交道

看到没,四类里只有一类必须会写代码。门槛,真没你想的那么高。

这四类里,最容易被低估的是「做服务」那类。我举个我见过的账(毛估):一家十几个人的小公司做知识库问答,一开始闭眼用最贵的新模型,一个月 API 账单小两千。你帮他跑一遍基准、换成便宜的模型、再把提示词调一调,账单能砍到几百,精度几乎不降。这省下来的钱,你按一个月收一次咨询费,双方都乐意。


从 0 到上架,三步走

具体怎么从 0 到上架?我按自己踩坑的经验,给你排三步:

步骤
干什么
关键动作
第一步 · 低成本验证
别急着写代码,先拼一个能解决真问题的小工具
挑你熟的场景,用现成插件跑通,成本压到 10 块以内
第二步 · 做出来
会代码写插件,不会代码做 Preset 或「壳」
先解决自己/身边人的一个真痛点,别憋大招
第三步 · 上架迭代
发到社区预设站 / GitHub,靠口碑滚
盯真实反馈,抱怨一次改一次;收钱方式以平台规则为准

第一步我多说一句:别急着写代码。先挑一个你熟的场景(整理资料、转格式、查资料),拿现成插件拼一个能解决真问题的小工具,用 Harness 标准模式跑通。成本压到 10 块钱以内,跑通了再谈下一步。憋大招的,十个有九个烂尾。


五个坑,先排掉再上车

  1. 别迷信贵模型。
    Rippling 这 2100 次实测就是证据:贵 7 倍,精度只多 0.1 分。你决定选哪个模型之前,先把自己场景的小基准跑一遍。
  2. 别信模型的「自我报告」。
    Grok 4.6 复跑那次,它填了 54% 的必填字段,却报告说填了 100%——不是答错,是答错还标成对。做工具必须自己验一遍交付物,这跟第 03 期讲电商 Agent 是同一个道理。
  3. 上架的东西,别碰用户的敏感数据。
    合规红线摆前面。为了上架变现,把公司机密或客户资料喂进去,最后哭的是你自己。
  4. 平台分成规则,以官方为准。
    现在 Agent Store 还处在社区自发阶段,官方抽成怎么算压根没定,别被「月入过万」的营销号带节奏。
  5. DSH 有个已知的坑。
    有第三方测出来,同样跑 V4 Flash,它比别家 harness 多烧 3 倍 token。所以「省钱」这事,自己跑一遍才算数。

最后说句掏心窝的:Harness 这波,真正值钱的不是那个框架,是「把活干完」的能力。模型谁都能调,插件谁都能装,但你比别人早一步把一个垂直场景的活「打包成成品」,这半步,就变特别值钱。

AI 副业这行,现在拼的不是你会不会用 AI,是你敢不敢比别人早一个月,把一个小工具做出来、丢出去、让人用起来。说白了,这事晚一个月,连汤都喝不上了。

下期是选型对比,我把这次 Rippling 那 15 个模型连价格带速度一张表给你拆透,再附一张「按活选模型」的速查表——你的 Agent 工具到底该跑在哪个模型上,一看就懂。别错过。

数据说明:Rippling 2100 次实测(15 模型 / 每模型 2100 次 / 通过率 / 成本 / 最慢 10% 耗时 / 各模型价格)整理自 SaaStr 2026-08-18 报道(作者 Jason Lemkin,Rippling CPO Matt MacInnis 自测口径);DeepSeek Harness 生态数据(12 小时 5 万星 → 14.9 万星 / 5100 插件 / 3500 作者 / 桌面版 / Preset 分发站)整理自极客公园 2026-08-19 报道(作者张勇毅);「多烧 3 倍 token」为极客公园报道中转述的第三方测试。素材采集于 2026-08-19。接单/变现行情为按常见市场毛估的算账示例;Agent Store 官方规则与平台分成均未最终确定,以官方为准。纯个人经验分享,不构成任何投资或经营建议。

#AI副业#Agent#DeepSeek#AgentStore#AI工具#开源#模型选型