哪些工作,能彻底脱离我、让AI自己跑完。
这,就是我理解的 AI first。
我只给目标和验收标准,不规定它怎么实现。使劲“PUA” AI自己去解决问题。

这两年整个行业的重心,就是从单轮对话的co-pilot,转向能长时间自主跑的goal-driven系统。
物理学背景的AI大牛姚顺宇也在采访中说自己想研究攻克的方向是“Long horizon”。这个确实很难,误差会复利放大(0.95¹⁰≈60%),context越拉越长、注意力会被稀释......

自主性是一个"设计选择",不是LLM的能力提升就能解决的。一个很强的模型,你可以刻意让它半自动、每步都回来问你;一个没那么强的模型,在边界清晰的小任务上你也可以放它全自动。给多长的绳子,是你定的,需要做harness engineering。
这就是 AI first 作为设计哲学的核心:不是在用一个agent,是在设计它的“自主度”。
我这半年最烧时间的事,就是在练这个。尤其是2-4月份精力都在养龙虾(已从 OpenClaw 迁到 Hermes agent):Jarvis 当调度官(主agent)下面的子agent :huatuo管健康、SMS 管交易、Mei-di 管社媒。 我没把AI当一个对话的框,而是一个架构的组织。
另一个"自主性"是尝试做AI trading agent。真金白银7×24地跑,人在loop外。我试过多个AI trading agent产品,也自己设计过AI trading agent,当前都还不满意,还被盗了1000U😭
以下梳理了几个日常场景,我会对照着看自己是不是真的在用 AI first 思维。
【写周报】❌ 每周自己回忆一遍写好,让AI把措辞润色一下。✅ agent自动从 Obsidian、日历、聊天记录里抓素材、生成初稿,你只做终审。【查资料】❌ 有问题就问一句、把答案复制回来。✅ 派deep research agent自己去查、workflow multi-agent去交叉比对,产出结构化结论,你只做判断。【客服】❌ 自己回消息,回不过来时让AI帮你想措辞。✅ 针对具体场景搭一个agent,自主处理80%,剩下20%才升级给人。【日程·健康】❌ 想起来了才问AI一条建议。✅ 接入日历/WHOOP手环等API,agent持续监测、主动协调,用心跳机制按时提醒。【投资决策】❌ 对话里让AI给个"买不买",然后照做。✅ agent持续跟踪、主动推送信号与风险、标注置信度,你只负责拍板。
2|从vibe coding 做玩具
vibe coding去年年底热度很高,很多人在吵它到底行不行。我觉得这问题问错了。该问的不是"vibe coding 行不行",是"手上这个东西,容得下多少 vibe"。
但只要一个东西开始"自己跑"、而且"错了有代价",需要的工程量就陡增,专业要求就高的多。
代码库越乱,AI 在里面越容易懵、越容易改错地方,你的协作者现在也要读你的代码。所以在 AI 时代,工程思维和纪律没有变得不重要,是在"高自主"的地方变得更重要了。
vibe coding或许能解决99公里,最后的1公里还是需要专业的程序员。这是人家吃饭的本领,不是普通人随随便便用个AI就能替代的。
3|真正的杠杆在harness engineering
这半年新概念一个接一个冒:
prompt engineering、context engineering、harness engineering、FDE……
看着眼花,但杠杆的位置一直在往上游走。抠单条prompt的收益早已见顶。context现在动辄很大,于是很多人的第一反应是"把所有东西都塞进去",这恰恰是错的。
context不是越多越好,塞太多,模型的注意力会被稀释,反而变笨。
这门手艺真正的前沿,已经从"往里放什么"变成了"从里面删什么"。
harness engineering说白了就是给模型搭一个好的干活环境:CLAUDE.md怎么写、context怎么裁、权限的爆炸半径怎么隔离、工具怎么挂。我自己的CLAUDE.md原则就加了“减法原则”。模型越强,越需要你帮它把注意力收敛到该看的地方。

我的Claude code - claude.md 文档 👆
4|给agent接通“四肢”,接口配好才能跑更远
只会生成文本的AI是嘴,能调CLI的AI才有手。我把Vercel、Railway、gh、AWS的CLI全给它配好,agent能自己部署、自己提交、自己动基础设施。/goal启动,auto模式打开,剩下的它自己跑。
这背后是个更大的趋势:模型本身在快速商品化,但套在模型外面的那一层:工具、权限、harness是自己的。等MCP、tool use、computer use这些能力成熟,agent就能真正碰到真实世界。想让AI替你干活,先把真实世界的接口交到它手里,光会出主意的chatbot不值钱。
5|用AI的速度快速证伪,别慢慢完善
造东西的成本被打到接近零,带来一个后果:这周你能做出来的东西,别人这周也能。所以"做得快"不再是优势,"学得快"才是,谁能更便宜、更快地把错的想法杀掉,谁赢。
我自己就是这么干的。数字员工的toC方向,找6个人测试,直接证伪,那就砍掉转toB。AI策略相反,5个用户,加上已经在Binance合约上跑出的真实收入,说明方向对,那就往下做。Agent交易平台出了点问题,先闲置,不硬撑。海外Crypto和美股交易平台慢慢优化,逐渐放手给Agent管理。。
不对自己做的东西有感情。AI给最大的红利不是产能,是让能低成本地做很多次证伪商业模式。
6|不做中间件,钻进具体的生产场景
前沿模型每吸收一个新能力,就有一批做通用中间层的产品死掉,参考Claude design对figma的降维打击。中间件自己薄薄的那一层,大厂更新一个功能就替代了。
那护城河在哪?在模型吃不下、也懒得碰的地方——独家的数据、一个足够具体足够痛的生产场景、分发渠道、以及信任和关系。微笑曲线,做两头生意在AI产业也生效。

所以AI数字员工这门生意,我的结论是必须to B,面向具体的生产环境去做,token出海。判断一个AI产品能不能活,就问一句:大厂加个feature,你还在不在?
7|AI没让人变闲,它把工作重新分配了
AI能力大爆发,没让任何人变闲。它夺走了用不好AI的人的工作,同时加重了用得好AI的人的工作。
"AI解放人类、每周四天工作制"这套叙事,和我看到的现实是反的。恰恰因为杠杆变高了,休息的机会成本也跟着变高,用得好AI的人反而更忙,只是忙在更高杠杆的事情上。这道口子在快速拉大,中间地带在消失。
我上半年基本闭关搞AI,是真的累。所以下半年强迫自己减少develop,多社交、多休息、多读书。用得好AI是红利,但红利也能把人烧了。
8|判断力、品味、健康,才是真正的瓶颈
当一种生产要素变得极度便宜,价值就会转移到它的互补品上。 而"执行",包括“写代码、做设计、写文案、跑数据分析...“,正在飞快地变成那个便宜的要素。
那价值往哪儿跑?往判断力、品味、分发、信任、以及独有的数据、经验、context上跑。

把精力放在那些"因为AI变便宜、反而变贵"的东西上面。
大多数人是对着"当前这个模型能干什么"去做产品,到处拿着锤子找钉子。
对着导数做产品,架构要让每一次模型升级都能白嫖到红利,而不是被它一口吃掉。这一点我是亲身经历的——Opus从4.7升到4.8,我什么都没改,一觉醒来整个系统的能力上了一个台阶。Fable 5 刚出来,我立即让它把所有的产品代码debug加固,算是赶上了Fable 5的昙花一现。反过来思考,如果我辛苦做的功能,模型下个版本就原生支持了,那其实是在给大厂做免费的需求调研,就是炮灰😂。
现在模型基本每隔几个月一个台阶,agentic能力(自己跑几个小时的任务、调工具、操作电脑)起得很快。这个节奏下,死磕"当下能力"的优化几乎必输,因为你优化的东西,下一版可能就免费了。
这也是为什么我一个没有开发背景的人,敢从零做全栈。"全栈"这个技能现在是可以租的,你不需要花五年去积累。但"知道该做什么、能判断做出来的东西好不好",这个租不到。别再囤能租到的技能,去囤租不到的判断力和品味。
执行被AI接管之后,人的瓶颈整体上移到了判断力、对商业模式的理解、品味审美。这些恰好是模型替不了的,只能靠大量阅读、思考、以及和真实世界互动拿反馈,慢慢长出来。
总结可以把AI的能力拆成两层——道和术。
道,是判断力、品味、审美、目标感:知道该做什么、能判断做出来的东西好不好。这层长在自己身上,长得慢,只能靠大量阅读、思考、和真实世界互动拿反馈慢慢养。
术,是把 AI 真正用起来的那套具体手艺。这层可以刻意练、能看到进步、甚至能量化。LLM“选品”成本控制、agent框架、context/prompt、agent 协作......
术决定能不能把 AI 用起来、用得顺;道决定把这份能力用来做对的事。术可以速成,道不能。
最后说一件当下最重要的事:健康。
哈萨比斯说"先解决智能,再用智能解决一切",AlphaFold已经在兑现这句话,蛋白质折叠结构问题解决了。如果你真信未来一二十年AI能把衰老和大部分疾病啃下来,那健康其实是你手里一张对未来医学的看涨期权,你得活着、活得够好,才能行权。
生产力指数级井喷的时代,健康比赚钱重要。
AI无涯而吾生有涯。该吃吃、该睡睡、该玩玩,活在当下、珍惜眼前。

夜雨聆风