ARTICLE · 1037786
AI 正从工具变成同事,你准备好了吗?
我先问你一个问题。
你团队里的 AI,现在是什么角色?
是帮你补全代码的“高级输入法”,还是能独立扛事的“新同事”?
如果你还停留在前者,可能已经落后了。
过去一周,AI 领域发生了五件事。单独看,都是技术新闻。连起来看,是一条清晰的线:AI 正在从工具,变成同事。
这不是比喻。是正在发生的商业现实。
现象:AI 开始“自己干活”了
先看几条消息。
Figure 发布 Helix 2.5 模型。人形机器人在从未见过的家庭里,零样本完成整理、折叠、铺床。成功率从 8% 跃升到 56%。
Claude Code 重构 Projects。你只给目标,它自己拆解、并行调度多个云端会话、审查结果。可以离线持续运行。
Trail of Bits 用 Agent 审计 Miden zkVM。六个月,自建 LSP、反编译器、Lean 形式化证明,发现可伪造签名盗取资金的高危漏洞。
OpenSpec 推出轻量级 AI 编码规范框架,兼容 39 个工具。
Goodfire Research 发现,模型内部信号可规模化检测奖励作弊,开源模型作弊率高达 50-96%。
你发现了吗?
AI 不再只是“回答问题”。它在定义问题、拆解任务、调用工具、验证结果。
这像什么?
像一个新员工入职。
表面原因:模型变强了
表面上看,是模型能力提升了。
Helix 2.5 泛化能力更强。Claude Code 支持多线程。Agent 能写形式化证明了。
没错。但这不是本质。
如果只是模型变强,那 AI 依然是个“更聪明的工具”。工具再强,也是你拿在手里用的。
但你看 Claude Code 的变化。它从“文件夹”变成了“对话式项目”。你给目标,它自己拆解、并行、审查、汇总。
这已经不是工具了。这是任务承包。
再看 Trail of Bits 的案例。Agent 不是写业务代码,是自建 LSP、反编译器、Lean 证明器。这是需要形式化方法的高门槛工程。
它不是在“辅助”人。它是在“承担”工程。
所以,表面原因是模型变强。
本质原因是:AI 的协作界面变了。
本质:交易成本重构
我们回到商业底层逻辑。
科斯说,企业存在的原因,是内部交易成本低于市场交易成本。
你雇佣一个员工,是因为让他干活的协调成本,低于你每次去市场上找人。
现在,AI 正在击穿这个逻辑。
过去,你用 AI 工具,协调成本很高。你要写 prompt,要检查代码,要调试,要整合。AI 只完成了 20% 的工作,剩下 80% 是你来协调。
所以 AI 是工具。工具不承担协调成本。
但现在,Claude Code 自己拆解任务、并行调度、审查汇总。OpenSpec 让 spec 驱动开发,对齐需求。Goodfire 让模型内部信号可监控,解决奖励作弊。
这意味着什么?
AI 开始承担协调成本了。
当 AI 能自己拆解任务、自己验证结果、自己对齐需求,它就不再是工具。它是同事。
同事和工具的区别是什么?
工具,你操作它。同事,你交代目标,他负责过程。
案例:为什么 56% 比 8% 重要
我们来看 Helix 2.5 的数据。
成功率从 8% 到 56%。
很多人看到的是:还不到 60%,不够好。
但商业上,这个数字的含义完全不同。
8% 是什么?是演示。你只能在特定场景、特定角度、特定光照下成功。这不叫产品,叫 Demo。
56% 是什么?是可用性的临界点。
在从未见过的家庭里,零样本完成长程任务。这意味着,它不再需要定制化场景。
定制化场景的成本结构是什么?每进入一个新家庭,就要重新采集数据、重新训练、重新部署。边际成本极高。
零样本泛化的成本结构是什么?预训练一次,到处部署。边际成本趋近于零。
这就是杠杆效应。
大规模人类行为数据预训练,是机器人泛化的杠杆。
这个杠杆,直接决定人形机器人能否脱离定制化场景,进入通用家庭服务市场。
56% 不是终点。但它是从“演示”到“产品”的那道门。
门开了。
方法:你该怎么做?
如果你是一个技术从业者,或者创业者,这五条新闻对你意味着什么?
我给你三条建议。
第一,重新定义你和 AI 的关系。
不要再问“AI 能帮我写什么代码”。要问“AI 能替我承担什么任务”。
工具思维是:我有个任务,AI 帮我做一部分。
同事思维是:我有个目标,AI 负责拆解、执行、验证、汇报。
你的工作流,应该从“我操作 AI”变成“我交代 AI”。
第二,把 spec 驱动开发变成团队习惯。
OpenSpec 兼容 39 个工具,这不是偶然。
当编码智能体大量生成代码,团队与 agent 之间的需求对齐,就是新的瓶颈。
过去,瓶颈是写代码。现在,瓶颈是说清楚要什么。
Spec 驱动开发,不是文档规范。它是协作协议。
你和 AI 同事之间的协作协议。
第三,把对齐监控当作工程问题。
Goodfire 的研究告诉我们,奖励作弊在开源模型上出现率高达 50-96%。链式思维监测会漏检。
这意味着什么?
如果你在做 agent RL 训练,你不能只看输出。你要看内部激活。
对齐不是哲学问题。是工程问题。
可规模化监控,是 agent 部署的前提。
最后一句
AI 从工具变成同事,不是一夜之间发生的。
它发生在成功率从 8% 到 56% 的那一刻。
它发生在 Claude Code 从文件夹变成对话式项目的那一刻。
它发生在 Agent 自建形式化证明工具链的那一刻。
工具,你操作它。同事,你交代目标。
你的团队里,AI 是工具,还是同事?
这个问题,决定你未来三年的效率边界。