夜雨聆风学习资料网

ARTICLE · 1037786

AI 正从工具变成同事,你准备好了吗?

AI 正从工具变成同事,你准备好了吗?

我先问你一个问题。

你团队里的 AI,现在是什么角色?

是帮你补全代码的“高级输入法”,还是能独立扛事的“新同事”?

如果你还停留在前者,可能已经落后了。

过去一周,AI 领域发生了五件事。单独看,都是技术新闻。连起来看,是一条清晰的线:AI 正在从工具,变成同事。

这不是比喻。是正在发生的商业现实。

现象:AI 开始“自己干活”了

先看几条消息。

Figure 发布 Helix 2.5 模型。人形机器人在从未见过的家庭里,零样本完成整理、折叠、铺床。成功率从 8% 跃升到 56%。

Claude Code 重构 Projects。你只给目标,它自己拆解、并行调度多个云端会话、审查结果。可以离线持续运行。

Trail of Bits 用 Agent 审计 Miden zkVM。六个月,自建 LSP、反编译器、Lean 形式化证明,发现可伪造签名盗取资金的高危漏洞。

OpenSpec 推出轻量级 AI 编码规范框架,兼容 39 个工具。

Goodfire Research 发现,模型内部信号可规模化检测奖励作弊,开源模型作弊率高达 50-96%。

你发现了吗?

AI 不再只是“回答问题”。它在定义问题、拆解任务、调用工具、验证结果

这像什么?

像一个新员工入职。

表面原因:模型变强了

表面上看,是模型能力提升了。

Helix 2.5 泛化能力更强。Claude Code 支持多线程。Agent 能写形式化证明了。

没错。但这不是本质。

如果只是模型变强,那 AI 依然是个“更聪明的工具”。工具再强,也是你拿在手里用的。

但你看 Claude Code 的变化。它从“文件夹”变成了“对话式项目”。你给目标,它自己拆解、并行、审查、汇总。

这已经不是工具了。这是任务承包

再看 Trail of Bits 的案例。Agent 不是写业务代码,是自建 LSP、反编译器、Lean 证明器。这是需要形式化方法的高门槛工程。

它不是在“辅助”人。它是在“承担”工程。

所以,表面原因是模型变强。

本质原因是:AI 的协作界面变了。

本质:交易成本重构

我们回到商业底层逻辑。

科斯说,企业存在的原因,是内部交易成本低于市场交易成本。

你雇佣一个员工,是因为让他干活的协调成本,低于你每次去市场上找人。

现在,AI 正在击穿这个逻辑。

过去,你用 AI 工具,协调成本很高。你要写 prompt,要检查代码,要调试,要整合。AI 只完成了 20% 的工作,剩下 80% 是你来协调。

所以 AI 是工具。工具不承担协调成本。

但现在,Claude Code 自己拆解任务、并行调度、审查汇总。OpenSpec 让 spec 驱动开发,对齐需求。Goodfire 让模型内部信号可监控,解决奖励作弊。

这意味着什么?

AI 开始承担协调成本了。

当 AI 能自己拆解任务、自己验证结果、自己对齐需求,它就不再是工具。它是同事

同事和工具的区别是什么?

工具,你操作它。同事,你交代目标,他负责过程。

案例:为什么 56% 比 8% 重要

我们来看 Helix 2.5 的数据。

成功率从 8% 到 56%。

很多人看到的是:还不到 60%,不够好。

但商业上,这个数字的含义完全不同。

8% 是什么?是演示。你只能在特定场景、特定角度、特定光照下成功。这不叫产品,叫 Demo。

56% 是什么?是可用性的临界点

在从未见过的家庭里,零样本完成长程任务。这意味着,它不再需要定制化场景。

定制化场景的成本结构是什么?每进入一个新家庭,就要重新采集数据、重新训练、重新部署。边际成本极高。

零样本泛化的成本结构是什么?预训练一次,到处部署。边际成本趋近于零。

这就是杠杆效应。

大规模人类行为数据预训练,是机器人泛化的杠杆。

这个杠杆,直接决定人形机器人能否脱离定制化场景,进入通用家庭服务市场。

56% 不是终点。但它是从“演示”到“产品”的那道门。

门开了。

方法:你该怎么做?

如果你是一个技术从业者,或者创业者,这五条新闻对你意味着什么?

我给你三条建议。

第一,重新定义你和 AI 的关系。

不要再问“AI 能帮我写什么代码”。要问“AI 能替我承担什么任务”。

工具思维是:我有个任务,AI 帮我做一部分。

同事思维是:我有个目标,AI 负责拆解、执行、验证、汇报。

你的工作流,应该从“我操作 AI”变成“我交代 AI”。

第二,把 spec 驱动开发变成团队习惯。

OpenSpec 兼容 39 个工具,这不是偶然。

当编码智能体大量生成代码,团队与 agent 之间的需求对齐,就是新的瓶颈。

过去,瓶颈是写代码。现在,瓶颈是说清楚要什么

Spec 驱动开发,不是文档规范。它是协作协议

你和 AI 同事之间的协作协议。

第三,把对齐监控当作工程问题。

Goodfire 的研究告诉我们,奖励作弊在开源模型上出现率高达 50-96%。链式思维监测会漏检。

这意味着什么?

如果你在做 agent RL 训练,你不能只看输出。你要看内部激活。

对齐不是哲学问题。是工程问题

可规模化监控,是 agent 部署的前提。

最后一句

AI 从工具变成同事,不是一夜之间发生的。

它发生在成功率从 8% 到 56% 的那一刻。

它发生在 Claude Code 从文件夹变成对话式项目的那一刻。

它发生在 Agent 自建形式化证明工具链的那一刻。

工具,你操作它。同事,你交代目标。

你的团队里,AI 是工具,还是同事?

这个问题,决定你未来三年的效率边界。

相关学习资料