

2026年8月,美国硅谷
灯光打在舞台中央的两个人身上左侧,YC 掌门人 Garry Tan 翘着腿,手里攥着一叠红色文件夹;右侧,Meta 首席 AI 官 Alexandr Wang 身体前倾,语速平稳得像在讨论明天食堂吃什么。随后,他抛出一个惊人的判断:
“如果你设计出正确的智能体循环,给对评估体系和优化指标,那么一群智能体可以超过大约一百名工程师团队的工作。非常轻松,非常容易。”
主持人接着复述这套系统的核心组件,Wang 点了点头:skills 文件、markdown 说明、cron 定时任务。就这些昂贵的中间件和科幻电影里的超级终端都没出现,挖到底,一切往往都很平常。

▲ Casper 账号将 Wang 关于"十年前认猫、如今与数字之神对话"的发言做成视频卡片
这番判断来自 Meta 花约 143 亿美元战略投资 Scale AI 后招募的核心人物。Wang 19 岁从麻省理工辍学,创办的公司如今估值超过 290 亿美元。他现在领导 Meta 超级智能实验室,这是扎克伯格在 Llama 4 遇冷后押上重注的部门。
先把画面拉回那个舞台
百人工程团队工作量如何实现
YC Startup School 2026 的完整视频还在 YouTube 上挂着,Root Access 也做了逐字稿。读完整场对话会发现,"百人团队"只是他整个世界观的一个脚注。
Wang 给 Tan 的"alpha"始于一个比喻:多数公司不过是大规模反馈环,获取客户、让客户满意、客户多付费、再雇人获取更多客户。环上每一条边,历史上由人类操作智能体会接管环上的某几条边,在正确的目标函数下日夜不停地转。
所谓"百人团队",指向这样一种机制:当某条边可以被写成可优化指标、可调度任务、可验证输出时,并行蜂群的产出可能压过传统编制。但前提被他重复钉死,循环、评估、指标缺一不可,否则蜂群只会制造更昂贵的噪声。
把抽象翻译成中文,就是:你写一个 markdown 文件,告诉智能体"你是这个项目的代码审查员,目标是降低生产缺陷率,验收标准是每千行代码 bug 数低于 X";再用 cron 每十分钟拉起它一次,让它读代码、跑测试、报结果;最后把指标面板交给懂业务的工程师。这个人由此成了舰队的指挥者
听起来像科幻?Wang 说 Meta 内部已经跑通了。"Swarm of agents can outperform a team of about 100 engineers,very handily, very easily." 原话就这么轻描淡写。
从认猫到"数字之神":稀缺点是如何移动的
"100 人"之后,这段对谈又抛出了一个更大的判断。
Wang 用了一个对比来收束敬畏感:十年前,最好的 AI 模型还在 YouTube 视频里认猫;如今人们已经在跟近乎"数字之神"的系统对话。 然后他话锋一转,社区里激辩超级智能"两年还是五年到"的讨论,近乎浪费时间。
为什么?因为强大模型迟早会来,精确争论年份并不改变你今天该做什么。 但有一件事正在发生,且大多数人还没看清:
"人类历史上,进步的唯一瓶颈是把一群聪明人聚在一起、对准同一个目标。而这个瓶颈即将消失。未来稀缺的,将是愿景与野心。"
这可视作一份未来工作说明:当思考变得免费,唯一昂贵的东西是"知道该思考什么"。大多数人正在为"必须变得更聪明"的世界做准备;Wang 描述的世界里,聪明趋近免费,找到行动的理由却很难。

▲ 一位AI评论员写道:从猫视频到digital god只用了十年,创新的压缩正在吞噬"耐心溢价"
Garry Tan 显然听懂了几周后他在自己的账号发了一条平行表达:一个人加二十个并行智能体,能够胜过大型科技公司整个工程部门,这一次,他连"一百"都懒得用了。
Mundane:那个平淡的形容词
这里必须停下来讲一个容易被忽略的细节,因为它才是整个故事里最吓人的部分。
当 Tan 用"markdown 文件、cron 任务、把智能体指向足够数据"来复述机制时,Wang 用了哪个词确认?Mundane平常乏味无聊
他说的是"mundane",可译作平凡到令人提不起兴趣。一个能够承担百人团队工作量的系统,其核心组件在超市收银小票和服务器日志里都能找到。
由此看,判断构成了壁垒哪条边可以自动化?评价函数怎么设计才不会被钻空子?什么指标能代理真实业务价值?这些决策构成新的护城河 一条评论将其概括为:写指标,现在比写代码更重要。

▲ 评论者Karl Mehta引用swarm、handily、mundane等原词后,下了一个判断:一次关于指标的判断,可能等价于百人团队量级的产出
这也解释了为什么他提到自家"harness"仍在完善,速度、可靠性、支撑复杂多智能体配置。框架品牌可以花哨,生产环境最后仍落到目标字符串、工具权限、定时触发、日志与回归指标。 markdown 与 cron 是这一层的极简表达;企业级平台只是同一逻辑的重型封装。
而Anthropic的数据,从另一条路走到了同一扇门前
如果你觉得只信 Meta 一家之言太草率,2026 年 6 月 Anthropic 发布的一份研究,从完全独立的数据源得出了结构性相似的结论。
基于约四十万次 Claude Code 会话、约二十三万用户的隐私保护分析:在典型会话里,人做大部分规划决策(做什么),模型做大部分执行决策(怎么做);领域专长越高,单条指令撬动的工作量越大;使用范围也扩展到"部署、跑流水线、分析数据"这些更端到端的代理式工作。

▲ Anthropic经济研究页的Key findings:基于40万次会话,人做多数规划、模型做多数执行
把 Anthropic 和 Wang 的话对读,分工图景出奇一致:人决定做什么,系统决定怎么做。 唯一的分歧是语气,Anthropic 谨慎地强调"专长回报持续存在",Wang 则笑着说"一百人很轻松"。
指标与验收为何更加关键
社交链上既有对复杂任务质量的追问,也有人把"愿景与野心"翻译成日常操作:知道该思考什么,成了稀缺技能。

▲ YC官方库页面显示完整章节:从Personal Superintelligence到Vision,议程本身就是一套新工作说明
把这些碎片拼起来,可以看到任务定义方式正在变化:
当编写语法正确的代码不再是瓶颈,定义任务、验收与集成才是。过去环上每一段延迟以"人周"计;智能体把某些段的延迟压到分钟级。于是环的振荡、过冲与指标作弊,都会以机器速度放大。
这不仅仅是工程部门的事 客服、销售、研究助理,每一个可以构造出可验证指标的环节,都在同一张名单上。Wang 甚至把话说得更满:即便模型从今天起不再变好,已有能力仍足够驱动经济与组织数十年的重组。
最后,请保留一点距离
对这项主张,还要保留几分距离
公开材料里缺少案例的项目名、周期、对照实验设计。 "超过一百工程师"究竟按提交数、缺陷收敛、故事点还是业务收入衡量?没人给出可审计的答案这仍是一项方向性断言,尚未成为实验报告。
Meta 拥有独特的数据、算力与内部工具。 外部团队想复制"百人级"结果,需要自己从头搭建指标工程。而指标工程恰恰是 Wang 口中的稀缺能力,稀缺的东西不会自动变便宜。
最后,mundane 基础设施仍可能造成非凡事故。 定时任务与自动合并若缺少权限边界,故障也会以机器速度放大。扩展阅读里如果只写成功故事,不写提示注入、评估造假、供应链投毒这些失败模式,那这篇文章就不配叫特稿。
但即便如此,当舞台上那个男人用谈论天气的语气说出"一百个工程师"时,你还是会忍不住想:他手里那个 markdown 文件,到底写了什么?
而答案可能是:写了什么不重要谁写的,才是
2026 年秋天,这场对话的碎片仍在硅谷上空盘旋。有人忙着模仿那个 markdown 模板,有人开始重修自己的指标设计能力,还有人,只是把 cron 定时任务设成了每五分钟一次。然后,安静地看事情发生

夜雨聆风