夜雨聆风学习资料网

ARTICLE · 1023727

AI 自己造 AI 的进度,取决于反馈有多便宜

AI 自己造 AI 的进度,取决于反馈有多便宜

让上一代模型去改进下一代模型,只用了约 2400 条训练样本——这是最接近「AI 训练下一代 AI」的一次公开实验

9 月,Anthropic 公布了一次不起眼的实验:让早期的 Claude Sonnet 5 去改善早期的 Claude Opus 4.8。约 60 小时里,它测了 50 多种方案,只用约 2400 条训练样本,就把后者在既定评测中的对齐成绩,推到接近正式版 Opus 4.8 的水平。

几乎同一时间,9 月 10 日,一份题为《The Last AI Built by Humans》的预印本挂上 arXiv(编号 2609.11873)。作者来自上海交大、清华大学、字节跳动、上海人工智能实验室等机构,材料取自 72 家公司与团队的公开信息。它做了一件此前没人做过的事:把「递归自我改进」(RSI)拆成 L1 到 L5 五个层级

📌 本文看点

01

分数与干活

02

打分定快慢

03

谁在踩刹车

04

谁先被接走

01

A WIDENING GAP

「考试快摸到顶,干活刚过一半」

报告先造了一把尺子。它用 HCI(能力余量闭合指数)衡量模型填补了多少通往满分的差距,样本是 2023 到 2026 年 10 大能力领域的 393 组观测。结果反差很大:截至 2026 年,前沿数学的 HCI 达 86.4,研究生级科学 85.8;而软件工程只有 52.6,搜索与终端 Agent 56.8,工具调用 Agent 更是低到 39.9。

报告自己点出了原因:在边界清晰、容易验证的环境里拿到的分数,并不能自动迁移到长程、有状态的真实工作流里。会做题和会干活,本来就是两种能力。

— 分数能标定机器的上限,标不出它能不能收尾

02

THE REAL BOTTLENECK

「卡住它的不是算力,是打分」

一个改进循环要转起来,前提是每一步都能拿到可信的评分信号。报告把信号排了强弱次序:形式化验证器最强,规则与过程奖励模型居中,模型自评最弱。自我改进的真实强度,基本跟着这条次序走。

这解释了大厂进度为什么参差不齐。OpenAI 在组建 RSI 团队,Anthropic 发布《When AI Builds Itself》,Google DeepMind 用 AlphaEvolve 优化自家芯片,腾讯混元用 Hyra 做经验驱动的搜索。按五级框架对号,多数还停在 L1 到 L2;自主出题、自主求解的腾讯 R-Zero,算是摸到了 L3 的门。

到 L5,被改进的对象不再是能力,而是改进机制本身,目前只有少数候选。报告的结论是:反馈成本、可验证性、部署约束,决定了一个领域往 RSI 走的速度。代码、数学、网络安全这些当场能验对错的地方跑得快,医疗、机器人、科学发现因为反馈又贵又危险,只能慢慢来

— 反馈越贵的地方,循环转得越慢

03

WHO HOLDS THE BRAKE

「踩刹车和踩油门的,是同一批人」

这件事的安全叙事也到了高点。9 月 8 日,曾在 OpenAI 和 Anthropic 做研究的 Jacob Coxon 宣布从 Anthropic 辞职,理由是两家公司没有采取负责任的行动,而是在竞相研发能自我提升的超级智能,这份声明在 X 上的浏览量很快超过 1.7 亿次。

Anthropic 的在职对齐科学负责人公开附和,CEO 达里奥·阿莫代伊随后呼吁同行给安全研究让出一到两年,并提议让第三方评估机构常驻实验室。

36 氪转载爱范儿 9 月 15 日的分析给出另一面:能承担高额安全审查成本的,恰恰是这些头部公司;风险如何评估、哪种能力该被限制,规则也在很大程度上由它们定义。这是分析观点,不是定论。

💡 提速的理由和减速的理由,出自同一批实验室。对读者来说,值得记的不是他们说了什么,而是他们手里同时握着油门和刹车。

04

WHAT GETS GRADED

「能被自动打分的活,先被这个循环接走」

落到岗位上,会更清楚。OpenAI 在 9 月 6 日的内部报告里说,团队已经实现了「自动化研究实习生」的目标:这类系统能在人的指导下写代码、跑实验、排查故障、分析结果,其中一些任务原本要熟练研究员花上几天。截至 8 月中旬,每投入一个人类工作日,它研究部门的智能体运行时长已相当于 3.1 个工作日。

另一份今年 7 月 8 日挂上 arXiv 的综述(编号 2607.07663)调研了 1250 篇论文,结论更冷静:真正卡住这条链路的,是「研究定方向」这一环。判断一个失败的实验意味着方向错了,还是值得继续,至今仍高度依赖人的直觉。

— 说不清好坏在哪的活,还留在人手里

这轮自我改进真正在筛的,不是谁的模型更聪明,而是谁的活能被自动打分。评测越客观、反馈越便宜的工作,会越早被改进循环接走,而且交出去之后很难再要回来;反过来,说不清「干得好」长什么样的活,机器暂时接不住。所以值得问的问题,也许该从「AI 会不会取代我」换成更具体的这一句:我手上这件事,能不能被自动判分。

1965 年,数学家 I.J. Good 提出「智能爆炸」时,担心的是机器越来越聪明。六十年后真正挡在路上的,却是另一个问题:谁来给进步打分。能被验证的进步才配得上加速,这对普通干活的人来说是提醒,也可能是机会。

(本文配图由 AI 生成)

END

我是中明,每天把一件正在发生的事,多想一层。

如果这篇让你有点收获,欢迎点赞、在看、转发三连,下篇见。

相关学习资料

返回首页浏览学习资料