2026 年 6 月 21 日,凌晨。
一条转发在 X 上引发了强烈震动。
投资人、CoreView 联合创始人 Ivan Fioravanti 只打了一个词:WOW。
然后他把 DeepSeek 研究员 Deli Chen 的一段话原封不动贴了出来——
"The entire RL pipeline — experiment design, code writing, running, debugging, and conclusion summarization — was 100% automated, with zero human intervention from me. This was incredibly difficult, but an incredibly important step."
「整个强化学习管线——实验设计、代码编写、运行、调试、结论总结——100% 自动化完成,我的零人工干预。这一步极其困难,但也极其重要。」



▲ Deli Chen(@victor207755822)6月17日发布的公告帖:AutoResearch SKILL 正式开源,同时放出第4篇综述论文。帖子获得1246赞、1915书签、36万次浏览

▲ Ivan Fioravanti 的引用转发,仅仅撷取最核心的那句话。118赞、169书签
这句话信息量有多大?
一个 AI 代理,自己设计了强化学习实验方案,自己写了训练代码,自己把作业提交到 GPU 集群上跑,自己盯着日志等结果、出了 bug 自己修、跑完自己分析数据、最后自己把结论写进论文。
被调去跑实验的模型,是DeepSeek 285B——参数量千亿级的真实大模型。不是实验室里跑跑 benchmark 的小玩具。
而且这件事,已经被写成了 75 页论文、配 217 条引用、经过 16 轮内部评审迭代,得分8.6/10,开源发布了。
Deli Chen 是谁?他不是在玩票
Deli Chen(@victor207755822)的 X 认证栏只有一个身份:DeepSeek Senior Researcher。
他的履历比这几个字重得多:
- DeepSeek-V1、V2、V3、V4 全系列核心贡献者
- DeepSeek-R1 核心成员
——这篇论文登上了《Nature》2025 年封面 此前在腾讯微信 AI 做 NLP,北大本硕,导师徐孙教授,LancoPKU 实验室出身 研究方向从图神经网络(GNN)过平滑,一路做到 LLM 安全水印、步级验证、RL 推理

▲ Deli Chen 个人主页。Auto Research Papers 专区醒目地列出了四篇由 AI 代理生成的综述论文
他不是那种“写个 prompt 让 ChatGPT 跑个 demo”的 AI 爱好者。他是亲手做过 V1 到 V4、亲手把 R1 送进 Nature的研究员。
而他在帖子里反复声明的是:这是我个人的业余项目,与 DeepSeek 组织无关。
一个 DeepSeek 核心研究员,用自己的业余时间,搞出了一套能让 AI 自己做完一整套研究闭环的框架。他把这套框架开源了——不交付可执行代码,只交付一套经过真实 285B 实验验证的工程协议。
不交代码只交协议,这套框架凭什么撑起 285B 实验?
打开 Deli 的项目主页,映入眼帘的是三行字:
- Zero Interaction
(禁止向用户提问) - Anti Cognitive Loop
(反认知死循环) - Heartbeat Watchdog
(心跳看门狗,三层守护)

▲ 框架主页:左侧是三种反复出现的失败模式,右侧是硬约束与三层看门狗架构
Deli 的框架文件本质是一份SKILL.md——不包含任何可执行代码,只规定了在长时间自主运行中必须遵守的工程惯例。
但这套惯例,每一条都是从“跑崩了无数次”的血泪教训里提炼出来的。
他总结了长时程代码代理的三种经典死法:
死法一:认知死循环(Cognitive Loop)。Agent 越跑越像自己,生成的想法高度重复,永远跳不出局部最优解。对策:强制新方向必须与历史所有方向不同,stale_count >= 2 就强制 pivot——改环境约束,不许再调 learning rate 糊弄。
死法二:假死(Stalling)。Agent 写完一段总结后就停下来“等用户”,外表看还在跑,其实已经死了。对策:Zero Interaction 硬约束——运行期间不许问问题、不许进 Plan Mode、不许以一个问题结尾。“准备好就去干。”
死法三:运行时脆弱性(Runtime Fragility)。上下文压缩或会话关闭后,所有寄生在内存里的定时器全挂。对策:所有进度写入 state/ 目录的文件系统——task_spec.md、progress.json、findings.jsonl、iteration_log.jsonl 等——每次迭代启动全新 session,只注入人造状态摘要,绝不“恢复”旧会话。
三层看门狗是这套系统最硬核的工程设计:
- L0
:常驻 shell 进程 - L1
:每小时 cron 定时触发 - L2
:业务循环自检
任意一层死掉,另外两层能救。这是给长时程无人值守上的“三保险”。
有人问:那你给 Agent 设了什么权限?
Deli 的回答很直白:提交真实 GPU 作业的权限。没有模拟层,没有 sandbox 隔离,Agent 拿到的是往 DeepSeek 285B 集群上直接提交 RL 作业的权限。
GRPO:一把被 AI 研究员拿去解剖的手术刀
在讲实验之前,必须先讲一个工具:GRPO。
GRPO(Group Relative Policy Optimization)是 DeepSeek 团队 2024 年在 DeepSeekMath 论文中提出的训练方法,后来被大规模用在 DeepSeek-R1 上,成为 R1 推理能力爆发的核心驱动力之一。
传统 PPO(Proximal Policy Optimization)做 RL 训练时,需要一个和策略网络差不多大的价值网络(critic)来估计状态价值,显存开销巨大。
GRPO 的做法完全不同:
对同一个 prompt,采样一组(G 个)回答 用 reward 模型或规则给这组回答打分 用组内相对排名来估计每个回答的优势(advantage),彻底扔掉 critic 网络
省掉一个和 policy 同量级的 critic,显存直接砍半。对大模型 RL 来说,这是决定性的效率突破。
但 GRPO 有个软肋:它对 group 内的多样性非常敏感。如果 reward 信号(verifier)本身有噪声——比如判断“这个数学证明对不对”的时候经常判错——那组内排名就会被污染,优势估计跟着失准。
Deli 的 AutoResearch Agent 抓住的就是这个软肋。
它设计了一套实验,系统地测量:当 verifier 的噪声越来越高时,self-play(自博弈)还能不能发挥作用?

▲ GRPO 技术概览:没有 critic 的 PPO 变体,靠组内相对排名估计 advantage,大幅降低显存,但对 verifier 噪声敏感
285B 实验:12 轮、3570 GPU 小时、五次自主修 bug
这是整套系统最核心的验证。
AutoResearch Agent 被扔进一个具体的科学问题里:在 verifier 存在噪声的条件下,自博弈(self-play)的训练增益到底有多少?噪声到什么程度会“吃掉”所有增益?
Agent 自己设计了实验方案:
使用DeepSeek 285B作为基座模型 训练方法GRPO,batch size 512,每组采样 16 条(N=16),32k 上下文窗口 18,953 道数学题作为训练集 设置四种 verifier 噪声条件:噪声翻转概率 ε 分别为{0, 0.10, 0.30, 0.45} 每种条件做种子复现,共12 轮完整 RL 运行
结果是一条单调下降的曲线:
| +4.8% | |
| −4.1% | |
ε 每增加 0.1~0.15,self-play 带来的训练增益就显著衰减,直至转负。
Agent 还做了一个更精细的子实验:调节 KL 惩罚系数。发现在 ε=0.30 时,KL=0.01 条件下居然出现了+0.8% 的缓冲反弹。这说明合适的 KL 正则化能在噪声不太高时部分保护训练质量。
总消耗:3570 GPU 小时。
这中间 Agent 碰到过五次真问题,全部自己修了。
最顽固的一个 bug:某个超参数(learning rate)被 Agent 用科学计数法写进了配置,但提交脚本把它当字符串 parse,导致训练启动失败。Agent 排查了日志、定位到类型错误、修改了参数格式、最后还把这条教训写进了一个pre-submission check 脚本,固化到后续实验流程里。
把这当成“一次性跑通就发推”的 demo,太低估它了。3570 个 GPU 小时,是实打实的验证。

▲ 论文页面:四篇论文总表。Paper #4 一行醒目标注「285B RL experiment」「6 theorems & lemmas」「8.6/10」。下方生产统计大表:~80 agent turns、600k+ tokens、15+ subagents

▲ 博客滚动至实验核心段落:噪声条件表、KL 缓冲消融结果、GPU 小时统计、五次自主修复故事
不止会跑实验,它还能写论文、审论文、给自己打分
如果只是“AI 提交了一个训练任务”,那它跟 AutoML 工具的差别不大。
Deli 这套系统的不同之处在于:论文写作和评审也是全流程自动化的一部分。
他设计了 5 个论文写作子技能,配有弱点路由表:
- Literature Survey
:4 阶段文献漏斗——Recall 召回 387 条结果 → LQS 质量评分 → A/B/C/D 分级分类 → venue upgrade 会议/期刊升级推荐 - Experiment
:专门为真实 GPU 作业设计了 Path B(GPU RL),提交后立即 polling、自动诊断和修复 - Peer Review Simulation
:5 种不同“偏见人格”的评审代理并行打分——R1 实验主义者、R2 理论洁癖、R3 方法保守派、R4 应用导向、R5 新来者视角——取中位数作为最终评分,并路由弱点到对应的修改技能
而且这套评审系统在 V12 版本主动降过分——原因是系统发现了几条坏引用,经过外部核查确认后,主动把分数从 8.8 调到 8.2。它不是在给自己贴金——这套评审系统已经具备了一定程度的自我批判能力。
最终版本 V16:75 页、217 条引用、8.6/10,包含 6 条定理和引理。

▲ 论文写作技能组详情:5 个子技能卡片、弱点路由表,覆盖文献调研、实验执行、论文起草与内部评审的完整链路
四篇论文加起来,累计生成时长约 44 小时、总输出 255 万 tokens、1970+ 次工具调用、63+ 个子代理。
这些数字背后是一个完整闭环:研究问题 → 文献调研 → 实验设计 → GPU 作业提交 → 运行监控与故障修复 → 数据分析 → 论文起草 → 多轮内部评审 → 理论补完 → 终稿。
全程只有 Deli 一个人给了方向性输入,没有在任何一步替 Agent 动手。
AutoResearch 浪潮:它不是孤例
Deli 不是唯一在做这件事的人。
2025 到 2026 年,Karpathy 提出的“让 agent 自己改代码、跑实验、keep the diff if better”在社区里迅速扩散。GitHub 上涌现了大量 one-file、three-file 的 autoresearch 模板。
Deli 的贡献是把这种模式从“单脚本跑 5 分钟实验”升级到了“多周长时程、真实 GPU 集群、论文产出、理论闭环”的完整协议。
社区也给出了强烈反馈:
- Vuk Rosić
转发并几乎完整复述了 pipeline 100% 自动化的原话,获得数百互动 中文作者AYi_AInotes总结道:“这可能是我近期看到的最值得深入研究的一次 skills 开源和工程脚手架”,并提炼了 5 个可直接拿去用的工程思路 GitHub 上的awesome-autoresearch列表收录了上百个同类项目:从科学(EurekAgent、AutoResearchClaw、生物、量子、材料)到系统(内核优化、vLLM serving、ClickHouse bug 发现),再到 RL 专项、交易、游戏、SAT 解题、机器人……
Deli 本人也在自己博客末尾写道:“We see this as the beginning of our Continual Learning research journey.” 他把这一步定位为持续学习研究旅程的起点——还远没到终点。

▲ GitHub awesome-autoresearch 列表:收录上百个同类项目,涵盖科学、系统、RL、交易、游戏、机器人等领域。Deli 的工作被归入「Infrastructure & Skills」
冷静地说三件事
第一,这套系统厉害在工程,不在算法。Deli 的框架没有用什么神秘的推理黑科技。它解决的是三个被反复忽视的工程问题:认知死循环怎么破?长时程无人值守怎么保证不死?状态在上下文窗口外怎么持久化?三个问题全都卡在工程脚手架上,跟模型能力关系不大。Deli 把脚手架搭好了,模型就能在上面跑长途。
第二,局限是明牌。Deli 自己公开写清楚了:评审分数是内部 5 人格模拟,只能纵向对比,不能当真实同行评审用;LLM 幻觉依然存在,只能靠机械化的外部检查来兜底;最长一次连续运行 72 小时,中间仍然需要人类给方向性输入;论文最终投不投稿,还是要人来判断。他不回避任何一条。
第三,AI 能自己跑实验这件事本身不可怕。可怕的是有人把它当自动驾驶来用。3570 GPU 小时的自主提交权限如果被滥用——写了一个有 bug 的脚本就跑掉,或者用昂贵的模型反复做无用实验——后果是真金白银的算力账单,3570 个 GPU 小时级别的浪费。Deli 选择开源协议而非代码的决策,某种程度上也是在这个问题上画了一条线:他给你地图和路规,但真正上路的人,得自己会开车。
而最值得问的问题是这一个:
当 AI 研究员可以 7×24 小时不知疲倦地设计实验、写代码、修 bug、写论文,人类研究员的位置在哪里?
Deli 给了他的答案:给方向,搭脚手架,审判断——然后让机器去跑。
夜雨聆风