周一,快手推荐算法组的会议室里,有人抛出一个模糊到近乎废话的目标:「把生活服务的转化再拉一拉。」
放在过去,这句话之后要走的路是:资深工程师翻历史文档,画白板,写方案,排期,改代码,配实验,然后等,等A/B跑出结果,往往是几周之后的事。一个工程师手上能同时盯的实验,论文给出的数字是约1.5个。
现在,快手把这套流程的大部分环节,交给了不会累、不用开会、也不用请假的东西。
三周之内,374个实验想法被送进这套系统,最终只有10个活到了全量上线的那一刻。干这活的,是三个跑在服务器上的AI Agent。
这就是快手最新论文披露的AgentX,一套被塞进真实生产环境、扎扎实实跑了三周的多智能体研发系统。围绕它的数字劲爆得很:8倍并发、3.7倍单位人力业务价值、主站用户消费时长累计**+0.561%,生活服务场景年化收入超1亿元人民币**。
这里要先泼一盆冷水:这套系统在快手App里连续验证的窗口,满打满算只有三周。「年化超1亿」说的是把三周里跑出的收益速率,按一年外推出来的数字,跟「系统已经闷声赚了一年多」完全是两回事。把这两件事搅在一起,是这场讨论里最容易踩的坑。
搞清楚这一点之后,真正值得琢磨的问题才浮出水面:一套AI系统,凭什么能把工业界最难自动化的部分,写生产代码、上线上实验、判断成败,串起来跑通?
真正的瓶颈,是「人肉实验工厂」
先说一件容易被忽略的事:推荐系统的核心竞争力,早就不只是模型够不够强。
短视频App每打开一次,系统要在几十毫秒内从海量内容池里挑出用户更可能看下去的那条。这背后是召回、粗排、精排、重排等一整条链路,任何策略上的小调整,都可能影响到亿级用户的时长和收入。
问题是,离线跑出来的AUC、损失函数这些指标,和用户线上真实的行为经常对不上。工业界的做法是A/B实验:一部分用户走新策略,一部分走旧策略,靠统计方法判断差异到底算不算噪声。
于是一个反直觉的结论成立了:算法创新在工业界,本质上约等于实验工厂的产能。
想法再多,一个工程师同时只能盯1.5个实验,一边等训练跑完,一边改配置,一边看监控,一边写复盘,无论模型库里堆了多少论文,能落地检验的永远是少数。创新速度被焊死在了人头数上。
快手的论文把这一层讲得毫不含糊:
"Recommendation algorithm iteration is moving from an artisanal, engineer-bound process toward an industrialized research loop, but this transition remains blocked by a structural execution bottleneck..."
「推荐算法的迭代,正从一种依赖工程师个人手艺的手工活,转向工业化的研发闭环,这个转型,一直被一个结构性的执行瓶颈卡住脖子。」
AgentX要拆掉的,就是这个瓶颈。


▲ 机器之心@jiqizhixin 2026年7月9日发布的英文推文,附论文Figure 1:左侧是传统人工驱动的串行流水线,右侧是AgentX的Agent驱动闭环。
一个点子要闯四道关,才能活着上线
AgentX把原本靠人肉接力的流程,拆成了四个能自动运转的阶段。
第一关,Brainstorm Agent。 它接到的输入往往模糊得像句空话,「把观看时长做上去」「冷启做好一点」。如果放任大模型自由发挥,大概率会写出一堆听起来很美、实际依赖不存在的特征、或重复过去失败方案的空想点子。
Brainstorm被死死摁在证据里:综合历史实验知识库、系统架构知识库、真实数据分析,甚至外部论文,每个候选方案都要带上目标指标、实现位置、机制假设和风险点。374个点子,就是这一关的产出。
第二关,审核门。 只有106个方案能过,通过率28.34%。这道门很关键,它说明人类审核的位置一直都在,AI没有拿到「自己想干嘛就干嘛」的权限。
第三关,Developing Agent。 过审的方案要被真正写成能上生产的代码。工业代码的门槛比GitHub玩具仓库严苛得多:字段看着合理但schema里根本没有,策略写完了却没注册到正确队列,实验开关默认打开,这些都是能捅出事故的坑。Developing Agent靠仓库知识、特征schema校验、静态分析和dryrun(上线前的仿真校验)把生成摁在平台规则内。106个过审方案里,100个成功完成实现并上线,成功率94.3%。这个数字才是真正吓人的地方,想法很少死在「写不出来」这一步。
第四关,Evaluation Agent。 代码能跑,不代表能留。Evaluation不看离线自评,只认线上A/B的真实结果:安全分流、参数冲突检查、指标抽取,还有一道guardrail veto(护栏否决),哪怕主指标涨了,只要体验、安全或多样性指标出问题,照样一票否决。最终,10个方案拿到了「可全量发布」的判决。
374→106→100→10,这条漏斗背后还藏着一个容易被漏掉的机制:Harness Evolution,论文里叫它SGPO(基于语义梯度的提示优化)。它不会去改推荐策略本身,而是从每一次执行轨迹里揪出Agent自己工作方式上的毛病,漏掉了业务约束、证据不够扎实、交付字段缺了哪个,再把诊断变成对子Agent工作手册的局部修改,拿新旧两版在同一批任务上做回放测试,确认真的变好了才采纳。
打个比方:复盘结论当场写进操作手册,还要求新旧两版手册在同一批案例上盲测过关,才能换岗上线。
值得补一句:这套「假设,实现,反馈,沉淀」范式,还被用在模型研究支线上,自动读论文、跨论文做模块组合复现,这条支线不计入前面的374个点子,达到发布级的模型让快手App直播时长涨了+0.865%。

▲ Bridging China英文长文里的Agent Workflow全景图:Brainstorm、Developing、Evaluation三个Agent之外,还有Trajectory Memory(轨迹记忆)、数据层与监控平台托底。
蒙错的第一轮,怎么变成第二轮的养料
这套系统最有说服力的地方,藏在它怎么处理「没蒙对」这件事上,它很少一次就蒙对答案。
快手团队公开的一个案例,发生在精排环节。目标很简单:在不破坏用户体验的前提下,把观看时长再往上提一点。
工程师用的信号叫PCV(Post-Consumption Value,消费后价值),分享、收藏、重播这些「看完之后还愿不愿意多做点什么」的行为,理论上能反映内容的长期价值。但这个信号有噪声:标题党、低质内容也可能刺激出类似的后置行为。
第一轮,Brainstorm一上来就提议给PCV加权;Developing把它写成乘法打分,配上实验开关保护;上线跑A/B后,Evaluation给出的结论是:方向大致对,但统计显著性不够,而且部分人群和多样性指标出现了风险信号。
这轮实验的结论没有被当场标记「失败」扔进垃圾桶,而是被写成了下一轮的假设:一上来就抬高PCV权重,可能会连噪声一起放大。
第二轮,系统在此基础上加了质量门控,按用户活跃度自适应调整权重,再垫上一个时长导向的底分。结果:观看时长**+0.071%,真实曝光+0.118%**,体验类护栏指标保持稳定。
这才是这套系统真正的高光时刻,把不够好的第一轮,变成了让第二轮变好的养料。放在工业推荐的语境里,这其实是十年经验沉淀方式的数字化版本:老工程师的判断力,过去只存在个人脑子里,现在被结构化地写进了系统能检索的知识库。
一个冷酷的真相:AI没有人挑得准,但架不住它能跑
如果只看一个数字,这个故事会显得没那么震撼,论文自己承认,单个点子的命中率,资深工程师依然比AgentX高出大约1.9倍。
按每个worker每周计算,论文Table 8给出了一组对照:
人挑点子,是老猎手的精准一枪;AI跑点子,是撒开的一张网。网眼粗,但架得住撒得快、撒得多,并发数是人类的8倍,最终换算下来,单位人力创造的业务价值反而是人类的3.7倍。
这背后靠的是流水线并行度的提升。传统工程师做实验,个人带宽被反复的上下文切换吃掉:一边等训练,一边改配置,一边盯监控,一边写复盘。AgentX把方案生成、编码、上线、监控拆成能并行推进的阶段,不同点子能同时挂在不同工位上,这就是一个worker能同时维持约12个在制品的真实来源,靠的是流程拆分的效率,跟某次灵光乍现的天才点子产出没有关系。
亿元收入从哪来?两条业务线,别揉成一句
这个故事最容易被简化掉的一个细节是:主站的时长增益,和生活服务的收入增长,来自两条不同的业务线。
主站推荐:361个点子里,跑出了8个可发布结果,换来用户App消费时长累计**+0.561%。在一个已经被优化了十年的大盘上,零点几个百分点通常意味着极难啃的增量,容易拿的增益早在过去几年里被吃干净了。+0.561%**是多个可发布结果叠加后的累计口径,没法归到某一个点子单独的功劳上。
生活服务场景:只有13个点子,却跑出2个可发布结果,贡献了年化收入超1亿元人民币。想法数量最少的战场,爆出了最大的商业数字,原因不难理解,商业化场景的目标函数紧紧连着成交和收入,一次成功实验的货币化路径比纯内容时长更短更快。
这类标题党写法最常见的简化方式,是把这两件事拧成一句「三个AI一年狂赚一亿」。真实情况是,一套闭环同时服务了体验类指标(时长)和收入类指标(生活服务),没有靠某个单一魔法策略刷出这个数字。
一场全球大厂都在推进的研发竞速
如果觉得这套打法有点眼熟,不奇怪,2026年初,YouTube团队交出了一份类似的答卷。
论文Self-Evolving Recommendation System(arXiv:2602.10226)里,YouTube用Gemini系Agent搭了一套双环系统:Offline Agent在内环用代理指标做高吞吐的假设生成和训练,Online Agent在外环用延迟到达的北极星业务指标做生产验证。论文摘要称多次实现了成功的生产上线,具体业务数字披露得比AgentX更少。

▲ YouTube团队论文《Self-Evolving Recommendation System》的arXiv摘要页,2026年2月上线,比AgentX早了大约四个月。
两套系统的共同点是:都不再满足于「模型能不能更强」,而是把矛头对准了研发本身能不能更快地自我迭代。差异也很明显:AgentX的重心在策略与模型研发闭环,强调生产代码和A/B实验工厂的产能;YouTube的双环设计更偏向模型优化本身的结构与奖励函数迭代。「推荐系统开始自我迭代」,正在变成2026年这个赛道里能观察到的行业级迁移,两家公司几乎同时交出了各自的答卷。


▲ 智东西@Chinazhidx英文线程,用374→10、8倍并发、3.7倍单位人力价值、年化超1亿元等数字,把这套系统介绍给海外读者。
工程师的角色,往上挪了一层
看到这里,一个自然的问题冒出来:算法工程师的岗位会怎么变?
论文和数据给出的答案,更接近分工重组,执行层被大规模自动化,判断层的位置反而更重了。
28%的idea通过率意味着,人类审核的关卡从来没有被撤掉,高吞吐产方案是Agent的活,决定哪些方案值得投入昂贵的开发和线上流量,决定权还在人。护栏否决的存在,也说明「AI会不会乱上线」这件事,答案落在工程护栏和人工审核位的双重兜底上。
工程师的角色在往两个方向挪:一部分人负责设定目标、审核高风险方案、做最终判断;另一部分人负责进化Agent框架本身。执行层的吞吐量,交给可以横向扩展的Agent worker去扛。
论文留了一句清醒的话:只靠堆更多高级人力串行跑实验的组织,迟早会被自动化吞吐与自我进化的组合甩开。这恰恰说明,执行不再是瓶颈之后,谁能提出更值得被执行的假设,会变得更重要。
三周的样本窗口,证明的只是可行性,「永远3.7倍」的稳态还谈不上。自我加速曲线未来是否饱和,公开数字里能看到的,是周并发实验数从15涨到60、点子通过率从15%涨到45%、每周可发布结果从2个涨到5个以上,这条曲线本身也是需要持续验证的假设。
尾声:被写清楚的锚点,比任何修辞都有力量
回到开头那句被纠偏的话,AgentX在快手App里连续验证的窗口,满打满算只有三周;超1亿元,是年化外推出来的收入速率,跟已经落袋的存量完全是两回事。把这两件事分清楚,恰恰是看懂这件事真正分量的前提:一套系统,用三周时间跑通了374个点子到10次上线的完整闭环,还把每一次执行的轨迹变成了让自己下一次跑得更快的养料。
真正新的地方,在于快手把工业推荐系统里最难自动化的部分,生产代码、线上实验、失败归因,串成了一条能够自转的闭环,而且这个闭环是在真实用户和真实流水上跑出来的,压根没走实验室demo那条捷径。
374、10、8倍、3.7倍、0.561%、超1亿、三周,这些数字锚点,是这场关于AI能不能替代工程师的讨论里,最值得被记住的部分。
夜雨聆风