374个想法,最后活下来的只有10个。 淘汰率超过97%,比任何一场大厂晋升答辩都残酷。干这件事的,是快手内部三个24小时连轴转的AI Agent,没有一个算法工程师因此掉过一根头发。
三周之内,主站App消费时长涨了0.561%,生活服务这条业务线的收入被拉到年化超1亿元。这几个数字,被快手写进了一篇48页的技术报告,挂在arXiv上,编号2606.26859。
先泼一盆冷水:网上流传的说法是「三个AI Agent跑了一年多,赚了一个亿」。这个说法经不起核对。论文白纸黑字写的是「三周生产窗口」,一亿元是把三周观测到的收益按年度口径折算出来的数字,系统本身满打满算只运行了三周。时间被压缩了,效果被放大了,这恰恰是这件事更值得细看的地方,三周,就够了。
三个「Agent」,到底是什么
先纠正一个更容易望文生义的误解:这三个Agent,跟能聊天的机器人助手隔着十万八千里,也跟套壳ChatGPT弄出来的自动回复工具毫无关系。
论文里更精确的说法是「三个AgentX worker」,每个worker内部又分了好几个角色:一个负责想点子,一个负责写代码改策略,一个负责跑A/B实验做裁决。三个worker并行工作,相当于三条流水线同时在快手的真实代码库、真实特征系统、真实A/B实验平台上运转,动的是能影响上亿用户信息流的生产代码,跟沙盒里的玩具环境隔着一整个次元。
过去十年,推荐系统这个领域拼的是模型够不够大、特征够不够细、序列够不够长。AgentX把战场挪到了另一个维度:从想法到上线的这条链路,能不能不再靠人一个个手动推进。
论文里有一段被反复引用的话:
"From the labor of algorithm engineers to the capability of agent systems."
「从算法工程师的人力,转向Agent系统的能力。」
工程师原来是怎么干活的?想一个点子,写代码,配实验,等结果,复盘,再想下一个点子,全程串行,一个人一段时间只能推进一两个实验。这个瓶颈,跟模型聪不聪明关系不大,卡住的是人力的吞吐量。


▲ 机器之心@jiqizhixin 发布的AgentX核心数据卡片,左侧是传统人工串行研发链路,右侧是Agent驱动的自迭代闭环。
这套系统在arXiv上的完整题目是《AgentX: Towards Agent-Driven Self-Iteration of Industrial Recommender Systems》,作者按姓名首字母排序,署名里能看到长期活跃在推荐与广告算法圈的盖坤(Kun Gai),阵容横跨策略代码、模型训练、实验平台和监控审计好几个团队。

▲ AgentX论文在arXiv的摘要页,标题、长长的作者名单和四阶段方法描述一览无余。
374个点子,364个死在半路上
三周时间,AgentX一共产出374个实验想法:主站361个,生活服务13个。最后能拿到「可发布」资格、正式全量上线的,只有10个,主站8个,生活服务2个。
算成比例,端到端转化率只有2.67%。乍一看像是失败率高得吓人,实际上这恰恰是工业级研发漏斗该有的样子:想法足够多足够便宜,真正稀缺的是能被验证、能被信任的结果。
这套漏斗分四道关卡:想法先要通过初筛(idea pass),主站过筛率27.7%,生活服务46.1%;过筛的想法进入代码开发并上线灰度(code-&-launch),成功率九成以上;灰度之后是A/B正向评估(positive eval),这一关最狠,主站只有8.4%能拿到正向结果;最后才是可发布(LR)。一层层筛下来,374变成106,106变成100,100里最终活下来10个。

▲ 第三方论文精读平台Paper Archivist的页面,蓝色摘要框把三周、三个worker、374→10、+0.561%、年化超1亿等核心数字整整齐齐列了出来。
拿这套系统和真人工程师对比,账面上更有意思。按每个worker每周产出算,AgentX能同时跑12个实验,人类工程师平均只能跑1.5个,并发能力差了8倍。单位人力贡献的App时长增益,AgentX是0.0623%,工程师是0.0167%,差了3.7倍。
但有一行数字必须放进来一起看,否则整个故事会被讲歪:按每个点子算命中率,AgentX是2.7%,人类工程师是5.1%,人反而比AI高出近一倍。 换句话说,AI谈不上比人更懂推荐,胜在跑得更快、铺得更广。3.7倍的业务价值,是靠吞吐和并行堆出来的,跟精度碾压扯不上关系。这行数字,比前面所有倍数都更接近真相。
谁杀死了那364个点子?
这是整篇论文里最诚实、也最容易被自媒体标题忽略的一段。
268个没能通过初筛的想法里,研究团队做了归因分析:64.7%死于一个原因,参数资源冲突。说白了,就是想要的实验流量、想要的holdout配置,已经被别的在跑实验占用了,排不上号。另外14.5%是因为需要的特征在系统里压根没有暴露出来;7.5%撞上了刚性约束或白名单红线;6.4%是因为相关的开关默认关闭没打开;5.2%是想法和历史实验重复了;剩下不到2%才是想法本身立不住脚,或者技术上根本实现不了。
加总起来,大约91.4%的拒绝理由来自平台和基础设施,只有8.7%左右能算是Agent自己「想差了」。

▲ 论文附录中的模块复现与组合实验数据表,从中能看到工业场景下方法排名和公开数据集不完全一致。
编代码这一关同样如此。失败案例里,DSL语法用错、C++底层约束踩雷、if/else结构写歪这类「框架层面」的问题占了大头,真正意义上的算法逻辑错误不到5%。
这组数字翻译成大白话:这套系统最大的敌人,排队排不上、门锁着进不去,比自己够不够聪明麻烦得多。想再往前一步提升效率,砸钱换更强的大模型未必是最优先的选项,先把实验平台的排队机制和特征暴露程度理顺,回报可能来得更快。
两个活下来的故事
数字讲完了,讲两个具体案例,看看这套系统实际是怎么把一个「不够好」的想法,磨成一个能上线的结果。
第一个故事,关于PCV。 PCV全称Post-Consumption Value,指的是用户看完内容之后的行为,分享、收藏、二刷,这些动作比单纯的停留时长更能代表内容的长期价值,但也容易被标题党、猎奇内容污染。
第一轮尝试很简单粗暴:给PCV相关信号加权,把精排里的PCV权重往上调。上线一看,人均观看时长涨了0.034%,用户观看时长涨了0.021%,看着是正向的,但活跃设备数悄悄往下走,18到30岁这个年龄段的多样性指标也在承压。方向是对的,做法太糙。
第二轮改了思路:不再是简单加权,改成时长导向的基础打分,叠加一个质量门控,只有PCV表现超过某个阈值的内容才会被额外加分,同时根据用户活跃度动态调整权重。结果,用户观看时长涨到0.071%,真实曝光涨了0.118%,护栏指标全部稳住。
这个案例最有意思的地方在于,第一轮「不够好」的结果没有被扔掉,被存进了系统记忆,喂给了下一轮更强的假设。第二轮效果更好,只是这套记忆机制的副产品,失败没有被浪费。
第二个故事,发生在生活服务的广告场景。 一个专门做用户诊断的专家Agent,发现某一类用户结合职业信息和搜索行为,明显对汽车相关广告感兴趣,但现有系统没有很好地服务到这批人。这个诊断结果被交给AgentX,AgentX评估了可行性,做出了对应的投放控制策略调整,跑了A/B实验,最终这个案例带来了广告收入+4.7%的提升。
这说明AgentX的能力边界不止一条线:自己从零想点子、写代码、推上线是一条线;给任何领域专家的判断做执行放大器,是另一条线。人负责给出洞察,Agent负责把洞察变成能落地、能验证的产品改动。
同一天,腾讯也交了一份答卷
2026年6月25日,快手把AgentX的论文挂上arXiv的同一天,腾讯也挂出了一篇编号2606.27243的论文,代号NOVA,主题同样是工业推荐场景下的验证感知Agent系统。两篇论文互相没有引用对方,是完全独立的并发研究。
两套系统的侧重点不太一样。AgentX管的是从想法到代码到A/B到负结果沉淀的全链路;NOVA更聚焦在模型架构本身的演化,试哪种网络结构、哪种特征交互模块更好。AgentX用「语义梯度」这个说法描述系统怎么进化,指的是自然语言形式的失败诊断,用来更新Agent「怎么思考」;NOVA用的是「架构梯度」,更新的是「下一步该试什么结构」。

▲ 腾讯NOVA论文在arXiv的摘要页,同样聚焦工业推荐场景下的验证感知Agent系统。
两家头部平台公司在同一周交出了方向近似的答卷,这件事本身传递的信号,比任何一篇论文单独的结论都更重要:用Agent重构推荐系统的研发方式,已经成了整个行业不约而同在做的选择,早就不只是某一家公司自己在闷头尝试。
而这次故事里最大的卡点,从头到尾都跟「模型够不够聪明」没多大关系,卡在实验平台的资源排队和特征基础设施的完备程度上。这意味着,想复制这套打法的团队,真正该优先砸钱的地方,或许是实验平台的治理能力,而非再多买几张显卡。
推荐系统下一阶段的较量,未必只看谁的模型参数堆得更大,也可能要看谁能把「提出假设、改生产代码、安全实验、把经验存下来」这条又脏又累的链路,先跑成一台可以自己越转越快的机器。快手用三周真实流量交出的这份答卷,证明了这件事至少在一家公司内部行得通。同时它也提了个醒:卡住整个系统的往往跟AI够不够聪明没多大关系,卡在脚下这块实验田够不够平整。
夜雨聆风