乐于分享
好东西不私藏

AI训练的第三条路:不靠猜一步,让它猜K次再挑最好的!

AI训练的第三条路:不靠猜一步,让它猜K次再挑最好的!

刚看到 Hacker News 上一篇论文爆了。

52 个赞,评论区吵翻天。

标题叫"Explorative Modeling",中文直译就是"探索式建模"。

但别被名字骗了,这玩意儿野得很。

现在 AI 训练有个致命 Bug

你有没有想过这个问题:

让 AI 画一只狗,正确答案有多少个?

答案是几十亿个。

每只狗长得都不一样,但都算"狗"。

现在的问题来了:

当你训练神经网络直接预测"狗",它看到了几千张不同的狗照片。

它会输出什么?

一团棕色的模糊。

因为它在算平均值!几千只狗的平均长相,根本不像狗。

举个更直白的例子

作者做了个实验:扔飞镖游戏。

靶子上有好几个环,飞镖会随机落在某个环上。

让 AI 猜下一个飞镖会落在哪儿。

最优解是什么?靶心正中央。

AI 每次都猜正中央,因为这样"平均误差最小"。

但问题是:飞镖从来不会落在正中央!

这就是生成式 AI 的核心矛盾:

当答案有很多种,最优的单一预测就是它们的平均值。

而平均值往往不是任何一个真实答案。

现在的解决方案:把生成拆成碎片

ChatGPT 能写文章, Midjourney 能画画。

它们怎么解决这个问题的?

答案是:一步一步来。

自回归模型( LLM )

不猜整句话,只猜下一个字。

给定前面的字,下一个字的可能性就少多了。

就像猜飞镖:先猜左右,再猜上下。

扩散模型( Stable Diffusion )

从纯噪声开始,走几百步慢慢变成图。

每一步都只需要"微调",不用一次性猜中最终图像。

但这个方法有两个致命问题:

问题 1 :训练和推理不一致( Exposure Bias )

训练时:只学一步。

推理时:跑几百上千步。

自己的错误会累积放大。

这就是为什么视频模型 10 秒后就糊成一团。

这就是为什么 LLM 长文本后期越来越乱。

问题 2 :不是端到端

深度学习革命的核心就是端到端训练。

AlexNet 之后,整个 AI 圈都在搞端到端。

只有生成式模型还在手工设计流程。

训练方式和推理方式完全不一样,怎么可能不出问题?

Explorative Modeling :换个维度拆分

既然生成过程不能拆,那就拆训练过程。

核心思路:让模型一次生成 K 个猜测,然后只训练最好的那个。

听起来简单?但效果炸裂:

• 样本效率提升 6.2 倍

• 计算效率提升 4.1 倍

• 参数效率提升 47%

• 推理计算量降低 256 倍(在控制任务中)

它是怎么做到的?

传统训练:生成 1 个输出,计算损失,反向传播。

Explorative Modeling :

1.

生成 K 个输出(比如 K=8 )

2.

只选最接近真实数据的那个

3.

只对这个最好的结果做反向传播

这样模型学到的不是"平均值",而是"可能的真实答案之一"。

回到飞镖游戏:

传统方法猜 1 次 → 永远猜靶心(平均值)

Explorative 方法猜 8 次 → 至少有一个会落在环上!

更狠的是:它能叠加到任何现有模型上

这不是一个新模型架构。

这是一个新的训练范式。

你可以把它加到:

•

扩散模型上

•

自回归模型上

•

任何生成式模型上

论文实验显示:

随着数据量增加,提升从 7%涨到 36%。

随着参数量增加,提升从 13%涨到 23%。

越大的模型,提升越明显!

这意味着什么?

第一,这是训练的第三个维度。

之前 AI 进步靠两条路:

•

加数据

•

加参数

现在多了第三条:

•加探索次数(增大 K )

第二,端到端生成成为可能。

不用再把生成拆成几百步。

模型训练和推理可以完全一致。

第三,推理成本暴降。

在图像控制任务中,达到扩散模型同等效果,只需要 1/256 的计算。

但也有代价

训练成本会增加。

生成 K 个候选结果,肯定比生成 1 个费时间。

但论文数据显示:

即使考虑训练成本,整体 FLOP 效率还是提升了 4.1 倍。

因为收敛更快,需要的训练轮数更少。

这会改变什么?

如果这个方法真能普及:

1. 视频生成质量会有质的飞跃

不会再 10 秒后就糊掉了。

2. LLM 长文本能力会大幅提升

不会再长篇大论后期越来越乱。

3. 推理成本会大幅下降

不用跑几百步,可能只需要几步。

4. 小模型能达到大模型的效果

参数效率提升 47%,意味着更小的模型就能干同样的活。

最后

这篇论文 7 月 29 号刚发布。

代码已经开源在 GitHub 上了。

Hacker News 评论区已经有人开始复现实验。

下一个月,我们就能看到社区的验证结果。

如果真的 work ,整个生成式 AI 的训练范式可能要变天了。

你觉得这个方法靠谱吗?


论文链接: https://alexiglad.github.io/blog/2026/explorative_modeling/

GitHub : https://github.com/alexiglad/XM

相关学习资料