刚看到 Hacker News 上一篇论文爆了。
52 个赞,评论区吵翻天。
标题叫"Explorative Modeling",中文直译就是"探索式建模"。
但别被名字骗了,这玩意儿野得很。
现在 AI 训练有个致命 Bug
你有没有想过这个问题:
让 AI 画一只狗,正确答案有多少个?
答案是几十亿个。
每只狗长得都不一样,但都算"狗"。
现在的问题来了:
当你训练神经网络直接预测"狗",它看到了几千张不同的狗照片。
它会输出什么?
一团棕色的模糊。
因为它在算平均值!几千只狗的平均长相,根本不像狗。

举个更直白的例子
作者做了个实验:扔飞镖游戏。
靶子上有好几个环,飞镖会随机落在某个环上。
让 AI 猜下一个飞镖会落在哪儿。
最优解是什么?靶心正中央。
AI 每次都猜正中央,因为这样"平均误差最小"。
但问题是:飞镖从来不会落在正中央!
这就是生成式 AI 的核心矛盾:
当答案有很多种,最优的单一预测就是它们的平均值。
而平均值往往不是任何一个真实答案。

现在的解决方案:把生成拆成碎片
ChatGPT 能写文章, Midjourney 能画画。
它们怎么解决这个问题的?
答案是:一步一步来。
自回归模型( LLM )
不猜整句话,只猜下一个字。
给定前面的字,下一个字的可能性就少多了。
就像猜飞镖:先猜左右,再猜上下。
扩散模型( Stable Diffusion )
从纯噪声开始,走几百步慢慢变成图。
每一步都只需要"微调",不用一次性猜中最终图像。

但这个方法有两个致命问题:
问题 1 :训练和推理不一致( Exposure Bias )
训练时:只学一步。
推理时:跑几百上千步。
自己的错误会累积放大。
这就是为什么视频模型 10 秒后就糊成一团。
这就是为什么 LLM 长文本后期越来越乱。
问题 2 :不是端到端
深度学习革命的核心就是端到端训练。
AlexNet 之后,整个 AI 圈都在搞端到端。
只有生成式模型还在手工设计流程。
训练方式和推理方式完全不一样,怎么可能不出问题?
Explorative Modeling :换个维度拆分
既然生成过程不能拆,那就拆训练过程。
核心思路:让模型一次生成 K 个猜测,然后只训练最好的那个。
听起来简单?但效果炸裂:
• 样本效率提升 6.2 倍
• 计算效率提升 4.1 倍
• 参数效率提升 47%
• 推理计算量降低 256 倍(在控制任务中)

它是怎么做到的?
传统训练:生成 1 个输出,计算损失,反向传播。
Explorative Modeling :
生成 K 个输出(比如 K=8 )
只选最接近真实数据的那个
只对这个最好的结果做反向传播
这样模型学到的不是"平均值",而是"可能的真实答案之一"。
回到飞镖游戏:
传统方法猜 1 次 → 永远猜靶心(平均值)
Explorative 方法猜 8 次 → 至少有一个会落在环上!

更狠的是:它能叠加到任何现有模型上
这不是一个新模型架构。
这是一个新的训练范式。
你可以把它加到:
扩散模型上
自回归模型上
任何生成式模型上
论文实验显示:
随着数据量增加,提升从 7%涨到 36%。
随着参数量增加,提升从 13%涨到 23%。
越大的模型,提升越明显!

这意味着什么?
第一,这是训练的第三个维度。
之前 AI 进步靠两条路:
加数据
加参数
现在多了第三条:
第二,端到端生成成为可能。
不用再把生成拆成几百步。
模型训练和推理可以完全一致。
第三,推理成本暴降。
在图像控制任务中,达到扩散模型同等效果,只需要 1/256 的计算。

但也有代价
训练成本会增加。
生成 K 个候选结果,肯定比生成 1 个费时间。
但论文数据显示:
即使考虑训练成本,整体 FLOP 效率还是提升了 4.1 倍。
因为收敛更快,需要的训练轮数更少。
这会改变什么?
如果这个方法真能普及:
1. 视频生成质量会有质的飞跃
不会再 10 秒后就糊掉了。
2. LLM 长文本能力会大幅提升
不会再长篇大论后期越来越乱。
3. 推理成本会大幅下降
不用跑几百步,可能只需要几步。
4. 小模型能达到大模型的效果
参数效率提升 47%,意味着更小的模型就能干同样的活。
最后
这篇论文 7 月 29 号刚发布。
代码已经开源在 GitHub 上了。
Hacker News 评论区已经有人开始复现实验。
下一个月,我们就能看到社区的验证结果。
如果真的 work ,整个生成式 AI 的训练范式可能要变天了。
你觉得这个方法靠谱吗?
论文链接: https://alexiglad.github.io/blog/2026/explorative_modeling/
GitHub : https://github.com/alexiglad/XM
夜雨聆风