LG - 机器学习 CV - 计算机视觉 CL - 计算与语言
1、[LG] Dion3:Full-Stack Orthogonal Updates
2、[CL] Information Abundance Paradox:Long-Context Training Undermines Parametric Knowledge
3、[CL] One Frozen Simulator Is Not Enough:Simulator Collapse in Multi-Agent RL
4、[LG] Small-Scale Experiments:Are We There Yet?
5、[LG] SoftWater:Class-Aware Rate Allocation for Softmax Quantization
摘要:全栈正交更新、长上下文训练如何削弱参数化知识、多智能体强化学习中的模拟器坍缩问题、小规模实验:我们离目标还有多远?、面向 Softmax 量化的类别感知比特分配方法
1、[LG] Dion3: Full-Stack Orthogonal Updates
N Amsel, J Zhang, K Ahn, A Naeimi…
[New York University & Princeton University & NVIDIA]
Dion3:全栈正交更新
要点:
挑战了在大型语言模型 (LLM) 预训练中必须对完整动量矩阵进行全量正交化才能获得最优收敛的传统假设。 提出了 Dion3 全栈优化器框架,将 Muon 的正交化开销降低了高达 6 倍,在 7B 模型上将优化器单步时间相对于 AdamW 的开销从 26 倍压缩至仅 4 倍。 提出了 Gram Newton-Schulz (GNS) 算法,通过改在尺寸更小的对称 Gram 矩阵 () 上进行数学等价的迭代,将计算复杂度从 降至 ,大幅减少高长宽比矩阵的正交化 FLOPs。 揭示并解决了半精度 (fp16/bfp16) 下 Gram Newton-Schulz 的根本性数值发散问题——该问题源于构造 Gram 矩阵时产生的微小“伪负特征值”,并设计了理论完备的“重启 (Restarting)”刷新策略。 基于 CuteDSL 为 Hopper 和 Blackwell GPU 开发了自定义对称 GEMM 内核,利用三角调度跳过上三角区域的重复计算,实现了相比 cuBLAS 近 2 倍的算子加速。 提出了带有误差反馈的行采样更新规则(依据 范数仅挑选 比例的动量矩阵行进行正交化),使矩阵运算 FLOPs 缩减至 ,分布式通信量缩减至 。 反直觉发现:对动量矩阵进行采样/压缩更新 () 非但未损害模型效果,反而在 1B 到 14B 参数规模上一致取得了比充分调优的 NorMuon/Muon 更低的验证集交叉熵 Loss 和更高的下游评估准确率。 确立了分步采样更新的学习率迁移法则:将学习率按 进行等比放大,即可在不同采样率下保持最佳学习动态。 引入了分布式 Megabatching 通信策略,将同形状权重的通信合并,把全到全 (all-to-all) 通信轮次从与模型深度相关的 降低为常数级 ,避开了分布式通信的延迟底线。 证明了将 SwiGLU MLP 中的 Up 和 Gate 权重拆分并分别进行正交化,不仅能显著降低 Newton-Schulz 的 FLOPs,还能提升模型困惑度(如在 Llama-430M 上提升约 0.2 PPL)。
主旨: 解决正交化优化器(如 Muon 和 NorMuon)在现代大语言模型(LLM)预训练中面临的高昂计算复杂度( 级的 Newton-Schulz 正交化迭代)以及分布式权重切分带来的巨大通信开销问题,旨在不牺牲(甚至提升)模型泛化性能的前提下,实现全栈正交更新的高效落地。
创新:
Gram Newton-Schulz (GNS) 算法与数值稳定重启策略:改在较小的对称 Gram 矩阵 () 上迭代计算逆平方根,大幅降低矩形矩阵乘法开销;针对半精度下 Gram 矩阵产生的“伪负特征值”发散问题,推导出理论最优的“重启 (Restarting)”机制。 CuteDSL 对称 GEMM 自定义内核:针对 Hopper 和 Blackwell 架构编写了三角调度与转置写入的高效对称 GEMM 内核,省去一半的重复 FLOPs。 行采样的 Dion3 更新规则与误差反馈:每步仅选取 范数最大的前 比例(如 或 )行进行正交更新,结合误差反馈保留未选中信息,实现计算量()与通信量()的双重剧减,并总结出 的学习率缩放法则。 Megabatching 通信打包机制:将同一形状组的张量合并进行单次分布式全到全 (all-to-all) 传输,将通信轮次压缩为与模型深度无关的常数级 。
贡献:
理论与数值稳定性贡献:深入剖析了 Gram 矩阵正交化在半精度下的数值失效机理(伪负特征值与特征向量漂移),提供了严谨的数值谱分析和自动化重启参数选择方法。 全栈系统与工具贡献:开源了 gram-newton-schulz和dion两个高兼容性 Python 包,为 distributed FSDP2/DDP 训练提供了可直接替代 Muon 的全栈生产级解决方案。算法与实证贡献:提出了比 Dion 和 Trion 更加简单高效的行采样更新规则,并在 1B 至 14B 参数量级的预训练实证中发现了“动量行采样正交化可进一步改善模型 Loss”的重要现象。
提升:
优化器步骤加速:相比标准 Muon 实现,优化器步骤耗时(Excluding FWD/BWD)减少高达 6 倍;将相比 AdamW 的额外时间开销从 26 倍降低至 4 倍。 计算与算子效率:GNS 结合 CuteDSL 对称内核为高长宽比权重(如 Gemma MLP、MoE 专家权重)提供了 1.5×~2× 的 FLOPs 和时间节省;采样更新使通信体积减少至 (例如 25% 采样率下减少 75% 通信量)。 模型性能指标:在 1B 至 14B 参数模型上,Dion3 () 的验证集交叉熵 Loss 一致优于 fully-tuned 的 NorMuon/Muon(在 14B 模型上 Loss 降低 0.027),且在 12 个 downstream 评估套件上的平均准确率提升了 0.7%。
不足:
时间开销仍高于 AdamW:尽管实现了 6 倍加速,Dion3 的优化器步骤耗时仍为 AdamW 的约 4 倍,在极度计算受限或通信带宽极低的环境下仍有一定优化空间。 采样更新改善 Loss 的理论机理尚缺乏完备证明:论文虽观察到 行采样能降低 Loss 并提出了正则化/Mask 效果的猜想,但尚未给出严格的优化收敛性理论证明。 超参数 在非 Transformer 或极稀疏架构上的泛化性待验证:最佳采样率 或 主要在 Dense Transformer 上得到了充分验证,在极稀疏 MoE 或其他非 Transformer 架构中的最优设定与稳定性仍需进一步评估。 极高条件数矩阵的潜在风险:虽然重启策略解决了常规情况,但在输入矩阵条件数极度恶化的极端预训练阶段,Gram 矩阵()使条件数平方的固有缺陷仍可能存在潜在数值风险。
心得:
反直觉的“稀疏/采样正交化”带来正则化红利:传统观点认为正交更新需要完整精确地作用于整个动量矩阵。Dion3 证明仅对 范数最大的部分行(如 25%)正交化更新并配合误差反馈,不仅大幅降本,更充当了某种隐式正交噪声/Mask 正则化,提升了 LLM 的泛化能力。 软硬件深度协同的典范(Gram 矩阵 + 对称 GEMM):GNS 算法本身增加了对称矩阵运算比例,这正好完美匹配了现代 GPU(Hopper/Blackwell)对对称 GEMM 算子的加速潜能(省去一半 FLOPs)。算法推导不能脱离硬件特性,寻找能将“一般矩形乘法”转化为“对称乘法”的算法表征是软硬件联合优化的核心思路。 半精度数值稳定性的“重启”智慧:在 16 位半精度时代,直接移植数学等价的公式(如 GNS)往往因“伪负特征值”指数级放大而崩溃。不应轻易放弃高效算法,通过深入特征谱分析并引入低成本的“重启 (Restart)”刷新机制,能够以极小代价锁住数值稳定性。
一句话总结: Dion3 提出了包含 Gram Newton-Schulz 算法、对称 CuteDSL 内核、行采样更新规则与 Megabatching 的全栈优化方案,在将 Muon 正交化开销降低高达 6 倍的同时,反直觉地通过采样更新提升了大型语言模型的预训练表现与下游泛化能力。
The Muon optimizer incurs a significant overhead cost due to its cubic-time Newton-Schulz orthogonalization step. When weights are sharded, communication overhead compounds this computational cost, eroding the benefits of Muon in many settings. We present Dion3, a revision of Muon that targets this overhead at every level of the stack. Our Gram Newton-Schulz algorithm reduces the FLOP cost of orthogonalization, our CuteDSL kernels accelerate it by exploiting symmetry, and our megabatching strategy reduces communication overhead. Moreover, we propose a simple change to the update rule that cuts costs even further: selecting only a fraction of the momentum matrix’s rows to orthogonalize at each step. This update rule improves on Dion (another “compressed” version of Muon), in both speed and performance [2]. Overall, Dion3 matches or improves on the loss achieved by Muon but reduces optimizer step time by up to 6×. Dion3 is available via the dion package1 as a drop-in replacement for Muon. Standard Muon + Symmetric kernels + Gram-NS + Fractional update (25%) AdamW 0 10 20 30 Optimizer step time vs AdamW 26× 19× 15× 4× 1× Figure 1: Optimizer step time of Muon (excluding forward/backward pass) relative to AdamW for a 7Bparameter language model trained on four GH200s. Each colored bar adds one of our contributions on top of the previous one. Together they reduce Muon’s cost from 26× AdamW to just 4×. ∗Work performed while at Microsoft Research.
https://arxiv.org/abs/2608.11612


2、[CL] Information Abundance Paradox: Long-Context Training Undermines Parametric Knowledge
A Uzunoglu, B v Durme, D Khashabi
[Johns Hopkins University]
信息丰裕悖论:长上下文训练如何削弱参数化知识
要点:
挑战了“只要有高质量数据,在大语言模型(LLM)训练中无限扩大上下文窗口就百利而无一害”的传统假设。 提出了“信息丰裕悖论”(Information Abundance Paradox):当训练上下文包含丰富且与任务相关的信息时,模型将该信息参数化编码进权重的动力会降低,从而将其学习模式从“参数内化”转向“上下文依赖/语境化”。 揭示了“上下文上瘾”(Context Addiction)现象:在丰富信息下训练的模型,在测试时存在支持性上下文的情况下表现优异,但在上下文缺失或存在误导(冲突)时,性能会出现严重衰退。 在预训练实验(20M 至 750M 参数)中,固定 Token 预算与超参数,仅增加上下文窗口会导致下游任务(SuperGLUE, MCQA)呈现倒 U 型性能曲线、语言模型 Loss 呈现 U 型曲线,性能在到达中间最佳值(如 MCQA 在 ~2K Token 处)后持续下降。 实证评估表明,现有的主流长上下文模型(如 Phi-3 128K 和 OLMo 3 65K)在 Zero-Shot 和 Few-Shot 设定下,其性能普遍劣于对应的短上下文版本(Phi-3 4K 和 OLMo 3 8K)。 在监督微调(SFT)实验中(跨越 Qwen3 0.6B 至 14B),增加训练时与任务相关的上下文文档数量,虽然提升了有支持性上下文时的测试准确率,但显著削弱了无上下文或冲突上下文下的鲁棒性。 提供了理论形式化证明:更长的训练上下文拓宽了预测器的可行集,从而降低了实现特定风险阈值 所需的最小参数化任务信息量 (参数信息前沿的单调性)。 机制分析表明,当上下文示范提供了复杂度更低的优化路径时(通过更低的训练平均梯度范数度量),“上下文上瘾”现象会选择性地显现。 丰裕上下文训练改变了模型内部的优化动力学:梯度压力从前馈网络(FFN,通常与参数记忆相关)转移到了自注意力模块(SA,与上下文检索相关)。 因果干预实验证实:仅微调 FFN 能增强无上下文下的参数鲁棒性;而仅微调 SA 虽然提升了有支持上下文时的表现,却大大加剧了对上下文的依赖与脆弱性。 推理阶段的注意力分析确认:在富上下文下微调的模型,其中间层在推理时对上下文 Token 分配了显著更高的注意力质量(Attention Mass)。
主旨: 挑战现代大语言模型(LLM)盲目追求极长上下文窗口的训练范式,提出并证实了“信息丰裕悖论”(Information Abundance Paradox):即训练阶段提供过于丰富且相关的上下文信息,会导致模型减少将知识参数化内化到权重中的倾向,进而转变为过度依赖上下文的“上下文上瘾”模式,损害模型在缺乏或面对误导性上下文时的泛化与鲁棒能力。
创新:
概念与假设创新:首次提出“信息丰裕悖论”和“上下文上瘾(Context Addiction)”的概念,将上下文窗口从单纯的“数据传输管道”重新定义为“重塑模型学习模式(参数内化 vs. 语境化)的决定性机制”。 理论形式化证明:利用信息论和风险最小化框架,定义了“参数信息前沿(Parametric Information Frontier)”,证明了随着上下文长度 的增加,模型达到相同风险阈值所需的最小参数化任务信息量 呈单调递减趋势()。 软硬件/机制剖析维度:结合优化路径复杂度(梯度范数)、模块级梯度分配比率(FFN/SA Gradient Norm Ratio)以及推理期注意力质量分配(Attention Mass),从三个互补维度对该悖论进行了深度的可解释性与因果机制剖析。 实验设计控制:在预训练(固定 Token 预算与更新步数)和 SFT(固定 Token 总预算仅改变相关性 )中实现了严谨的控制变量对比,排除了数据质量和计算量不等带来的干扰。
贡献:
实证贡献:揭示了现有商业/开源长上下文模型(如 Phi-3 128K、OLMo 3 65K)在无上下文或 Few-Shot 闭卷任务中劣于短上下文版本的“真实病因”,并在 20M–750M 预训练及 0.6B–14B SFT 跨规模实验中证实了 Post-optimum 性能衰退现象。 理论与机制贡献:从信息论角度解释了为什么长上下文训练会导致权重知识储存减少,并通过梯度分配和因果干预实验证明了 FFN(知识内化)与 SA(上下文路由)在长上下文训练中的博弈过程。 实用指导贡献:警示了盲目扩大训练上下文窗口的潜在风险,提出了训练上下文窗口与评估任务平均长度之间存在约 1–2 个数量级匹配的隐式 Scaling 规律,为未来 LLM 长上下文训练的数据配比与窗口调度(Curriculum Learning)提供了关键指导。
提升:
评估客观性与鲁棒性认知:通过引入“冲突上下文(Conflicting Context)”和“无上下文(No Context)”测试条件,暴露了过往长上下文 SFT 模型在缺乏理想上下文时的严重脆弱性(如 Qwen3 系列在冲突上下文下准确率暴跌)。 优化路径理解:通过 FFN/SA 梯度范数比率指标,提升了对模型内部如何根据训练上下文信息量分配学习权重的理解粒度。 针对性干预效果:证明了仅微调 FFN 模块(FFN-only SFT)可以在保持一定上下文能力的同时,显著提升无上下文条件下的参数鲁棒性(相比全参数微调降幅更小)。
不足:
预训练模型规模有限:受限于计算资源,预训练控制变量实验的模型规模最大仅达到 750M,虽然在 14B 规模的 SFT 中验证了结论,但超大规模(如 70B+)预训练阶段的拐点(Inflection Point)位移规律仍有待验证。 预训练中上下文相关性的控制粒度:预训练阶段采用自然文档切片作为上下文相关性的代理(Proxy),难以像 SFT 那样精准定量分离“纯长度扩展”与“任务相关信息增加”的影响。 未提出完备的缓解算法:论文主要致力于现象的发现、理论证明与机制诊断,虽然指出了 FFN 微调和短-长渐进式训练(Curriculum Learning)的潜在方向,但尚未构建并验证一套能够完全消除“信息丰裕悖论”的全新训练算法。
心得:
上下文是双刃剑——“懒惰”的神经网络:神经网络倾向于寻找损失函数优化的“最低复杂度路径”(Lower Complexity Solution)。如果上下文已经直接提供了答案或强暗示,梯度压力就会避开复杂的“参数内化”(FFN 权重更新),转向简单的“信息路由”(SA 机制)。这种“偷懒”导致模型失去了将知识内化为常识的能力。 长上下文 scaling 不仅仅是数据问题:不能简单认为“只要有足够多的长文档数据,无限扩大 Context 就会带来更强的模型”。训练窗口的大小会改变模型的学习模式,必须在“语境化能力”与“参数化记忆”之间寻找平衡点。 模块分工与因果干预机制:FFN 和 SA 模块在 Transformer 中承担着截然不同的功能(FFN 存储知识,SA 提取上下文)。长上下文训练会显著降低 FFN/SA 的梯度比率。在需要模型具备强闭卷常识的场景下,限制 SA 模块的更新强度或采用 FFN 定向微调,是保障模型鲁棒性的有力手段。
一句话总结: 本文提出并证实了“信息丰裕悖论”,揭示了训练阶段过于丰富的上下文信息会导致 LLM 倾向于“偷懒”依赖上下文而非将知识内化至参数中,从而在缺乏或面对误导性上下文时出现严重的性能衰退与鲁棒性丧失。
Large language models are increasingly trained and deployed with long contexts that span documents, code repositories, and interaction histories. This scaling reflects the implicit assumption that training on longer contexts will only help the model by exposing it to richer evidence. We challenge this view by studying how the context window shapes a model’s mode of learning, shifting it between parametric internalization and contextualization. We propose the Information Abundance Paradox, which hypothesizes that abundant relevant information in the training context can reduce the incentive to encode that information parametrically, thereby increasing reliance on context. In pretraining with long documents, increasing the context window improves language modeling, natural language understanding, and closed-book MCQA only up to an intermediate optimum, after which performance consistently declines. In supervised fine-tuning, more task-relevant train-time context improves performance with supporting context, but reduces robustness when context is absent or misleading at test time. Our analysis suggests that this behavior arises when longer context provides a lower complexity solution. Mechanistically, training with informative context shifts gradient pressure from feed-forward networks, often linked to parametric knowledge, toward attention modules, and causal interventions show that this shift increases reliance on context during inference. Overall, these findings support the Information Abundance Paradox and suggest that scaling toward near-infinite context is not simply a matter of supplying more data, even when high-quality long-context data is abundant.
https://arxiv.org/abs/2608.12218


3、[CL] One Frozen Simulator Is Not Enough: Simulator Collapse in Multi-Agent RL
S Yu, N Tomlin, M Abdulhai, X Lu…
[Northeastern University & New York University & UC Berkeley]
单一固定模拟器远远不够:多智能体强化学习中的模拟器坍缩问题
要点:
揭示并定义了多智能体强化学习中的“模拟器崩溃(Simulator Collapse)”现象:对单一且存在模式崩溃(Mode Collapse)的冻结 LLM 用户模拟器进行 RL 训练,会导致策略模型过度拟合该模拟器的特定行为,退化为死板的套路脚本。 理论证明了模式崩溃的模拟器会使策略梯度严重偏向“单模态用户”目标,导致组相对优势(GRPO)仅仅依据“模式套利”能力对样本进行排序,彻底丧失对用户鲁棒性的学习。 揭示了一个反直觉的实证现象:在单一冻结模拟器上训练的 RL 策略,其策略熵会迅速跌落至接近零,且在面对真实人类用户时,其表现甚至劣于完全未经训练的基线模型。 提出了推理侧解法口头化采样(Verbalized Sampling, VS):在 Rollout 阶段要求模拟器输出口头化的概率分布并从中采样,无需重新训练即可恢复模拟器内部的响应多样性。 提出了训练侧解法协同训练(Co-Training):在同一对话中将用户模拟器与策略模型进行联合梯度更新,将模拟器打造为“动态靶场”,防止策略锁定在固定的套路上。 将协同训练扩展为种群协同训练(Population Co-Training):从历史 Checkpoint 的 FIFO 缓冲区中随机采样活跃模拟器,以最大化 Checkpoint 间的意见分歧与行为覆盖率。 揭示了协同训练中模拟器奖励函数设计的敏感性:纯对抗(导致拒答崩溃)或纯合作(导致过分配合的 Reward-hacking 崩溃)都会使模拟器重新陷入新的单模态,必须采用方差课程(Variance Shaping)奖励。 发布了开源多智能体 RL 框架 SCOPE(基于 SLIME 构建),在统一接口下原生支持异构模拟器轮换、自博弈(Self-play)、双模型协同训练和 Checkpoint 种群采样。 在三个多轮 Benchmark(Persuasion for Good、-bench、CooperBench)上验证,种群协同训练相比单模拟器 RL 将未见模拟器上的任务成功率提升了高达 14%,同时维持了健康的策略熵。 开展了基于 Prolific 的预注册人类实验,证实协同训练在真实人类测试中将 -bench 的任务成功率从 0.43 提高至 0.70,并在 P4G 中显著提升了对话自然度与筹款效果。
主旨: 解决多智能体强化学习(MARL)在人机对话与协作任务中因依赖单一冻结 LLM 用户模拟器而导致的“模拟器崩溃”与策略泛化失效问题。论文通过理论证明与实证分析,阐明了模拟器的模式崩溃如何破坏策略梯度,并提出了推理侧的“口头化采样”与训练侧的“种群协同训练”两种解决方案,显著提升了策略向未见模拟器及真实人类用户的泛化能力。
创新: -“模拟器崩溃”现象的理论形式化:首次从数学上证明了冻结模拟器的模式崩溃(Mode Collapse)如何将策略梯度简化为“单模态用户”目标,并证明了组相对优势(GRPO)在此环境下会导致策略熵呈几何级数崩溃。
口头化采样(Verbalized Sampling, VS):无需重新训练,在推理 Rollout 阶段通过特殊的 Prompt 要求 LLM 模拟器显式输出多个候选回复及其概率并进行采样,成功在模拟器内部恢复了预训练参考分布的多样性。 种群协同训练(Population Co-Training)机制:让用户模拟器与策略模型在同一对话中共同演化,并结合历史 Checkpoint FIFO 缓冲区进行种群采样,打破了固定模式套利,迫使策略保持高熵与高泛化性。 通用开源框架 SCOPE:开发并开源了基于 SLIME 的多智能体 RL 训练系统,屏蔽了底层分布式计算细节,原生支持自博弈、双模型协同训练和历史检查点种群采样等复杂范式。
贡献:
理论与机理贡献:揭示了多轮人机交互 RL 中“训练环境的多样性比策略算法本身更关键”的深层机理,给出了策略熵崩溃和跨分布迁移失效的定量分析边界。 算法与开源系统贡献:提出了 VS(推理侧)与 Co-Training(训练侧)两套互补解法,并发布了全功能多智能体开源训练系统 SCOPE。 实证与人类研究贡献:在三个复杂多轮 Benchmark(P4G、-bench、CooperBench)上进行了全面评估,并完成了预注册的真实人类(Prolific)对比实验,为多轮 Agent RL 的训练提供了坚实的基准与范式指导。
提升:
未见模拟器泛化率(Held-out Success Rate):在 -bench(Retail/Airline)和 Persuasion for Good 上,VS 相比单模拟器 RL 提升高达 9%,Population Co-Training 进一步提升高达 14%。 真实人类测试表现(Human Success Rate & Metrics):在 -bench 真实人类测试中,单模拟器 RL 任务成功率仅为 0.43(甚至低于未训练基线的 0.41),而 Co-Training 大幅提升至 0.70;在 P4G 中对话自然度与筹款额均达到显著最佳。 策略熵与抗过拟合能力(Policy Entropy):单模拟器 RL 的策略熵在训练中会迅速崩溃至近 0(死记硬背单一脚本),而 VS 与 Co-Training 成功将策略熵维持在 0.8~1.2 nats 的健康区间,消除了“策略崩溃”。
不足:
协同训练带来额外的计算与显存开销:Co-Training 需要在同一 Rollout 中同时对策略模型和模拟器模型进行梯度更新,单步计算开销约翻倍(2×);Population Co-Training 维护 Checkpoint 缓冲区会增加显存占用。 模拟器奖励函数设计的敏感性:Co-Training 对模拟器的奖励设计高度敏感,纯对抗(导致拒答崩溃)或纯合作(导致过分配合的 Reward-hacking 崩溃)都会导致模拟器重新陷入新模态,必须精心配置方差课程(Variance Shaping)奖励。 种群管理目前基于简单的 FIFO 缓冲区:当前的种群采样仅采用简单的 FIFO 历史检查点机制,尚未实现依据训练信号动态筛选/淘汰 Checkpoint 的自适应种群进化策略。
心得:
“环境的多样性”决定了“策略的生死”:在多轮人机交互 RL 中,单模态的冻结模拟器不仅无法提供良好的训练信号,反而会形成“过拟合黑洞”。策略会不择手段地寻找该模拟器特定 Mode 的 Bug(如过度礼貌或固定套路),导致真实的泛化能力彻底崩溃。 动态靶场(Moving Target)比静态精雕更重要:相比于花大量精力 Prompt 调整或微调一个“完美但静态”的单模拟器,让模拟器在训练过程中与策略同步演化(Co-Training)更能逼迫策略学到鲁棒的泛化能力。 口头化采样(Verbalized Sampling)是极具性价比的零成本基线:无需任何额外的梯度更新或重训,仅在推理 Rollout 阶段改变 Prompt 提示词让 LLM 输出分布式候选,就能通过恢复内部概率分布摆脱绝大部分的模态崩溃。
一句话总结: 本文揭示了多智能体 RL 中使用单一冻结模拟器会导致策略过拟合与策略熵崩溃(“模拟器崩溃”),并提出口头化采样(VS)与种群协同训练(Population Co-Training),成功实现了多轮策略向真实人类与未见模拟器的高度泛化。
Multi-agent reinforcement learning for human-AI interaction typically relies on a single large language model to simulate user behavior. We show that this approach systematically fails to generalize, and trace the failure to simulator collapse: because the simulator LLM is mode-collapsed, an LLM policy trained against it overfits to narrow strategies that exploit the simulator’s dominant mode, and such a policy transfers poorly to unseen simulators and real users. We formalize this collapse theoretically and propose two complementary solutions, one at inference time and one at training time. The inference-time solution, Verbalized Sampling, broadens the simulator’s behavior by sampling from a verbalized response distribution, reducing mode collapse. The training-time solution, Co-Training, jointly optimizes the policy against a population of trainable simulators, preventing it from overfitting to any single simulator’s mode. We validate both solutions on three multi-turn benchmarks: Persuasion for Good, τ 2-bench, and CooperBench. Verbalized Sampling improves held-out success by up to 9% over single-simulator RL, and Co-Training pushes gains further to 14%; the human study shows similar gain on real users. Both solutions preserve the policy diversity that collapses under single-simulator RL. To support further work in this direction, we release SCOPE, an open-source framework for Population Co-Training multi-agent RL. More broadly, our results suggest that the diversity of the training environment, not only the policy, is critical to the generalization of multi-turn RL to real-world deployment.
https://arxiv.org/abs/2608.12253


4、[LG] Small-Scale Experiments: Are We There Yet?
N Lourie, K Cho, K Ullrich, S Lotfi
[FAIR at MSL Meta & New York University]
小规模实验:我们离目标还有多远?
要点:
挑战了“Scaling Laws 在小规模(<100M 参数)下失效、模型创新研究必须依赖昂贵的大模型预训练”这一普遍认知。 揭示了超参数(HP)敏感性是阻碍小规模标度律显现的核心混淆因素:小模型对超参数极度敏感,而这种敏感性随着模型规模扩大而迅速衰减。 证明了 Scaling Laws 在小至 4M 参数的模型(单卡 GPU 上训练不足 1 小时)中依然严格成立,但它仅显现于“完全调优的前沿(Fully Tuned Frontier)”,需要进行远超常规小网格的广搜(数百组配置)。 从超参数损失曲面的几何机制解释了上述现象:随着模型参数增加,超参数损失曲面的本征维度(Intrinsic Dimension )会降至 ~1,使大模型天然具备极高的超参数容错率(即参数的“维度红利”消解了超参数的“维度灾难”)。 提出了一种针对模型中心化(Model-centric)研究的新方法论,融合三大工具:噪声二次极限(诊断超参数调优完整性)、Scaling Laws( Loss 标度建模)与 Perplexity-能力对应律(证明固定数据下预训练 Loss 直接决定下游能力)。 指出了长距离纯定量 Loss 外推的统计学陷阱:小规模标度律在数据附近高度可靠,但跨数量级外推会剧烈放大不可约误差(Irreducible Error )的采样噪声。 以经典 Transformer 架构争论(Pre-Norm vs. Post-Norm)为案例,仅凭微型小模型实验便完美复现了大模型的已知结论(Pre-Norm Scaling 效率更高且极易调优)。 证明了参数统计方式(如是否包含 Embedding、是否计算 Attention FLOPs 等)对标度律拟合的影响微乎其微,超参数充分调优与学习率衰减(Decay)才是决定标度律成败的绝对核心。
主旨: 解决小规模神经网络预训练实验难以可靠外推至大模型这一长期困局。论文揭示了超参数敏感性是阻碍小规模 Scaling Laws 显现的关键因素,并证明只要超参数得到充分调优,4M 以上的小模型就能显现出与大模型完全一致的标度律;进而结合“噪声二次极限”与“Perplexity-能力对应律”,建立了一套低成本、高严谨性的小规模模型研究新范式。
创新:
揭示小模型超参数损失曲面的“降维机制”:首次指出超参数损失曲面的本征维度()随着模型规模扩大而降至 1 的现象,从理论上解释了为何大模型易于调优,而小模型必须依赖深度搜索才能暴露标度律。 重新发现微型模型(4M 参数)上的 Scaling Laws:破除了学术界“小模型 Scaling Laws 不可靠”的迷思,证明只要在完全调优的前沿(Fully Tuned Frontier)上采样,微型模型即遵循极度规范的幂律衰减。 集成三柱模型研究新框架:将“噪声二次极限”(诊断超参数调优深度)、“Scaling Laws”(标度外推)与“Perplexity-能力对应律”(建立 Loss 与 downstream 能力的映射)有机结合,构建了完整的小规模模型创新验证方法论。 提出了针对纯定量外推的统计瓶颈诊断:澄清了直接依赖小模型 Scaling Laws 进行长距离不可约误差()数值外推的危险性,主张通过小规模实验建立定性理解而非盲目追求绝对 Loss 预测。
贡献:
打破算力壁垒,重塑学术界模型研究范式:证明了普通实验室利用单卡微型模型(4M-34M)就能开展高质量的模型架构与算法创新研究,大幅降低了 AI 研究的门槛与成本。 澄清标度律拟合的关键要素排序:通过消融实验证实,超参数充分搜索与学习率 Decay 是拟合标度律的绝对关键,而参数统计定义、指数相等假设()等细节影响甚微。 经典架构争议的高效复现(Pre-Norm vs Post-Norm):仅耗费相当于极少数次 1B 模型训练的算力,成功解答了曾耗费工业界数年才确立的 Pre-Norm 在 Scaling 和调优上的全面优势。
提升:
实验算力效率:将架构/算法验证的算力成本降低了数个数量级(例如 65,536 次 4M 实验仅相当于 1 次 1B 模型训练)。 外推拟合准确度:将超参数搜索组数从 4 组扩展至 256 组后,标度律拟合的外推均方误差(MSE)降低了数千倍,消除了过往小模型 Scaling Laws 中充斥的统计噪声。 调优难度量化:利用 指标首次实现了对不同规模、不同架构(如 Pre-Norm 相对 Post-Norm 的渐进区更大)超参数调优难度的定量诊断。
不足:
强依赖于“固定预训练数据”前提:该方法论强依赖于 Perplexity-能力对应律,仅适用于模型中心化(Model-centric)研究,对于改变数据质量/分布的数据中心化(Data-Centric)研究不适用。 长距离绝对 Loss 定量预测存在统计瓶颈:由于不可约误差()会在远距离外推时放大采样噪声,小规模实验无法精准预测数十亿/数千亿参数模型具体的 downstream 任务得分。 超参数损失曲面维度的理论推导尚待深入:虽然实证观察到了 的现象,但对于不同参数化方案(如 P)下损失曲面演变的完备数学证明仍需未来进一步探索。
心得:
大模型的“维度红利”救了超参数的“维度灾难”:人们通常直觉认为参数越多越难调,但事实刚好相反。随着模型规模增加,超参数损失曲面的本征维度降到了 1,这意味着大模型对超参数极度鲁棒,小模型调优经验可以轻松平移;而小模型正因为高维超参数曲面极度敏感,才必须进行极其详尽的搜索。 Scaling Laws 藏在“完全调优的前沿”:过往关于“小模型标度律失效”的结论,几乎全部是因为实验只尝试了十几个超参数组合,未能触达真实的最佳前沿。只要超参数搜得够深(256+ 组),4M 参数的小模型就会展现出与大模型完全一致的标度律。 从“精确预测能力数值”转向“定性趋势与控制成本”:长距离定量外推 Loss 会放大不可约误差的统计噪声,试图精确预测大模型具体几分是没有意义的。正确的做法是利用小规模实验建立定性理解(如哪种架构在相同 Loss 下成本更低),再利用 Perplexity-能力对应律,确信“更低 Loss 必带来更强能力”,从而放心将最优架构升阶。
一句话总结: 本文揭示了超参数敏感性是阻碍小规模 Scaling Laws 显现的核心因素,证明了小模型在完全调优前沿上依然遵循严谨标度律,并提出了一套利用微型实验高效指导大模型创新的科学方法论。
Scaling laws promised cost-effective experiments; six years later, they have yet to fully deliver. Instead, researchers have found them unreliable at small scales (starting at 4M parameters) and concluded that sizable models cannot be avoided. We show this is not the case: the confounding factor is hyperparameters. Small models are highly sensitive, but hyperparameter sensitivity fades with scale. This small-scale sensitivity makes scaling laws easy to miss because they only emerge on the fully tuned frontier, and reaching that frontier requires an extensive search far beyond what most ever run. By ablating the basic scaling law recipe, we show well-tuned hyperparameters matter more than any other ingredient. Further, we reveal why those hyperparameters become easier to find: as scale increases, the hyperparameter loss surface becomes lower dimensional. Nevertheless while scaling laws exist in small models, extrapolation hits statistical limitations. A holistic approach is required. Synthesizing our insights with the recent literature, we develop a new methodology for model-centric research and demonstrate it on a question that once took the field years to settle: where to place normalization layers in the transformer architecture. From small-scale experiments, we recover the large scale result: pre-normalization works better as models grow in size. With the right tools and a better understanding, small-scale experiments can deliver on scaling laws' long-awaited promise.
https://arxiv.org/abs/2608.11859


5、[LG] SoftWater: Class-Aware Rate Allocation for Softmax Quantization
J V. Cavalcanti, A C. Wilson
[MIT]
SoftWater:面向 Softmax 量化的类别感知比特分配方法
要点:
揭示了现有模型量化流水线(PTQ)长期忽略 Softmax 输出头的痛点:在词表庞大的小型大模型中,输出头参数占比达 15%–30%;而在模型主体量化至 2–4 bit 时,输出头占全模型存储的 52%–68%,成为最严重的存储瓶颈。 传统针对线性层的加权均方误差(WMSE)指标在输出层失效,因为 Softmax 输出是概率分布,真正的失真度量是输出概率之间的 KL 散度。 通过对 KL 散度的二阶泰勒展开,证明了误差权重由输入特征协方差与类别曲率联合决定的超大矩阵 E[(diag(p) - pp^T) ⊗ XX^T](规模为 Kn × Kn)所主导。 提出了基于抖动理论与可分离性假设的 SoftWater 算法,将 Kn × Kn 的超大 Cholesky 分解简化为单次 n × n 的特征协方差分解与 K 维类别曲率统计量 λ_k = E[p_k(1 - p_k)] 的逐类别缩放,使得连续干扰消除(SIC)格子编码可在 O(n^3) 复杂度内完成。 所有统计量仅需在单次前向校准传播中伴随计算,无需反向传播,不改变解码格式,计算开销极低。 码率分配核心准则:给“高频且跨上下文低方差”的类别分配更细的量化网格(更多比特),给“低频/罕见”类别分配粗网格;语言词表的齐夫分布(Zipf's Law)使得类别维度的收益远超特征维度。 引入先验平滑机制(ε 平滑),有效解决了罕见或未见词因扰动过大导致泰勒展开失效的问题,并在理论上将 WaterSIC 统一为类别均匀分布下的特例(ε=1)。 在 1B 到 32B 的 5 个人类常用开源模型上,2-bit 量化下 SoftWater 相比 WaterSIC 将头层引起的 KL 散度降低了 6.5 倍至 8.3 倍(相当于节省了约 1 bit 的量化精度损失)。 在权重绑定(Tied-head)模型(如 Llama-3.2-1B)上,2-bit 输出头可在保持极低困惑度增加(2.9%–3.7% vs WaterSIC 的 9.7%–17.6%)的同时,削减整个模型 45%–60% 的存储体积。 类别统计量天然蕴含领域词频信息,支持针对特定领域的校准(Domain-targeted Calibration),当校准域与部署域匹配时能取得最优的 KL 散度表现。
主旨: 针对后训练量化(PTQ)中长期将参数占比巨大的 Softmax 输出头排除在低比特量化之外、以及传统线性层 MSE 指标无法准确刻画输出概率分布失真的问题,论文提出了基于输出 KL 散度二阶展开的率失真建模方法,旨在实现超低比特(2–4 bit)下高保真、低开销的语言模型输出头量化。
创新:
建立了基于输出分布 KL 散度的 Softmax 层量化率失真理论框架,推导出类别与特征耦合的二阶误差曲率张量。 提出了可分离性代用模型(Separability Surrogate)与平滑先验(Smoothing Prior),将难以求解的 Kn × Kn 庞大误差度量分解为单次 n × n 特征 Cholesky 分解与类别方差折扣因子的乘积,兼顾了理论严谨性与计算可行性。 设计了感知类别频率与上下文方差的二维格子码率分配算法(SoftWater),并在单次校准前向传播中同时捕获特征协方差与类别曲率。
贡献:
理论贡献:从二阶 KL 散度严格推导出了 Softmax 层的几何结构,证明了对高频、低方差词分配高码率的最优性,并将 WMSE 目标统一为 SoftWater 在类别均匀分布下的特殊情形。 算法贡献:提出了 SoftWater 量化算法,无需反向传播与额外迭代,以极低计算复杂度实现了类别维度的自适应网格缩放与 SIC 格子编码。 实证贡献:在 1B–32B 多种模型及全模型低比特量化(GuidedQuant 主体)场景下进行了广泛验证,大幅削减了模型端到端存储体积,并在下游零样本任务(尤其是 LAMBADA)上显著优于基线。
提升:
KL 散度与失真度:在 2-bit 头量化下,SoftWater 在 WT2 上的输出 KL 散度相比近信息论极限的 WaterSIC 基线降低了 6.5×–8.3×,在 59/60 的测试点上取得全面领先。 语言模型困惑度(PPL):在 2-bit Tied-Head 场景下,Llama-3.2-1B 的 PPL 增幅从 WaterSIC 的 17.6% 压低至 3.7%;在 4-bit 下接近无损(增幅仅 0.2%–0.3%)。 存储体积压缩:成功使得输出头实现 2-bit 极限压缩,将 1B 模型的整体存储尺寸直接削减 45%–60%。 零样本下游任务精度:在 LAMBADA 等概率敏感任务上,2-bit 头的准确率较 WaterSIC 提升了 5.2–7.1 个百分点。
不足:
可分离性假设的普适性边界:将类别曲率与特征协方差解耦是基于经验上不超过 10% 的近似误差,缺乏严格的理论下界保证,在极端异构或未归一化的特征表征下可能存在退化风险。 部署端硬件适配与实际推理吞吐:论文主要关注压缩率、KL 散度及信息论界限,采用熵编码存储不同列/行的可变比特,未在论文中展示底层专用硬件(如 GPU Tensor Core)上的实际端到端推理延迟与解码内核优化。 实验主干模型的依赖性:端到端量化实验主要依托于单一的 GuidedQuant 量化主干家族,对其他主流 PTQ 算法主干的兼容性有待更广泛的实证。
心得:
突破固有范式,度量对齐往往比算法堆叠更具根本性:过去 PTQ 算法在 MSE/WMSE 上通过复杂的后处理将压缩逼近信息论极限,但忽视了 Softmax 层“概率流形”的本质。SoftWater 仅通过将优化目标从 MSE 改为 KL 散度,在不使用任何微调或后处理技巧的前提下,便击败了高度工程优化的 SOTA 基线,证明了“找准几何度量”的威力。 齐夫定律(Zipf's Law)在模型压缩中的非对称价值:自然语言词频的幂律分布导致参数重要性呈现极度极化。在类别维度上根据“频率与跨上下文方差”进行自适应比特分配(高频词精细、低频词粗糙),其带来的边际收益远高于传统的特征通道剪裁。 单次前向统计与先验平滑的工程平衡艺术:巧妙利用二阶展开的对角近似,在单次前向推理中同时完成特征与类别的统计量累加;同时引入简单的先验混合(ε-smoothing)解决长尾/未见词的扰动溢出问题,展示了将严谨数学理论优雅落地的工程智慧。
一句话总结: SoftWater 针对大模型输出头长期难以压缩的痛点,通过将 Softmax 层的量化建模为基于输出 KL 散度的二阶率失真问题,提出了兼顾类别词频与上下文方差的自适应二维网格分配算法,在单次前向校准下以 2-bit 超低比特实现了全模型最高 60% 的存储削减与接近无损的概率保真度。
Post-training quantization pipelines routinely leave the softmax output layer in high precision. Yet in small LLMs with modern vocabularies, the head holds 15– 30% of all parameters, so a nominal “2-bit” model with an fp16 head can store several times as many bits per weight. We pose softmax-layer quantization as a rate-distortion problem under the KL divergence between the original and quantized output distributions. A second-order analysis reveals a class-aware geometry: quantization error is weighted jointly by feature covariance and class-specific softmax curvature. A separability approximation replaces the Kn×Kn Cholesky with one n × n factorization rescaled per class, making the lattice encodable by successive interference cancellation, with both statistics from a single forward pass. The resulting method, SoftWater, gives fine grids to frequent, low-variance classes and coarse grids to rare ones, a large gap under Zipfian token distributions. Across five models from 1B to 32B, SoftWater outperforms the released WaterSIC quantizer (near-optimal under linear-layer WMSE but not output KL) at matched head rates on 59 of 60 test points, using none of that pipeline’s refinements and cutting head-induced KL by 6.5×–8.3× at 2 bits. On Llama-3.2-1B-Instruct with quantized bodies, a 2-bit head removes 45–60% of stored bytes for a 2.9–3.7% perplexity increase. Because the class-side statistic comes from calibration data, matching calibration to the deployment domain gives the lowest KL on that domain throughout. On a tied model, a 4-bit head is near-lossless and a 2-bit head costs under 4% perplexity, making head quantization of such models practical.
https://arxiv.org/abs/2608.12026
夜雨聆风