今日重要性排序
图表说明:今天四项动态分别覆盖推理系统、Agent训练、多模态安全和Agent工程评测。
一、LFM2.5-DSpark:约3亿参数的草稿器,让目标模型最高加速3.18倍
Liquid AI于8月20日开放了三组DSpark草稿模型,分别配合LFM2.5-1.2B-Instruct、2.6B和8B-A1B使用,并同步接入SGLang与llama.cpp。官方技术文章与模型入口
核心流程
用户上下文↓约3亿参数的DSpark一次产生多个候选Token↓顺序轻量头修正候选之间的依赖↓置信度模块提前剪掉低价值后缀↓目标模型一次验证整块候选↓接受最长正确前缀
图表说明:DSpark减少的是目标模型反复读取权重的次数,不是跳过目标模型验证。
它解决了什么问题
LLM逐Token解码通常受显存带宽限制。即使GPU计算单元没有满载,每生成一个Token仍要重新读取大量模型权重。
普通推测解码使用小模型先猜一段,再由目标模型并行验证。DSpark在此基础上加入三项设计:
并行草稿骨干:一次生成整个候选块的隐藏状态。 Markov顺序头:补充候选Token之间的局部依赖,避免后半段快速失真。 置信度调度:预测每个候选能够通过验证的概率,收益不足时提前停止。
三组草稿器均约3亿参数,使用5层注意力结构,最大候选块为9个Token。训练模型依据“接受率”选择,而不是依据最低训练损失选择。
关键性能数据
以下结果均为Liquid AI官方测试,不能跨硬件直接比较绝对吞吐。
测试口径:H100 80GB使用BF16和SGLang;M4 Max使用FP16 GGUF、llama.cpp和Metal;Batch Size为1、温度为0、最多生成256个Token。
2.6B模型在多工具场景中的函数调用延迟平均下降57%。8B-A1B在MATH500上获得最高3.18倍GPU吞吐,但Mac端平均仅提升18%。
为什么MoE在设备端没有同步获得高收益
验证多个Token时,MoE可能激活更多专家,增加权重读取量。当前llama.cpp的Metal后端也未充分发挥这种验证模式。
因此,候选接受率高不一定意味着端到端加速高:
边界判断
已证实:权重、GGUF文件以及SGLang、llama.cpp接入方式已经开放。
官方数据:最高3.18倍GPU吞吐、2.87倍设备端吞吐、函数调用延迟平均下降57%。
合理推断:低并发、长输出和工具调用任务可能是DSpark最合适的场景。
尚不能推出:所有在线服务都能获得两倍以上收益。官方数据只覆盖Batch Size为1,尚缺高并发、长上下文及P95延迟测试。
二、RTPO:多轮Agent训练应该从最后一步倒着优化
8月20日进入公开索引的RTPO论文,针对多轮工具Agent强化学习的训练不稳定问题,提出Reverse-Turn Policy Optimization。论文原文
传统训练的三个结构性问题
训练流程
完整Agent轨迹↓从最后一轮建立同状态的多个Sibling分支↓比较这些分支的最终结果,计算该轮贡献↓更新最后一轮策略↓使用更新后的策略重新生成后续路径↓依次向前训练倒数第二轮、倒数第三轮……
图表说明:从后向前优化,可以先稳定“下游会发生什么”,再评估前一轮动作的真实贡献。
与GRPO把整条交互展平成一个Token序列相比,RTPO把每轮模型响应视为一个宏动作。只有当前轮输出参与梯度更新,历史上下文只作为条件输入。
结果与成本必须一起看
主实验使用Qwen3-8B,在8个数学和知识检索任务上评测。
作者将RTPO相对GRPO和SeeUPO的提升概括为21.50%和10.76%。不过,汇总表中的直接差值分别是7.95和3.98个百分点,阅读时应区分“相对改进”“百分点差”和作者采用的综合口径。
RTPO也付出了更高训练成本。在Qwen3-1.7B的Airline实验中:
RTPO的GPU小时增加约41.3%。在近似等算力条件下,两者Pass@1相同,但RTPO的Pass@4由25%提高到35%,环境完成率由20%提高到30%。
工程影响
多轮RL平台以后需要把以下对象作为训练数据的一部分保存:
每轮真实可见的上下文,而非事后重建的上下文; 工具返回和环境状态的版本; 生成该轮轨迹时的策略版本; 每个决策点的Sibling分支; 截断、摘要和缓存策略; 单轮贡献与最终任务奖励。
局限是Sibling续写会显著增加采样量;稀疏二值奖励环境中,大量分支仍可能得到完全相同的零奖励。论文还观察到训练后期成功率回落,说明逆序训练并没有消除过优化问题。
三、VLM攻击:只击穿占比1.6%至18%的视觉编码器
一项8月19日提交、随后进入新稿列表的研究表明,攻击者不必对完整VLM反向传播,只优化视觉编码器的Embedding,就能显著改变模型生成的图像描述。论文原文
攻击路径
原始图片↓向像素加入受约束的微小扰动↓只通过视觉编码器计算梯度↓让图片Embedding接近目标图片↓语言模型接收到错误视觉表示↓把坦克描述成救护车等无关对象
图表说明:攻击利用的是视觉表征与语言输出之间的连接,不需要直接操纵语言模型。
为什么成本更低
攻击仅对视觉编码器执行50轮I-FGSM优化。实验使用1000组随机ImageNet源图与目标图,并由Granite-4.0-micro判断模型描述是否已接近攻击目标。
在扰动预算0.05下,作者报告的定向攻击成功率为:
数据为四次运行均值,属于作者报告。
需要谨慎解释的地方
第一,这是白盒攻击,攻击者需要访问视觉编码器及其梯度。
第二,成功率由另一个LLM判断,尚未使用大规模人工标注验证。
第三,作者称扰动“人眼不可感知”,但没有给出系统的人类感知实验。0.05像素范围是否不可见,还会受到图像位深、缩放、压缩和显示设备影响。
工程上不应只对完整多模态模型做红队测试。视觉编码器、投影层、OCR、图像预处理和共享Embedding都应分别测试,并加入JPEG压缩、截图重拍、缩放和跨模型迁移实验。
四、FinSkillBench:可靠技能包有效,Agent临时自写技能几乎无收益
FinSkillBench在最新公开列表中给出了2,603个任务Episode、12项投资管理子任务和完整验证器,用来隔离“可复用技能”对Agent表现的影响。论文原文
三种实验条件
人工技能提高16.2个百分点;自生成技能仅提高0.5个百分点,95%置信区间跨越零。
收益主要集中在需要确定性计算工具的任务:
图表说明:技能包对优化器、风险计算等程序性任务帮助最大,对主要依赖文本判断的任务帮助较小。
最重要的评测边界
这里的“人工技能”不只是提示词,还包含可执行组件和精确的数据传递说明。因此结果不能被简化为“多写一份SKILL.md就能提升16个百分点”。
此外,21%的调用耗尽了最大轮数;一个模型因运行问题取得零分,并从主要条件分析中排除。独立Harness复现也改变了无技能条件下的工具可用性,导致提升幅度更大。
合理结论是:经过验证的领域程序、输入契约和说明文档组成的技能包确实有价值;但Agent在单次任务中临时生成、未经回归验证的技能,暂时不能替代人工维护的能力层。
今日最值得精读的3项
LFM2.5-DSpark官方技术文章重点看不同模型、数据分布与硬件下的接受长度和实际加速为何不成正比。 RTPO论文重点看真实Rollout上下文保存、同状态Sibling分支以及逆序更新的训练闭环。 视觉编码器攻击论文重点看威胁模型、扰动预算和LLM-as-a-Judge评测带来的结论边界。
今日可实践与复现建议
今天最值得带走的结论是:模型周围的执行结构已经成为主要性能变量——推测解码决定速度,信用分配决定多轮训练稳定性,组件级攻击决定安全下限,而技能包的验证质量决定Agent能否把知识可靠地转化为行动。
夜雨聆风