乐于分享
好东西不私藏

爱可可AI前沿推介(8.7)

爱可可AI前沿推介(8.7)

LG - 机器学习 CV - 计算机视觉 CL - 计算与语言 AI - 人工智能

1、[CV] Towards Physics of Multimodal Pretraining:Knowledge Flow, Modality Synergy, Early Unification, and Recipes
2、[LG] Privileged, but Biased:How PI-Conditioned Teachers Break Self-Distillation
3、[CL] Toward Skill-Native LLMs:Skill Entropy for Benchmarking and Training Long-Horizon Reasoning
4、[AI] COMPAS:Difficulty-Aware Joint Search for Optimizing Code Generation
5、[CL] The Personalization Mirage:How LLMs Fabricate User Profiles, and Why Self-Monitoring Misleads

摘要:迈向多模态预训练的物理学、受特权信息(PI)约束的教师模型如何使自蒸馏失效、以“技能熵”赋能长程推理的基准测试与训练、面向代码生成优化的难度感知联合搜索、大语言模型如何虚构用户画像以及为何“自我监测”具有误导性

1、[CV] Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes

J Han, S Tong, D Fan, M Chen,…
[FAIR, Meta]

迈向多模态预训练的物理学:知识流动、模态协同、早期统一与训练配方

要点:

  • 通过受控的真实数据与合成数据实验,解密了统一多模态预训练(同时进行语言建模、视觉理解与视觉生成)的底层“物理机制”(Physics)。
  • 揭示了跨模态知识流动存在显著的非对称性:语言是所有视觉任务的通用促进因子,视觉理解为视觉生成提供强先验,而视觉生成对语言和理解的反向迁移效果呈中性(既无显著提升也无干扰)。
  • 通过合成 CLEVR 剥离实验发现,零样本概念迁移严格取决于概念的抽象层级:低阶属性(颜色、形状)在双向零样本迁移中完全失败,而高阶结构概念(空间关系、尺寸、数量)能从理解迁移至生成。
  • 发现了反直觉的隐性先验机制:虽然视觉生成缺乏零样本反向迁移能力,但其预训练过程建立了精细的像素级特征,在微调阶段能作为强隐性先验显著加速低阶视觉理解能力的恢复。
  • 揭示了模态间的协同与竞争由任务复杂度决定:学习极其简单的视觉目标(如纯色背景或噪声)反而能超越纯文本基线并降低语言困惑度,而复杂真实世界数据的引入则会引发对有限参数容量的剧烈竞争。
  • 精准定位了 Transformer 模块结构对模态相互作用的决定性影响:共享 Attention 与 Normalization 层能构建表征桥梁促进跨模态协同,而解耦/独立 FFN(或采用 MoE)可隔离算力容量以消除毁坏性干涉。
  • 证明了跨模态协同效应可泛化至多种视觉 Tokenizer 设计(RAE、Raw Pixels、CLIP + VAE 及自回归 UniTok),表明预先对齐的视觉表征空间并非实现模态协同的刚性前提。
  • 发现并从机制上证实了“视觉懒惰”(Vision Laziness)现象:延迟视觉引入(晚期对齐)会导致过早硬化的语言干线占据主导,造成视觉 FFN 激活度降低、Wrapper Token 嵌入缩减,以及注意力大幅偏离视觉 Token。
  • 证明了从零开始的早期联合预训练全面优于所有顺序式阶段化训练方案(包括符合人类认知习惯的“视觉优先”顺序及带有数据重放机制的方案)。
  • 推导出一种极具算力效率的不对称预训练 Recipe(70% 语言、25% 视觉理解、5% 视觉生成),利用语言与理解先验以极低的算力成本强力 Bootstrapping 视觉生成能力。
  • 在 2T Token、13.5B 参数的 MoE 模型规模下验证了上述所有核心结论,仅用 5% 的生成算力即实现了顶尖的视觉理解与高质量文本生成图像表现。

主旨: 本文旨在探索并建立原生统一多模态预训练(Native Unified Multimodal Pretraining)的底层“物理机制”(Physics of Multimodal Pretraining)。论文试图回答:在单一模型中同时训练语言、视觉理解与视觉生成时,跨模态知识如何在各能力间流动?模态间在何种条件下协同或竞争?何时以及如何进行模态融合最有效?并基于机制分析设计出算力利用率最高、可扩展的预训练 Recipe。

创新:

  • 合成环境受控因果剥离法(CLEVR 试验台):在真实数据之外,构建了严格受控的合成数据集,通过在特定模态数据流中精准剥离特定概念(颜色、形状、关系、尺寸、数量),首次将跨模态迁移分析从相关性推升至因果机制层面。
  • 机制性揭示与量化“视觉懒惰”(Vision Laziness):从训练/推理激活范数、 Wrapper 嵌入范数及注意力分配 4 个维度,机制性地解释了晚期对齐(Late Alignment)导致视觉分支钝化、模型过度依赖语言先验的深层原因。
  • Transformer 模块级“协同-竞争”解耦架构设计:系统拆解 Transformer 内部组件,提出“共享 Attention 和 Norm 以搭建协同桥梁,解耦 FFN(或引入 MoE)以隔离容量竞争”的架构设计原则。
  • 非对称极简生成预训练 Recipe (L70/U25/G5):突破传统的平均数据混合直觉,利用“语言与理解是生成强先验”的非对称规律,仅需分配 5% 的生成 Token 就能被理解与语言先验强力启动,实现高效扩展。

贡献:

  • 机制理论贡献:系统厘清了统一预训练中的非对称知识流动路径、复杂度驱动的协同/竞争演化规律,以及晚期融合诱发视觉钝化的物理机制。
  • 架构设计贡献:确立了“共享注意力/归一化 + 模态独立 FFN/MoE”的架构范式,并证明该协同规律独立于视觉 Tokenizer 类型(均适用于 RAE、Raw Pixels、CLIP、AR 等)。
  • 工程实践贡献:提出了高算力效率的不对称预训练 Recipe,并在 2T Token、13.5B MoE 规模下通过严密的单变量对照实验验证了其扩展性与优越性,为下一代 Any-to-Any 基础模型提供了科学的构建蓝图。

提升:

  • 极高的算力利用效率:在仅分配 5% 生成算力的前提下,13.5B MoE 模型(1.5B 激活参数)在 GenEval (0.482)、DPG (0.689) 及 50k FID (5.234) 上达到了与 25% 生成算力占比相同的顶级生成质量,同时大幅提升了语言准确率(54.31%)与视觉理解均分(43.08%)。
  • 早期联合 MoE 预训练的全维度超越:相比密集的 Dense 架构与晚期融合(Late-Fusion)基线,早期联合 MoE 预训练在语言困惑度 (PPL)、VQA 综合理解、文本到图像生成对齐度及生成 Loss 上均取得全面且显著的提升。

不足:

  • 模态扩展范围局限:目前研究主要聚焦于文本与静态图像的理解与生成,尚未在视频、音频、3D 或具身动作(Action)等连续动态或更复杂时空模态上进行验证。
  • 极限 Scaling 下的双向涌现未探明:在 13.5B/2T Token 规模下,视觉生成对语言和理解的反向迁移仍呈现中性;当模型扩展至万亿(1T+)参数的 Frontier 规模时,生成任务是否能演变为内部世界模拟器并反哺高阶逻辑推理,仍属于未解的前沿问题。

心得:

  • 反直觉的数据配置策略:生成是“被Bootstrapped的表达”,而非“重算力堆砌的目标”:研究表明视觉生成缺乏对语言和理解的反向迁移能力,但语言和理解却能强力驱动生成。因此,在统一预训练中平均分配生成算力是非常低效的。将 95% 的算力集中在语言和理解上构建成熟的世界表征,仅用 5% 的算力即可被动“触发”出顶尖的生成能力。
  • 早期联合融合(Early Unification)是原生多模态的刚性约束:先训练强 LLM 再接视觉模块的经典 Late-Fusion 范式存在隐患。语言干线过早硬化会导致模型倾向于使用语言先验走捷径,发生“视觉懒惰”(视觉 FFN 激活度降低、注意力偏离视觉 Token)。真正的原生多模态必须从预训练最初阶段让视觉与语言共同演化(Co-evolution)。
  • “共享桥梁,隔离算力”的架构解耦智慧:多模态相互作用的本质是“Attention/Norm 负责跨模态上下文对齐与特征尺度对齐(提供协同),FFN 负责吸收各模态的高熵计算需求(隔离竞争)”。这种设计为 Mixture-of-Experts (MoE) 在多模态领域的优越性提供了极具说服力的物理解释。

一句话总结: 本文深入探索了统一多模态预训练的底层物理机制,揭示了语言与理解对生成的非对称驱动作用、低阶与高阶概念的迁移界限、共享 Attention 与解耦 FFN(MoE)的协同原理,以及晚期融合诱发的“视觉懒惰”现象;基于此提出的非对称 Scaling Recipe(仅需 5% 生成算力)在 2T Token、13.5B MoE 规模下实现了高性能、高效率的原生多模态理解与生成协同演化。

Vision offers a critical axis for advancing foundation models, driving a shift towards natively unified multimodal pretraining. Despite this momentum, the design space and the fundamental mechanisms of how modalities interact during unified training remain underexplored. We provide empirical clarity through a systematic exploration of multimodal pretraining. Our controlled experiments on both synthetic and large-scale real-world datasets yield four key insights into the physics of multimodal pretraining: (i) Knowledge Flow: We disentangle how language, visual understanding, and visual generation transfer knowledge across modalities, revealing distinct patterns of influence and asymmetry; (ii) Synergy vs. Competition: We show that data "complexity" largely determines whether modalities are synergistic, identify architectural choices that promote synergy: such as shared attention and normalization with modality-specific feed-forward layers, and find that these behaviors generalize across different visual tokenizer designs; (iii) Early Unification: Unifying modalities from the very early stages and training them jointly is shown to be more effective than late alignment or sequential training. This process uncovers a vision laziness phenomenon, where delayed integration leads models to rely on language priors; (iv) Recipes: We derive efficient pretraining recipes that achieve strong generative performance using only 5% of the compute budget. These core findings are subsequently validated at scale by training multiple 13.5B MoE models on 2T tokens. We hope this study provides a principled foundation for understanding and scaling multimodal pretraining.

https://arxiv.org/abs/2608.05000


2、[LG] Privileged, but Biased: How PI-Conditioned Teachers Break Self-Distillation

S Harne, C Karkar, Y Pandya, A Awadallah…[Microsoft Research]

优越亦有偏:受特权信息(PI)约束的教师模型如何使自蒸馏失效

要点:

  • 挑战了当前人工智能领域的流行假设,即基于特权信息(PI)的自蒸馏(Self-Distillation, SD,如 SDPO 和 OPSD)可以在没有可验证奖励(RLVR)的情况下,作为大语言模型推理 Post-training 的独立训练目标。
  • 实证表明,在复杂推理任务(数学、代码、通用问答及多轮 Agent 具身工具调用)中,尽管每 Token 的自蒸馏 Loss 在训练期间平滑下降,但验证集正确率完全无法提升甚至显著退化(例如在 Agent 任务中平均下降达 3.51 分)。
  • 构建并证实了自蒸馏失效的 5 阶段因果链:PI 偏置 → 损失与正确性脱钩 → 算力被无信息 Token 浪费 → 惩罚探索能力 → 学生策略扁平化/钝化。
  • 提出了 PI 偏置得分(PI Bias Score),仅需前向传播即可证明:带特权信息的教师模型极度倾向于拟合特定参考解答的表面文本轨迹(),而非学习通用正确性(对同一问题的另一种正确解法 ,与无关问题的解法得分无异)。
  • 证明了逐 Token 蒸馏损失与任务正确性彻底脱钩:正确与错误 Rollout 的 Loss 曲线和 KL 散度几乎重合,且教师在学生已经做对的轨迹上施加的学习压力反而高于做错的轨迹。
  • 揭示了全 Token 密度蒸馏会导致 55.4% 的 Loss 预算被无信息 Token(停用词、标点符号、空格、语气/不确定性标记词如“wait”,“maybe”)占据,而真正决定答案的内容词、数字和数学符号占比较低。
  • 发现自蒸馏会主动惩罚推理所必需的试错探索:在正确的 Rollout 内部,偏离参考解答路径的探索性 Token 比路径内 Token 承受高达 4 倍的 KL 散度惩罚,导致学生模型被迫缩短回答并过早做出决定。
  • 反直觉地证明了弱化特权信息(用简短 Hint 或结构化 Skill 卡片替代完整参考解答)无法解决该问题;相反,这会导致教师监督信号彻底崩溃,使模型性能进一步恶化。
  • 澄清了先前 SDPO 等方法在简单短选择题基准(如 SciKnowEval 生物/物理)上取得收益的原因:仅因在低难度狭窄设置下,单条参考解答表面上恰好等价于正确性。
  • 确立了自蒸馏的技术边界:逐 Token 密度目标无法替代明确的可验证奖励信号(RLVR),SD 无法独立作为大模型复杂推理训练的唯一目标。

主旨: 本文探讨在没有任何外部可验证奖励(Reward/RLVR)和判别器的情况下,仅依赖基于特权信息(PI)的自蒸馏(Self-Distillation, SD)作为唯一训练目标(Lone Objective),能否提升大语言模型(LLM)在复杂任务(数学、代码、复杂问答、多轮 Agent 工具调用)上的推理和解题正确性。

创新:

  • 诊断并构建了自蒸馏失效的完整因果链:首次提出并从实证上证明了“PI 偏置 → 损失与正确性脱钩 → 算力被无信息 Token 浪费 → 惩罚探索能力 → 策略扁平化/退化”这一 5 阶段因果机制。
  • 提出 PI 偏置得分(PI Bias Score):设计了一种仅需前向传播即可计算的新评估指标,定量揭示了带特权信息的教师模型仅是在强行引导学生模仿特定参考解答的表面形式(Trajectory),而非学习通用的解题能力(Correctness)。
  • Token 级与路径级的深层归因分析:按 Token 语义类型细分 Loss 分配,并对比在路径/离路径(On-path / Off-path)的 KL 散度,揭示了蒸馏目标如何误伤深度推理所必需的思维试错与推演过程。
  • 验证 PI 粒度“两难陷阱”:系统对比了完整解答、简短 Hint 和结构化 Skill 三种特权信息形式,反直觉地证实了调弱 PI 粒度并不能消除偏置,反而会导致监督信号全面失效。

贡献:

  • 打破了自蒸馏可独立作为推理训练目标的迷思:证明了先前 SDPO/OPSD 的收益仅存在于简单短文本选择题中,在复杂推理任务中作为独立目标会导致模型性能一致性退化。
  • 提出了低成本诊断工具 PI Bias Score:为社区提供了一个在训练前仅需极少前向传播即可评估特权信息教师有效性与偏置程度的诊断工具。
  • 澄清了自蒸馏在 Post-training 体系中的合理定位:明确了 SD 无法独立提供正确性导向,必须与基于奖励的强化学习(RLVR)相结合(如作为辅助正则项或重加权)才能发挥作用。

提升:

  • 评估诊断与机制分析维度的提升:本文是一篇经典的诊断与实证反思研究(Diagnostic Paper)。其提升体现在:
    1. 成功在简单选择题基线(SciKnowEval)上完全复现了 SDPO 原论文的性能提升,证明了诊断环境的严格性与代码实现的忠实性;
    2. 在覆盖 4 个复杂域(问答、数学、代码、Agent)、多种推理模式(Think 长思考 / Instruct 指令)、不同模型规模(Qwen3-8B / 32B)的全面实验中,清晰展现了 SD 作为独立目标时的性能下挫(如 Agent 域平均下降 3.51 分,单基准最大下降 7.0 分),为后续研究指明了避坑方向。

不足:

  • 研究侧重于诊断而未提出新型修复算法:本文重点在于证明“独立 SD 目标的失效机制”,虽然指出了结合 RLVR 的可行方向,但未在本文中直接验证一套全新的、无奖励却能消除 PI 偏置的自蒸馏新算法。
  • 模型架构覆盖有限:实验主要基于 Qwen3 体系模型(8B 与 32B 规模),尽管涵盖了 Think 和 Instruct 两种推理模式,但在其他开源模型家族(如 Llama 3、DeepSeek 等)上的表现仍待进一步补充验证。
  • 弱化 PI 生成依赖外部模型:实验中的 Hint 与 Skill 卡片由外部大模型生成,提示词工程的构建方式可能对弱 PI 实验的信号强度产生了一定的潜在影响。

心得:

  • 警惕“训练 Loss 下降”与“任务成功”脱钩的假象:自蒸馏 Loss 持续平滑下降并不意味着模型在学会解题。在复杂推理中,蒸馏 Loss 极易被标点符号、停用词和“Wait”、“Maybe”等语气词占据,模型是在“模仿文本表面风格”而非“学习逻辑正确性”。
  • 教师模型教的是“特定轨迹”而非“通用正确性”:特权信息教师由于提前看到了某一条参考答案,其生成的 Per-token 概率目标极度偏向该特定解法。这会导致模型将其他合法的正确解法或思考推演中的必要探索(Off-path 步骤)判定为高 Loss 并加以惩罚,从而扼杀模型推理所必需的试错能力(导致回答变短、过早做出决定)。
  • 特权信息(PI)的粒度两难:过细则偏置,过粗则失效:试图通过弱化特权信息(如用简短 Hint 或 Skill 卡片替代完整解答)来消除偏置是行不通的——这会导致教师信号急剧衰减,无法给学生提供任何有效的监督。因此,自蒸馏绝不能脱离外部可验证奖励(Verifier/Reward)独立运行。

一句话总结: 本文对基于特权信息的自蒸馏(Self-Distillation, SD)技术进行了深度的实证诊断,提出了 PI 偏置得分(PI Bias Score),揭示了在复杂推理任务中 SD 作为独立目标会全面失效 的根本原因:教师模型仅在强行诱导学生模仿特定参考解答的表面轨迹,导致 Loss 与正确性脱钩、大半 Loss 预算被无信息 Token 浪费,且会惩罚推理所必需的思维探索,从而重新确立了自蒸馏必须依赖可验证奖励(RLVR)才能发挥作用的技术边界。

Self-distillation (SD) has emerged as a compute-efficient alternative to reinforcement learning with verifiable rewards: a self-teacher, conditioned on privileged information (PI) about the answer such as a reference solution, supplies dense per-token supervision to a student that never sees it. Reported gains, however, come almost exclusively from narrow, low-difficulty settings, leaving open a basic question: as a lone objective, with no reward term, does SD teach anything? We reproduce SDPO’s reported gains in its easy setting, then apply the identical setup to difficult tasks and find that it does not. Across question answering, mathematics, coding, and multi-turn agentic tool use, across reasoning modes, model sizes, and forms of PI, and under both the SDPO and OPSD recipes, the per-token loss falls steadily while validation accuracy does not improve and typically degrades. We explain this failure through a single causal chain from the loss to the model it produces. The chain begins with PI bias: having seen one particular reference solution, the teacher’s per-token target is pulled toward that trajectory rather than toward correctness in general, an effect we quantify with a PI Bias Score. Trained to match this target everywhere, the student’s objective becomes nearly blind to whether a rollout is correct, and the loss it assigns falls mostly on low-information tokens like stopwords, punctuation, uncertainty markers, rather than those that determine the answer; within correct rollouts the exploratory tokens incur the highest divergence, so it penalizes the hesitation that reasoning requires. The result is a flatter, less decisive student that is no better at reasoning: as a lone objective, SD optimizes a signal decoupled from task success.

https://arxiv.org/abs/2608.04794


3、[CL] Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning

Y He, L Yang, J Liu, Y Yang…
[Princeton University & CMU]

迈向技能原生大语言模型:以“技能熵”赋能长程推理的基准测试与训练

要点:

  • 形式化定义了跨技能长程推理任务(Cross-Skill Long-Horizon Task):即多步骤推理任务中,相邻步骤需要在同一思维链内频繁跨越完全不同的技能领域(如:数学推导 → 逻辑推理 → 行程规划 → 文本提取)。
  • 提出了“技能熵”(Skill Entropy, SkE)概念:一种用于度量从技能  切换到  难易程度的定向双向指标,证明了“技能切换难度”与“单项技能熟练度”是互相正交的维度。
  • 反直觉地揭示了领域单项准确率与技能切换熵的解耦关系:单项准确率极高的领域(如科学科学知识 Science)在跨技能切换时往往展现出极高的技能熵,导致其极难与其他技能顺畅切入或切出。
  • 推出了 Skill2-Bench 综合基准:涵盖 9 个领域(含 6 个可验证领域和 3 个开放域)的 558 种技能,根据任务级技能熵将测试划分为低、中、高三个难度层级。
  • 在 8 款前沿商业模型(如 Claude-opus-4.7, GPT-5.5)和 4 款开源模型上发现了普遍存在的“技能切换鸿沟”(Skill-switching gap):模型的解题准确率随任务技能熵的增加呈现单调显著下降。
  • 归纳了跨技能推理的核心失效模式:在推理链后半程,模型极易产生认知惯性,倾向于沿用上一步的技能和输出模态(例如在上一步算完数学后,下一步需要进行长文本创作,却仍输出简短的数字)。
  • 提出了 Skill-Entropy RL 训练框架:要求模型在推理每一步显式预测 <skill> 标签,采用结合步骤正确性()与技能熵排名对齐()的联合奖励进行强化学习。
  • 取得了大幅性能提升:Skill-Entropy RL 将 Qwen3-4B-Instruct 在 Skill2-Bench 上的得分从 34.4% 飙升至 68.4%,将 Qwen3-1.7B 从 14.6% 提升至 40.1%,显著超越了传统 GRPO 和已有的技能感知 Post-training 基线。
  • 展现了强大的泛化能力:仅在 6 个可验证领域训练的模型,能无缝 Out-of-Distribution 泛化至 3 个开放域任务(创意写作、上下文检索等)及 5 个外部复杂推理基准(MuSR、LongBench-MuSiQue 等)。
  • 实现了现成开源数据的“即插即用”:将传统开源数据(如 OpenR1-Math)的 CoT 轨迹自动拆解标注为技能链后接入该框架,成功打破了传统 GRPO 的奖励饱和瓶颈,在 6 项数学基准上相比 GRPO 平均再提升 1.9%。

主旨: 本文旨在探讨并解决大语言模型(LLM)在长程推理中“单项技能表现优异,但跨不同领域频繁切换技能时极易崩溃”的核心痛点。为此,论文提出了定量度量技能切换难度的“技能熵”(Skill Entropy)理论,构建了包含 558 种技能的 Skill2-Bench 评估基准,并设计了结合技能熵对齐奖励的强化学习框架 Skill-Entropy RL,显著提升了 LLMs 的跨技能长程推理能力。

创新:

  • 提出“技能熵”(Skill Entropy, SkE)度量体系:建立了定向双向指标定量刻画跨技能切换的物理难度,揭示了“技能切换能力”是独立于“单技能熟练度”的正交维度。
  • 构建 Skill2-Bench 综合评估基准:跨越 9 个领域、558 种技能,首次依据任务级技能熵严格划分难度等级,全面暴露了前沿模型在复合长程推理中的技能切换短板。
  • 设计 Skill-Entropy RL 强化学习范式:引入结构化的“显式技能规划”(在每一步回答前显式输出 <skill> 标签),将模型预测的技能序列熵排名与 Ground Truth 进行 CDF 排名对齐,形成有效的结构化强化学习奖励。
  • 现成 CoT 数据集的“技能化”拆解(Plug-and-play):提出了一种可复用的数据管线,能将任意开源 CoT 轨迹(如 OpenR1-Math)自动分段并映射至技能熵空间,使传统数据无需重新标注即可提供技能熵训练信号。

贡献:

  • 理论贡献:定义了跨技能长程推理问题及技能熵,实证归纳出“技能/模态惯性重用”是导致长程推理失效的本质原因。
  • 基准贡献:发布了 Skill2-Bench 评估集,填补了现有 Benchmark 仅评估单一技能或单纯长文本,缺乏“技能切换难度”刻画的空白。
  • 算法贡献:提出了 Skill-Entropy RL,大幅提升了中小型开源模型在长程推理上的表现,证明了结构化元认知(Meta-Cognition)奖励能有效突破传统 RLVR 的奖励饱和瓶颈。

提升:

  • Skill2-Bench 性能大幅超越基线:在 Skill2-Bench 基准上,Skill-Entropy RL 将 Qwen3-4B-Instruct 的得分从 34.4% 提升至 68.4%(超越传统 GRPO 的 58.8% 及 SkillRL、STAT 等基线);将 Qwen3-1.7B 得分从 14.6% 提升至 40.1%。
  • 突破传统 GRPO 训练饱和:在开源 OpenR1-Math 数据集上接入技能熵奖励后,在 AIME24, AIME25, MATH 等 6 项数学基准上平均提升 1.9%(比 Base 模型提升 7.7%),训练曲线打破了传统 GRPO 容易过早平摊的瓶颈。
  • 强劲的 Out-of-Distribution 泛化:仅使用 6 个可验证领域进行 RL 训练,模型在 3 个开放域(如创意写作提升近 20%)及 5 个外部复杂推理基准(MuSR, LongBench-MuSiQue, GPQA 等)上均取得一致的最高分。

不足:

  • 技能熵估算存在参考模型偏置:技能熵的初始矩阵依赖于一个强参考模型(如 Claude-opus-4.7)在合成数据集上的蒙特卡洛采样评估。虽然实验证明不同参考模型的排序具有高相关性,但仍可能受到参考模型固有能力偏向的影响。
  • 开放域判卷依赖 LLM Judge:在 3 个开放域(如创意写作、上下文检索)中,由于缺乏确定性的断言代码,评估需依赖 LLM 裁判(Claude-opus-4.7 搭配 Rubric 评分),在边界样例上可能引入裁判模型的固有偏置。

心得:

  • 单项能力不等于复合能力:技能切换难度与单项准确率完全解耦:反直觉的是,单项准确率很高的领域(如科学 Science)在跨技能切换时可能具有极高的“技能熵”(即极难切入/切出)。评价和提升模型长程推理能力,必须将“跨技能切换”作为一个正交维度独立对待。
  • 长程推理崩溃根源:模型在后半程存在严重的“ cognitive inertia(认知惯性)”:论文细致的失效分析表明,模型在长链条推理后半程失败,绝大多数是因为它沿用了上一步的技能和输出模态(例如在上一步算完数学后,下一步需要写长文本,却仍输出一个简短数字)。
  • 显式元认知(Meta-Cognition)规划能极大改善 RL 训练效率:要求模型在输出答案前显式承诺 <skill> 标签,并用“技能熵对齐”作为结构化奖励,能够促使模型在推理时显式规划思维路径。这种“显式技能规划 + 结果正确性”的联合 RL 范式,能有效解决传统强化学习中结果奖励过于稀疏、容易过早饱和的问题。

一句话总结: 本文针对大语言模型在长程推理中“单项技能强但跨技能频繁切换易崩溃”的痛点,创新性地提出了技能熵(Skill Entropy)指标来定量刻画技能切换难度,推出了包含 558 种技能的 Skill2-Bench 基准,揭示了模型由于“技能惯性”(沿用上一步技能/答题模态)导致准确率随技能熵单调衰减的现象;基于此提出的 Skill-Entropy RL 框架通过显式预测技能并实施技能熵对齐奖励,成功将 Qwen3-4B-Instruct 在 Skill2-Bench 上的得分从 34.4% 飙升至 68.4%,展现出卓越的泛化能力与开源数据适配性。

Long-horizon reasoning in recent LLMs demands that the model switch between distinct skills inside a reasoning chain, such as first doing a math derivation, then using the result to plan a schedule. We call such problems cross-skill long-horizon tasks: multi-step tasks whose steps require different reasoning skills and depend on earlier outputs. Existing benchmarks often evaluate individual skills, lacking a principled way to measure how well a model switches between skills. We address this gap from both the evaluation and training sides. We introduce Skill Entropy, a measure of the difficulty of switching from one skill to another. We then propose Skill^2-Bench, a benchmark of cross-skill long-horizon tasks built over 558 skills across 9 verifiable and open-ended domains. Each task is assigned a task-level skill-entropy score and grouped into three difficulty levels. Evaluating 8 frontier and 4 open-source models on Skill^2-Bench reveals a skill-switching gap: accuracy decreases on higher-entropy tasks. We then turn skill entropy from a benchmark scale into a training signal. We propose Skill-Entropy RL, an RL framework where the model predicts not only the answer at each step but also the skill used to produce it. The reward combines step-level correctness with a skill-entropy reward that measures the alignment between the model-predicted skill sequence and the gold skill sequence. On Qwen3-4B-Instruct and Qwen3-1.7B, Skill-Entropy RL improves the Skill^2-Bench score from 34.4% to 68.4% and from 14.6% to 40.1%, respectively, outperforming competitive baselines. The same pipeline can be applied to off-the-shelf training data such as OpenR1-Math, indicating that skill entropy is a reusable training signal.

https://arxiv.org/abs/2608.05139


4、[AI] COMPAS: Difficulty-Aware Joint Search for Optimizing Code Generation

J Gong, J M. Zhang, G Jahangirova, D Huang,…
[King’s College London]

COMPAS:面向代码生成优化的难度感知联合搜索

要点:

  • 指出了大语言模型(LLM)代码生成优化中的关键盲区:现有方法普遍存在孤立调优问题(模型路由只选模型、Prompt 优化器固定参数/模型、全局调优器用单一配置覆盖所有任务),忽略了“模型、Prompt、解码参数”三者跨任务困难度组的联合交互效应。
  • 揭示了 Prompt 与解码设置存在强协同效应:联合搜索的 Pass@1 达到 72.2%,大幅超越仅调优 Prompt(64.3%)或仅调优解码设置(64.9%)。
  • 发现了联合调优具有模型特异性(Model-Specific):完全相同的 Prompt+解码参数更新,作用在 DeepSeek-V3 上能带来提升(+0.9%),但在 DeepSeek-V3.2 上却导致性能下降(-1.9%),证明模型选择必须先于联合调优。
  • 证明了“全局最佳配置”是一个陷阱:搜索出的全局单最佳配置 Pass@1(53.4%)甚至不如默认配置(54.1%);而按任务困难度分组建立专属配置,性能可跃升至 62.4%。
  • 提出了 COMPAS 框架(困难度感知的模型、Prompt 及解码设置联合优化方法),将离线两阶段 Pareto 搜索与在线零额外成本路由相结合。
  • 设计了高效的离线两阶段搜索:阶段一通过轻量探针(Cheap Probe)为各困难度组快速锁定模型;阶段二利用基于 LLM 反思(Reflection)的变异循环,同时优化 Prompt 与解码参数(Temperature, Top-p, Frequency Penalty),生成按困难度划分的 Pareto 质量-成本前沿。
  • 在 LiveCodeBench (v6-only) 上取得了 SOTA 表现:Pass@1 从最佳基线(EcoTune)的 45.9% 提升至 52.8%,同时 API 成本降低了 7.4 倍(从 4.92)。
  • 成功泛化至仓库级软件工程任务(SWE-bench Verified-mini):任务解决率达到 76.0% (38/50),显著优于顶尖基线 RouteLLM 和 PromiseTune 的 70.0%。
  • 消融实验证实,困难度分组(Task Grouping)带来的性能提升最为显著(相比无分组单配置提升了 +13.4% 的 Pass@1)。
  • 验证了实际部署的可行性:使用训练好的 XGBoost 困难度分类器替代官方难度标签,仍能取得 49.7% 的 Pass@1,与基于官方标签路由的性能无统计学显著差异。

主旨: 本文旨在解决大语言模型在代码生成(从函数级合成到仓库级软件修复)中,模型选择、Prompt 模板和解码参数(Temperature, Top-p, Frequency Penalty)的联合调优与降本增效问题。针对现有优化方法仅孤立优化部分维度或对所有任务采用全局固定配置的缺陷,提出了困难度感知的两阶段联合搜索与路由框架 COMPAS。

创新:

  • 实证驱动的三大交互规律发现:通过大规模对比实验,首次系统阐明了“Prompt 与解码设置的强协同性”、“联合参数更新的模型特异性”以及“困难度分组路由远优于全局最优配置”三大实证规律。
  • 困难度感知的两阶段高效离线搜索机制:
    • 阶段一(轻量探针选模型):使用极少量的预算探针,结合困难度组的质量-成本偏好权重(),提前锁定最适模型,避免后续庞大的跨模型搜索开销。
    • 阶段二(反思驱动的联合变异):利用 LLM 反思(Reflection)循环,在单一上下文内同时变异 Prompt 与解码设置,并引入 Compact 搜索历史与 Held-out 验证集防过拟合,构建各困难度组的 Pareto 质量-成本前沿。
  • 零在线搜索成本的困难度路由:测试阶段无需任何在线搜索或额外 Prompt 开销,只需将任务匹配至对应困难度组的 Pareto 前沿并按偏好提取配置,兼顾高准确率与低成本。

贡献:

  • 实证贡献:填补了代码生成领域关于模型、 Prompt 及解码设置三方联合交互与任务困难度关系的实证研究空白。
  • 算法贡献:提出了 COMPAS 框架,为代码生成系统提供了一套高算力效率、可同时优化 Pass@1 和 API 成本的离线搜索与在线路由解决方案。
  • 实用与泛化贡献:在基准测试(LiveCodeBench)和仓库级工程实战(SWE-bench)中均取得了明显的质量提升与成本剧降,并证明了可以通过学习型分类器(XGBoost)脱离人工难度标签进行部署。

提升:

  • LiveCodeBench 性能与成本:在 v6-only 主测试集上,Pass@1 从最佳基线(EcoTune)的 45.9% 提升至 52.8%,且 API 总成本从 4.92(降幅高达 86.5%/7.4倍);在随机划分集上,Pass@1 达到 62.2%,显著高于基线(51.1%~59.6%),成本仅为 $1.09。
  • SWE-bench 仓库级修复率:在 Verified-mini 仓库级任务上,成功修复率达到 76.0% (38/50),高于 RouteLLM / PromiseTune 的 70.0% (35/50) 和 Default 的 68.0%。
  • 消融与分组优势:消融实验表明,困难度分组(Task Grouping)消融后 Pass@1 暴跌至 39.4%,证明困难度感知分组是带来 +13.4% 性能飞跃的核心动力。

不足:

  • 模型池多样性存在局限:主实验中的模型池主要在同家族的大小模型之间进行选择(如 DeepSeek-V4-Flash/Pro, Devstral Small/2, Qwen3.5-Flash/Plus),尚未在跨厂商、大跨度异构模型池(如 OpenAI + Anthropic + DeepSeek 混合池)上进行充分验证。
  • 阶段一模型探针的边界失效风险:在 Devstral 实验中,由于两款候选模型性能极其接近,阶段一的轻量探探针产生了微小评估波动并偏向了更便宜的模型,导致后续未能选出潜在表现更好的大模型,表明探针策略在模型区分度极低时存在失效风险。

心得:

  • 打破“全局最优配置”的思维定势:研究表明,试图寻找一个放之四海而皆准的“最佳 Prompt + 最优解码参数”(53.4%)甚至不如默认配置(54.1%)。真正的优化突破来自于“困难度分组”,针对简单、中等、困难任务分别建立 Pareto 前沿(62.4%),才能实现质量与成本的双赢。
  • Prompt 与解码设置不可切割(Synergy):在传统的 LLM 工程中,Prompt 工程师与参数调优师往往各干各的。本文证实单独优化 Prompt(64.3%)或单独调解码参数(64.9%)都会遭遇瓶颈,唯有利用 LLM 反思将二者放在同一个循环里“联合变异”(72.2%),才能释放巨大的协同效应。
  • 拒绝 Prompt 的“盲目迁移”:实验清晰展示了完全相同的联合参数修改在 DeepSeek-V3 上提升性能(+0.9%),但在 DeepSeek-V3.2 上却导致性能下降(-1.9%)。这警示我们在构建 LLM Workflow 时,在一个模型上优化的 Prompt 和参数配置绝不能直接套用到另一个模型上,必须先选定模型再进行深入搜索。

一句话总结: 本文针对大语言模型代码生成中模型、Prompt 及解码参数长期被孤立调优或采用全局固定配置的缺点,揭示了“Prompt与解码设置强协同”、“参数调优具有模型特异性”及“分组路由远优于全局最优”三大规律,并提出了困难度感知的两阶段联合搜索与路由框架 COMPAS,通过离线建立各困难度组的 Pareto 质量-成本前沿并在在线零成本路由,在 LiveCodeBench 上实现了 Pass@1 从 45.9% 到 52.8% 的飞跃且 API 成本降低 7.4 倍(降至 $4.92),并成功泛化至 SWE-bench 仓库级代码修复(解决率达 76.0%)。

Code generation systems make each LLM call with a model, a prompt, and decoding settings. However, existing optimization methods usually tune only part of these choices or use one fixed configuration for all tasks: global optimizers search one configuration for all tasks, routers choose only a model, and prompt optimizers keep the model and decoding settings fixed. This leaves their joint, group-specific interactions unclear. We therefore examine how these choices interact and observe that prompts and decoding settings interact, tuning effects vary by model, and the best configuration varies by task difficulty. Guided by these observations, we introduce COMPAS (Code-generation Optimization over Models, Prompts, And Decoding Settings), a difficulty-aware method that learns group-specific quality-cost fronts through low-cost model selection and joint prompt-decoding search, then routes each test task to its matching front online without further search. Under a matched search budget on LiveCodeBench, COMPAS improves pass@1 from 45.9% for the best baseline to 52.8% while reducing cost from 4.92. This also transfers to repository-level code generation on SWEbench, resolving 76.0% of tasks versus 70.0% for the best baseline.

https://arxiv.org/abs/2608.04336

5、[CL] The Personalization Mirage: How LLMs Fabricate User Profiles, and Why Self-Monitoring Misleads

Y Sun, Y Zhang, R Sheng
[LIGHTSPEED & The Hong Kong University of Science and Technology]

个性化幻象:大语言模型如何虚构用户画像以及为何“自我监测”具有误导性

要点:

  • 形式化定义并隔离个性化 LLM 中的“过度推断”(Over-Inference, OI)现象:即模型在缺乏依据的情况下,虚构或盲目外推用户个人属性。
  • 提出了 MirageBench 基准:包含 150 个用户人设(均衡分布于刻板、反刻板和中性人设)、6 个跨越“想象力梯度”的个性化任务,以及四级忠实度分类体系(有据可依 Grounded、合理推断 Reasonable、刻板印象 Stereotype、纯粹虚构 Fabricated)。
  • 构建了高度可靠的独立 LLM 法官(Claude-Opus-4-7),并通过与人类盲审标注员在 400 条断言上的对比验证了其高一致性(Cohen's κ = 0.863 四分类,κ = 0.900 二分类)。
  • 在对 7 个家族的 12 款主流模型(共 143,616 条断言)的大规模评估中证实,过度推断具有普遍性与严重性:所有模型的过度推断率均高居 35%–49%(跨模型均值 41.6%),仅有 24%–31% 的个性化表达真正有据可依。
  • 首次发现了反直觉的“自我监控逆转”(Self-Monitoring Inversion)现象:在模型挑选层面上,模型的自评过度推断率与法官实测的过度推断率呈显著负相关(ρ = -0.60, p = 0.044)。自称“最忠实/最少过度推断”的模型,实际上被法官判定为虚构最严重。
  • 厘清了 LLM 自我审计的作用域差异(Scope-Split):自我审计不能作为跨模型安全对比的指标,但在单一模型内部,自我审计仍能较好地对其自身断言的相对风险进行排序(AUROC 0.58–0.83)。
  • 揭示了过度推断受任务“可接地性梯度”(Groundability Gradient)驱动:过度推断率从具体任务(如根据已知兴趣推荐生日礼物,OI 率 27.0%)向想象力任务(如描述用户卧室布局,OI 率 57.8%)单调剧增。
  • 证实了刻板印象先验的填补效应:反刻板人设引发的过度推断率(37.0%)显著低于刻板人设(44.8%),证明在缺乏个案证据时,预训练分布先验会强行介入并替代真实证据。
  • 揭示了多轮交互中的“无声记忆污染”现象:能力最强的模型在多轮对话中会以线性轨迹($R^2 - 提出了系统设计启示:依靠模型自评/自信度挑选可信模型不可靠,建立外部独立校验与显式属性溯源追踪(Provenance Tracking)才是构建可信个性化 AI 系统的新基石。

主旨: 论文探讨了具备持久记忆的个性化大语言模型(Personalized LLMs)在交互中普遍存在的“过度推断”(Over-Inference, OI,即基于极少事实无依据虚构用户属性)现象,系统评估了过度推断在不同模型、任务与人设中的严重程度,并深挖了模型“自我监控”(Self-Monitoring)机制在跨模型对比与单模型内部排序中的盲区与信任危机。

创新:

  • 概念与分类创新:首次将“过度推断”(Over-Inference)从通用幻觉与群体社会偏见中独立隔离出来,专门研究个体层面的无依据属性虚构,并建立了 Grounded / Reasonable / Stereotype / Fabricated 四级忠实度分类法。
  • MirageBench 基准设计:设计了包含 150 个均衡人设(含反刻板人设压力测试)、6 类想象力梯度任务、四重评估管线(Probe, Task, Judge, Accum)的完整基准,且 LLM 法官经过了高强度的人类双盲一致性验证(κ = 0.900)。
  • 发现“自我监控逆转”(Self-Monitoring Inversion)现象:首次揭示在跨模型挑选时,模型自评的过度推断率与外部客观测得的过度推断率呈现反向相关(ρ = -0.60),颠覆了“自信/自评谨慎的模型更安全”的直觉。
  • 自我审计作用域拆分(Scope-Split):明确区分了自我审计在“跨模型横向挑选(无效且误导)”与“单模型纵向筛选(有效 AUROC 0.58–0.83)”中的不同效用。

贡献:

  • 实证贡献:通过 143,616 条裁决断言的大规模实验,首次给出了主流 LLM(12 款模型、7 个家族)在个性化场景下过度推断率的定量全景图(跨模型均值 41.6%)。
  • 理论与机制贡献:解释了过度推断的三大驱动机制(冗长陷阱、预训练先验填补、体裁合规压力),并揭示了强模型在多轮记忆中“高线性累积、近零自我修正”的无声污染动力学。
  • 系统工程贡献:否定了依赖模型自评作为跨模型安全选择标准的行业做法,为可信个性化记忆系统(如记忆存储、溯源标记、外部校验)的设计提供了直接警示与指导。

提升:

  • 评估诊断与方法论提升:填补了个性化 LLM 评估中“记忆忠实度与属性虚构”的诊断空白;通过双盲人类标注(400 条断言,四分类 Accuracy 89.8%, Cohen's κ = 0.863;二分类 Accuracy 95.0%, κ = 0.900)证明了独立 LLM 法官(Claude-Opus-4-7)作为无偏裁决器的高精准度。
  • 跨任务与人设的对比提升:定量证明了任务可接地性(从 27% 到 57.8% OI 率)与人设刻板性(刻板人设比反刻板人设高出 7.8 个百分点的 OI 率)对模型虚构倾向的显著影响。

不足:

  • 自我监控逆转结论基于小样本模型:跨模型负相关结论基于  款模型(跨 7 个模型家族),自助法置信区间较宽([-0.90, +0.06]),属于探索性发现,未来需更大规模模型库验证。
  • 多轮累积(Accum)实验规模较小:Accum 试点实验仅使用了 2 个人设,且记忆更新提示词带有“保留历史”的偏向,仅能作为趋势性启示而非精确定量结论。
  • 未包含针对性的算法缓解方案:论文专注于现象刻画与机制诊断,未评估具体的算法缓解措施(如记忆写入过滤、Prompt 惩罚等)或测量其对最终用户满意度的影响。

心得:

  • 警惕“自信逆转陷阱”:自称谨慎的模型往往虚构最严重。在选择或部署个性化模型时,绝不能相信模型自评的“忠实度”或自建的自我检查结果。因为“严格”的模型倾向于对自己苛刻(自评高虚构但实际低虚构),而“幻觉严重”的模型对自己的虚构毫无感知(自评低虚构但实际高虚构)。
  • 个性化与忠实度存在天然的“博弈边界”:实验显示在仅有 3 条极简事实的情况下,模型输出的个性化表达中有近 3/4 属于未经证实的推断或虚构。若要求 100% 绝对忠实,个性化系统将寸步难行。因此系统设计的核心不在于完全禁止推断,而在于“显式属性溯源(Provenance Tracking)”,区分事实与假设。
  • 越强大的模型在多轮对话中越容易遭受“无声记忆污染”:顶级模型(如 GPT-5.5、GLM-5.1)在多轮对话中展现出极高的“过度自信”——以每轮 10+ 个属性的速度线性累积推断,且删除修正率低于 5%。这些未证实的推断会作为记忆悄然沉淀并在后续交互中被当作既定事实放大,这提示我们在长期记忆系统中必须建立时间与证据效力的清理机制。

一句话总结: 本文针对个性化 LLM 中普遍且严重的“过度推断”(Over-Inference, 即基于极少事实无依据虚构用户个人属性,各模型发生率达 35%–49%)现象构建了 MirageBench 基准,并首次发现了反直觉的“自我监控逆转”(Self-Monitoring Inversion)——模型自评的过度推断率与外部客观测得的实际过度推断率呈显著负相关(ρ = -0.60),证明依赖模型自评挑选可信模型不可靠,必须依靠外部校验与记忆溯源追踪来构建真正可信的个性化 AI。

Personalized LLMs with persistent memory are increasingly deployed, yet the faithfulness of their user models remains unexamined. We study over-inference (OI): the phenomenon where LLMs fabricate user attributes beyond what evidence supports. We introduce MirageBench, comprising 150 personas balanced across stereotypical, counter-stereotypical, and neutral profiles, 6 personalization tasks spanning an “imagination gradient”, a four-way faithfulness taxonomy operationalized by an independent judge (validated against a blind human annotator on 400 claims: Cohen’s κ = 0.863 four-class, κ = 0.900 binary), and a leaderboard of 12 models across 7 families on 143,616 judged claims. We find that overinference is pervasive: every one of the 12 models over-infers 35%–49% of its claims (cross-model mean 41.6%; claimweighted 41.8%), with no model in this evaluation escaping it. Most strikingly, we surface a Self-Monitoring Inversion: at the model-selection level, models’ self-assessed OI is negatively rank-correlated with their judge-measured OI (ρ = −0.60, p = 0.044; exploratory, wide bootstrap CI [−0.90, +0.06], n = 12). The models that report the least over-inference tend to be flagged as fabricating the most, so self-reported confidence is a misleading signal for comparing models, even though within a single model self-audit still ranks that model’s own claims moderately well (AUROC 0.58–0.83). We further show that OI is task-dependent (27%–59%) and that, in a multi-turn pilot, inferred attributes accumulate approximately linearly with little revision. MirageBench positions external verification, rather than model self-report, as a more reliable foundation for trustworthy personalization.

https://arxiv.org/abs/2608.04570


基本 文件 流程 错误 SQL 调试
  1. 请求信息 : 2026-08-07 06:56:43 HTTP/1.1 GET : https://www.yeyulingfeng.com/a/909211.html
  2. 运行时间 : 0.216722s [ 吞吐率:4.61req/s ] 内存消耗:4,982.17kb 文件加载:145
  3. 缓存信息 : 0 reads,0 writes
  4. 会话信息 : SESSION_ID=78017492b1756af12c5e7a18ee4d36cf
  1. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/public/index.php ( 0.79 KB )
  2. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/autoload.php ( 0.17 KB )
  3. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/composer/autoload_real.php ( 2.49 KB )
  4. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/composer/platform_check.php ( 0.90 KB )
  5. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/composer/ClassLoader.php ( 14.03 KB )
  6. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/composer/autoload_static.php ( 6.05 KB )
  7. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/think-helper/src/helper.php ( 8.34 KB )
  8. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/think-validate/src/helper.php ( 2.19 KB )
  9. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/ralouphie/getallheaders/src/getallheaders.php ( 1.60 KB )
  10. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/think-orm/src/helper.php ( 1.47 KB )
  11. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/think-orm/stubs/load_stubs.php ( 0.16 KB )
  12. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/framework/src/think/Exception.php ( 1.69 KB )
  13. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/think-container/src/Facade.php ( 2.71 KB )
  14. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/symfony/deprecation-contracts/function.php ( 0.99 KB )
  15. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/symfony/polyfill-mbstring/bootstrap.php ( 8.26 KB )
  16. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/symfony/polyfill-mbstring/bootstrap80.php ( 9.78 KB )
  17. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/symfony/var-dumper/Resources/functions/dump.php ( 1.49 KB )
  18. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/think-dumper/src/helper.php ( 0.18 KB )
  19. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/symfony/var-dumper/VarDumper.php ( 4.30 KB )
  20. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/guzzlehttp/guzzle/src/functions_include.php ( 0.16 KB )
  21. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/guzzlehttp/guzzle/src/functions.php ( 5.54 KB )
  22. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/framework/src/think/App.php ( 15.30 KB )
  23. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/think-container/src/Container.php ( 15.76 KB )
  24. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/psr/container/src/ContainerInterface.php ( 1.02 KB )
  25. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/app/provider.php ( 0.19 KB )
  26. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/framework/src/think/Http.php ( 6.04 KB )
  27. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/think-helper/src/helper/Str.php ( 7.29 KB )
  28. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/framework/src/think/Env.php ( 4.68 KB )
  29. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/app/common.php ( 0.03 KB )
  30. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/framework/src/helper.php ( 18.78 KB )
  31. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/framework/src/think/Config.php ( 5.54 KB )
  32. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/config/alipay.php ( 3.59 KB )
  33. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/framework/src/think/facade/Env.php ( 1.67 KB )
  34. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/config/app.php ( 0.95 KB )
  35. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/config/cache.php ( 0.78 KB )
  36. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/config/console.php ( 0.23 KB )
  37. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/config/cookie.php ( 0.56 KB )
  38. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/config/database.php ( 2.48 KB )
  39. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/config/filesystem.php ( 0.61 KB )
  40. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/config/lang.php ( 0.91 KB )
  41. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/config/log.php ( 1.35 KB )
  42. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/config/middleware.php ( 0.19 KB )
  43. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/config/route.php ( 1.89 KB )
  44. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/config/session.php ( 0.57 KB )
  45. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/config/trace.php ( 0.34 KB )
  46. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/config/view.php ( 0.82 KB )
  47. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/app/event.php ( 0.25 KB )
  48. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/framework/src/think/Event.php ( 7.67 KB )
  49. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/app/service.php ( 0.13 KB )
  50. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/app/AppService.php ( 0.26 KB )
  51. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/framework/src/think/Service.php ( 1.64 KB )
  52. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/framework/src/think/Lang.php ( 7.35 KB )
  53. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/framework/src/lang/zh-cn.php ( 13.70 KB )
  54. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/framework/src/think/initializer/Error.php ( 3.31 KB )
  55. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/framework/src/think/initializer/RegisterService.php ( 1.33 KB )
  56. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/services.php ( 0.14 KB )
  57. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/framework/src/think/service/PaginatorService.php ( 1.52 KB )
  58. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/framework/src/think/service/ValidateService.php ( 0.99 KB )
  59. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/framework/src/think/service/ModelService.php ( 2.04 KB )
  60. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/think-trace/src/Service.php ( 0.77 KB )
  61. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/framework/src/think/Middleware.php ( 6.72 KB )
  62. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/framework/src/think/initializer/BootService.php ( 0.77 KB )
  63. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/think-orm/src/Paginator.php ( 11.86 KB )
  64. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/think-validate/src/Validate.php ( 63.20 KB )
  65. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/think-orm/src/Model.php ( 23.55 KB )
  66. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/think-orm/src/model/concern/Attribute.php ( 21.05 KB )
  67. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/think-orm/src/model/concern/AutoWriteData.php ( 4.21 KB )
  68. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/think-orm/src/model/concern/Conversion.php ( 6.44 KB )
  69. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/think-orm/src/model/concern/DbConnect.php ( 5.16 KB )
  70. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/think-orm/src/model/concern/ModelEvent.php ( 2.33 KB )
  71. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/think-orm/src/model/concern/RelationShip.php ( 28.29 KB )
  72. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/think-helper/src/contract/Arrayable.php ( 0.09 KB )
  73. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/think-helper/src/contract/Jsonable.php ( 0.13 KB )
  74. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/think-orm/src/model/contract/Modelable.php ( 0.09 KB )
  75. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/framework/src/think/Db.php ( 2.88 KB )
  76. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/think-orm/src/DbManager.php ( 8.52 KB )
  77. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/framework/src/think/Log.php ( 6.28 KB )
  78. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/framework/src/think/Manager.php ( 3.92 KB )
  79. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/psr/log/src/LoggerTrait.php ( 2.69 KB )
  80. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/psr/log/src/LoggerInterface.php ( 2.71 KB )
  81. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/framework/src/think/Cache.php ( 4.92 KB )
  82. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/psr/simple-cache/src/CacheInterface.php ( 4.71 KB )
  83. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/think-helper/src/helper/Arr.php ( 16.63 KB )
  84. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/framework/src/think/cache/driver/File.php ( 7.84 KB )
  85. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/framework/src/think/cache/Driver.php ( 9.03 KB )
  86. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/framework/src/think/contract/CacheHandlerInterface.php ( 1.99 KB )
  87. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/app/Request.php ( 0.09 KB )
  88. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/framework/src/think/Request.php ( 55.78 KB )
  89. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/app/middleware.php ( 0.25 KB )
  90. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/framework/src/think/Pipeline.php ( 2.61 KB )
  91. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/think-trace/src/TraceDebug.php ( 3.40 KB )
  92. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/framework/src/think/middleware/SessionInit.php ( 1.94 KB )
  93. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/framework/src/think/Session.php ( 1.80 KB )
  94. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/framework/src/think/session/driver/File.php ( 6.27 KB )
  95. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/framework/src/think/contract/SessionHandlerInterface.php ( 0.87 KB )
  96. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/framework/src/think/session/Store.php ( 7.12 KB )
  97. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/framework/src/think/Route.php ( 23.73 KB )
  98. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/framework/src/think/route/RuleName.php ( 5.75 KB )
  99. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/framework/src/think/route/Domain.php ( 2.53 KB )
  100. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/framework/src/think/route/RuleGroup.php ( 22.43 KB )
  101. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/framework/src/think/route/Rule.php ( 26.95 KB )
  102. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/framework/src/think/route/RuleItem.php ( 9.78 KB )
  103. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/route/app.php ( 4.22 KB )
  104. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/framework/src/think/facade/Route.php ( 4.70 KB )
  105. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/framework/src/think/route/dispatch/Controller.php ( 4.74 KB )
  106. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/framework/src/think/route/Dispatch.php ( 10.44 KB )
  107. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/app/controller/Index.php ( 9.87 KB )
  108. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/app/BaseController.php ( 2.05 KB )
  109. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/think-orm/src/facade/Db.php ( 0.93 KB )
  110. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/think-orm/src/db/connector/Mysql.php ( 5.44 KB )
  111. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/think-orm/src/db/PDOConnection.php ( 52.47 KB )
  112. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/think-orm/src/db/Connection.php ( 8.39 KB )
  113. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/think-orm/src/db/ConnectionInterface.php ( 4.57 KB )
  114. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/think-orm/src/db/builder/Mysql.php ( 16.58 KB )
  115. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/think-orm/src/db/Builder.php ( 24.06 KB )
  116. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/think-orm/src/db/BaseBuilder.php ( 27.50 KB )
  117. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/think-orm/src/db/Query.php ( 15.71 KB )
  118. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/think-orm/src/db/BaseQuery.php ( 45.13 KB )
  119. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/think-orm/src/db/concern/TimeFieldQuery.php ( 7.43 KB )
  120. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/think-orm/src/db/concern/AggregateQuery.php ( 3.26 KB )
  121. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/think-orm/src/db/concern/ModelRelationQuery.php ( 20.07 KB )
  122. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/think-orm/src/db/concern/ParamsBind.php ( 3.66 KB )
  123. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/think-orm/src/db/concern/ResultOperation.php ( 7.01 KB )
  124. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/think-orm/src/db/concern/WhereQuery.php ( 19.37 KB )
  125. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/think-orm/src/db/concern/JoinAndViewQuery.php ( 7.11 KB )
  126. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/think-orm/src/db/concern/TableFieldInfo.php ( 2.63 KB )
  127. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/think-orm/src/db/concern/Transaction.php ( 2.77 KB )
  128. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/framework/src/think/log/driver/File.php ( 5.96 KB )
  129. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/framework/src/think/contract/LogHandlerInterface.php ( 0.86 KB )
  130. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/framework/src/think/log/Channel.php ( 3.89 KB )
  131. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/framework/src/think/event/LogRecord.php ( 1.02 KB )
  132. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/think-helper/src/Collection.php ( 16.47 KB )
  133. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/framework/src/think/facade/View.php ( 1.70 KB )
  134. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/framework/src/think/View.php ( 4.39 KB )
  135. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/app/controller/Es.php ( 3.11 KB )
  136. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/framework/src/think/Response.php ( 8.81 KB )
  137. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/framework/src/think/response/View.php ( 3.29 KB )
  138. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/framework/src/think/Cookie.php ( 6.06 KB )
  139. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/think-view/src/Think.php ( 8.38 KB )
  140. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/framework/src/think/contract/TemplateHandlerInterface.php ( 1.60 KB )
  141. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/think-template/src/Template.php ( 46.61 KB )
  142. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/think-template/src/template/driver/File.php ( 2.41 KB )
  143. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/think-template/src/template/contract/DriverInterface.php ( 0.86 KB )
  144. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/runtime/temp/c935550e3e8a3a4c27dd94e439343fdf.php ( 31.50 KB )
  145. /yingpanguazai/ssd/ssd1/www/wwww.yeyulingfeng.com/vendor/topthink/think-trace/src/Html.php ( 4.42 KB )
  1. CONNECT:[ UseTime:0.000968s ] mysql:host=127.0.0.1;port=3306;dbname=wenku;charset=utf8mb4
  2. SHOW FULL COLUMNS FROM `fenlei` [ RunTime:0.001493s ]
  3. SELECT * FROM `fenlei` WHERE `fid` = 0 [ RunTime:0.000646s ]
  4. SELECT * FROM `fenlei` WHERE `fid` = 63 [ RunTime:0.000615s ]
  5. SHOW FULL COLUMNS FROM `set` [ RunTime:0.001390s ]
  6. SELECT * FROM `set` [ RunTime:0.000534s ]
  7. SHOW FULL COLUMNS FROM `article` [ RunTime:0.001603s ]
  8. SELECT * FROM `article` WHERE `id` = 909211 LIMIT 1 [ RunTime:0.001135s ]
  9. UPDATE `article` SET `lasttime` = 1786057004 WHERE `id` = 909211 [ RunTime:0.003952s ]
  10. SELECT * FROM `fenlei` WHERE `id` = 64 LIMIT 1 [ RunTime:0.000731s ]
  11. SELECT * FROM `article` WHERE `id` < 909211 ORDER BY `id` DESC LIMIT 1 [ RunTime:0.001666s ]
  12. SELECT * FROM `article` WHERE `id` > 909211 ORDER BY `id` ASC LIMIT 1 [ RunTime:0.000988s ]
  13. SELECT * FROM `article` WHERE `id` < 909211 ORDER BY `id` DESC LIMIT 10 [ RunTime:0.004365s ]
  14. SELECT * FROM `article` WHERE `id` < 909211 ORDER BY `id` DESC LIMIT 10,10 [ RunTime:0.009280s ]
  15. SELECT * FROM `article` WHERE `id` < 909211 ORDER BY `id` DESC LIMIT 20,10 [ RunTime:0.002573s ]
0.220422s