夜雨聆风学习资料网

ARTICLE · 1143865

刷手机速览软件工程顶会新文-10篇ICSE 2026获奖论文

刷手机速览软件工程顶会新文-10篇ICSE 2026获奖论文

1. 使用大型语言模型评估自动生成的提交信息

Evaluating Generated Commit Messages with Large Language Models

  • 作者: Qunhong Zeng (Beijing Institute of Technology), Yuxia Zhang (Beijing Institute of Technology), et al.
  • 代码与数据集: https://github.com/0x404/awesome-git-commit
  • 关键词: 提交信息评估(Commit Message Evaluation);LLM 评审器(LLM-as-a-Judge);思维链(Chain-of-Thought);少样本学习(Few-shot Learning);语义质量评价(Semantic Quality Assessment)
  • 一句话速览: 本文证明,采用思维链、少样本示例和统一多维评分提示的 LLM 评审器,能够以接近人工评审的一致性评价提交信息中的“改了什么”和“为何修改”。
  • 研究动机与技术挑战:
    • 动机: BLEU、ROUGE、METEOR 等参考答案指标假设代码变更与提交信息一一对应,但同一代码差异可以对应多种语义等价且高质量的表达,开发者原始信息本身也可能较差;人工评审虽可靠,却耗时、昂贵且难以复现。
    • 挑战: LLM 评审器必须理解代码差异而非仅匹配文本,并分别判断信息完整性(What)和修改理由(Why);同时还需控制模型随机性、表述扰动、温度设置和潜在“偏爱 AI 文本”等稳定性与公平性风险。
  • 核心贡献与方法:
    • 贡献: 本文构建了包含 200 个 Python 提交和 200 个 Java 提交、共 800 条人工与模型生成提交信息的人工评分基准,系统比较 GPT-4、Llama 3.3、Qwen2.5 和 QwQ 的多种提示策略,并与六类传统自动指标比较。
    • 方法: 六名具有平均五年以上开发经验的评审者按照 What 和 Why 两维标注数据;实验组合零样本、思维链、少样本与统一/分维评分。最佳 GPT-4 配置采用 _CoT + Few-shot + Unified Evaluation_,与人工评分的 Spearman 相关系数分别达到 0.65 和 0.78,显著高于 BLEU、ROUGE-L、METEOR、CIDEr、BERTScore 和 SBERT。800 条信息的人工标注约需六天,而 LLM 评估可在一小时内完成,平均成本约 0.08 美元/样本;但重复运行和语义等价改写仍会带来一定评分波动。
  • 对标NSFC申请书:
    • 科学目标: 面向开放式软件工程文本中多答案语义等价导致传统指标失真的问题,揭示代码语义理解、评价提示结构与 LLM 判断一致性之间的作用机制,发展兼具参考无关性、可复现性、鲁棒性和公平性的智能评价理论与方法,支撑生成式软件工程系统的可信迭代。
    • 核心科学问题: 在参考信息可能低质量且存在多种同样有效表达的条件下,如何使 LLM 稳定识别提交信息的语义充分性与因果合理性;模型随机性、措辞变化和作者身份线索引发的评分偏差如何被度量与校准?

2. 从挣扎到成功:揭示学生在毕业设计项目中的情绪历程

From Struggle to Success: Unveiling Students’ Emotional Journeys during Capstone Projects

  • 作者: Wardah Naeem Awan (LUT University), Maria Paasivaara (LUT University), Peter A. Gloor (Massachusetts Institute of Technology SDM)
  • 代码与数据集: https://doi.org/10.6084/m9.figshare.28870871 ;https://figshare.com/s/3093176c1b59223cb594
  • 关键词: 软件工程教育(Software Engineering Education);毕业设计项目(Capstone Project);成就情绪(Achievement Emotions);控制—价值理论(Control-Value Theory);纵向质性分析(Longitudinal Qualitative Analysis)
  • 一句话速览: 本文以控制—价值理论分析 14 周真实客户项目中的学习日志,揭示学生情绪并非线性改善,而是在希望、挫折、自豪和失望之间随项目阶段循环转化。
  • 研究动机与技术挑战:
    • 动机: 软件工程毕业设计同时包含陌生技术、模糊需求、真实客户、团队协调和时间压力,情绪会影响学习动机与绩效,但既有研究多关注短时、个体编程任务,缺少长期团队项目中的过程性证据。
    • 挑战: 情绪并非由问卷实时报告,而需从事后学习日志中识别并结合事件触发因素解释;同一文本可能同时包含多种情绪,且项目阶段可反复回退,研究还需谨慎处理小规模、性别不平衡样本带来的解释边界。
  • 核心贡献与方法:
    • 贡献: 本文把控制—价值理论与 Kinnunen–Simon 阶段模型结合,构建了毕业设计情绪轨迹及其技术、团队和利益相关者触发因素的纵向解释框架,并提出面向情绪安全的课程干预建议。
    • 方法: 研究分析三个 Scrum 团队共 24 名学生在六个 Sprint、14 周课程中的反思日志,采用演绎与归纳结合的主题分析,编码一致性 Cohen’s κ 为 0.73。共识别 454 个情绪实例,其中挫折 27%、自豪 25%、希望 22%、焦虑 6%、感激 5%、失望 4%、释然 2%。挫折常由技术失败、需求模糊和协调问题触发,自豪与感激则与克服困难、个人成长和团队支持有关;论文还报告了探索性的性别差异,但明确提示样本规模和二元分类限制了可推广性。
  • 对标NSFC申请书:
    • 科学目标: 面向真实项目式软件工程学习中情绪波动与能力发展相互交织的问题,揭示控制感、任务价值、团队支持和项目阶段共同驱动情绪转化的机制,发展融合过程监测、心理安全和适应性教学干预的课程设计理论,支撑高强度实践教学中的持续投入与健康成长。
    • 核心科学问题: 在需求不确定、团队协作和多重时间压力条件下,学生的控制—价值判断如何驱动希望、挫折、自豪等情绪的阶段性转换并影响学习投入;何种团队规范和教师干预能够在不削弱真实挑战的前提下改善情绪恢复力?

3. HoarePrompt:以自然语言对程序正确性进行结构化推理

HoarePrompt: Structural Reasoning About Program Correctness in Natural Language

  • 作者: Dimitrios Stamatios Bouras (Peking University), Yihan Dai (Peking University), et al.
  • 代码与数据集: https://figshare.com/s/5d39b388bd9ff2c7ffab
  • 关键词: 程序正确性(Program Correctness);自然语言需求(Natural-language Requirements);Hoare 逻辑(Hoare Logic);结构化推理(Structural Reasoning);k 归纳(k-induction)
  • 一句话速览: 本文把最强后置条件和 k 归纳思想迁移到自然语言空间,通过逐语句生成可达状态描述并注释程序,显著增强 LLM 对“代码是否满足自然语言需求”的判断能力。
  • 研究动机与技术挑战:
    • 动机: 软件需求通常以自然语言表达,直接形式化成本高;但直接询问 LLM 判断代码正确性时,模型常因无法系统追踪程序状态而漏掉简单缺陷,基于 LLM 生成测试的方法又容易生成错误或不完整的预言。
    • 挑战: 方法既要利用自然语言表达能力,又要保持对所有可达状态而非少数具体执行轨迹的覆盖;循环会产生无限行为,LLM 对复杂循环的摘要容易失真;结构化推理还会显著增加多轮调用和 token 成本。
  • 核心贡献与方法:
    • 贡献: 本文提出首个以自然语言作为程序语义推理媒介的 _HoarePrompt_,提出 few-shot-driven k-induction 处理循环,并构建包含 645 个程序—自然语言需求对的 CoCoClaNeL 正确性分类基准。
    • 方法: 系统先从需求推断自然语言前置条件,再沿控制流图逐段生成自然最强后置条件,将关键程序点的可达状态描述作为注释交给最终分类器。对循环,方法展开三次并依次生成自然 Hoare 三元组,再把这些三元组作为少样本示例归纳整个循环语义。四个开源模型上的平均 MCC 相比 Zero-shot-CoT 提升 61%、相比直接提示提升 72%、相比 LLM 测试分类器提升 106%;k 归纳相对无展开版本再提升 25.7%。代价是完整版本 token 开销显著增加,而无展开版本可减少约 90% token 并保留次优性能。
  • 对标NSFC申请书:
    • 科学目标: 面向自然语言需求与可执行程序语义难以直接对齐的问题,揭示自然语言状态抽象、组合式程序分析和 LLM 推理能力之间的互补机理,发展兼具语义覆盖、可解释性和成本可控性的非形式化—形式化桥接方法,支撑需求驱动的智能程序验证与生成。
    • 核心科学问题: 在循环和大状态空间条件下,自然语言状态描述能否以足够语义保真度概括全部可达行为并支持稳定正确性判断;其表达能力、逻辑严谨性与推理成本之间的边界如何刻画?

4. 培养下一代航天软件工程师的经验与启示

Lessons Learned from Training the Next Generation of Space Software Engineers

  • 作者: Martina De Sanctis (Gran Sasso Science Institute; Fondazione Gran Sasso Tech), Francesco Basciani (Gran Sasso Science Institute; Fondazione Gran Sasso Tech), et al.
  • 代码与数据集: https://doi.org/10.5281/zenodo.18416338 ;https://spaceraise.academy/pasteditions/2025/
  • 关键词: 航天软件工程(Space Software Engineering);产学协同(University–Industry Collaboration);跨学科教育(Interdisciplinary Education);博士生学校(Doctoral School);课程设计(Curriculum Design)
  • 一句话速览: 本文以三周国际博士生学校 SPACERAISE 为案例,总结如何围绕机器人、数字孪生和航天人工智能构建需求驱动、产学深度协同且兼顾多背景学员的高强度培养模式。
  • 研究动机与技术挑战:
    • 动机: 航天软件要求高可靠、可认证和长期可维护,同时快速吸收机器人、数字孪生和人工智能等新技术,传统大学课程难以及时覆盖产业需求,也难以提供真实工具、工程案例和跨机构合作环境。
    • 挑战: 学员横跨硕士生、博士生、研究人员和产业实践者,基础与目标差异显著;课程既要保持研究深度,又要提供可操作实践,还需协调大量国际学者和产业专家、三条主题轨道、奖学金与跨国后勤。
  • 核心贡献与方法:
    • 贡献: 本文给出 SPACERAISE 的需求分析、课程结构、产学师资组织、招生与资助方案、学员和讲者双向评估,并提炼可迁移到其他关键软件领域的组织经验。
    • 方法: 学校连续三周分别聚焦空间机器人、空间制造与卫星数字孪生、航天人工智能,设置理论讲授、实验、案例和项目;共邀请 58 名讲者,其中约 39.7% 来自产业,吸引 32 个国家的 153 名注册者并发放 54 项奖学金。实际到场 128 人,77 名学员和 40 名讲者参与调查,学员总体满意度加权均值约 4.5/5。核心经验包括先以产业生态需求确定主题、明确共同目标与目标群体、让产业专家承担完整教学而非仅作主题报告,以及通过统一教学指南和分层材料缓解背景异质性。
  • 对标NSFC申请书:
    • 科学目标: 面向关键领域软件人才培养中知识更新、跨学科融合和工程实践脱节的问题,揭示需求分析、产学共同设计、学习者异质性与知识迁移成效之间的作用关系,建立可复制的高可靠领域软件人才培养模式与评价框架,支撑航天等战略领域的软件能力建设。
    • 核心科学问题: 在学习者背景高度异质且领域知识具有高安全门槛的条件下,课程模块化、产业师资参与和实践活动如何共同影响知识吸收与跨域迁移;如何在理论深度、实践广度和组织可行性之间形成稳定平衡?

5. 基于蒙特卡洛树搜索的数据库管理系统 LLM 测试用例生成

LLM-Based Test Case Generation in DBMS through Monte Carlo Tree Search

  • 作者: Yujia Chen (Harbin Institute of Technology, Shenzhen), Yingli Zhou (The Chinese University of Hong Kong, Shenzhen), et al.
  • 代码与数据集: https://github.com/yujiachen99/DBMSTesting
  • 关键词: 数据库测试(DBMS Testing);测试用例生成(Test Case Generation);大型语言模型(Large Language Model);蒙特卡洛树搜索(Monte Carlo Tree Search);覆盖率引导(Coverage Guidance)
  • 一句话速览: 本文提出 _MIST_,先用数据库特征树和执行错误反馈提升轻量 LLM 的方言适配与查询多样性,再用覆盖率引导的蒙特卡洛树搜索突破测试覆盖平台期。
  • 研究动机与技术挑战:
    • 动机: 传统 DBMS 模糊测试器需要为不同数据库手工维护语法和操作规则,而企业又常因隐私和安全限制只能部署参数较小的本地 LLM;这些模型既不熟悉专有 SQL 方言,也容易生成语义相似、只覆盖浅层路径的查询。
    • 挑战: 测试用例必须同时包含合法的 DDL、DML 和 DQL,并组合多种方言特征;执行错误需要被转化为可复用知识而非简单重试;覆盖率平台期之后,还需在巨大“种子查询 × 变异规则”空间中平衡探索和利用。
  • 核心贡献与方法:
    • 贡献: 本文提出两阶段 DBMS 测试框架 _MIST_,将文档驱动的特征组织、错误记忆和 MCTS 覆盖率搜索结合,使轻量本地模型也能生成高质量、深路径 SQL 测试。
    • 方法: 第一阶段从官方文档人工构建三级特征树,分层抽样语义相关且具有跨类别多样性的特征组合,并把历史执行错误加入提示以适配目标方言;第二阶段把测试种子和 DDL/DML/DQL 变异规则表示为搜索树,使用 UCB 选择、模拟和覆盖率奖励迭代探索。对 DuckDB、PostgreSQL 和 SQLite 以及四种 7B—32B 轻量模型的实验表明,相比最佳基线,平均行覆盖率、函数覆盖率和分支覆盖率分别提升 43.3%、32.3% 和 46.4%,DuckDB 优化器模块行覆盖率达到 69.3%。
  • 对标NSFC申请书:
    • 科学目标: 面向资源受限和专有方言环境下 LLM 数据库测试有效性不足的问题,揭示文档特征知识、执行错误反馈与覆盖率搜索之间的互补作用机制,发展能够自适应方言并持续探索深层执行路径的智能测试生成方法,支撑数据库基础设施的高可靠验证。
    • 核心科学问题: 在模型容量受限、目标方言训练数据稀缺且执行路径空间巨大的条件下,如何联合利用显式特征知识与在线错误反馈形成有效语法—语义约束;何种搜索策略能够突破生成多样性和代码覆盖率的平台期?

6. “让生活少些单调”还是“只是把事情勾掉”:关于运维苦差的探索性多方法研究

“Making Our Life Less Monotonous” or “Just Tick Things Off”: An Exploratory Multi-Method Study of Toil

  • 作者: Tom Kafoe (Netlight), Lina Ochoa (Eindhoven University of Technology), et al.
  • 代码与数据集: https://zenodo.org/records/17095493
  • 关键词: 运维苦差(Toil);站点可靠性工程(Site Reliability Engineering);DevOps(DevOps);质性研究(Qualitative Study);自动化决策(Automation Decision)
  • 一句话速览: 本文首次在 Google 之外系统研究 SRE 语境中的 toil,发现其总体有害但并非绝对负面,是否应消除取决于自动化成本、组织情境、知识积累和员工角色。
  • 研究动机与技术挑战:
    • 动机: Google 将 toil 定义为手工、重复、可自动化、反应式、缺少持久价值且随服务规模增长的运维工作,并倡导减少它,但这一主张在其他组织中的适用性和经验基础十分有限。
    • 挑战: “苦差”既是技术属性集合,也是主观工作体验,不同角色可能将同一任务理解为枯燥负担、低压力快速成果或学习系统的机会;研究还需区分 toil 本身的影响与消除 toil 所需的成本、复杂性和岗位变化风险。
  • 核心贡献与方法:
    • 贡献: 本文采用灰色文献综述与 ING 案例访谈的顺序式多方法设计,形成了对 toil 定义、影响和消除后果的首个系统软件工程证据,并对“越少越好”的简单化主张作出情境化修正。
    • 方法: 研究从 1,330 个搜索结果中形成 61 个高质量灰色文献来源,并访谈 ING 荷兰分支的 6 名运维工程师和 5 名运维协调者直至主题饱和。结果表明,Google 定义被广泛采用,但实践者还强调例行、耗时、持久、临时、单调和乏味等属性。Toil 通常损害组织增长、团队效率、士气并增加倦怠风险,但也可能提供快速成就感、低风险工作和新人系统认知;自动化消除则可能受成本、复杂性、回报不确定和岗位威胁感阻碍。
  • 对标NSFC申请书:
    • 科学目标: 面向数字化运维中重复劳动自动化决策缺少情境理论的问题,揭示任务技术属性、主观工作体验、组织成本和知识积累共同塑造 toil 价值的机制,发展兼顾可靠性、效率、员工福祉和组织学习的运维工作优化框架,支撑可持续的智能运维转型。
    • 核心科学问题: 在服务规模、自动化成本和团队角色结构变化的条件下,何时 toil 会成为效率与福祉的负担,何时又具有学习或低风险缓冲价值;如何确定消除、保留与重构 toil 的最优边界?

7. “也许我们还需要更多示例”:开发者使用生成式 AI 工具的个体与团队驱动因素

“Maybe We Need Some More Examples:” Individual and Team Drivers of Developer GenAI Tool Use

  • 作者: Courtney Miller (Carnegie Mellon University), Rudrajit Choudhuri (Oregon State University), et al.
  • 代码与数据集: https://doi.org/10.5281/zenodo.17822096
  • 关键词: 生成式 AI 工具采用(GenAI Tool Adoption);开发者行为(Developer Behavior);社会技术系统(Sociotechnical System);适应性坚持(Adaptive Persistence);生产率压力悖论(Productivity Pressure Paradox)
  • 一句话速览: 本文通过同团队高频与低频用户配对访谈发现,生成式 AI 使用差异主要来自工具心智模型、试验倾向和失败后的坚持策略,而组织支持会放大或抑制这些个体机制。
  • 研究动机与技术挑战:
    • 动机: 企业普遍部署生成式 AI 编程工具并期待快速生产率回报,但同一团队内部使用频率和收益仍高度不均;传统技术接受模型难以区分个人态度与代码库、管理方式、工具政策等环境差异。
    • 挑战: 研究需要尽量控制团队、项目、语言、职级和管理链等外部混杂因素,并在组织强力倡导 AI 的情境下保护低频用户的匿名性和心理安全;还要解释同一障碍为何会导致一人放弃、另一人形成有效变通策略。
  • 核心贡献与方法:
    • 贡献: 本文提出开发者生成式 AI 使用的四阶段概念框架,识别工具认知、采用方式、失败响应和角色演化的个体路径,并提出“生产率压力悖论”解释组织为何可能因过早要求回报而阻碍真正的能力形成。
    • 方法: 研究使用八周遥测数据在 Microsoft 内部识别 27 个同团队配对,共访谈 54 名开发者;每对包含一名高频用户和一名低频用户,并在语言、角色和资历等方面匹配。高频用户更常把 AI 视为协作者,持续、实验性地融入工作,并在失败时通过调整提示、任务拆分和示例补充继续尝试;低频用户更常把 AI 视为单一功能,采取保守、任务特定的使用方式并快速放弃。清晰领导愿景、AI champion、情境化示例、知识分享机制和受保护的探索时间能够促进转化;相反,要求立刻提效却不给学习时间,会使开发者无暇形成日后节省时间的能力。
  • 对标NSFC申请书:
    • 科学目标: 面向组织部署生成式 AI 后个体使用成效高度分化的问题,揭示工具心智模型、试验学习、失败恢复与团队支持之间的社会技术耦合机制,建立从个体能力形成到组织生产率实现的动态采用理论与干预方法,支撑生成式 AI 的负责任规模化落地。
    • 核心科学问题: 在团队任务和工具条件相近的情况下,为什么开发者会形成截然不同的使用轨迹与失败响应;组织生产率要求如何通过学习时间和心理预期产生反向作用,何种支持结构能够打破这一悖论?

8. 模型发现与图仿真:通向混沌工程的轻量级入口

Model Discovery and Graph Simulation: A Lightweight Gateway to Chaos Engineering

  • 作者: Anatoly A. Krasnovsky (Innopolis University; MB3R Lab)
  • 代码与数据集: https://doi.org/10.5281/zenodo.15332249
  • 关键词: 模型发现(Model Discovery);微服务韧性(Microservice Resilience);图仿真(Graph Simulation);混沌工程(Chaos Engineering);可用性估计(Availability Estimation)
  • 一句话速览: 本文提出从分布式追踪等被动工件自动发现微服务依赖图,并以轻量蒙特卡洛仿真预筛选韧性风险,从而把低成本模型分析与高成本在线混沌实验连接起来。
  • 研究动机与技术挑战:
    • 动机: 混沌工程能直接暴露级联故障,但频繁在线注入具有成本和运营风险;传统可靠性模型较安全,却依赖人工建模,难以跟上快速演化的微服务架构。
    • 挑战: 自动发现的依赖图可能受追踪采样、不完整覆盖、服务身份混淆和可选调用影响;仅使用连接关系和副本数的简化模型还会忽略重试、熔断、灰色故障、相关故障和异步事件流,因此必须明确其适用边界与预测偏差来源。
  • 核心贡献与方法:
    • 贡献: 本文提出“模型发现”作为 CI/CD 或可观测平台中的通用步骤,能够从追踪、服务网格、基础设施即代码、API 合约和 SLO 工件合成可分析模型,并以 DeathStarBench 案例证明简单拓扑模型可以提供有价值的可用性近似。
    • 方法: 论文把系统表示为带服务类型、同步依赖边、副本数和入口点的有向图,在独立 fail-stop 故障假设下以蒙特卡洛采样计算入口到可达叶节点的成功概率。实证从 Jaeger 自动导出 DeathStarBench Social Network 的依赖图,在两种副本配置和五种故障率下与真实故障注入比较,模型与实测整体 Pearson 相关约为 0.992;有副本且故障率为 0.3 时中位有符号误差接近零,其他条件的系统偏差可由重试和级联超时等未建模机制解释。
  • 对标NSFC申请书:
    • 科学目标: 面向微服务韧性验证中真实实验高风险与人工模型高成本的矛盾,揭示被动可观测证据、自动拓扑抽象与端到端可用性之间的映射规律,发展带不确定性度量的持续模型发现与混合验证方法,支撑在线系统韧性的低成本监测和精准混沌实验。
    • 核心科学问题: 在追踪数据不完备、调用路径动态变化和故障机制被简化的条件下,何时“拓扑连接 + 副本数”足以稳定预测端到端可用性;如何量化模型偏差并据此选择最值得进行真实混沌验证的场景?

9. PreServe:基于分层预测的 LMaaS 系统智能管理

PreServe: Intelligent Management for LMaaS Systems via Hierarchical Prediction

  • 作者: Zhihan Jiang (The Chinese University of Hong Kong), Yujie Huang (The Chinese University of Hong Kong), et al.
  • 代码与数据集: https://github.com/OpsPAI/PreServe
  • 关键词: 大模型即服务(Language-Model-as-a-Service);分层预测(Hierarchical Prediction);资源伸缩(Resource Scaling);请求路由(Request Routing);服务级目标(Service Level Objective)
  • 一句话速览: 本文以服务级长期负载预测和请求级短期生成长度预测联合驱动实例伸缩与请求路由,缓解 LMaaS 的冷启动、资源浪费和长尾时延问题。
  • 研究动机与技术挑战:
    • 动机: 传统云服务管理假设请求执行特征相对稳定且实例启动迅速,但 LLM 服务负载具有显著日周期和不确定峰值,单个请求的输出长度又差异巨大;大型模型冷启动需数十秒甚至更久,使反应式扩容无法及时响应突发需求。
    • 挑战: 服务级预测必须从不稳定峰值中提取可利用的周期模式,请求级预测又要在生成开始前或早期估计未知响应长度;两种时间尺度的误差需要被融合到实例级未来负载估计中,并在资源利用率、SLO 违约和路由均衡之间实时权衡。
  • 核心贡献与方法:
    • 贡献: 本文提出面向 LMaaS 的分层预测管理框架 _PreServe_,把服务工作负载预测器、请求负载预测器、实例负载预估器、主动伸缩器和预测感知路由器统一起来,实现多时间尺度的前瞻性资源管理。
    • 方法: 服务级预测器依据历史 token-per-second 周期预估未来窗口需求;请求级预测器利用提示语义估计响应长度,并由每个实例的 load anticipator 维护未来若干解码步的负载图;伸缩器提前调整实例数量,路由器同时考虑当前和预期负载。论文分析一周内 4,410 万条 Azure LMaaS 请求,并结合 ShareGPT 进行评测。相对最佳基线,_PreServe_ 将峰值时延降低约 45.1%、P99 归一化时延降低 41.3%、SLO 违约降低 66.58%、资源消耗降低 49.38%,附加时延仅约 0.23%。
  • 对标NSFC申请书:
    • 科学目标: 面向大模型服务中长期周期性、短期请求异质性和冷启动时延共同导致的资源失配问题,揭示多时间尺度负载演化与实例资源状态之间的耦合规律,发展鲁棒的分层预测、主动伸缩和前瞻路由一体化方法,支撑低成本、低时延、高可靠的智能算力服务。
    • 核心科学问题: 在聚合负载存在周期但峰值不确定、单请求生成长度高度长尾的条件下,如何融合不同粒度和不同误差结构的预测形成稳定的实例未来负载表征;当分布漂移或预测失准时,资源配置与路由策略如何保持 SLO 鲁棒性?

10. ProxyWar:在游戏竞技场中动态评估 LLM 代码生成

ProxyWar: Dynamic Assessment of LLM Code Generation in Game Arenas

  • 作者: Wenjun Peng (The University of Adelaide), Xinyu Wang (The University of Adelaide), Qi Wu (The University of Adelaide)
  • 代码与数据集: https://github.com/xinke-wang/ProxyWar
  • 关键词: LLM 代码生成评测(LLM Code Generation Evaluation);动态执行(Dynamic Execution);游戏竞技场(Game Arena);多智能体竞赛(Multi-agent Tournament);运行质量(Operational Code Quality)
  • 一句话速览: 本文让不同 LLM 生成的游戏智能体在统一资源约束下真实对战,以竞争结果同时检验代码正确性、效率、稳定性、策略质量和自我修复能力,揭示静态基准难以观察的能力差异。
  • 研究动机与技术挑战:
    • 动机: HumanEval、pass@k 和文本相似度主要衡量孤立函数能否通过有限测试,无法判断代码在动态、交互、竞争和资源约束环境中的算法效率、运行稳定性、适应能力及策略优劣,也难以评价模型依据错误反馈持续修复代码的能力。
    • 挑战: 需要为多种游戏建立统一而不泄漏解法的自然语言规格、接口和分层测试,并保证不同模型在相同预算和环境中竞争;比赛结果还受模型采样、游戏随机性、对手组成、运行时版本和第三方 API 变化影响,评价必须兼顾可复现性和生态有效性。
  • 核心贡献与方法:
    • 贡献: 本文提出首个面向 LLM 代码生成的竞争式、执行式综合评测框架 _ProxyWar_,将代码生成、层级单元测试、错误反馈修复、代理部署、自动锦标赛和 TrueSkill 排名统一为可扩展流水线。
    • 方法: Prompt Manager 向模型提供游戏规则、观察/动作空间、文件结构和编码约束;Tester 按结构、函数、逻辑和鲁棒性分层验证,失败代码最多经过多轮修复;通过测试的代理进入九种单人、双人和多人游戏,在统一资源预算下对战。对 18 个通用、推理增强和代码专用模型的实验表明,静态测试通过率不能可靠预测锦标赛表现,模型间决策速度可相差两个数量级,完美修复也不保证强策略;不同游戏复杂度与信息结构会显著改变模型排名,完美信息与不完美信息游戏排名相关仅约 0.28,说明代码模型选择必须情境化。
  • 对标NSFC申请书:
    • 科学目标: 面向静态代码基准无法反映真实运行效用的问题,揭示功能正确性、计算效率、运行鲁棒性、策略适应与交互环境之间的多维耦合规律,发展动态竞争驱动、资源约束一致且可扩展的代码智能评价体系,支撑可部署代码生成模型的可信选型与优化。
    • 核心科学问题: 在动态、对抗和部分可观测环境中,功能正确、运行效率、鲁棒性与策略质量如何共同决定生成程序的实际效用;基于游戏竞技得到的能力排序在何种条件下能够推广到非游戏的软件工程任务?

相关学习资料