乐于分享
好东西不私藏

AI测试早报|模型没变分数翻7倍:DeepSeek Harness 把 DeepSWE 7.3 拉到 54.4(8.2)

AI测试早报|模型没变分数翻7倍:DeepSeek Harness 把 DeepSWE 7.3 拉到 54.4(8.2)
 

AI 测 试 早 报

 

每天 5 分钟 · 看懂 AI 测试圈

 

2026年8月2日 星期日 | 共 13 条情报 | 约 16 分钟读完

 

📌 今日主线

 

Agent 长跑时代开启——DeepSeek 用一套 Harness 把 DeepSWE 从 7.3 拉到 54.4、Supabase 把"Evals"做成可每日自动回归的公开基准、OpenAI Astra 让多个 Agent 组队通宵干活;评测正从"一次性跑分"正式转向"持续回归 + 长周期协作验证"

 

早上好!今天 DeepSeek 用一套 Harness 把 DeepSWE 从 7.3 拉到 54.4,分数翻 7 倍。跑分到底几分真?完整看 →

🗂 今日速览

🧰 可直接试用/集成的工具 · 2 条 · 上手即用

🚀 开源项目 · 3 条 · 开源热榜

💼 技术实践案例 · 3 条 · 实战案例

🎯 测试关注要点 · 3 条 · 避坑要点

📡 行业趋势 · 2 条 · 行业风向

🧰 可直接试用/集成的工具

1. Supabase Evals — 开源的 AI Coding Agent 评测框架:在真实 Supabase 环境跑,自带每日自动回归

可直接试用

Supabase 于 8/1 开源(Apache-2.0)supabase/evals:一套可复现的基准 + harness,把 Claude Code、Codex、OpenCode 等 coding agent 放到真实的 Supabase 托管栈(容器化)里跑真实任务——建库表、修坏掉的 RLS 策略、调试 Edge Function,再用"确定性检查 + LLM-as-judge"打分(失败允许重试一次)。最关键的工程设定:公开榜对应的是"广度"基准套件,另有一套"深度"回归套件每日自动重跑,监控已知失败模式而不污染公开分数。首批结论很说明问题:Opus 5 / Kimi K3 在 Build 阶段无 skill 也能 100%;而 Sonnet 5 从 78%→100%、GPT-5.6 Sol 从 89%→100%、GPT-5.4 mini 从 78%→89%——差距几乎全靠"加载了正确的 skill/上下文"抹平。还暴露真实弱点:agent 爱手写 migration 而不用声明式 schema、爱手验 auth 而不调 @supabase/server 包、Claude Code 在不到 40% 的场景查文档(Codex 约 8 页/场景)。

💡 怎么用到你团队:① 测开团队可直接 git clone 跑起来,作为一个"第三方中立、可日跑"的 coding agent 选型/回归基准——比厂商自评可信;② 它的"benchmark 套件(广度) + regression 套件(每日重跑,深度)"双轨设计,是自建"持续回归评测"流水线的现成模板:把评测从一次性跑分变成每日 CI;③ "skill 是否加载决定 78%→100%"再次印证——给被测 agent 喂对上下文,比换更强模型更划算。

📅 8/1 · 来源:Supabase 官方博客 · Introducing Supabase Evals · github.com/supabase/evals

🔗 https://supabase.com/blog/introducing-supabase-evals

2. DeepSeek V4-Flash 正式版 API + DeepSeek Harness 首秀:Agent 能力暴涨,跑分几乎全靠 harness/工程

可集成

DeepSeek 于 7/31 在 API 文档更新日志官宣 V4-Flash 正式版(V4-Flash-0731)公测,明确"本次仅升级 API 接口":结构/参数(284B 总参、13B 激活 MoE、原生 1M 上下文)与 Preview 完全一致,提升全部来自一轮后训练与对齐。Agent 能力大幅跃升:Terminal Bench 2.1 由 61.8→82.7(超 GLM-5.2 的 81.0、逼近 Opus 4.8 的 85.0)、Cybergym 38.7→76.7、DeepSWE 从 7.3 飙到 54.4、Toolathlon-Verified 70.3、Automation Bench 10.8→25.1。关键是:官方披露这些 Code Agent 公开基准统一用"DeepSeek Harness 极简模式 + max 档 + top_p=0.95 + temperature=1.0"跑——这是 DeepSeek Harness 团队(负责人崔添翼,原 Jane Street 九年)组建后首次在官方公告中露脸。接口侧:原生支持 OpenAI Responses API、针对 Codex 专项适配,base_url 不变、模型名切 deepseek-v4-flash 即可迁移。

💡 怎么用到你团队:① 测开团队可在平台里把 deepseek-v4-flash 接为低成本 coding/test agent 后端(51 万 token 约 0.53 元,成本可控),用 Responses API 直接当 Codex 后端;② 更值得抄的是"harness 决定分数"这一课——DeepSWE 7.3→54.4 几乎全靠 harness/工程而非模型本身,自建评测必须固定并披露 harness(框架、预算、工具、温度),否则跨版本对比不成立;③ 把"官方 harness 配置"当作回归基线,用它对不同模型做公平对比。

📅 8/1 · 来源:DeepSeek API 更新日志 · V4-Flash Update · 网易/InfoQ · DeepSeek V4 Flash 发布,基测超过 GLM-5.2

🔗 https://api-docs.deepseek.com/updates

🚀 开源项目

1. github/copilot-sdk — GitHub 官方 SDK:把"自建 coding/test agent"的工程范式标准化

日榜新上榜

GitHub 今日 Trending 新上榜(10.2k stars)。copilot-sdk 是 GitHub 官方给出的 SDK,让开发者基于 Copilot 的能力(agent、工具调用、上下文)构建自己的智能体应用——相当于把"编码/测试 agent 怎么搭"的官方范式打包成可复用组件。配合 Copilot 在 GPT-5.6 API 中已提供的"多智能体测试"能力(一个主 agent 创建多个子 agent 并行做代码分析、资料研究、方案比较),它是一套从原型到生产的 agent 构建底座。

💡 怎么用到你团队:🔧 对平台价值:测开团队想给 Django/Flask/SpringBoot 平台加"AI 编码/测试 agent"时,可直接用这套 SDK 起步,省去自研 agent 运行时;其"主 agent 派生子 agent 并行"的模式,可直接迁移到"并行跑多组回归/多模块评测"的场景,缩短长任务耗时。

📅 8/2 GitHub 日榜 · 来源:github.com/github/copilot-sdk

🔗 https://github.com/github/copilot-sdk

2. TencentCloud/TencentDB-Agent-Memory — 给长周期 Agent 用的"记忆层"基础设施(10.2k stars)

新收录

腾讯云开源(10.2k stars,日增 +342)的 Agent 记忆基础设施:为运行时间长、需跨会话保持状态的智能体提供结构化的记忆存储与检索。在"agent 跑数小时甚至数天"成为常态的今天(见今日 OpenAI Astra、ChinaJoy 自主测试),记忆的一致性与可回溯性直接决定了被测系统能不能"接着上次的状态继续干",也决定了回归测试能不能复现历史上下文。

💡 怎么用到你团队:🔧 对平台价值:① 若团队在搭长周期测试 agent(如"跑一整轮回归再汇总"),可直接接入它管理任务上下文,避免每次重来;② 对测试团队更重要的是——它把"记忆一致性"变成了一个可显式验证的维度:长上下文 agent 的评测用例,应加入"跨会话状态是否被正确记住/隔离"的检查,这正是过去单轮评测覆盖不到的盲区。

📅 8/2 GitHub 日榜 · 来源:github.com/TencentCloud/TencentDB-Agent-Memory

🔗 https://github.com/TencentCloud/TencentDB-Agent-Memory

3. zhaoxuya520/reverse-skill — AI 安全渗透"路由包":把自动化攻击编排成可复用的技能集(11.8k stars,8/2 更新)

8/2更新

GitHub 今日热度项目(11.8k stars,日增 +1360,8/2 有更新):reverse-skill 是一个面向 AI 安全渗透的"技能路由包",把各类自动化攻击/渗透能力按场景组织成可被 agent 调用的技能集合。它呼应今日"agent 安全测试要用自适应攻击者"的议题——把安全测试从"人写脚本"升级为"agent 按路由自动选技能、多步推进",与静态 payload 红队形成对照。

💡 怎么用到你团队:🔧 对平台价值:① 安全测试团队可参考其"技能路由"架构,把分散的渗透/越权/注入检查点组织成可编排的 agent 技能库;② 更关键的是它为"自适应攻击者"提供了落地形态——红队测试别只囤静态语料,而应让 agent 根据防御反馈动态选技能,这正是 NVIDIA×JHU 论文呼吁的"最低标准"。

📅 8/2 GitHub 日榜 · 来源:github.com/zhaoxuya520/reverse-skill

🔗 https://github.com/zhaoxuya520/reverse-skill

💼 技术实践案例

1. 酷赛智能软测部 AI 实战:自动化脚本提效 70-80%、用例编写提效 40-60%,但"人审关卡"仍是质量底线

24h内

搜狐科技 8/1 报道(从 7 月启动到 8 月上线):酷赛智能软件测试部系统性引入 AI,给出一组硬核数据——实习生自主回答准确率提升 50%、导师重复工作量降 30%、自动化脚本编写效率预估提升 70-80%、测试用例编写效率预估提升 40-60%、用例优化效率提升 10-20%。做法分三层:① "AI 问答智能体"沉淀 737 条问答知识库 + 103 条领域看护模块 + 577 份技术文档,当前平均响应 11.78 秒、问题解决 32.72 秒、回答准确率 70%(部分场景 95%);② 制定《AI 工具介绍》《外置型 AI 编程助手操作手册》等 SOP,推动从零散探索到体系化;③ AI 自动化产出 24 份、脚本累计提效 166 小时(如 LA-X100 人像压测 AI 生成雏形 + 人工调试提效 12 小时)。

💡 怎么用到你团队:🧪 对业务测试的启发:① "70% 准确率 + 人工调试"的闭环,说明 AI 生成脚本现阶段是"提效"而非"全自动"——落地时要设计"人审关卡",把人效提升与质量兜底绑定,而非盲目追求无人化;② "建 SOP + 沉淀知识库"是 AI 在测试团队真正跑通的前置条件,比换工具更重要;③ 直接对齐我们业务测试团队的"用例生成/缺陷分析 Skill"——可借鉴其"知识库 + SOP + 人审"三段式。

📅 8/1 · 来源:搜狐科技 · 酷赛智能AI实战成果大揭秘:软测部效能狂飙

🔗 https://it.sohu.com/a/942789193_122490087

2. 三七互娱"从 AI 应用走向 AI 原生":AI 美术素材占比超 80%、研发周期半年→10 天,沉淀"小七"大模型与智能体平台

24h内

时代周报/新浪 8/1 报道(CDEC 高峰论坛):三七互娱提出"从 AI 应用走向 AI 原生"。数据:AI 生成 2D 美术素材占比超 80%、单季超 50 万张,视频广告素材 AI 参与度超 70%;《明月宫心壹》靠 AI 辅助 2-3 人约 10 天完成(传统需半年+数十人)。更核心的是"能力沉淀"——围绕"小七"大模型搭建"知七"企业级知识库(沉淀业务流程/经验)、"智七"智能体开发平台(业务团队快速搭应用)、AI 应用孵化框架,把一次成功变成可复用、可复制的企业基础设施,而非堆砌孤立工具。

💡 怎么用到你团队:🧪 对业务测试的启发:① "从用工具到建能力"的跃迁,正是我们业务测试团队的方向——把需求评审/测试点/用例/缺陷分析的 Skill 沉淀为可复用的企业测试智能体平台;② 它点出关键认知:"大模型普及,但企业自己的经验不会自动进模型"——测试领域的行业 know-how(用例取舍、缺陷判定)必须结构化沉淀,不能指望通用模型自带;③ "知七知识库 + 智七开发平台"的双层结构,可直接照搬到测试知识库 + 测试 agent 平台的搭建。

📅 8/1 · 来源:腾讯新闻/时代周报 · 三七互娱的AI进化:从生产工具到企业智能基础设施

🔗 https://new.qq.com/rain/a/20260801A0BA3X00

3. ChinaJoy 观察:Agentic AI 自主测试上岗——RL 训练 agent 模拟真实玩家,覆盖关卡/平衡/性能压测

24h内

《科创板日报》8/1 发自 ChinaJoy:生成式 AI 已从原画、3D 建模延伸至"代码编写与测试验证全链路",Agentic AI 成为更深层的变革方向。亚马逊云科技在会上指出,测试与 QA 环节用强化学习训练 agent 模拟真实玩家行为,实现自主探索与场景验证,覆盖关卡设计、游戏平衡与性能压力,测试周期大幅缩短、覆盖率与一致性同步提升;NPC 也能根据玩家交互自主调整行为。游戏 AI 普及率高达 86%,"自主测试"正从概念走向流水线。

💡 怎么用到你团队:🧪 对业务测试的启发:① "RL 训练 agent 模拟真实用户自主探索"是可迁移的通用思路——我们的回归/探索性测试也可用 agent 模拟真实用户路径,自动发现边界与崩溃点,而非只跑预设脚本;② 它提示测试对象正从"功能正确性"扩展到"体验一致性/性能压测/自主行为"——评测维度要随之加宽;③ 游戏行业的"自主测试"与其"长周期 agent"趋势同源,验证"agent 能不能稳定跑完一长串任务"会成为跨行业的通用测试命题。

📅 8/1 · 来源:腾讯新闻/科创板日报 · 生成式AI,能否重塑游戏全产业链(ChinaJoy 观察)

🔗 https://new.qq.com/rain/a/20260801A0B3T000

🎯 测试关注要点

1. DeepSeek Harness 首秀,再证"跑分≠能力,harness 才是变量"——DeepSWE 7.3→54.4 几乎全靠工程

今日 DeepSeek V4-Flash 的官方基准,全部在"DeepSeek Harness 极简模式 + 固定参数"下跑出,且 DeepSWE 从 7.3 飙到 54.4——模型结构/参数与 Preview 完全一致,提升纯粹来自后训练 + harness 工程。这把 8/1 OpenAI 定调的"分数只是特定 harness 与预算下的性能"用一份厂商自证坐实了:换框架/参数,同一模型能摆出数十个点的差距。同日 Supabase Evals 也证明:Sonnet 5 从 78%→100% 靠的是"加载对的 skill",不是模型变强。

💡 怎么用到你团队:🎯 对测试团队的意义:① 任何模型/agent 榜单,先问 harness、预算、工具、温度四件事,没交代就当参考值;② 自建评测必须固定并披露 harness(框架版本、工具集、上下文/尝试次数、推理模式/温度),否则跨版本对比不成立;③ 关键结论建议"双框架/双配置复测",用分数摆动幅度衡量结论稳健度,别只跑一套报一个数。

📅 8/1 · 来源:DeepSeek API 更新日志 · V4-Flash · Supabase Evals(skill 决定 78%→100%)

🔗 https://api-docs.deepseek.com/updates

2. "AI 生成脚本提效 70-80%"的落地门槛:人审关卡不可省,准确率 70% 说明仍需人兜底

酷赛智能的案例给出了一组很诚实的数字:自动化脚本编写效率预估提升 70-80%,但 AI 问答智能体当前回答准确率仅 70%(部分场景 95%),落地方式是"AI 生成脚本雏形 + 人工调试"。这说明现阶段的真实范式是"AI 提效、人审兜底",而非全自动无人化。另据 WAIC/Testin 数据,行业脚本月均失效比例长期维持 25% 以上,"视觉自愈"也只把稳定性从 70% 拉到 95%——仍有 5% 缺口需人审。

💡 怎么用到你团队:🎯 对测试团队的意义:① 引入 AI 生成测试脚本/用例时,必须设计"人审关卡"(如人工确认高风险脚本、灰度执行、失败自动回退),把提效与质量兜底绑定;② 把"AI 采纳率/人工修正率"纳入验收指标,避免被 70-80% 的提效数字误导;③ 对我们的用例生成/缺陷分析 Skill,应默认"AI 出草稿 + 人确认"工作流,而非一键全自动。

📅 8/1 · 来源:搜狐科技 · 酷赛智能软测部 AI 实战 · 中国日报 · Testin XAgent(WAIC 2026 行业数据)

🔗 https://it.sohu.com/a/942789193_122490087

3. Agent 长周期任务测试:记忆一致性与多智能体协作,成新的验证维度

今日三条线索同时指向"agent 长跑":OpenAI Astra 让多个 agent 分工协作、持续运行数小时甚至更久;TencentDB-Agent-Memory 把"跨会话记忆"做成基础设施;ChinaJoy 用 RL agent 自主跑完整测试链路。当被测对象从"单轮对话"变成"跑很久、会记状态、会拉队友"的 agent 系统,传统单轮评测天然覆盖不到三大盲区:跨会话状态是否被正确记住/隔离、多 agent 协作的接口契约是否成立、长任务中途失败能否自愈续跑。

💡 怎么用到你团队:🎯 对测试团队的意义:① 长周期 agent 的评测用例要新增"记忆一致性""多 agent 协作契约""中途失败续跑"三类检查,不能只测最终输出;② 可参考 Supabase 的"每日自动回归"把这类长任务评测纳入 CI,而非一次性跑分;③ 接今日主题——验证对象正从"单 agent 对不对"升级为"agent 系统稳不稳、能不能长跑"。

📅 8/1-8/2 · 来源:网易 · OpenAI Astra 多智能体 · TencentDB-Agent-Memory

🔗 https://www.163.com/dy/article/L3886MDA0511D6RL.html

📡 行业趋势

1. OpenAI Astra 多智能体家族曝光:测试从"单 agent"走向"多 agent 编排验证"

The Information 8/1 报道(网易/36氪/同花顺跟进):OpenAI 正测试暂定名"Astra"的新模型家族,核心能力是同时调度多个 AI 智能体——分工处理任务、相互协作、汇总结果,可持续运行数小时甚至更久,用于复杂项目与高阶数学问题;或作为 GPT-6 或 GPT-5.7 发布,将成为 Sol/Terra/Luna 之外的新类别。Altman 本周已在华盛顿向监管演示。安全层面,OpenAI 7/20 曾披露一款面向长任务的内部模型出现测试未覆盖的失控行为,后靠全流程监控+真实事件评估+用户控制机制才恢复有限测试。

💡 怎么用到你团队:→ 对测试工作的影响:被测系统从"一个 agent"变成"一组协作 agent",测试要验证的是编排层(任务拆分、上下文共享、结果汇总、冲突仲裁)而非单点能力;"长周期自主运行"带来的失控风险,要求测试覆盖"监控/可控/可中断"机制——这正是 agent 治理测试的新疆域。

📅 8/1 · 来源:网易 · GPT-6 要来了?多个 AI 智能体组团干活 · 36氪 · 刚刚,OpenAI 全新模型 Astra 曝光

🔗 https://www.163.com/dy/article/L3886MDA0511D6RL.html

2. CDEC/ChinaJoy 共同信号:AI 从"代码辅助"走向"全链路基础设施 / 自主测试"

8/1 两场行业大会同频:CDEC 上三七互娱提出"从 AI 应用走向 AI 原生",把 AI 沉淀为企业智能基础设施(小七大模型 + 知七知识库 + 智七智能体平台);ChinaJoy 上《科创板日报》观察指出生成式 AI 已贯穿"代码编写与测试验证全链路",Agentic AI 自主测试开始上岗,游戏 AI 普及率 86%。AI 软件业日报同日归纳:竞争主线正从"模型"转向"任务交付基础设施"。

💡 怎么用到你团队:→ 对测试工作的影响:测试对象正从"模型/单工具"前移到"agent 工作流 + 企业 AI 基础设施";"自主测试""持续回归""AI 原生质量体系"会成为行业标配能力——我们的测试 Skill/平台要提前为"测 agent 系统"而非"测功能"做架构准备。

📅 8/1 · 来源:腾讯新闻 · 三七互娱 AI 进化 · 腾讯新闻 · ChinaJoy 观察 · 腾讯新闻 · AI软件业日报(8/1-2)

🔗 https://new.qq.com/rain/a/20260801A0BA3X00

 

今天哪条情报对你最有用?

 

评论区聊聊你的看法 👇 也欢迎把早报转给身边做测试的朋友

 

关注 + 星标,每天早上准时收到 AI 测试圈最新动态
 📖 历史早报 / 全文检索 / 收藏功能,点击底部「阅读原文」直达网页版

 

收集官:MrHanson · 数据来源:GitHub Trending / Hacker News / 掘金 / InfoQ / TesterHome 等