ARTICLE · 985759
氦启AI 日报 · 2026-08-30
覆盖方向:AI Coding / 具身智能条目数:10 条(AI Coding 5 条 + 具身智能 5 条)
一、AI Coding
1. OpenAI 终止向 Cursor 直供模型,11 月 12 日生效
事件:8 月 28 日 OpenAI 宣布,因 Cursor 已被 SpaceX 收购、无法确信其遵守服务条款,将终止直供合同,拟定 11 月 12 日为停止日期(合同允许的最长过渡期)。Cursor 称 OpenAI 模型仅占其流量约 5%,用户可通过自带 API Key、Codex 扩展等路径过渡,但 Tab 补全、Cloud Agents 等深度集成受影响最大;马斯克次日回应"我根本不在乎"。
为什么值得你关注:这是大模型厂商首次因"下游工具被收购"而切断模型供给,把"谁控制 coding agent 的底层模型"摆上台面。它暴露了主流编程工具的供应链脆弱性——开发者正用开源插件、本地代码智能、agent 多路复用等方式对冲厂商集中风险。11 月前的迁移窗口,会是观察 Cursor 自研/换血成色与"模型中立"工具生存空间的第一现场。
2. 智谱 GLM-5.3 权重开源,登上 Hugging Face
事件:8 月 29 日智谱开源 GLM-5.3 权重(753B,BF16/FP8 双格式),擅长复杂编码、防御性网络安全与长程任务,AA 综合智能指数 60 分与 Claude Fable 5、GPT-5.6 Sol 同档,居开源模型第一;此前 GLM-5.3-Flash 以 Opus 4.8 四十分之一定价跑通十万张国产芯片集群。
为什么值得你关注:国产开源编码模型正式挤入"第一梯队"且与前沿闭源同档,意味着企业可在合规与成本可控前提下自托管强编码模型。"编码 + 漏洞审计"双能力叠加,也呼应了近两周"编程安全"这条持续主线——模型不只是写代码,还要能审代码。
3. 腾讯混元 Hy4 preview 开源,软件工程能力大幅跃升
事件:8 月 28 日腾讯发布并开源 Hy4 preview(770B 总参数、49B 激活、1M 上下文),软件工程能力大幅增强;实测 DeepSWE 从 28.0 升至 64.3、SWE Atlas Refactoring 达 53.3,已与 GLM-5.3、Kimi K3 同处开源第一梯队,并深度协同 CodeBuddy/WorkBuddy。
为什么值得你关注:又一家头部厂把"编程"作为开源旗舰模型的头号卖点。长上下文 + 高激活稀疏 + 工程基准翻倍,说明开源模型在真实软件任务上的代差正在快速收敛,自托管强 coding 底座的选择面进一步拓宽。
4. Claude Code 2.1.251:hooks 可阻断模型切换,并修复路径穿越漏洞
事件:Anthropic 8 月 29 日发布 Claude Code 2.1.251,新增"当模型变更时可由 hook 介入拦截"的能力,并封堵若干 symlink 与 path-traversal 漏洞;与此前 2.1.248 的 restricted mode(剥离可运行代码的工具)形成权限加固组合。
为什么值得你关注:自 8 月 19 日"编程安全"成为持续主线以来,防御重心已从"模型行为"下沉到"harness/工具链"工程层。能主动拦截模型切换、收紧文件系统越权,是把 coding agent 放进生产系统的真实前提——这比任何跑分都更贴近落地。
5. 华为 × 港中文开源 Lego-RL:coding agent 强化学习训练框架
事件:华为与香港中文大学开源 Lego-RL,一个面向 Coding Agent 的强化学习训练框架,无需修改 OpenHands SDK、Claude Code、OpenCode 任一 harness 即可接入 RL;以"积木式"模块化方式组合奖励、环境与策略。
为什么值得你关注:coding agent 的训练范式正在从"提示工程"走向"可微调的强化学习"。Lego-RL 的"零侵入接入"降低了研究者给任意 harness 做 RL 后训练的门槛,可能催生一批更会自我纠错、更省 token 的编码智能体——这是开源生态对闭源托管模型的直接补位。
二、具身智能
6. Google Gemini Robotics ER 2 公开预览:机器人的"高层大脑"
事件:8 月 30 日 Google DeepMind 开放 Gemini Robotics ER 2 公开预览(基于 Gemini 3.5 Flash,经 Gemini API / AI Studio 调用)。作为"具身推理"高层模型,它新增连续视频进度理解、任务进度分类(五档)、多机器人协同与多步工具调用;可判断灯泡是否拧紧、咖啡是否倒至适量,并支持 Live API 双向流式低延迟控制。演示用波士顿动力 Spot、Apptronik Apollo 2 完成自然语言取物。旧版 er-1.6 端点将于 8 月 31 日退役。
为什么值得你关注:ER 2 补上了机器人"规划与执行脱节"的关键一环——能边做边看、出错即纠、跨机分工。它把"高层大脑"与底层 VLA/运动控制器解耦,开发者可像接 API 一样组装具身系统;同步推出的 ASIMOV-Agentic 安全基准,也把"碰撞规避/人近即停"纳入评测。这是具身智能从演示走向可编排工程的信号。
7. Hugging Face Microduck:$399 开源双足机器人,附完整 RL 训练栈
事件:Hugging Face(Pollen Robotics)8 月 27 日开启预购 Microduck——25cm、<800g 的开源双足机器人,售价 $399,预购 24 小时订单破 260 万美元。硬件含 15 个电机、摄像头、LiDAR、双 IMU;核心卖点是 Apache-2.0 的 SDK + MuJoCo 仿真 + 完整 RL 训练栈(microduck_rl,PPO,4096 并行环境,1–2 小时出可用步态),并公开 BAM 执行器模型与域随机化配方,把 sim-to-real 做成可跑代码。
为什么值得你关注:把"能自己训练的物理 AI 平台"压到手机价,直接拉低具身研究的准入门槛;开源训练循环 + Hub 策略共享,可能复刻 Hugging Face 在 NLP 上的社区飞轮。无论英伟达 130 亿美元收购后续如何,代码与预购已落地——物理 AI 的"平民化入口"出现了。
8. 大晓 × 港大发布 StreamPI:给 VLA 加上时间维度
事件:大晓机器人联合香港大学发布 StreamPI,为 VLA 模型引入流式时序建模,使系统能记住过往状态、理解变化,显著提升真实任务成功率,推动具身智能从"空间智能"迈向"连续物理智能"。
为什么值得你关注:当前多数 VLA 仍是"看一帧、出一动作"的空间推理,难以应对长时序、状态会变的真实场景。StreamPI 把时间维度显式建模,是让机器人离"持续部署"更近的关键一步——具身智能的竞争焦点正从"能不能做一次"转向"能不能一直做对"。
9. 独立变量发布 WALL-SS 世界模型:60 秒连续推理
事件:独立变量(Independent Variable)发布世界模型 WALL-SS,采用 next-scale 自回归架构,攻克因果一致、长程推理、虚实一致三大瓶颈,实现 60 秒连续推理,虚拟与现实成功率相关性达 0.926。
为什么值得你关注:世界模型被视为机器人训练的关键基建。60 秒连续、且虚实高度相关的推理能力,意味着仿真到落地的距离被显著缩短——可用更可靠的合成环境替代昂贵的真实试错,加速具身策略的迭代与泛化。
10. 当虹科技 × 云深处签署机器人合作协议:四足机器人进应急消防
事件:8 月 29 日当虹科技与云深处科技签署"机器人业务合作协议",联合研发销售面向应急、消防等场景的四足机器人,并推出远程操控系列——云深处部分机器狗在特定行业方案内标配当虹 BlackEye Vision 超远距离远程操控系统。
为什么值得你关注:具身智能的落地正从"展会炫技"切到"高危刚需场景"。四足 + 超远距远程操控的组合,先把人从危险现场替下、再谈自主,是比全自主更现实的商业化路径,也印证了"小批量试用→规模落地"的产业拐点判断。