ARTICLE · 1035559
今日AI十件事·机器人进陌生家庭干活
农历八月初九
9 月 17 日 Figure 发布 Helix 2.5,把 Figure 03 人形机器人带进旧金山湾区 30 栋从未采集过数据的陌生房子,零样本完成整理客厅、叠毛巾、铺床三件事。对照实验里除初始化方式外架构、数据、评测全部固定,用人类行为数据集 Index 预训练的策略成功率 56%,随机初始化的只有 9%;420 次尝试成功 237 次,铺床 67%、叠毛巾 62%、收玩具 40%。它还会在抓取失败后自己后退、换站姿、绕着床纠错。反口径藏在分项里:40% 的收玩具意味着”能做家务”和”能靠得住”还隔着一段路。Figure 已承诺 35 亿美元算力,本月锁定约 10 万块 Vera Rubin GPU。
9 月 18 日阿里千问上线 Qwen3.8-Omni-Flash,原生全模态、1M 上下文,直接吃文本、图像、音频、视频。官方称 30 项评测平均比上代提升超 26%,WildClawBench-MM 提 36.5 分、AgenticVBench 提 22.3 分,音频整体超过 Gemini 3.8 Flash、音视频接近它。最狠的是价格:每小时音频输入降价超 98%、音视频输入降价超 93%,百万 Token 输入 0.8 元。长视频理解改成”智能体式”取证,OmniVideoBench 准确率 63.4→67.8、Token 消耗降 45.7%。同步开源 Qwen-MM-Plugins 与 Qwen-Live Harness。另有一场”模型优化模型”实验:12 小时把小模型的四川话错字率从 25.79% 压到 15.30%。
9 月 18 日凌晨,阿里达摩院与浙大一院等研发的通用医疗影像模型 DAMO RADAR 登上《科学》。它不做”一病一模”,而是用视觉-语言学习直接吃临床 CT 与诊断报告,首创”器官级细粒度对齐”把三维 CT 拆成解剖单元,全程不需要人工标注病灶。覆盖 18 个器官、146 种腹部病症,近 4 万例真实病例 AUC 达 0.913,8 家外部中心 2.4 万余例 AUC 0.874-0.912,没训练过的急腹症 2.7 万例仍有 0.904。在 14 家医院 26 名放射科医生的对照中,它平均准确率超过其中 23 人;医生在它提示下敏感度提升约 10%、阅片时间缩短 30% 以上。模型已开源。
9 月 17 日智谱 GLM 团队披露国内首个跑进生产环境的递归自我改进案例:由 GLM-5.3 驱动的 Infra Agent 在超过 10 万张国产 AI 加速器组成的集群上,从零搭建并调试 GLM-5.3-Flash 的推理服务,不到两周完成全量生产流量承载,端到端吞吐提升 3.2 倍,硬件效率与单 Token 成本接近主流英伟达 GPU。Agent 干的活包括分析瓶颈、定位精度缺陷、改底层代码、跑分层测试。这套系统已受真实流量检验——GLM-5.3-Flash 此前以匿名身份 Ox-Alpha 上线,6 天调用超 62 万亿 Token,那个”神秘模型”的谜底也就此揭开。团队同时承认,离完全自主训练下一代模型还很远。
9 月 17 日 OPPO 开发者大会发布 ColorOS 17,OPPO、一加、realme 三品牌同步升级,全球活跃用户 7.7 亿。端侧大模型 On-Device Compute 首发 Linear Attention 架构,原生 128K 上下文,内存降 48%、能耗降 55%;Persona X 记忆共生引擎会记录、遗忘与反思;Agent Matrix 让小布内测满意度提升 19%。落到用户身上是:一句话直达 200 项支付宝服务、发微信、打电话,小布建议接入 40 多家服务商覆盖 700 多个场景、蜂群感知预判准确率 95%,AI 一键闪记的取餐码累计用了超 10 亿次。荣耀 MagicOS 11、vivo 原系统 7 也在同期主打同一件事。
OpenRouter 数据显示,9 月 7 日至 13 日中国大模型周调用总量约 61.2 万亿 Token,是美国模型 21.8 万亿的近 3 倍,连续领跑全球。一年前调用量前十里中国模型只有 2 席、份额不足 20%,如今占 7 席,涉及腾讯混元、智谱、DeepSeek、小米等。新发布的 DeepSeek V4.1 Flash 上线不到 24 小时就处理约 1 万亿 Token。摩根士丹利报告认为中美大模型技术差距在快速缩小,中国已具备大规模商业化基础。调用量不是能力排名,但它回答了另一个问题:到底有多少活是真跑起来的。
9 月 18 日,社区逆向发现智谱 AI 编程工具 ZCode 在登录状态下会静默把整个工作区打包上传,包含完整 git 历史、LFS 缓存、reflog 与全局配置;加密用的 RSA 公钥由服务端下发、私钥只在云端,用户和客户端都解不开,UI 里也没有开关。智谱当天致歉,归因于”代码库索引”里的 Repo Wiki 功能上线初期默认开启,称页面生成后数据即销毁、现已修复,并承诺近期开源 ZCode 代码库、请第三方审查,全员补一次周额度重置。耐人寻味的是处置方式——7 月 Grok Build 被曝上传完整 Git 仓库后也是同一套赔付,额度重置正从里程碑福利变成数据事故的标准动作。
据路透社报道,长鑫存储正计划进军闪存市场,将在北京新工厂建设 NAND 闪存研发生产线,并已设立研发机构开展 NAND 技术开发,直接与三星、SK 海力士、美光正面竞争。这家公司 2026 年二季度 DRAM 营收 146.24 亿美元,环比增长 99.3%,全球市占率提升到 9.5%。AI 把存储的景气周期拉长,存储也从配角变成算力链上的卡点——当天 A 股芯片板块涨停潮、燧原科技涨超 9% 续创历史新高,总市值站上 2300 亿元,正是这条逻辑的折射。
9 月 18 日晚 MiniMax 宣布 Code CLI v0.4.12 面向全球开发者开放,并以 MIT 协议开源,源码在 GitHub 的 MiniMax-AI/minimax-code。给出的理由是让开发者能审查工具调用与权限处理,让安全机制在真实使用中完善。第三方 FrontierHarness Eval 上,MiniMax Code 0.3.2 配 Kimi K3 跑 30 道题,23 道通过、4 道未通过、3 道超时,通过率 76.7%,成功任务耗时中位数 4 分 33 秒、单次成本 1.825 美元,两项均优于报告所列公开基线。官方自己标了口径差异:供应商、checkpoint 与部分任务时限跟公开基线不同,只作数值比较、不代表榜单排名。当天 MiniMax 港股收涨超 18%。
今天 GitHub 热榜换了叙事。Fission-AI/OpenSpec 69,307 星,主打”规范驱动开发”——先让 AI 读懂并遵守一份规范,再动手写代码;Tencent/BrowserSkill 5,237 星、单日新增 1,319,让智能体能用你真实登录态的浏览器而不打断你的工作。老面孔仍在霸榜:agent-skills 96,365、ECC 261,992、阿里 open-code-review 36,595。从”谁的模型更聪明”到”怎么让智能体按规矩干活、又能碰到真东西”,热榜的重心已经挪了位置。
今日AI寄语:模型开始自己搭系统,边界还得人来划。
以上是今日AI圈最值得关注的十件事。科技日新月异,点个关注,明天见。