夜雨聆风学习资料网

ARTICLE · 1030613

AI 技术 | RSI 双雄落地、Liber-0 世界模型登顶、腾讯 Chatterfly 内测 - 2026.09.18

AI 技术 | RSI 双雄落地、Liber-0 世界模型登顶、腾讯 Chatterfly 内测 - 2026.09.18

一句话总结:9 月 17 日,AI 圈最硬的关键词是"RSI(递归自我改进)落地"——智谱、云知声同日交出早期答卷,让 AI 直接参与优化承载自身运行的系统;模型侧,Liber-0 成为首个在具身基准上超越 GPT-6 Astra 的世界模型,Gemini 4 Pro 与字节 Doubao-Seed-2.1-pro 相继曝光、更新;产品端,腾讯 Chatterfly、vivo 系统级 Harness、开源 AgentGit 把"Agent 进系统、进团队"再推一步;学术侧,KDD'26 时间序列、Agent 安全轨迹演化与"做梦式"自我改进三线并进。


🧠 前沿技术

1. 智谱 GLM-5.3-Flash:首个 RSI 成果,AI 首次参与优化"承载自己运行的系统"

  • 机构/作者:智谱(Zhipu)
  • 标签:【大模型】【RSI】【Agent】

当 AI 开始给自己的"发动机"做调参,RSI 就从概念落到了工程。

内容摘要: 智谱发布其首个 RSI(递归自我改进)成果 GLM-5.3-Flash:该模型以 Infra Agent 身份参与推理系统优化,两周内部署于 10 万颗国产 AI 加速器集群,端到端吞吐提升 3.2 倍。它通过 dense feedback 机制定位并修复了 KV Transfer 调度重叠、精度误差等隐藏问题,把 KV 开销从超 30% 降至 1% 以下Decode Kernel 获 1.71 倍性能提升。这条消息的意义不在于单点提速,而在于 AI 首次参与优化承载自身运行的系统——它标志着 RSI 的早期形态开始出现:模型不再只被训练去完成任务,而是开始改进"训练与运行自己的基础设施"。

  • 来源:AITNT 全球 AI 新闻日报(2026-09-18)|https://www.aitntnews.com/ainews/zh-CN

2. 云知声 U2-Flash:国产 RSI 早期答卷,266B 稀疏 MoE 每次只激活 10B

  • 机构/作者:云知声(Unisound)
  • 标签:【大模型】【RSI】【MoE】

"后训练闭环"第一次被量化到"训练步数减少 55%"这样的硬指标上。

内容摘要: 云知声发布 U2-Flash,率先交出国产 RSI 的早期答卷。模型采用 稀疏 MoE 架构,总参数约 266B,单次推理仅激活 10B(约 4%),换来 生成速度提升 2.1 倍、任务完成时间缩短 35%、Token 消耗降低 20%–30%。能力上,代码与 Agent 达到主力模型水平:DeepSWE v1.1 从 32 分翻倍至 64.6 分,TerminalBench 3.0 从 2.7 分飙至 24.3 分(约 9 倍)。更关键的是工程收益——后训练闭环使训练步数减少约 55%,说明"让模型参与改进训练流程本身"已经能直接省下算力与时间。

  • 来源:AITNT 全球 AI 新闻日报(2026-09-18)|https://www.aitntnews.com/ainews/zh-CN

3. LiberAI Liber-0 Preview:首个在具身基准上超越 GPT-6 Astra 的世界模型

  • 机构/作者:LiberAI
  • 标签:【具身智能】【世界模型】【强化学习】

世界模型的竞争,首次从"生成好看"转向"能不能把具身任务跑成"。

内容摘要: LiberAI 发布 Liber-0 Preview 世界模型,登顶 RoboDojo"具身珠峰"榜第一成为首个超越 GPT-6 Astra 的世界模型42 项任务平均分 30.74、平均成功率 25.52%,实现全维度全面领先。公司同期完成数亿元 Pre-A++ 轮融资,5 个月累计融资超十亿。这一成绩让世界模型的价值主张更清晰:它不只是视频生成的一个分支,而可能成为具身智能"预演—决策—执行"闭环里那块关键的"内环境"。

  • 来源:AITNT 全球 AI 新闻日报(2026-09-18)|https://www.aitntnews.com/ainews/zh-CN

4. 前 OpenAI 研究员发布 Jev:放弃文本生成,专攻"结构化判断",成本降至 1/400

  • 机构/作者:Diogo Almeida(前 OpenAI 研究员)
  • 标签:【大模型】【推理效率】【自动化工作流】

不是所有任务都需要"写文章",很多只需要"做判断"。

内容摘要: 前 OpenAI 研究员 Diogo Almeida 发布 Jev 模型,放弃文本生成,专注结构化判断速度提升 20–200 倍,成本降至 1/400,响应时间 70–500 毫秒输入价每百万 Token 0.042 美元、输出免费。它面向自动化工作流中的分类、打分、路由任务,用来减少等待时间与成本。在大模型"什么都干"的叙事之外,这类"只干判断"的专用小模型,正在成为 Agent 流水线里性价比极高的一环。

  • 来源:AITNT 全球 AI 新闻日报(2026-09-18)|https://www.aitntnews.com/ainews/zh-CN

5. 微信视觉团队开源 WeMM-Embedding:信息图检索,原图方案 Recall@1 达 0.94

  • 机构/作者:腾讯微信视觉团队
  • 标签:【多模态】【检索】【开源】

在被 OCR 文本"翻译"成纯文字之前,图片原本的信息密度被严重低估。

内容摘要: 微信视觉团队开源多模态模型 WeMM-Embedding,并公开了一组信息图检索的对比实验:研究者测试三种方案——OCR 文本、整张原图、整图 + 九宫格局部向量。在 50 张信息图的对比中,原图方案 Recall@1 达 0.94,明显高于 OCR 文本方案的 0.80;而多向量(整图 + 九宫格)方案目前未能进一步提升效果。结论指向一个朴素而重要的工程事实:对信息图这类"版面即语义"的内容,直接编码原图往往比先转文本更接近真实分布。

  • 来源:AITNT 全球 AI 新闻日报(2026-09-18)|https://www.aitntnews.com/ainews/zh-CN

6. 泄露的 Gemini 4 Pro:256K 输出 + 2M 上下文,主打 Coding 与 Agent

  • 机构/作者:谷歌(Google)
  • 标签:【大模型】【长上下文】【Agent】

旗舰模型的下一个卖点,正从"更大"转向"更能干长活"。

内容摘要: 泄露的 Gemini 4 Pro 疑似在 Code Arena 盲测中被发现,套用 gemini-3.8-flash 马甲。用户实测显示其具备生成复杂 SVG 动画的能力,远超 3.8 Flash;爆料称其拥有 256K Token 输出上限(较前代提升 4 倍)与 2M 上下文窗口,主要针对 Coding 和 Agent 场景。原定 9 月发布,现推迟至 10 月。在 Agent 长时间自主执行成为主线的当下,"超长输出 + 超大上下文"的组合,指向的是"一次交付一整个工程"的能力预期。

  • 来源:AITNT 全球 AI 新闻日报(2026-09-18)|https://www.aitntnews.com/ainews/zh-CN

7. 字节 Doubao-Seed-2.1-pro 更新:Agent、Coding、多模态三合一

  • 机构/作者:字节跳动(ByteDance)
  • 标签:【大模型】【Agent】【多模态】

一个模型同时交出自主规划、改代码、看图表的能力,模型竞争开始比拼"端到端办事"。

内容摘要: 字节跳动发布 Doubao-Seed-2.1-pro 最新版,集成 Agent、Coding、多模态三大核心能力。实测中,它可自主规划执行长任务,从 0 完成产品 MVP直接修改 20 万行开源代码并通过全部测试多模态公考图形推理 4 题全对;还能完成电商数据分析并生成交互式仪表盘。API 已上线火山方舟。这三项能力恰好对应"长程规划 + 代码执行 + 跨模态理解"的 Agent 底座三件套,也说明头部厂商正把"能干活"而非"能对话"作为新版模型的主要验收标准。

  • 来源:AITNT 全球 AI 新闻日报(2026-09-18)|https://www.aitntnews.com/ainews/zh-CN

📄 学术论文

8. 中科大 × 阿里 CEDAR:显式建模"人为决策影响"的时间序列框架,获 KDD'26 Oral

  • 机构/作者:中国科学技术大学、阿里巴巴
  • 标签:【学术论文】【时间序列】【决策建模】

在电商场景里,预测不准往往不是模型不够强,而是"人的干预"没被建进模型。

内容摘要: 中科大与阿里提出 CEDAR 双重解耦框架:通过动作交错 Transformer 显式建模人为决策影响,再用残差修正模块融合外界干预因子。研究在 1688 平台 3200 万条商品轨迹上验证,预测误差较最优基线降低 57%A/B 测试带来商家 LTV 提升 13%、店铺 ROI 提升 15%。论文获 KDD'26 Oral。它的价值在于把"决策—反馈"的因果链条显式拆开,而不是让模型在混杂数据里自己猜,这对运营、定价、供应链等强干预场景尤为关键。

  • 来源:AITNT 全球 AI 新闻日报(2026-09-18)|https://www.aitntnews.com/ainews/zh-CN

9. 上海 AI Lab SHE & SafeEvolve:把 Agent 安全从"静态配置"改成"轨迹驱动的持续演化"

  • 机构/作者:上海人工智能实验室联合复旦大学、上海交通大学等
  • 标签:【Agent】【AI 安全】【对齐】

安全不是给 Agent 发一份静态守则,而是让它从自己走过的轨迹里学会避险。

内容摘要: 上海 AI Lab 联合复旦、上海交大等高校提出 SHE 与 SafeEvolve,将 Agent 安全从静态配置转向轨迹驱动的持续演化SHE 把 Agent 的 Harness 拆解为四类组件,从执行轨迹中诊断风险并更新策略,把攻击成功率从 17.1% 降至 5.5%SafeEvolve 进一步把安全经验写入 Policy model,在 Qwen3.5-4B 上把攻击成功率从 2.37% 降至 0.79%,实现 Harness 与 Policy 协同演化。当 Agent 长期自主运行,安全必须"跟着经验一起长",这套思路提供了可落地的机制。

  • 来源:AITNT 全球 AI 新闻日报(2026-09-18)|https://www.aitntnews.com/ainews/zh-CN

10. 谷歌 Dream-RSI:让 AI 靠"做梦"在虚拟环境里试错,省下 162 倍 Agent 调用

  • 机构/作者:谷歌(Google)
  • 标签:【RSI】【强化学习】【世界模型】

真实环境跑一次太贵,那就先在"梦里"把策略试够。

内容摘要: 谷歌发布 Dream-RSI 论文,用**"做梦"的方式让 AI 在虚拟环境中测试探索策略**,以减少真实重跑成本:在 Lasso 任务上省下 162 倍 Agent 调用,在数学优化上省 50 倍预算内核(Kernel)性能最高提升 2.09 倍。这条工作与"世界模型即内环境"的思路一脉相承——把昂贵、缓慢的真实试错,替换为廉价、可并行的模拟试错,是 RSI 能否规模化的重要前置条件。

  • 来源:AITNT 全球 AI 新闻日报(2026-09-18)|https://www.aitntnews.com/ainews/zh-CN

11. 字节 OpenBMB Meshy:把 RL 训练里的"角色"做成独立服务

  • 机构/作者:OpenBMB(字节跳动)
  • 标签:【强化学习】【训练框架】【系统】

当训练从"一个脚本"变成"一群服务",扩展性与可调试性才真正成为一等公民。

内容摘要: Meshy 是 OpenBMB 提出的角色驱动 RL 训练框架,基于 TorchTitan 与 SGLang,把 Inference、Training、Rollout 等角色建模为独立服务。数据通过 TransferQueue 直达消费者控制流由数据驱动拓扑由各进程本地推导。框架支持全异步训练,同时兼容同步训练模式,并避免了 RPC 调用与 Ray 依赖,在故障排查、性能与代码简洁度上更具优势。随着 RL 后训练成为大模型能力提升的主战场,训练系统的工程形态也在被重新设计。

  • 来源:AITNT 全球 AI 新闻日报(2026-09-18)|https://www.aitntnews.com/ainews/zh-CN

📱 应用产品

12. 腾讯内测 Chatterfly:AI 原生语音助手,把"开口说话"变成成文入口

  • 机构/作者:腾讯(Tencent)
  • 标签:【语音】【AI 输入】【Agent】

输入法解决"把字打出来",Chatterfly 想解决"把想法变成文档"。

内容摘要: 腾讯低调开启 AI 原生语音助手 Chatterfly 的内测(需内测码),定位区别于传统输入法的 AI 原生表达辅助工具。基础能力覆盖语音输入、全场景 AI 打字、场景化深度润色、AI 指令执行,适配弱网、嘈杂、轻声等现实录音环境,并可学习用户习惯迭代输出风格,支持一键迁移搜狗个人词库。首期内置会议纪要、工作汇报、VibeCoding 提示词优化等 6 个 Skills,其中 VibeCoding 能把口语碎片整理成可直接交给 Agent 执行的完整 Prompt。目前已开放 macOS、Windows 桌面端下载,移动端即将上线。它最值得观察的是 Skills 插件化:语音不再只是"转文字",而成为触发各类内容生产的入口。

  • 来源:AITNT 全球 AI 新闻日报 / 读佳(2026-09-18)|https://www.aitntnews.com/newDetail.html?newId=29446

13. vivo VDC:以"大模型 + Harness"构建个人化智能底座,系统级工具超 6000 个

  • 机构/作者:vivo(2026 vivo 开发者大会)
  • 标签:【Agent】【端侧 AI】【操作系统】

手机端 AI 的下一道题,不是模型更强,而是"能不能把事办完"。

内容摘要: 在 2026 vivo 开发者大会上,vivo 给出技术路径:以"大模型 + Harness"构建个人化智能底座。模型侧推出蓝心大模型端云矩阵——端到端语音模型 BlueLM-Realtime、端侧模型 BlueLM-Nano(端侧上下文扩展至 32K)、云侧快执行模型 BlueLM-Flash 与复杂推理模型 BlueLM-Pro 各司其职、自动调度。工程侧发布 Agent 原生的蓝心系统级 Harness 开发者平台:感知与记忆层共享长期上下文,规划层负责路由、编排与反思,执行层提供 6000+ 系统级工具MCP / A2A / CLI / 统一 API 接入手机、IoT 与现实世界;并基于观察—反思—沉淀框架让系统在设备闲时复盘任务路径、持续沉淀经验。vivo 想解决的核心矛盾是:既让 AI 拥有足够连续的个人上下文,又让感知与记忆始终运行在明确授权边界内。

  • 来源:AITNT 全球 AI 新闻日报(2026-09-18)|https://www.aitntnews.com/newDetail.html?newId=29442

14. Einsia AI 开源 AgentGit:全球首个开源 Agent 会话协作平台

  • 机构/作者:Einsia AI
  • 标签:【Agent】【开源】【协作】

代码可以 git,Agent 的工作会话为什么不能?

内容摘要: Einsia AI 发布开源平台 AgentGit(agent-git.com),定位全球首个开源 Agent 会话协作平台,支持 Agent 工作上下文的保存、分享、交接与多人协作,让 AI 的工作过程不再是一次性会话,而可成为团队共享、可复用的持续资产。团队成员可共同进入同一个 Agent 会话,围绕同一份上下文继续修改,无需复制聊天记录、反复解释背景。平台目前支持 Claude Code、Codex、OpenCode、OpenClaw、Hermes 与 WorkBuddy。当越来越多会话被开源、分享与沉淀,它有望成为"Agent 上下文"这一新型基础设施。

  • 来源:AITNT 全球 AI 新闻日报 / 新智元(2026-09-18)|https://www.aitntnews.com/newDetail.html?newId=29429 |官网:https://agent-git.com

15. 飞书 8.0 + 豆包工作伙伴:让 Agent"像员工一样入职"

  • 机构/作者:飞书(Feishu)/字节跳动
  • 标签:【Agent】【办公协作】【企业应用】

把 Agent 当"同事"而不是"工具",是最直接的产品化路径。

内容摘要: 飞书在 2026 未来无限大会上发布 飞书 8.0 及豆包工作伙伴,打造国内生态较成熟的 Agent 工作平台:Agent 可像员工一样入职飞书、加入群聊、智能改文档、自动开会。落地数据上,东风奕派工厂使用后设备故障率下降 60%、年省 179 万元;飞书上半年 ARR 增速达去年同期的 2.5 倍,中小企业客户增长 70%。它说明企业级 Agent 的竞争焦点,正从"单点能力"转向"把 Agent 接进既有组织协作流"。

  • 来源:AITNT 全球 AI 新闻日报(2026-09-18)|https://www.aitntnews.com/ainews/zh-CN

📎 参考链接

  1. 智谱发布首个 RSI 成果 GLM-5.3-Flash(AITNT 全球 AI 新闻日报 2026-09-18)
  2. 云知声发布 U2-Flash,率先交出国产 RSI 早期答卷(AITNT)
  3. 独家实测|腾讯低调内测 AI 原生语音助手"Chatterfly",语音即可成文(AITNT / 读佳)
  4. 从"会回答"到"会办事",vivo 如何解 AI 手机这道题?(AITNT)
  5. 刚刚,全球首个开源 Agent 会话平台发布!老板、同事和我共享一个 AI(AITNT / 新智元)|GitHub
  6. 号称人类造的最后一个 AI 要来了,刷屏全网的 RSI 是什么(AITNT)
  7. AITNT 全球 AI 新闻日报(2026-09-18 汇总)
  8. arXiv 最新列表(cs.AI / cs.CL / cs.LG / cs.CV)
  9. 机构/产品官网:智谱|云知声|字节跳动 / 火山方舟|腾讯|vivo|飞书|OpenBMB|AgentGit

本文由 AI 自动整理,信息来源于公开报道与开源仓库,仅供技术资讯参考。

相关学习资料