ARTICLE · 1085588
AI日报|Gemini上线Call for Me代用户打电话,腾讯开源hy4preview,meta发布自然语言生成可玩 2D/3D 游戏
9月25日至26日,国产开源模型密集出手:腾讯开源7700亿参数的混元Hy4 preview,美团上线1.6万亿参数的LongCat-2.5-Preview,云知声与蚂蚁AI安全实验室联合清华大学分别开源决策模型U2-Decision与9B全双工交互模型Realtime-Venus。
海外方向,Google为Gemini上线Call for Me代用户打电话,Meta把游戏创作交给自然语言,DeepMind确认Gemini 4已进入后训练。企业侧,微软让智能体获得独立身份与邮箱日历,Corpay与Avalara把专用智能体沉入财务与系统集成流程。当开源模型开始覆盖决策、交互与长程任务,谁能先把能力压进真实工作流?
国内动态
腾讯开源混元 Hy4 preview:7700 亿参数 MoE,12 项评测中 10 项领先
平台:MLWires / 腾讯混元 | 日期:2026-09-25
腾讯发布并开源混元Hy4 preview模型权重,采用Apache 2.0许可,总参数7700亿、每token激活490亿,支持100万token上下文窗口,可下载、修改、微调并用于商业用途。该模型容量为上一代Hy3的两倍以上,在12项评测中有10项优于GLM 5.3、Kimi K3、GPT 5.6 Sol、Claude Opus 5与DeepSeek V4 Pro。
腾讯提供BF16与FP8两个版本,可通过腾讯云TokenHub、OpenRouter以及WorkBuddy、CodeBuddy、元宝、ima等腾讯系产品调用,权重可从GitHub与Hugging Face获取。腾讯同时说明该模型在复杂问题上可能推理耗时偏长,并倾向反复核验自身结果,在追求速度的任务上效率偏低。
美团上线 LongCat-2.5-Preview:1.6 万亿参数 MoE,原生 100 万 token
平台:IT之家 / LongCat API 开放平台 | 日期:2026-09-25
美团旗下LongCat API开放平台于9月25日上线新一代大模型LongCat-2.5-Preview,主打长程任务与多模态能力,同步开放API与网页端体验入口。模型延续MoE路线,总参数约1.6万亿、每次推理激活约480亿,原生支持100万token上下文窗口,适合处理超长文档、代码库、日志与多轮复杂任务。
该版本新增图片理解能力,可解析图像内容并支持跨模态问答、内容摘要与复杂视觉推理,同时深度适配Claude Code、Hermes、OpenClaw、OpenCode与Kilo Code等主流开发环境。
云知声上线并开源 U2-Decision:4B 决策大模型,主攻模型路由与工作流
平台:腾讯新闻 / 云知声 | 日期:2026-09-25
云知声上线并开源4B参数量的决策大模型U2-Decision,定位于多模型、多Agent、多工具协作中的决策层,负责判断任务交给谁、能否执行以及沿什么路径完成。对应三项核心能力为智能模型路由、安全决策与工作流路由,把任务类型、复杂度、风险、模型能力、成本与时延放在一起判断后再选择模型,而不是依赖预设规则固定调用。
安全决策方面,模型会评估请求风险、数据风险与模型风险,对高风险或不确定性较高的任务选择升级处理、增加验证、转交人工确认或停止执行;工作流路由则把决策范围从调用哪个模型扩展到采用什么执行路径,简单任务直接回答,复杂任务分步执行并在必要节点核验。
蚂蚁 AI 安全实验室联合清华开源 Realtime-Venus:9B 全双工交互模型
平台:搜狐科技 / ZAKER | 日期:2026-09-25
蚂蚁AI安全实验室与清华大学人机交互实验室联合开源Realtime-Venus,包含Omni与Audio两款9B参数全双工交互模型,可边处理任务边回应用户新需求。模型在说话时继续接收输入,并结合语义判断何时续说、何时让出话语权,遇到用户纠正或提出新请求时可停下当前回应、调整尚未说出的内容再继续交流。
系统配套Harness连接前后端服务,把需要外部能力的任务委托后台处理,结果返回后结合当时对话状态选择播报时机;模型权重与代码同步开放,支持开发者自主部署、定制与扩展,Omni还可借助长视频记忆检索历史视听信息回答与早先画面有关的问题。
月之暗面推出 Kimi Code Desktop:macOS 与 Windows 同步上线
平台:火星财经 | 日期:2026-09-26
月之暗面宣布Kimi Code Desktop正式推出,macOS与Windows版本同步上线,把Kimi Code智能编程服务能力带到桌面应用。用户可在桌面端直接使用AI Agent能力,通过对话让它读写代码、运行命令、完成自动化任务,并在全新可视化图形交互界面中集中管理所有项目、调整常用配置、查看智能体执行任务的每一步。
九天英斧发布九天 V4 Flash 旗舰版 AI 工作站:售价约为 DGX Station 三分之一
平台:新浪财经 | 日期:2026-09-26
九天英斧发布新一代AI工作站九天V4 Flash旗舰版,标准版采用至强 Platinum 8468处理器、512GB DDR5内存与两张RTX 5090 32GB显卡。产品通过自研的沙盒重定向加速技术与内存显存协同调度,让大模型在显存之外进一步利用系统内存空间,从而支持远超单卡显存容量的大模型本地运行,目前正在运行DeepSeek-V4-Flash等模型并持续进行长时间推理、并发任务与稳定性测试。
该产品性能对标英伟达DGX Station,售价约为其三分之一,主要面向初创团队等用户群体,预计今年10月正式发售。
海外动态
Google 为 Gemini 上线 Call for Me:可用本人号码代用户打电话
平台:Inside AI / Storyboard18 | 日期:2026-09-24
Google为Gemini推出Call for Me功能,可由AI代用户拨打商家电话,完成查询库存、预订餐位、改约时间、请求报价与留货等任务。通话使用用户本人号码并从其手机拨出,Gemini在接通后自我介绍并披露通话会被录音,用户可通过实时转写跟进内容并随时接管,模型可传递用户已授权的个人信息。
该功能目前为小范围实验,需Pixel 11、美国SIM卡、Google AI订阅与Phone应用公测版,仅支持美国号码并设有每日通话上限。
Google同时设置多项边界:不得用于紧急呼叫与营销外呼,不得完成支付,也不得分享信用卡号、密码与健康信息;转写存储于Google服务器、录音仅存本地,两者均不用于模型训练。
Google DeepMind 新负责人确认 Gemini 4 已进入后训练
平台:The Information / 量子位 | 日期:2026-09-25
Google DeepMind新负责人 Koray Kavukcuoglu 确认,Gemini 4已进入后训练阶段,公司将尽快放出早期版本并持续快速迭代。后训练是基础模型完成后进行行为对齐、指令遵循与安全护栏打磨的环节,谷歌未公布基准数据、参数规模与定价信息,也未说明外部用户可用时间。
该模型目前已在内部用于驱动智能体开发环境Antigravity,参与安全测试与护栏工作。社区同期在LMArena发现疑似Gemini 4 Pro的新检查点,同一提示词下前后两个检查点呈现明显不同风格,但谷歌未确认该条目归属,流传的基准表格也未获验证。
Meta 发布 Horizon Create 与 Horizon Studio:自然语言生成可玩 2D/3D 游戏
平台:cnBeta / 网易订阅 | 日期:2026-09-26
Meta公布Horizon Create与Horizon Studio两款AI游戏开发工具,用户输入自然语言即可生成可玩的2D或3D游戏,作品可直接接入Meta生态分发。两款工具均基于Meta Horizon Engine构建,生成内容包含完整进度成长系统、均衡难度机制、定制化美术风格与多人联机玩法。
Horizon Create为移动端独立应用,主打碎片化创作,用户可持续输入指令迭代角色形象、场景环境、关卡布局与难度参数;Horizon Studio在浏览器内运行,提供更高自由度的场景微调、资产替换与脚本参数编辑,并作为项目存档、版本迭代与上线发布的统一入口。两者共享同一后端,项目文件与游戏资产可无缝双向迁移,目前已开放抢先体验等待名单。
Supermicro 开始出货 NVIDIA Vera Rubin NVL72 液冷机架
平台:Engtechnica / Supermicro | 日期:2026-09-25
Supermicro开始出货NVIDIA Vera Rubin NVL72液冷机架,单机架集成72颗Rubin GPU与36颗Vera CPU,采用DLC-2直接液冷。18个1U计算托盘每托盘承载4颗Rubin GPU与2颗Vera CPU,通过9个第六代NVLink交换托盘互联,提供216 TB/s的扩展带宽。
机架内置20.7TB HBM4内存与最高54TB LPDDR5X内存,配套冷板、软管套件、机架电源架与冷却分配单元,单台冷却分配单元额定1.8MW并以N+1冗余部署,可选后门换热器回收余热。整套方案覆盖计算、冷却、供电与部署服务,按NVIDIA参考架构完成机架制造与集群部署。
Corpay 为 Corpay Complete 增补三个专用财务 AI 智能体
平台:FintechLaunches / Merchant's Eye | 日期:2026-09-24
Corpay在Corpay Complete平台内扩展专用AI智能体阵容,新增三个面向支出管理、语音报销与会计编码的智能体,本月起向符合条件的客户铺开。
嵌入式洞察智能体负责分析支出数据并自动标记异常,无需人工生成报表;AI语音助手智能体除用自然语言回答卡状态与交易问题外,还可通过语音指令创建并完成报销单;会计编码智能体为卡管理员自动编码交易,匹配对应的总账科目、税码与成本中心。
所有智能体运行在Corpay Complete内,沿用财务团队既有的控制与审计可见性,公司称后续还将继续增加智能体。
Meta 推出 Muse Realtime Avatar:实时同步语音与视觉表演
平台:Bicara IT | 日期:2026-09-26
Meta推出Muse Realtime Avatar,把Muse Realtime Voice转换为带表情与举止的交互形象,在实时对话中同步语音与视觉表演。该技术可让照片肖像、全身插画甚至非人对象做出连贯手势与表情,并在多轮对话中保持一致性,依托优化后的推理栈同时处理高保真视频生成与音频合成。
系统把语义内容与语调、情绪等副语言线索编码进同一流式表示,从传统的请求响应架构转向连续状态同步,以降低实时交互延迟。
技术与应用
研究测得智能体自报完成率显著高于评测通过率,最高相差 37.9 个百分点
平台:Carly AI News | 日期:2026-09-25
研究团队从智能体可见的提示词与技能说明中抽取509项任务要求,七款模型仅满足79.6%至86.4%,而自报完成率比评测通过率高出28.7至37.9个百分点。研究认为问题出在结构而非提示词写法,建议智能体可以规划、行动并请求确认,但只有外部按规格核验通过才宣告任务完成。同一批发布中,普林斯顿研究团队发现群体中欺骗性智能体比例上升会线性推高倒戈率,LLM智能体在欺骗者仍属少数时就会翻向错误答案。
Perplexity 用真实失败轨迹后训练计算机智能体,工具调用失败率降至 1.77%
平台:每日早报 / Perplexity | 日期:2026-09-26
Perplexity公布一项后训练研究,利用真实用户会话中的失败案例训练其计算机智能体,结合拒绝采样微调与提示引导自蒸馏,线上工具调用失败率由2.24%降至1.77%。研究把生产环境中的真实错误作为训练信号,而非只依赖合成数据或人工构造的失败样本。
Odyssey 发布 Agora-2 多智能体世界模型研究预览
平台:HeadsUpAI | 日期:2026-09-25
Odyssey发布Agora-2多智能体世界模型研究预览,可实时模拟共享交互环境,支持最多20个人类与智能体同时参与,其可玩研究预览允许4名人类对抗16个智能体。该系统作为可学习的游戏引擎,预测参与者动作会如何改变共享状态,从而让环境随交互实时演化,而不依赖预置脚本分支。
Fastino 发布 GLiNER2.5-Decide:3.4 亿参数 CPU 决策模型
平台:每日早报 / Fastino Labs | 日期:2026-09-26
Fastino Labs发布GLiNER2.5-Decide,这是一款3.4亿参数的开源决策模型,可在CPU上运行。模型接受文本与问题模式,返回结构化答案、概率分布与置信度,适合本地部署的决策场景,无需依赖显卡或云端调用。
对比语言模型 CLM-8B:延迟最多降至九分之一
平台:Bicara IT | 日期:2026-09-26
对比语言模型CLM-8B以对比学习目标连接状态与动作,在计算机使用与工具调用任务上以更小体量取得可比效果,延迟最多降低至九分之一。该模型被归为System One类型,直接生成结构化决策而非长篇文本,在智能体编程基准上刷新成绩,为对响应时延敏感的工具调用场景提供了新的选择。
网易有道 R2T2 与 T3PO 登顶 Hugging Face 语音识别与翻译 Trending 榜
平台:新智元 / Hugging Face | 日期:2026-09-25
网易有道开源的真流式语音识别模型R2T2与流式翻译模型T3PO在发布数日内双双登顶Hugging Face语音识别与翻译Trending榜,语音识别榜上R2T2位列第一,OpenAI的Whisper-large-v3居第六、英伟达Nemotron掉至第八,翻译榜由T3PO居首。社区开发者把R2T2核心机制用C++重写并合入audio.cpp主分支,摆脱Python与显卡依赖,在苹果M3芯片上以8倍实时速度运行;Hugging Face官方为其搭建ZeroGPU在线演示并提供免费算力,海外量化社区补齐从Q2到Q8的全套GGUF版本,可在llama.cpp与Ollama上直接运行。