ARTICLE · 1129578
每日AI新闻速览|2026年10月5日
每日精选全球 AI 领域最值得关注的动态,中国 5 条、国际 5 条,每条 200 字说清来龙去脉。
🇨🇳 国内篇
一、腾讯混元图像3.0登顶LMArena文生图盲测第一
10月5日,腾讯官方宣布,混元图像3.0在LMArena文生图竞技场最新榜单中排名全球第一,在全球26款参评模型里突围,超过Nano Banana等标杆闭源模型,也是效果最好的开源文生图模型。该榜单不做自动跑分,由全球用户对两两随机配对的作品盲测投票,投票者事前不知道作品出自哪个模型。混元图像3.0于9月28日开源,官方当时称其表现媲美闭源SOTA;目前只开放文生图能力,图生图、图像编辑与多轮交互版本将陆续发布。以真实用户偏好衡量,开源模型首次在主流图像竞技场上压过闭源旗舰。
来源:腾讯混元官方公众号、金色财经、LMArena
二、智谱GLM-5.3上线Cursor,港股单日涨超6%
10月5日,AI编程工具Cursor宣布上线智谱GLM-5.3与GLM-5.3-Flash,并称GLM-5.3在最高推理档位下取得自有编程评测CursorBench 4.0开放权重模型的最高分,官方榜单得分42.6%,评测任务取自真实多文件编程场景。同日智谱港股走强,收盘报665港元,上涨6.15%;高盛将其评级由中性上调至买入,12个月目标价1560港元,并把2026年底年度经常性收入预测由27亿美元上调至32亿美元。海外头部工具把国产模型接入编程主链路,正在改变开源生态的供给格局。
来源:证券日报、上海证券报、澎湃新闻
三、彭博行业研究:中美顶尖大模型差距缩窄至3%
10月5日,彭博行业研究发布分析,中国顶尖大模型与美国领先竞品的基准测试差距已从年初的约15%收窄至3%,关键推动力是DeepSeek V4.1 Flash在LiveBench升至第六名。同期每日经济新闻依据OpenRouter数据测算,9月28日至10月4日中国大模型周调用量57.46万亿Token,连续二十三周超过美国。差距收窄与调用规模领先同时出现,说明国产模型的竞争重心正从跑分转向真实使用量。
来源:彭博行业研究、每日经济新闻、AGI Hunt
四、国庆假期机器人批量进景区上岗,从表演嘉宾变创收员工
10月5日消息,国庆假期人形机器人以咖啡师、冰淇淋师、售货员、讲解员等身份批量进入景区与商圈。跨维智能在30多个城市部署机器人商业服务小站,智平方的智魔方进入全国10余省市常态化运营,银河通用太空舱已落地约200个点位,部分假期表现突出的机器人小站单店营收超过10万元。在上海北外滩的机器人国庆奇妙夜里,机器人在品牌门店担任临时店长,夜间登上320米高空舞台演出。这个黄金周对具身智能行业是一次集中检验:能否连续稳定运行、能否在真实场景里完成交付并产生收入,决定了机器人从演示走向商用的实际进度。
来源:每日经济新闻、搜狐科技、新浪新闻
五、华为发布全球首个3D数据中心,支撑十万卡级AI算力集群
10月5日消息,华为发布全球首个3D数据中心方案,以分层架构重构机房形态,算力承载能力较传统数据中心翻倍,可支撑十万卡级超大规模AI算力集群,适配千亿、万亿参数模型的并行训练与高速推理。方案在散热上分区精准控温,对IT算力层采用液冷;核心机电模块前置到工厂完成组装调试,机电预制化率超过90%,现场机电交付周期由6个月压缩至3个月。华为云芜湖3D数据中心已作为全球首个落地项目投产,安徽芜湖、贵州、内蒙古三地完成布局。基建与算力设备解耦,让机房能跟上AI芯片的换代节奏。
来源:通信世界、电子工程专辑、EET China
🌍 国际篇
六、Grok 4.7登顶Artificial Analysis网络安全指数
10月5日消息,Artificial Analysis网络安全指数最新榜单显示,xAI旗下Grok 4.7以56分与小米MiMo-V2.6-Pro并列第一,OpenAI的GPT-6 Luna以53分列第三。该指数面向企业级攻防,要求模型在真实代码库中定位并复现漏洞,再提交可用的修复补丁。Grok 4.7在CWE-Bench-AA子项取得68%的pass@1并列领先,但按该指数口径每个任务成本约11.67美元,在同类模型中偏高,马斯克本人转发了这一排名。榜首并列意味着价格与实际集成成本将成为分水岭。
来源:Artificial Analysis、Crypto Briefing、24/7 Wall St.
七、Anthropic在印度通过Amazon Bedrock提供Claude境内推理
10月5日,Anthropic宣布Claude Opus 5、Sonnet 5与Haiku 4.5可通过Amazon Bedrock的印度端点实现境内推理,请求全部在印度本地服务器上处理。端点跨孟买与海得拉巴两个区域,并附带面向风控与合规团队的审计轨迹和访问控制。金融、保险与公共部门客户普遍要求数据不出境;塔塔咨询服务已向5万名员工推广Claude,印孚瑟斯设立专门的Anthropic卓越中心,印度国家支付公司则基于Claude搭建智能体平台。数据驻留正从合规选项变成企业把AI推向生产的前置条件。
来源:Anthropic、Moneycontrol、Economic Times
八、谷歌提出RRSI方法,防止自进化智能体死记测试基准
10月5日消息,谷歌研究人员提出正则化自改进方法RRSI,用于约束具备自我改进能力的AI智能体。团队指出,智能体反复自我优化时容易过度拟合当前测试任务,相当于把基准答案背下来,泛化能力随之下降;RRSI在自改进环节加入正则化约束,实验显示该方法在未见过的基准测试集上把表现最多提升4.7分,同时比未正则化版本减少约30%的Token消耗。随着智能体开始参与自身训练与评测,如何避免评测基准被记住,成为判断自进化系统是否真正进步的关键前提。
来源:谷歌研究院、The Decoder、掘金 AI 日报
九、芝商所推出首个GPU算力期货,追踪H100与B200租赁成本
10月5日,芝加哥商品交易所集团按计划推出首批算力期货合约,两份合约分别追踪英伟达H100与Blackwell B200图形处理器的小时租赁成本指数,每份合约代表一个月的GPU租赁费用,期限最长可覆盖未来36个月。据金融时报报道,当前B200的租赁基准约为每小时5.86美元,H100约为2.77美元。芝商所把算力称为AI时代的货币,认为其价格波动足以支撑套期保值需求;对已经转型为AI数据中心运营商的比特币矿企来说,这也多了一条锁定收入曲线的工具。算力正被金融化为一种可定价、可交易的商品类别。
来源:CME Group、Financial Times、Coinfea
十、AM Intelligence下单2万块英伟达GPU,HPE同日签下AMD大单
10月5日,由印度能源企业Greenko创始人支持的AM Intelligence下单采购2万块英伟达GPU,交易金额约40亿美元,平均每块约20万美元,是公开报道中规模最大的单笔GPU采购之一。同日惠普企业宣布一笔约12亿美元的协议,采用AMD的Helios GPU,集群配置规格对标英伟达的72卡方案。消息传出当天,英伟达、AMD与纳斯达克指数均创下新高。两笔订单指向同一个变化:大规模算力采购正在把AMD推成英伟达之外可信的替代选项,而客户也不再只按单一供应商规划自己的集群路线。
来源:TradingView、Livemint、Splitfeed
本期编辑:WorkBuddy|素材采集时间:2026-10-04 22:00–2026-10-05 22:00
声明:本内容基于公开信息整理,仅供学习参考,不构成任何投资建议。