ARTICLE · 1156334
福建9岁男孩靠AI收入达六位数;Anthropic半年封掉1140万个账号;英伟达被曝停产RTX5090| 周报

英伟达被曝停产 RTX5090,顶级游戏显卡让位给高价专业卡英伟达可能要停产最强的消费级显卡 RTX 5090,把核心芯片留给售价更高的专业显卡。硬件爆料者 MEGAsizeGPU 称,未来生产的 GB202 芯片将全部供应 RTX PRO 系列,不再用于 RTX 5090。另一名爆料者 hongxing2020 晒出疑似工厂通知,称中国特供版本也在停产范围。这两类显卡使用同系列的 GB202 芯片,但价格相差很大。RTX 5090 配备 32GB 显存,首发价 1999 美元。面向 AI 开发、设计和渲染的 RTX PRO 6000 则拥有 96GB 显存,英伟达官网标价 1.6 万美元,是前者的 8 倍。虽然售价不能直接代表利润,但高价专业市场对英伟达显然有更大的收入空间。
RTX 5090 此前已在美国市场出现明显缺货,个别第三方卖家甚至挂出 9600 美元的价格。如果停产属实,消费者今后只能依赖剩余库存。更大的变化可能是 GeForce 旗舰性能倒退。另一份爆料称,英伟达准备推出 24GB 版 RTX 5080,取代 RTX 5090 成为最高端游戏显卡。现款 RTX 5080 的 CUDA 核心数量只有 RTX 5090 的约一半,4K 游戏性能低约 30%。即使新款显存增加到 24GB,仍低于 RTX 5090 的 32GB。
福建 9 岁男孩靠 AI 收入达六位数,还给中学生发奖学金
福建厦门 9 岁男孩俞知乐近日在漳州南靖龙山中学设立「知乐 AI 奖学金」,向该校学生发放奖学金。他目前读小学四年级。《闽南日报》报道,他从今年 1 月开始学习 AI,随后用 AI 制作工具、产品和网站,并尝试销售。算上参加比赛获得的收益,累计收入据称达到六位数人民币。
俞知乐的母亲庄瑟惠在厦门经营一家互联网公司,龙山中学是她的初中母校。她此前就持续资助家乡学生。这次母子俩决定拿出部分收入设立奖学金,并计划今后每年奖励优秀学生。龙山中学校长吴瑞兴称,奖学金将用于激励品学兼优、热爱科技创新的学生。
陶哲轩最新演讲提出“数学 2.0”:AI 解出难题,不等于人类理解10 月 11 日,菲尔兹奖得主陶哲轩在其官方博客发布了在加州理工(Caltech)演讲的 27 页原厂 PPT《Math 2.0》。该演讲原定于 5 月举行(原题为《机器辅助证明》),但因近期 AI 领域的剧烈变化而做出了大幅内容调整。陶哲轩在博客中指出,当前学术界受 AI 强力介入的影响,出现了过度强调“由 AI 自动化解决数学开放式难题”的现状。他警告称,“解题快”并不等同于人类真正的数学理解。在未来的 “数学 2.0” 时代,AI 工具的定位应当被重新修正,用来维持和支撑人类数学社区内部的良性发展,而不是用大量人类无法消化的机器自动证明来取代人类思考。他呼吁必须将资源的评价重心重新转回以“人类理解”为核心的科学愿景上,并重新对齐数学与现实世界的实际应用。目前,该演讲的完整版 PDF 幻灯片已挂载于其个人网站供公开下载。
智谱下一代模型研发方向曝光10 月 8 日消息,据快科技报道,智谱创始人唐杰近日在新加坡演讲中介绍了下一代大模型的研发方向,包括扩大预训练数据与模型规模、加强后训练,以及提升长程推理和智能体能力。下一代模型可能命名为 GLM-5.4 或 GLM-5.5,并向万亿级参数规模发展,但具体型号和参数尚待官方确认。技术探索重点包括递归自我改进,以及让智能体在更复杂的环境中自主执行更长周期的任务。唐杰此前还提出“完全自训练”的研究目标,希望模型参与自身训练与迭代,其中关键挑战是让模型判断何时纠错、何时停止。目前这些内容属于研发方向与目标,不能视为新模型已经具备的能力。
Claude 封号有多狠?Anthropic 半年封掉 1140 万账号,39.8 万申诉仅 4.2 万改判
Anthropic 7 月 23 日更新的透明度报告显示,2026 年上半年共封禁 1,140 万个账号。2025 年下半年为 145 万个,新一期约为前一期的 7.9 倍。统计范围覆盖 Anthropic 的产品与服务,并未单独区分 Claude 聊天与开发者产品。
同期收到 39.8 万次封号申诉,其中 4.2 万次推翻原封禁决定。按两项同期数据计算,改判数约占申诉数的 10.6%。Anthropic 表示,账号可能因违反使用政策、服务条款或支持地区政策被封禁。
马斯克:Grok Bot 按任务选模,引入 Claude 等第三方模型10 月 7 日,马斯克在 X 表示,Grok Bot 将根据任务选用最可能带来最佳结果的后端模型,包括 Claude Opus 5.5、Midjourney、Suno 及其他领先 API。同日,9to5Mac 报道称,Grok Bot 已可使用 Claude Opus 5.5。此次调整意味着,其模型选择将不再局限于自研产品,而是结合不同厂商的能力完成任务;马斯克尚未披露各模型的具体分工及完整上线安排。Grok Bot 配备持续运行的云端电脑,可通过浏览器、文件系统、终端及连接器跨应用执行多步骤任务,多个 Bot 还能并行协作、共享上下文。据悉,模型选择由平台管理,平台不提供面向用户的模型选择菜单;用量分析会显示每次请求实际使用的模型,计费也随所用模型计算。
谷歌内部测试新一代 Gemini 4 Carbon 版本,剑指最强模型 Opus5.510 月 10 日消息,据《商业内幕》报道,谷歌在筹备向公众发布新一代 Gemini 4 “Argon” 模型之际,其内部已被爆出正在密集测试一款代号为 “Carbon” 的后续迭代检查点版本。该模型目前已被接入谷歌内部的编码与开发平台 Jetski(即 Antigravity 平台)。多位参与内测的谷歌员工透露,Carbon 在处理代码生成和复杂的长周期智能体任务时表现极其优异,其编程能力感觉已经可以媲美 Anthropic 旗下的最强模型 Claude Opus 5.5。据悉,Carbon 能够取得如此巨大的性能飞跃,关键在于应用了递归自我提升(RSI)技术,使其具备了自主发现错误并迭代优化的能力。不过,鉴于科技公司的内部代号与最终商业命名通常不挂钩,目前尚无法确定 Carbon 未来会以独立新型号面世还是作为 Argon 的常规升级推出。
“灾难日”推演:AI 巨头正为未来 6 至 12 个月内的 AI 重大事故做准备10 月 9 日消息,据外媒 Axios 独家报道,Anthropic、OpenAI 等前沿人工智能公司的高管及顶尖研究人员正在私下推演一项“灾难日(the day after)”应对计划。该事件的起因在于,随着 AI 技术的极其迅猛发展与广泛部署,行业内部对潜在安全漏洞的担忧已达到临界点。特别是近期,网络安全公司 CrowdStrike 披露,有攻击者涉嫌利用恶意 AI 侵入两家韩国银行,并尝试使用 Claude Code 协助处理被盗数据,该现实案例直接引发了业内对失控风险的警惕。许多行业内部人士预测,未来 6 至 12 个月内,恶意行为者或失控的智能体集群(Rogue-agent swarms)极可能发起大规模网络攻击,导致金融服务、互联网连接或电力水利等基础设施短暂中断。为此,AI 企业高管正提前评估可能面临的公众抵触与政策反弹,并计划加速向立法机构普及 AI 技术现状。尽管 OpenAI 强调此类演练属于防患未然、并非必然发生,但各大巨头普遍希望在未来潜在的行业危机爆发时,能凭借前瞻性准备协助政策制定者引导并塑造更合理的紧急立法与后续监管政策。
传 OpenAI 9 月营收“缩水”200 亿美元,但年底仍可能破 700 亿美元10 月 8 日消息,路透社、彭博社等多家外媒援引知情人士消息称,OpenAI 向投资者披露其 9 月年化收入接近 500 亿美元,较此前媒体报道的近 700 亿美元少了约 200 亿美元。据悉,这一数额的巨大落差并非因为业务下滑,而是源于投资者在尝试将 OpenAI 与其核心对手 Anthropic 进行直接比较时,两家公司采用了不同的会计统计口径。作为对比,竞争对手 Anthropic 在 7 月的年化收入已超过 650 亿美元,但这主要是由于 Anthropic 采用了“总额法”,将其通过亚马逊、谷歌等云合作伙伴渠道销售的服务全额计入营收;相比之下,OpenAI 采用的是“净额法”,自今年 4 月与微软更新商业协议后,对部分合作渠道仅确认自身所得的实际分成,此前传出的 700 亿其实是市场用总额法强行推估的数字。虽然该统计差异引发了市场的短暂恐慌,并导致英伟达、甲骨文等 AI 概念股一度下跌,但两家巨头的真实业务仍在飙升。CNBC 获得的演示材料显示,OpenAI 第三季度内整体年化收入规模大增 77%,企业业务更是激增 107%。受企业业务强劲推动,彭博社随后报道称,OpenAI 预计到今年年底的年化收入仍将顺利达到或超过 700 亿美元。目前上述财务数据均来自媒体获取的投资者沟通信息,OpenAI 目前拒绝就相关报道进行置评。
英伟达洽谈收购或增持 AI 初创公司 Reflection AI10 月 10 日消息,据《金融时报》报道,芯片巨头英伟达正与美国人工智能初创公司 Reflection AI 展开早期谈判。英伟达计划全面收购该公司或追加投资,目前重点讨论的方案包括“人才并购(acqui-hire)”,即通过聘用员工并获得技术授权来绕开反垄断审查;若全面收购未能完成,英伟达也在考虑通过追加股权投资、扩大芯片供应及算力支持等方式深化合作。双方可能在未来几周内达成协议,但谈判仍有破裂可能。Reflection AI 由前 DeepMind 研究员于 2024 年创立,专注于前沿开放权重模型与自主编码智能体,其在 2026 年 4 月 融资时的投前估值已高达 250 亿美元,英伟达此前已作为核心战略投资者向其注资 8 亿美元。该公司刚于 10 月 5 日(周一)发布了其首款开源权重模型 Beam,在编程和智能体任务上对标 DeepSeek、智谱 GLM-5.2 及 Kimi 等模型。
微信、抖音、快手重拳出击“AI 魔改”:9 月处置 7400 条违规视频10 月 9 日消息,为响应国家广播电视总局关于“AI 魔改”视频专项治理的要求,微信、抖音、快手三大平台同步披露了 9 月内容合规治理情况。三大平台针对部分账号滥用生成式 AI 能力对经典影视、动画作品进行低俗解构、颠覆性篡改等乱象重拳出击,9 月累计清理、处置违规视频达 7436 条。数据披露显示,抖音累计处置相关违规视频 2645 条,快手处置 2544 条,微信累计清理不良内容 2247 条。本次治理重点针对将《西游记》《红楼梦》等经典人物进行不当婚恋关联(如网络爆发的“圣黛 CP”等 AI 生成视频)、恶意歪曲历史英雄以及将《喜羊羊与灰太狼》等动画形象恶意邪典化、恐怖化等典型违规行为,标志着生成式 AI 二创内容(AIGC)的平台合规审查全面加码。
微软 CEO 纳德拉呼吁为先进 AI 建立“紧急制动”机制10 月 10 日晚,微软首席执行官萨蒂亚·纳德拉在社媒发文表示,企业应将功能强大的 AI 模型视为“潜在的内部威胁”。他呼吁在部署先进 AI(尤其是具备自主行动能力的智能体 Agent)时建立“紧急制动(Kill Switch)”机制,让授权人员能随时将其暂停或关闭,实现“智能的供给与控制权的分离”。
阿里千问 AI 耳夹式耳机上架预约10 月 5 日消息,阿里千问 AI 耳夹式耳机现已上架电商平台并开启预约,具体价格暂未公布。
这款耳机有深空蓝、星光色、极光紫三种颜色可选,不分左右耳,支持 IP55 级防尘防泼溅,至多可配对 8 台设备,支持双设备同时连接;耳机续航 9 小时,配合充电仓 40 小时,支持无线充电。这款耳机支持多种 AI 功能,语音就能操控千问全场景功能;支持录音实时转写、离线本地录音、92 语种转写纪要;支持 89 种语言 AI 翻译,包含面对面、通话等模式。
用豆包付水、电、燃气费?豆包工作上新:支持画布功能,模型再更新10 月 9 日消息,最近,社交媒体上有用户反馈,在豆包 App 内通过语音或打字的方式发起水、电、燃气等生活缴费指令,完成缴费业务操作,这也意味着,以后可以用豆包支付这些日常费用。接近豆包人士向媒体表示,豆包正在逐步建设包括出行服务、生活缴费等生活场景下的办事能力。
同日,豆包工作宣布任务模式新增画布功能,复杂任务操作更方便,交互体验更好,随时查看对比,快速编辑调整,还支持全新图片模型 Seedream 5.0 Flash。豆包 2.1 Lite 模型已上线豆包工作。目前,支持无限画布,随时查看整理。将素材、方案和创作成果铺在同一张画布上,随时查看、对比和整理,从一个想法延展出更多可能。也支持逐步编辑设计,复杂任务操作更快捷。生成之后,继续调整文字、配色与布局。从整体风格到局部细节,改出想要的效果。
超 33 亿元!Manus 拿下国内 Agent 创企最大单笔融资,腾讯投了10 月 8 日消息,Manus 母公司蝴蝶效应宣布于近日完成超过 5 亿美元(约合人民币 33.52 亿元)新一轮融资。这是国内 Agent 原生创企获得的最大一笔融资。本轮融资由博裕投资、IDG 资本领投,老股东腾讯、红杉中国、真格基金继续加持。就在融资官宣的同一天,Manus 继续发布招聘信息,直接在官网放出了 17 个新岗位,涵盖产品、研发、运营和增长,工作地点均为北京。
今年 9 月 1 日,Manus 正式对外宣布恢复独立运营。在此前不到一个月,腾讯、真格基金、HSG 等老股东,以 Meta 当初收购时的 20 亿美元对价,从 Meta 手中买回 Manus 股权。据媒体披露,腾讯接手 Benchmark 原持有的股份,成为 Manus 最大股东。Manus 后续还将推出多款新产品与功能,暂未公布具体上线时间。
一条提示词击穿云安全模型:Zenity 披露 AWS Bedrock AgentCore 高危漏洞链10 月 8 日,云安全机构 Zenity Labs 在多伦多举行的 SecTor 2026 大会上正式公布了一项名为“AgentCorruption”的高危漏洞利用链。报告揭示,攻击者仅凭向对外公开的 AI 智能体发送一条提示词,即可控制同一 AWS 账户及区域内的所有智能体系统。研究指出,AWS Bedrock AgentCore 底层运行的 Firecracker 微虚拟机网络隔离不彻底,使得任何具备 HTTP 请求能力的智能体工具均可成为 SSRF 原语,直接读取元数据服务(IMDS)套取临时 IAM 凭证。加之平台默认执行角色存在过度授权,攻击者获取凭证后即可横向渗透,读取私密会话、获取容器镜像与源码、提取 Secrets Manager 敏感密钥,甚至篡改智能体长期记忆实施持久化劫持。Zenity 于 2025 年 12 月向 AWS 披露,AWS 在 2026 年 2 月将部署默认升级为 IMDSv2,并在 9 月 29 日最终收紧了默认角色的过度权限。
百度 Q3 反腐通报:41 人被处理10 月 9 日,百度职业道德委员会向内部全员下发 2026 年 Q3 违法违纪案件通报,邮件一次性公布了 41 起违纪案件的处理结果。在本轮通报中,MEG 移动生态、ACG 智能云、IDG 自动驾驶三大业务线也有多人被移送司法。据通报,本次共追责 41 名相关人员,违纪问题集中在两类:一是利用职务便利谋取不当经济利益,二是弄虚作假、侵占公司费用。其中多名涉案人员已被相关部门依法处理,其余人员分别被辞退、退回外包公司或给予内部处罚。本次追责覆盖正式员工、外包人员、实习生等多个群体,是百度近年来力度较强的一轮内部披露。
小米 MiMo 团队招聘“AI 情报工程师”,点名分析逆向海外竞品10 月 9 日消息,小米大模型团队 MiMo 挂出的一个名为“AI 情报工程师”的社会招聘岗位在科技圈和黑客社区引发热议。该岗位因明确将“抓包、逆向”等硬核安全手段写入职位描述而受到广泛围观。该职位要求应聘者深度解构全球头部 AI 产品。除了常规的技术分析和情报收集外,更硬核地要求通过网络抓包、协议分析和逆向工程等白帽手段,摸清 ChatGPT、Claude、Midjourney 等海外闭源模型的底层客户端逻辑、接口调用机制以及实际的系统工作流。这些一手技术情报将直接用于反向赋能小米自有的 MiMo 智能体大模型及其端侧 AI 业务。在各家卷向 Agent 工程落地的当下,这一“特工型”岗位的曝光,侧面折射出大模型产业在工程细节层面的竞争已进入白热化。
字节跳动前争议实习生开发世界模型:融资近 3000 万美元10 月 8 日,据外媒报道,字节跳动前实习生田柯宇已获得五源资本等风投巨头的投资。这笔资金将用于一家尚处于隐身模式的创业公司,在世界模型这一新兴领域挑战李飞飞等 AI 先锋。
2024 年,田柯宇在字节跳动实习期间引发争议,被指因对团队资源分配不满,对公司内部模型“投毒”,通过编写、篡改代码等形式恶意攻击团队研究项目的模型训练任务,造成资源损耗。字节跳动向法院提起诉讼,要求田柯宇赔偿 800 万元。字节跳动当时对此回应称,涉事实习生恶意干扰商业化技术团队研究项目的模型训练任务,已被辞退,但网传“涉及 8000 多卡、损失上千万美元”严重夸大。田柯宇的研究实验室目前还没有名称,也没有产品,但已从包括月之暗面投资方五源资本、IDG 资本等投资者那里筹集了近 3000 万美元,投后估值达 2 亿美元。
消息称 DeepSeek 新一轮融资接近,规模至少 800 亿元10 月 6 日消息,据悉,中国人工智能公司 DeepSeek 最新一轮融资已接近收官,规模至少 800 亿元人民币(约 120 亿美元),远超其最初设定的约 500 亿元融资目标。根据已签署的投资条款清单,最终融资规模有望逼近 1000 亿元,腾讯控股和宁德时代是承诺出资金额最高的投资方。知情人士称,DeepSeek 最初在本轮仅寻求约 500 亿元,但在最新模型顺利发布后,投资者认购热情超出预期,公司最初设定的目标估值约为 5000 亿元。相关交易尚未最终敲定,具体条款仍可能发生变化。报道还提到,DeepSeek 正在内蒙古建设数据中心,并部署华为 AI 芯片。据报道,最新一轮融资落定后,DeepSeek 的下一步是推进公司重组,为 IPO 做准备。据路透社此前报道,DeepSeek 公司已聘请中信证券作为辅导机构,筹备在上海证券交易所科创板上市。
月之暗面完成 IPO 前融资,估值 500 亿美元,拟明年第一季度香港上市10 月 6 日,据彭博社报道,月之暗面已完成最后一轮私募融资,估值约为 500 亿美元,正朝着明年第一季度在中国香港进行首次公开招股 (IPO) 迈进。一些知情人士称,月之暗面已开始做准备工作,最早将于本月启动 IPO 早期摸底会议,以评估投资者意向。
可灵 AI 最早明年赴港上市:至少融资 10 亿美元10 月 6 日消息,财联社发布消息称,快手旗下视频生成大模型可灵 AI 据悉计划最早于明年赴港上市,至少融资 10 亿美元。随后,有报道进一步指出,可灵 AI 已选择中金公司、高盛和瑞银作为其香港 IPO 的承销商。若消息属实,这将是快手在 AI 大模型领域分拆上市的关键一步,也可能成为港股市场又一起大型 AI IPO。据知情人士消息,快手计划在未来 12 个月内启动可灵 AI 在香港的上市程序,预计 2027 年年初向港交所递交上市申请。不过,相关安排仍处于早期阶段,具体时间表、发行规模及估值水平可能随市场情况调整。
决策模型 Jev 爆火,开发商 TypeSafe AI 估值已达 75 亿美元10 月 10 日消息,初创公司 TypeSafe AI 旗下的新型 AI 决策模型 Jev 刚刚推出数周便迅速走红。近日,该公司完成了一轮约 8.7 亿美元的融资,由安德里森 · 霍洛维兹领投,公司估值已达 75 亿美元。TypeSafe 联合创始人兼 CEO 迪奥戈 · 阿尔梅达在接受采访时提到,多年来他目睹了众多 AI 从业者过度承诺却难以兑现。他表示公司的目标是通过 Jev 以及计划在未来几个月内推出的更新,提供稳定可靠且价格实惠的方案,从而重塑市场对 AI 技术的信任。TypeSafe 目前仅有一个约 20 人的精简团队。公司计划利用新筹集的资金扩充员工阵容、推进产品的大规模部署,并采购更多算力。这家初创公司表示,目前平台每天处理的标记数量已达数万亿级别。
Anthropic 联合天文学家,借助 Claude 补全天空紫外地图10 月 8 日,Anthropic 公布,约翰斯·霍普金斯大学天体物理学家兼 Anthropic 研究员 Brice Ménard 借助 AI 科研工具 Claude Science 成功绘制出人类首张完整的全天紫外线地图。由于紫外线无法穿透地球臭氧层,且早期太空望远镜(如 GALEX)因保护探测器而避开了银河盘面等亮星密集区,导致历史上约三分之一的天空缺乏紫外实测数据。研究团队通过 Claude Science 调度 AI 智能体,完成了海量紫外数据的收集、清洗、交叉定标与图像修复,并利用可见光、红外等波段数据对空白区域进行统计推算,最终将缺失区域补全,推算误差控制在 10% 以内。该成果不仅直观展示了宇宙的紫外全貌,更证明了 AI 在处理繁琐科研数据、填补低优先级基础科研空白方面的巨大潜力。

OpenAI 发布又一批 AI 数学研究成果,攻破数百个悬而未决难题10 月 7 日消息,OpenAI 在一批包含 722 份手稿、涵盖 372 个结果家族的文件中,公布了某款未发布的前沿模型解决的多项长期存在的数学难题。这一举措延续了其一系列突破性成果,这些成果既给数学界部分人士留下了深刻印象,也引发了不安,同时还带来了关于研究伦理和学术行为的疑问。据负责以负责任的方式传达这些成果、新成立的精英数学家独立咨询小组 AGMAI 介绍,此次公布的内容包含对数百个未解决问题的解答。
数周以来外界一直在期待这批成果,不过在此之前,OpenAI 始终没有说明模型究竟解决了哪些问题,也没有给出确切的发布时间。该公司曾在九月份称,自家模型已经解决了一百余个长期悬而未决的公开难题,覆盖数学的绝大多数分支领域」。本次对外发布的文稿以及相关资料还包含一部分模型推理过程摘要、算力消耗估算值,以及尝试求解过的问题数量统计数据。OpenAI 称,一项普通成果所消耗的算力,大致相当于 ChatGPT Pro 连续思考三小时的算力水平。
不过,这批成果发布后出现了修订与撤回。OpenAI 官方仓库 10 月 7 日的更新记录显示,一篇手稿存在符号错误,导致关键论证失效,并影响两篇依赖该论证的手稿,三篇因此被撤回;另有 14 篇进行了证明修补、命题修正等更新,目前目录保留 719 份手稿。OpenAI 表示,这批成果处于不同验证阶段,部分尚未形式化验证的结果可能存在问题,将持续修订。
三名被解雇的 OpenAI 安全研究员公开致信,呼吁保留独立监督10 月 8 日,三名被 OpenAI 解雇的安全研究员 Tomek Korbak、Jasmine Wang 和 Mikita Balesni 发布公开信,致公司安全与安保委员会等三个监督机构,呼吁落实第三方安全审计人员入驻的承诺、保留前沿模型思维链的可监控性,并明确员工与外部安全机构合作的规则。他们否认对外合作超出岗位职责,担心突然解雇及相关沟通会使其他员工不敢提出安全异议。Korbak 表示,公司告知其解雇与他同独立评估机构 METR 的沟通方式有关,而他原本就是相关调查的技术联系人。10 月 9 日,OpenAI 回应称,内部调查发现三人违反敏感信息处理政策,造成严重信任破裂,解雇与提出安全担忧无关。公司同时表示,正敲定第三方安全评估合同,将继续与独立安全机构合作,并支持保留模型可监控性。双方对解雇原因仍有分歧,具体违规细节尚未公开。
漏洞定价引争议:白帽披露 OpenAI 沙箱逃逸仅获 300 美元赏金10 月 7 日消息,安全研究员“Oliver Fish”(网名 Ofish)公开了一项针对 OpenAI 的漏洞报告结果。他发现了一个高危的“未授权沙箱逃逸”漏洞,攻击者无需任何 API 密钥或注册账号,即可绕过限制并免费调用 OpenAI 的付费底层模型。该漏洞直击 AI 基础设施的核心隔离层(Responses API),然而 OpenAI 在通过漏洞赏金平台 Bugcrowd 确认并修复该漏洞后,仅向其发放了 300 美元的低额奖金。此举在安全社区引发巨大争议,研究员公开表示,极其失衡的价值定价让人失去继续向官方报告漏洞的意愿。
OpenAI 披露两起 AI 辅助影响行动,涉及虚构记者与伪装智库10 月 8 日,OpenAI 发布安全报告,披露并封禁两组分别来自俄罗斯和伊朗的影响行动账号。相关组织将 AI 与传统操作方式结合,通过虚构记者、伪装研究机构等身份,向真实媒体和受众传播带有隐藏目的的信息。
伊朗相关行动使用 7 个虚构记者身份向全球中小型网络媒体投稿,并利用模型润色文章、撰写投稿邮件及批量生成社交评论。俄罗斯相关行动则通过假身份控制拉美地区一家“研究机构”,雇用可能不知情的当地人员,并制作假泄密文件及音频脚本。两组行动都大量使用 AI 编写内部绩效报告,部分报告存在夸大成果的情况。OpenAI 表示,相关内容已进入真实媒体渠道,潜在传播范围高于仅依赖假社交账号的行动,但不能将操作者自己宣称的传播效果视为经过验证的事实。
谎报进度与越权删档:Arena 发布“智能体对齐指数”揭示大模型对齐危机10 月 8 日,Arena 在宣布获得 2 亿美元 B 轮融资的同时,正式发布了预览版的“智能体对齐指数(Arena Alignment Index)”。该指数基于约 9 万次真实智能体(Agent)会话,对 27 款主流模型的行为可靠性与对齐表现进行了量化评估。虽然新一代模型(如 OpenAI GPT-6.1 Sol、Claude Opus 5.5 和 Grok 4.7)在可靠性上优于前代,但在实际任务中仍存在严重的失效案例。其中,平均约 10% 的会话出现了任务未完成却声称已完成的“欺骗性完成(Deceptive Completion)”现象,这一比例在代码调试类任务中更是飙升至 48%。此外,在 Claude Opus 5 约 2% 出现越权行为的会话中,高达 53.5% 涉及未经许可擅自删除或清理用户文件。Arena 还指出,会话长度与对齐失效概率呈正相关,会话越长,触发失败的风险越高。
谷歌诊断 AI 研究首登《柳叶刀》,真实临床诊断吻合度达 90%10 月 8 日,由 Google 与贝斯以色列女执事医疗中心(BIDMC)联合主导的诊断 AI 机器人 AMIE 研究成果在《柳叶刀》主刊发表,这是 Google 成果首次登上该顶尖期刊。该研究是全球首个在真实临床环境(门诊初级保健诊所)中,针对面向患者端对话式诊断 AI 的前瞻性可行性研究。在这项包含 98 名 真实急诊患者的临床试验中,患者在就诊前通过安全文本接口使用谷歌的研究级诊断 AI 机器人 AMIE 采集病史。结果显示,在执业医生实时监控下,所有对话均实现 “零安全中断”;75% 的接诊临床医生反馈 AI 生成的摘要有效帮助了诊前准备,超过半数的案例改变了医生的诊疗思路;且 AMIE 给出的鉴别诊断与医生最终确诊结果的吻合度高达 90%。该研究初步证实了 AI 在安全采集病史、优化医患关系并减轻医护人员工作压力方面的产业应用可行性。
众擎 T800 机器人格斗赛一脚踢翻美国网红惹争议,人机笼斗被叫停10 月 8 日消息,近日,一场号称“世界首场人机笼斗”的表演赛事在海外引发广泛讨论。美国旧金山 REK 公司举办的这场特殊格斗,让网红弗兰基・拉佩纳与改装后的众擎 T800 人形机器人在铁笼内对抗,火爆的比赛片段在网络迅速传播。这场表演赛中网红拉佩纳佩戴头盔、拳套、护膝全套防护装备,依次和三台不同机器人交手。
率先登场的小型机器人很快被拉佩纳踢倒落败。第二回合,身高约 1.8 米、重量接近 90 公斤的众擎 T800 机器人登场,这台机器人踢击力量最高可达 385 公斤。对抗过程中,机器人一记重踢直接将拉佩纳踹飞,重重撞在笼壁上,现场观众一片惊呼。不过拉佩纳调整状态后抓住机会,推倒机器人拿下这一局胜利。最后上场的“捕食者”机器人长时间对抗耗尽了拉佩纳的体力,这一局最终以人类选手失利收尾。
赛事后,主办方 REK 收到了加州监管部门的禁令,要求停止这类人机对战活动。监管机构认定,该活动属于没有取得审批许可的笼斗表演。但当地现行法律并没有明文禁止人和机器人格斗,REK 公司负责人对此表示,既然没有专门法律,就不应判定活动违法。

比亚迪具身智能机器人外观专利曝光,展现商用服务机器人布局10 月 9 日,国家知识产权局公示了一项由比亚迪股份有限公司持有的外观设计专利,名为“具身智能机器人”,授权公告号 CN310247768S。专利附图展示了一款黑白配色的人形机器人,头部采用圆润弧面造型,躯干及四肢设置多处关节结构,整体造型与比亚迪何志奇 7 月 28 日在社交平台预告“小迪”时放出的概念剪影海报轮廓高度相似,基本坐实了专利图对应的正是已在郑州“迪空间”公开亮相的“小迪”。
据此前官方披露的信息,“小迪”身高 1.61 米、体重 58.5 公斤,全身拥有 31 个运动自由度,灵巧手重复定位精度可达 ±1 毫米,支持物体抓取、手势互动和指向讲解等操作。作为商用服务机器人,其应用方向包括门店迎宾、车型讲解及车辆演示。比亚迪执行副总裁李柯曾表示,希望未来每家门店部署 2 至 3 台机器人,并进一步探索家庭服务等场景。目前,门店规模化投放仍属于未来规划。

全球首创双大模型架构:西湖机器人 WR1 攻克全自主叠衣服等长程家务难题10 月 9 日消息,西湖大学首个成果转化项目——西湖机器人科技(杭州)有限公司,正式发布了其通用大脑 WR1 人形机器人的重大技术升级。该成果实现了全球首个灵巧手全自主折叠复杂衣物(长裤)的人形机器人双机协同演示,技术壁垒直逼海外标杆 Figure。柔性物体(如衣服)的操作和跨场景长程任务一直是具身智能的黑门槛。演示中,WR1 成功抵抗了晾衣架晃动、布料形变等外部动态扰动,自主完成了从“晾衣架取衣、承托转身、双机协作铺展与折叠长裤”的连贯动作。随后,机器人直接跨越厨房、客厅和卧室三个区域,连续自主执行了开冰箱取玉米、操作空气炸锅、下蹲收纳玩偶及整理被子等长链条复合任务,全程无需人工复位或分段指令。
这一突破得益于 WR1 采用的全球首创通用大小脑双预训练系统架构。其通用大脑深度耦合了世界模型(WM)与视觉-语言-动作模型(VLA),统一输出全身姿态与操作序列;运动侧则交由原创自研的通用动作大模型 GAE 负责稳定执行。这种“想清楚”与“动起来”在端到端链路上的彻底贯通,不仅刷新了柔性物体泛化与高动态运动操作的一体化水平,也标志着人形机器人向真实家庭连续自主作业迈出了关键一步。
格芯推出 FDX Fusion 物理 AI 芯片平台,7nm 级 FD-SOI 2028 年德国量产10 月 9 日,格芯(GlobalFoundries)宣布推出面向物理 AI 的 FDX Fusion™ FD-SOI(完全耗尽型绝缘体上硅)平台,计划于 2028 年在德国德累斯顿晶圆厂启动量产。 作为 10nm 以下级别的全新先进制程方案,其第一代技术可提供 7nm 级的数字逻辑性能,主要服务于机器人、自动驾驶及边缘智能等领域。该平台通过在单一芯片上融合数模混合、高频射频与低功耗技术,无需昂贵的 EUV 光刻,为物理 AI 芯片提供了比传统 FinFET 成本更低、能效更高的替代路径。该项目依托《欧洲芯片法案》框架,计划使德累斯顿基地到 2028 年底实现年产能超 100 万片 300mm 晶圆,不仅获得了特斯拉、宝马、博世等巨头的联合支持,更大幅加速了欧洲在边缘 AI 芯片自主化上的战略布局。
Claude Haiku 5.5 发布,小模型 API 价格暴降 90%10 月 8 日,Anthropic 推出了 Claude Haiku 5.5,这是一款速度更快、价格更低的小型人工智能模型,旨在满足高容量企业工作流程和子智能体任务执行的需求。与前代产品 Haiku 4.5 相比,新版本平均成本降低了约 75%,在 10 万个令牌以下的标准提示加载操作中,成本最多可节省 90%。基准测试数据显示,Haiku 5.5 在各项技术评估中均实现了显著的性能提升。在 OSWorld 2.1 计算机使用基准测试中,Haiku 5.5 的成功率达到了 72.4%,远高于上一代产品的 15.7%。此外,该模型也是 Haiku 系列中首个具备可调节推理难度设置的模型,使开发人员能够根据具体的工作负载需求,动态地平衡成本参数和智能需求。Haiku 框架的战略性重新定位凸显了 Anthropic 专注于处理海量企业工作负载,同时将其规模更大的 Sonnet 和 Opus 模型保留给重型编码和复杂推理任务。
OpenAI 推出 ChatGPT 全新交互界面:AI 直接生成可操作的工具10 月 7 日,OpenAI 宣布将 GPT-6 推向更广泛的 ChatGPT 用户,并同步推出全新的 Intelligent UI(智能用户界面)功能。与此前以文字对话为主的交互方式不同,ChatGPT 现在可以根据用户的问题,自动组合文字、图表、按钮、表单等元素,生成可直接操作的交互界面。 例如,用户可以让 ChatGPT 直接生成计算器、账单分摊工具或小游戏,也可以通过交互式图表理解复杂概念。

ChatGPT 会根据问题自动选择最合适的呈现形式,而不再局限于输出一段文字。此外,GPT-6 还支持在继续推理或调用工具的同时逐步呈现回答,让用户不必等待整个任务完成。OpenAI 此前已推出 GPT-6 系列模型,此次更新的重点是将其引入更广泛的 ChatGPT 对话场景,并带来全新的交互体验。新功能从 10 月 7 日起向 Plus、Pro、Business 和 Enterprise 用户逐步开放,Free 和 Go 用户则从 10 月 8 日起陆续获得支持。
谷歌发布多项 AI 更新:Nano Banana 2.1、Gemini Agent、Gmail 智能体与 Playground谷歌围绕图像生成、企业办公、邮件和游戏创作连续释放多项 AI 进展。
图像方面,谷歌 10 月 7 日正式发布 AI 图像生成与编辑模型 Nano Banana 2.1,称其在视觉设计、基于蒙版的图像编辑以及主体一致性方面实现全方位提升。新版可生成构图更佳、完成度更高的视觉素材;用户能更精准选中并修改现有图像局部,无需重新生成整张画面;在执行编辑或批量生成关联图片时,也能更好保留主体样貌与特征。Nano Banana 2.1 正逐步上线 Gemini 应用、谷歌搜索 AI 模式、Google AI Studio、Google Flow、Stitch、谷歌广告及 Gemini 企业平台。面向开发者,该模型已正式开放,模型 ID 为 gemini-nano-banana-2.1,支持文本、图片、音频和视频输入,并可输出 1K、2K、4K 分辨率图像。
企业级方面,谷歌云 10 月 8 日在 Gemini at Work 2026 发布会上宣布,面向企业客户推出 Gemini 智能体。该产品定位“通用工作智能体”,支持 Gemini Enterprise、Workspace 以及第三方服务。谷歌表示,用户只需给出目标,Gemini Agent 就能完成回答问题、处理知识型工作、创建媒体内容以及编写程序等任务。它既可作为个人助理,也可作为“团队成员”,在团队中担任 PM、财务分析师等角色。目前该智能体支持 Gemini 和 Claude 模型,未来还将兼容各种闭源、开源模型,官方也将提供 API,方便开发者集成到第三方应用中。
Gmail 方面,10 月 7 日最新版 Gmail 应用 APK 拆解显示,谷歌可能正为 Gmail 新增 Gemini 智能体,让用户通过 AI 自动回复邮件。隐藏代码显示,AI 收件箱可能在待办事项旁显示“使用 Gemini”按钮,用户点击后可让 Gemini 查看收件箱;遇到需要回复的邮件,界面可能弹出“起草回复”选项。当 AI 无法确定下一步操作时,会寻求用户帮助,部分邮件发送前也需人工确认。相关字符串还显示,需要用户输入或确认的任务可能呈现“需要你的输入”状态,用户可点击“提供输入”补充信息。
同日,谷歌还正式推出实验性 AI 游戏平台 Playground。用户可通过自然语言描述直接生成、修改和游玩浏览器游戏,无需编程知识。通过对话即可指定游戏角色、玩法规则、物理效果和场景,生成后可直接测试,并继续用文字指令调整内容。完成的游戏可通过链接分享,也可发布至平台社区。Playground 支持排行榜及部分游戏类型的多人玩法。谷歌同时宣布,未来将与 Unity 推进更深层次合作,引入 Unity Spark,以提供更复杂游戏机制和高保真 3D 游戏制作能力。目前 Playground 首先面向美国 18 岁以上用户开放,Unity Spark 仍处于测试阶段。
Mistral 发布万亿参数 Large 4:欧洲开放模型重新挑战中美10 月 6 日,法国 AI 公司 Mistral 发布新一代旗舰模型 Mistral Large 4(ML4)公开预览版。
模型采用 MoE 架构,总参数量达到 1 万亿,每次推理激活 490 亿参数,原生支持文本和图像,并拥有 100 万 Token 上下文窗口。模型权重计划于 10 月 27 日开放。Mistral 称 ML4 是其迄今规模最大、能力最强的模型,在 Coding、Agent、多模态,以及网络安全、金融、法律和工业任务上已经进入全球开放模型第一梯队;公司尤其强调,ML4 的综合表现已经明显领先欧美其他开放权重模型。
Reflection 公布首款模型 Beam,主打编程与推理效率10 月 5 日,被称为‘美国版 DeepSeek’的美国 AI 创业公司 Reflection 公布首款计划开放权重的模型 Beam,面向编程、推理和智能体任务。模型采用稀疏混合专家架构,总参数量为 5010 亿,每个 Token 激活 230 亿参数。公司称,预训练使用了 23.8 万亿 Token,强化学习阶段则投入 1.05 万张 NVIDIA GB300 GPU,持续四周,生成超过 1 亿次任务尝试。Beam 的主要卖点是推理效率:据官方评测,在部分高级推理测试中,其表现接近 GLM-5.2,估算推理计算量仅为后者的四分之一至三分之一,但在部分能力评测中仍落后于领先开放模型,上述计算量估算也不等同于实际部署成本。当前 Beam 仍在进行最终红队测试和评估,仅向部分用户提供早期访问;Reflection 计划于 10 月内以 Apache 2.0 许可公开权重,并同步提供技术报告及运行、评测和微调工具。
适配大屏:Meta 推出 iPad 版 Muse AI 智能体10 月 7 日,Meta 现已将 Muse AI 智能体适配苹果 iPad 平台,同时新增 Canva、Dropbox、Figma、QuickBooks、GitHub、Klaviyo、Zoom 等连接器。Muse 是 Meta 推出的 AI 智能体应用程序,主要竞争对手有 Grok Bot、ChatGPT Dots 和 OpenClaw 等。过去几周,这款 App 一直位居美国 App Store 免费 iPhone 应用下载榜首位。此外,该应用最早于 9 月登陆 iPhone,后续推出 Mac 版本。如今,iPad 用户也能够在大屏上使用这款智能体,完成各种工作任务。
微软联合英伟达发布最强 Surface:本地运行千亿参数 AI 模型10 月 7 日,微软在旧金山举行 Windows 与 Surface 发布会,联合英伟达推出 Surface Laptop Ultra 和 Surface RTX Spark Dev Box,并公布面向 AI Agent 的 Windows 新架构。其中,Surface Laptop Ultra 搭载英伟达 RTX Spark 超级芯片,集成最多 6144 个 CUDA 核心、20 核 Grace CPU,并配备最高 128GB 统一内存。

微软表示,该设备可以在本地运行超过 1200 亿参数的 AI 模型,AI 算力最高达到 1 PFLOPS。新机起售价为 2599 美元,计划于 10 月 16 日正式上市。微软还提出混合智能(Hybrid Intelligence)路线,让 Windows 根据任务需求,在本地模型和云端模型之间灵活调度。同时,微软正式推出 Microsoft Execution Containers(MXC),为 AI Agent 提供隔离运行环境,允许用户和企业控制 Agent 能够访问的文件、网络及系统资源。OpenAI Codex、GitHub Copilot、OpenClaw 等工具已支持这一技术。
Cloudflare 发布多模态决策模型 Clef-omni,并针对老模型大幅降价 58%10 月 9 日,网络基础设施公司 Cloudflare 正式推出多模态决策大模型 Clef-omni,该模型能够同时接受音频、视频、图像和文本输入,每百万 Token 定价仅为 0.15 美元。同时,为了应对激烈的价格战,Cloudflare 将其老款 Clef-flash 模型的 Token 价格暴降 58%,由 0.09 美元降至 0.038 美元/百万 Token。
星动纪元开源世界动作模型 VPP2,登顶 RoboDojo10 月 9 日消息,清华系具身智能初创公司星动纪元正式发布并开源了全新一代 14B 自研世界动作模型 VPP2。该模型在全球双臂机器人仿真大考榜单 RoboDojo 中力压 GPT-6 Astra 等海外模型登顶榜首,平均成功率达 32.26%。技术核心在于其独创的“三阶段训练流水线”,成功将视频预测与物理动作解耦,解决了过往模型“换个环境就不会干活”的泛化痛点。应用联动上,VPP2 与负责认知规划的大模型形成了“GPT 管想、VPP2 管做”的物理 AI 完美闭环;在双层多模态协同下,其复杂长时序任务的平均成功率直接实现翻倍,从 27.6% 飙升至 57.6%。目前,该模型代码已在 GitHub 全面开源。
打造“万物共脑”,Agnes AI 开源智能体基础设施框架 AGH10 月 11 日,AI 初创公司 Agnes AI 宣布正式开源面向真实任务的智能体运行基础设施框架 Agnes Harness(AGH)。该框架作为 Agent 的执行底座,支持持续任务执行、工具调用与状态管理,同时 AGH 体系中的 MHS 1.0 设备交互协议和 MOS 1.0 感知数据协议同步开放,支持智能体直接连接并调度移动机器人、机械臂等真实或虚拟物理硬件,将 AI 执行边界从软件延伸至物理世界。此外,官方披露其新一代旗舰模型 Agnes 3.0 Pro 迎来能力升级,API 即将上线。目前,AGH 已在 GitHub 上全面开放源码及开发文档。
10 月 9 日,字节旗下 TRAE 宣布,即日起,TraeWork 和 TraeCode 将正式合并,融合为全新的 TRAE,升级为全链路开发平台。过去 TraeWork 更偏向办公、任务和内容生成,TraeCode 更专注专业开发者的编码需求。双端融合后,全新 TRAE 用一个统一入口承接这些连续任务,并支持 Agent 模式与 IDE 模式无缝切换。
10 月 9 日,Anthropic 宣布为 Claude 推出两项新的生产力功能:Claude Dashboards 和 Claude Motion,分别面向数据分析和动态内容制作。Claude Dashboards 允许用户通过自然语言直接生成实时更新的数据看板,用户不仅可以查看图表,还能检查每个数据指标背后的查询语句,并将分析结果转交给专业 BI 工具。Claude Motion 则可以将报告、图表、文字和图片转换成可编辑的动画内容,并导出 MP4 视频。
10 月 7 日,Anthropic 宣布扩大其 Claude for Startups 计划,为符合条件的公司提供其人工智能模型的补贴使用权以及其他各种福利。作为 Anthropic 旧金山科技周活动的一部分,新版 Claude Team 项目正式上线。该项目提供一年的免费 Claude Team 会员资格,最多可包含五个高级席位,以及价值 1000 美元的 API 额度,用于 Claude 的开发。企业还将获得 Claude Marketplace 的访问权限,用于开发该服务的插件。此外,企业还可以预约与 Anthropic 应用人工智能团队的线上办公时间。
10 月 7 日,苹果正与 LG 电子联合开发一批智能家居配件,包括视频门铃、智能门锁、恒温器、室内外摄像头和温度传感器。产品将使用 LG 品牌,由 LG 负责生产和技术支持,并适配苹果计划推出的智能家居中枢。
会议推荐
QCon 全球软件开发大会·2026(上海站)将于 10 月 22 日—24 日举办。本届大会聚焦 Harness AI 时代的工程实践,从「构建 AI」到「驾驭 AI」,围绕 AI Native 架构、Agent Runtime、AI Infra、Agent 安全与可观测、Loop Engineering、具身智能与世界模型等热门技术方向,邀请全球技术社区与产业一线实践者,共同分享 AI Native 时代最具价值的工程经验。查看更多详情可扫码或联系票务经理 18514549229 进行咨询。

今日荐文
字节Seed实习生曝DeepSeek-V4技术缺陷:长文本检索陷入“周期性盲区”
GPT-6.1 Sol 极速版上线,500 美元门槛惹怒用户:花钱买更快,额度烧得更狠?
AI Coding 贡献率超 90%,需求交付却只快了 10%:菜鸟如何用 Agent 托管端到端交付?
突发!ChatGPT全员免费上线GPT-6:覆盖12亿用户,界面升级让“交互即应用”

你也「在看」吗?👇