夜雨聆风学习资料网

ARTICLE · 1073969

嘴上喊减速,旗舰已偷跑 | AI周报 012

嘴上喊减速,旗舰已偷跑 | AI周报 012

🔧 技术前沿

一、Gemini 4 Pro疑似"偷跑"上线:13项跑分碾压Astra和Fable

9月18日,谷歌被曝疑似以代号"gemini-3.8-flash"在LMArena匿名上线了下一代旗舰模型,开发者实测后普遍推测为Gemini 4 Pro。流出的13项基准对比显示其全面领先:DeepSWE v1.1编码测试88.7%(Astra为86.9%)、GDPval-AA v2真实知识工作2064 Elo(Astra 1994)、HLE多学科推理72.1%(领先Astra近5个百分点)、OSWorld 2.0计算机使用86.8%。最值得注意的是,其优势集中在Agent长程任务——Terminal-Bench 4.0拉开Astra达13.9个百分点,任务越复杂、链路越长,领先越明显。网传定价为输入2.25美元、输出11.25美元/百万Token。需要说明的是,模型名称、跑分均来自传言,尚未获谷歌官方确认;分析认为谷歌真正押注的是RSI(递归自我改进)。

一句话:谷歌半年憋的大招疑似"偷跑"亮相,Agent长程任务能力成了新的分水岭——谁能在几百步的复杂链路里不"掉链子",谁才是真旗舰。


二、Anthropic解禁Mythos:生命科学验证计划上线,最高档"移除所有安全限制"

9月17日,Anthropic正式上线生命科学验证计划(LSVP)测试版,长期保密的神秘模型Mythos首次向专业群体开放。此前Claude对生物学问题"碰都不敢碰",现在通过认证的科学家可以直接提问。权限分两档:标准使用覆盖日常绝大多数生命科研工作,可授权整个团队、每年续期一次,支持Mythos 5.1、Opus 5、Sonnet 5;高风险使用则移除所有安全限制,仅按单个研究项目授权、每六个月续期。安全机制转为"认证+共同责任"模式:权限绑定申报用途、事后离线监控、机构管理员可收到越界告警,数据留存30天且不用于模型训练。同期路透披露,Anthropic已在旧金山湾区建立生物湿实验室,探索让Claude直接指挥实验室机器人完成真实实验。

一句话:从"一刀切拦截"到"分级放行",Anthropic把AI安全从开关变成了闸门——最强模型给最可信的人,而AI自己下场做实验,才是更大的信号。


三、Claude Code Projects大重构:协调器+共享记忆,内部3万Agent天天干活

9月17日,Anthropic重构发布Claude Code Projects,把Projects从"放提示词的文件夹"升级为"以对话为驱动的多Agent协作中心"。核心是名为Coordinator(协调器)的大脑:开发者只需下达高阶目标,协调器自动拆解为子任务,调度给并行工作线程;每个线程都是云端独立Claude Code实例,拥有隔离代码副本和独立Git分支,干完自动提PR,冲突走标准Git合并流程。新增共享记忆保证Agent间上下文对齐,并配套文件与产物库。Anthropic披露内部研发平台每天同时运行3万个AI Agent在云端写代码、调模型、跑测试,核心AI研发已有26%由Claude主导(半年前不到1%),达到L4级别。目前beta面向部分Pro/Max用户,随后全面开放。

一句话:当别人还在教单个Agent写代码,Anthropic已经把"带一个Agent军团"做成了产品——软件工程的下一形态,是给AI配一个项目经理。


四、Astra两周抢走13%企业AI支出,OpenAI时隔两年半反超Anthropic

9月19日,OpenRouter数据显示,GPT-6 Astra上线仅两周多,已占约13%的企业AI支出份额,而Anthropic的Fable系列只有8%;OpenAI整体份额9月第一周攀升至约65%,Anthropic降至35%——这是OpenAI时隔两年半首次反超。企业用脚投票的原因很直接:Fable 5发布两个月,客户没有踊跃升级最贵旗舰,转而选择"够用且便宜"的Opus 5,如今连这个位置也被Astra威胁。压力之下,据路透、华尔街日报报道,Anthropic原定10月的IPO推迟至11月,并正考虑在IPO前提前发布新模型应战;其年化营收预计突破1000亿美元(7月为650亿美元),估值约2万亿美元、募资最高1000亿美元,同时与埃森哲达成各投至少10亿美元的嵌入式评估合作。

一句话:嘴上喊着"慢一点"的Anthropic,被Astra两周逼到推迟IPO、提前发新模型——在份额面前,安全宣言让位给了商业防御。


五、豆包手机二代开售:全球首款AI智能体手机,预约36万台

9月16日,努比亚NaviX Ultra(豆包手机二代)正式发布开售,5999元起(国补后5499元起),自称全球首款AI智能体手机,搭载豆包手机助手消费者版。核心能力:端到端任务成功率超80%,一句话跨多个App自动完成操作,支持任务后台静默运行、排队与多线程处理;AI实体键集成指纹鉴权,锁屏下即可唤醒。与一代最大不同在合规策略——发布前推出屏幕自动化操作声明协议(SAEP),第三方App可自主声明允许或拒绝AI操作边界,豆包承诺对拒绝的App不进行自动化操作,避开一代被8款主流App联手封杀的老路。硬件上搭载第五代骁龙8至尊版、7100mAh电池、长鑫存储LPDDR5X(国产高速DRAM首次量产商用)。预约量达36万台,是一代首发3万台的12倍。

一句话:从"读屏模拟点击"到"协议优先、模拟兜底",豆包手机二代用部分主动权换合规通行证——AI操作手机第一次有了行业规矩。


📰 简讯

  1. 智谱GLM-5.3-FlashX上线——9月18日智谱推出GLM-5.3-FlashX升级版,最高推理速度200 tokens/s,面向企业及开发者。点评:Flash档持续"加量提速",国产模型的成本内卷还在继续。

  2. 千问发布Qwen3.8-Omni-Flash——9月18日千问上线原生全模态Agent模型,统一接收文本、图像、音频、视频,上下文扩至1M,在千问AI平台与阿里云百炼开放。点评:全模态从"听得清、看得懂"卷向"能规划、会调工具、交成品"。

  3. 中国发布《人工智能安全治理框架3.0》——9月14日网安标委在2026年国家网络安全宣传周开幕式发布,更新风险分类、优化技术应对与综合治理;同日金砖峰会习近平主席提出人工智能开源普惠倡议,宣布率先建设金砖国家人工智能开源专区。点评:中国AI治理"框架迭代+开源普惠"双线推进。

  4. OpenAI推出Astra for Law——9月17日OpenAI发布面向法律领域的Astra for Law,提供定制律所工作流、互联法律数据源与法律级控制措施。点评:继金融服务后,OpenAI垂直行业版图再下一城。

  5. Manus独立后融资5亿美元,估值40亿美元——9月19日消息,Manus与Meta完成拆分恢复独立运营半个多月后,正推进新一轮约5亿美元融资,目标估值约40亿美元,独立后首轮融资估值即翻倍。点评:通用Agent独角兽在资本市场的热度并未随拆分降温。

  6. Hugging Face机器鸭Microduck爆火——9月19日消息,Hugging Face旗下Pollen Robotics推出的智能机器鸭Microduck售价399美元,上线5天预售破1万台,高峰期每4秒售出一台。点评:399美元的可编程机器鸭,把消费级具身智能带到了"玩具价"。


💡 AI观察

一、"减速共识"的破产:嘴上喊慢,脚下狂飙

上周Anthropic CEO阿莫代伊刚呼吁全行业放慢模型能力提升,本周就上演了教科书级的"言行分裂":谷歌被曝疑似偷跑Gemini 4 Pro,13项跑分碾压全场;Anthropic自己被Astra两周吃掉份额后,立刻考虑提前发布新模型应战。这不是哪一家"说一套做一套"——当Astra两周抢走13%企业AI支出,任何一家公司的安全宣言都扛不住市场份额的流失。减速共识更像是一种"优势方叙事":站在领先位置时呼吁刹车,被追兵逼近时第一个踩油门。对行业观察者而言,别听巨头说了什么,要看它们把算力投向了哪里。

二、Agent长程能力成为新分水岭:从"会问答"到"干长活"

Gemini 4 Pro疑似跑分中,最值得关注的不是某个单项第一,而是它领先的优势全部集中在长程Agent任务:Terminal-Bench 4.0领先Astra 13.9个百分点,OSWorld 2.0达86.8%,任务越复杂优势越大。这印证了一个趋势——大模型竞争已从"单轮问答的智商"转向"几百步任务的耐力":能否在真实代码库中持续修改验证、在真实电脑环境中自主完成一小时以上的复杂操作,正在成为衡量旗舰的新标尺。当各家都能"说得对"时,"做得久、做得到底"就是下一个护城河。

三、AI for Science进入"验证瓶颈":模型设计快,实验跟不上了

Anthropic本周两件事放在一起看很有意思:一边解禁Mythos让科学家用最强模型,一边被曝自建湿实验室、探索让Claude指挥机器人做实验。背后的矛盾很直白——AI提出蛋白质设计、药物候选的速度越来越快,但真实世界验证这些设计的速度没有同步提升,"设计—构建—测试—学习"闭环卡在了实验端。AI for Science的下一个战场,或许不在模型参数,而在如何用AI加速真实实验本身:谁先让AI"闭环"到物理世界,谁就掌握了AI科研的真正瓶颈解法。

四、多Agent协作成为新范式:从"人机对话"到"AI团队自治"

Claude Code Projects的重构给出一个信号:AI协作的单元正在从"单个Agent"变成"一群Agent+协调器"。用户不再需要手把手教AI每一步,只需下达目标,协调器负责拆解、调度、验收、合并;Anthropic内部每天3万Agent并行、26%核心研发由Claude主导,就是这个范式的极限测试。这和扣子3.0"Agent团队"、Meta Muse"关闭App仍在云端干活"是同一条路径的不同入口——AI正在从"工具"变成"可托管、可并行、可自组织的数字员工"。管理Agent,正在成为新的管理技能。

五、AI智能体手机的"合规路线":豆包二代给行业打了个样

豆包手机二代最值得玩味的不是配置,而是SAEP协议——让第三方App自主声明AI操作边界,把"AI读屏点屏幕"从技术问题变成规则问题。一年前一代手机因被8款主流App联手封杀而受挫,二代选择用"协议优先、模拟兜底"换取合规通行证,与苹果、华为、荣耀、小米的路线殊途同归。这揭示了一个规律:AI Agent落地的最大障碍往往不是技术能力,而是生态信任与规则共识。当AI开始操作真实世界的App、系统、账户,谁能先建立被各方接受的"行为边界",谁才能真正走进千家万户。

我的往期文章合集(2015-2026)

相关学习资料