乐于分享
好东西不私藏

AI 入口战争全面爆发:这张图里,7 个巨头正在争夺你手机里的"默认按钮"

AI 入口战争全面爆发:这张图里,7 个巨头正在争夺你手机里的"默认按钮"

Grok 4.6 登顶 MedAgentBench:马斯克的高调反击

来源:@elonmusk 转发 @XFreeze · 发布时间:1小时前 · 互动:983K 浏览

内容还原

马斯克转发 @XFreeze 的推文:「Grok 4.6 刚刚在 MedAgentBench 上占据了 #1 的位置……这是现实世界代理医疗任务中最有趣的基准之一。而 Grok 现在有两代人位列前三名。」配图是 MedAgentBench Standard 排行榜,Grok 4.6 以 95.9% 准确率排名第一,Grok 4.5 以 93.4% 排名第三;第二名是 GPT-5.6 Sol(94.7%)。

深度解读

马斯克选择医疗 Agent 这个垂直赛道来造势,非常精准。医疗是 AI 落地最敏感、也最具商业价值的领域之一。能在 MedAgentBench 登顶,意味着 Grok 在复杂、长链条、高风险任务上的 Agent 能力得到了量化认可。

更值得玩味的是「两代 Grok 都进前三」:xAI 不仅有一个最强点,还形成了代际传承优势。这对 OpenAI 和 Google 是直接的挑衅。

行业关联

医疗 AI 是 Agent 竞赛的高地。从诊断助手到病历管理,从药物研发到临床决策,谁能在这个领域建立信任,谁就能拿到巨大的 B 端/G 端合同。Grok 此举是在向医疗保健行业喊话:我也可以。

何体观点:马斯克的传播策略永远是人狠话不多。他不跟你辩通用能力,直接甩一个细分榜单的第一名。这种「以点破面」的打法对普通用户特别有效,但对真正做医疗决策的人来说,榜单元准确率只是入场券,不是通行证。

Google Vids × Gemini Omni:视频编辑进入「文本驱动」时代

来源:@GoogleWorkspace · 发布时间:1小时前 · 互动:4.4K 浏览

内容还原

谷歌工作空间官方账号宣布,Google Vids 接入 Gemini Omni。用户可通过简单的文本提示编辑任何素材——从手机实拍视频到 AI 生成的片段;能让粗剪看起来专业,也能在不重拍的情况下微调场景。配图是 Google Vids 的编辑界面,中央大字「Edit videos with Gemini Omni」,周围是素材拖拽、时间轴、Edit 按钮等 UI 元素。

深度解读

这不是一个孤立功能,而是 Google 把 Gemini 往「生产力入口」里塞的又一步。过去视频 AI 的叙事集中在「生成」——Sora、Runway、可灵都在比谁生成得更像电影。但 Google Vids 这次强调的是编辑:让已有素材可被自然语言二次加工、补拍、替换。

这意味着 AI 视频的竞争维度从「无中生有」延伸到「改得顺手」。对企业用户和创作者来说,生成只是起点,迭代才是日常。Google 用 Workspace 的既有地盘去打这场仗,而不是另起一个独立 App。

行业关联

直接竞争者包括 Adobe Premiere 的 Firefly 集成、CapCut 的 AI 功能、OpenAI 潜在的 Sora 编辑能力。更深一层,它说明「多模态模型的终点不是会生成,而是会理解并修改」。编辑比生成更需要对世界和意图的理解。

何体观点:Google 的打法向来不是最炫,但最「稳」。它不做爆款 demo,而是把 AI 变成 Docs、Slides、Vids 里不起眼的按钮。对普通用户来说,这种无感渗透比发布会更有杀伤力。

Claude Cowork 全平台上线:异步 Agent 的 UX 雏形

来源:@claudeai · 发布时间:23小时前 · 互动:775K 浏览 / 6.2K 赞

内容还原

Anthropic 宣布 Claude Cowork 已向所有付费套餐开放移动端和网页版。配图中引用 7 月 8 日的预告:「把任务交给克劳德,然后从手机上拿起完成的作品。关上笔记本,克劳德继续操作。」视频帧显示「Finishing up your task」,背景有多个任务条目如「Build prep document」「Locating file」。

深度解读

Cowork 的核心不是功能多强,而是它试图定义一种新交互范式:异步、持续、跨设备的 Agent 协作。你不需要守着对话框等它完成,可以像交代同事一样发任务,然后离开。它把 AI 从「问答工具」变成「可委托的执行者」。

这个转变非常关键。当前大多数 AI 产品仍停留在同步会话:你问一句,它答一句。Cowork 试图打破这个循环,让 AI 在后台运行,这与 OpenAI Operator、Devin、Google Astra 的方向一致。

行业关联

Agent 赛道正在从产品功能竞争转向「信任竞争」:用户敢不敢把任务交给 AI、让它自主执行多久、出错后怎么追责。Anthropic 选择先强调「随时随地接管任务」的场景,是在抢占「可靠异步助手」的心智。

何体观点:Claude 最近在「 silently competent 」这条路上走得很稳。不炒作 AGI,不发奇奇怪怪的模型名,而是让产品变得像一个真正能替你干活的实习生。这种低调反而让我更看好它的企业落地。

Claude 设计蛋白质:从语言模型到「科学发现引擎」

来源:@AnthropicAI · 发布时间:18小时前 · 互动:240万 浏览 / 9.5K 赞

内容还原

Anthropic 发文称,许多药物通过结合体内特定靶点起作用,传统上设计紧密结合靶标的分子需要数周甚至数月的专家工作。他们测试 Claude 是否能从零开始设计新型蛋白质结合剂:在人类专家撰写的设计提示下,Claude 自主设计了针对 15 个靶点中 14 个的蛋白质结合剂。随后 Adaptyv Bio 和 Twist Bioscience 独立构建并测试了这些蛋白质。配图用蛋白质结构拼出「ANTHROPIC」字样,并标注了 Nipah G、TREM2、TrkA、IL-7Rα、EGFR、VEGF-A 等靶点及对应 Kd 值。

深度解读

这条信息量极大。它不只是「AI 能写代码」的又一个例子,而是大语言模型首次在严肃科学发现中展示出接近专家的从零设计能力。蛋白质设计需要理解三维结构、化学亲和力、生物功能,这些都不是纯文本任务。

14/15 的成功率说明 Claude 已经具备一定的「可迁移科学推理」能力——给定一个领域的提示和约束,它能生成满足物理/化学要求的候选结构。这与 AlphaFold 的「预测已有结构」不同,更接近「主动创造新分子」。

行业关联

这直接挑战了 DeepMind/Isomorphic Labs 在 AI 制药领域的领先地位,也预示着 LLM 的应用边界从数字世界(代码、文本、图像)扩展到物理世界(分子、材料、生物)。如果模型能设计蛋白质,下一步可能就是材料、催化剂、电池配方。

何体观点:这是我这次看到的最震撼的一条。它不是 AGI 的宣言,而是 AGI 能力一步步渗入硬核科学的实证。Anthropic 用「少说话多做事」的方式,在真正改变世界的领域悄悄得分。

Gemini 入驻 Chrome:浏览器即 AI 操作系统

来源:@googlechrome · 发布时间:19小时前 · 互动:70K 浏览

内容还原

Google Chrome 官方宣布 Gemini in Chrome 已向美国安卓用户开放。功能包括:总结长网页、连接喜欢的 Google 应用、在浏览器内生成图片。AI Pro 和 Ultra 订阅用户还能使用「自动浏览」处理繁琐任务,如预订停车或更新在线订单。配图是一部安卓手机的 Chrome 界面,Gemini 面板悬浮在网页上方,显示推荐礼物、描述门垫材质等示例。

深度解读

Chrome 是全球最大的浏览器入口之一。把 Gemini 嵌入 Chrome,等于给 Google 的 AI 一个几乎无摩擦的分发渠道。更重要的是「自动浏览」:它让 AI 不只是读网页,而是能操作网页——填表、下单、预约。

这是典型的「浏览器即操作系统」叙事。一旦 AI 能在浏览器里替用户完成任务,Chrome 就不再只是一个看网页的工具,而是用户与整个互联网交互的中介层。

行业关联

与 OpenAI Operator、Microsoft Copilot、Arc 浏览器的 AI 功能形成正面竞争。Google 的优势是 Chrome 的存量用户和 Google 应用生态的深度集成;劣势是监管和反垄断压力,以及用户对隐私的担忧。

何体观点:Google 再次证明了它最可怕的不是模型,而是「入口」。Chrome + Gmail + Maps + Workspace 连在一起,Gemini 的上下文天然比任何独立 App 都更丰富。问题是:用户愿不愿意把这么深的权限交给一个广告公司?

GoalKicker 免费编程笔记:AI 时代开发者教育的「基础设施」

来源:@DG_AI_HUB · 发布时间:13小时前 · 互动:8.1K 浏览

内容还原

账号 @DG_AI_HUB 分享了一批免费编程笔记资源 goalkicker.com,涵盖 Java、Python、JavaScript、SQL、DSA、C、C++ 等,声称「10000+ 页项目说明,100% 免费」。配图是九宫格封面,每格代表一门技术,风格统一为深色背景 + 技术 Logo + 模拟纸张页面。

深度解读

这条在 AI 巨头新闻堆里显得有些「朴素」,但它反映了一个被低估的趋势:在 AI 生成代码越来越强的背景下,系统性、结构化的人类知识资产仍然稀缺且有价值。LLM 能写片段,但不一定能替人建立完整的知识框架。

GoalKicker 这类资源之所以被 AI 账号转发,说明 AI 社区对「基础知识 + 实践能力」的双重需求在上升。会调 API 的人多了,但懂底层原理的人仍然抢手。

行业关联

AI 降低了编程门槛,但提高了对「工程判断力」的要求。未来开发者教育的分化会越来越明显:一边是面向 AI 的提示工程、Agent 编排;另一边是面向系统底层的算法、数据结构、性能优化。

何体观点:这条像喧嚣里的低音部。当所有人都在追最新模型时,基本功反而成了稀缺资源。AI 不会让学习消失,只会让「学什么」重新洗牌。

马斯克 2020 年的预言:GPT-5/6 逼近最聪明的人类

来源:@elonmusk · 发布时间:2020年8月15日(截图高亮)

内容还原

这是马斯克 2020 年的一条旧推,被红框高亮关键信息:「改进速度 GPT 到 GPT-3 很厉害。如果这种进步速度持续下去,GPT-5 或 6 可能与最聪明的人类无异。」他同时声明这是个人看法、不是建议,并提到自己 2 到 3 年前已离开 OpenAI,是中立的局外人。

深度解读

这张图的价值在于「事后回看」。2020 年 GPT-3 刚出来不久,很多人对 AGI 还嗤之以鼻;马斯克当时说 GPT-5/6 可能媲美最聪明人类,被视为典型 Musk 式夸张。但到了 2025–2026 年,这个判断不再是边缘观点,而是整个行业讨论的中心议题。

它提醒我们看到两个东西:第一,指数级技术的前瞻判断往往在当时显得荒谬;第二,马斯克对 OpenAI 的复杂态度从那时就开始了——既肯定其技术进展,又强调自己「中立局外人」身份。

行业关联

这张图与后续 OpenAI 的 GPT-6、xAI 的 Grok 4.6 形成互文。它既是对 scaling law 早期直觉的记录,也预示了后来 Musk 自立门户做 xAI 的动机:他不希望 OpenAI 独享这个未来。

何体观点:这条推就像时间胶囊。现在回头看,它不是预言有多准,而是它展示了顶级技术人物如何提前 5 年划定战场。普通人还在争论 GPT-3 是不是噱头的时候,他已经看到了 GPT-6 的轮廓。

 OpenAI 暂停 RL 训练:能力越强,刹车越紧

来源:@OpenAI · 发布时间:22小时前 · 互动:1.5万 浏览 / 5K 赞

内容还原

OpenAI 官方发文称,随着模型能力提升,内部开发和测试模型的风险也随之增加。因此暂时暂停针对最新部署模型的强化学习(RL)训练两周,期间加强红队、扩大监控范围。原计划中最大规模的前沿 RL 运行暂时搁置,等待小规模训练和评估验证保障措施,并建立更多对齐证据。配图标题为「Pacing model development in an era of cyber-critical capabilities」,意为「网络关键能力时代的节奏化模型开发」。

深度解读

这是一条罕见且重要的信号:OpenAI 主动按下了能力训练的暂停键。它说明前沿模型的强化学习已经达到了一个阈值——继续推进可能带来「网络关键能力」风险,比如自主进行网络攻击、绕过安全机制等。

「cyber-critical capabilities」这个词非常重。它不是泛指 AI 安全,而是特指模型在网络安全、关键基础设施等高风险领域的能力。OpenAI 选择公开暂停,也是在向监管者和公众传递一个信息:我们在认真对待对齐问题。

行业关联

这与 Anthropic 的 Responsible Scaling Policies、Google DeepMind 的安全框架属于同一类努力。整个行业都在寻找「能力与安全」之间的节奏:跑太快容易失控,跑太慢被对手超越。OpenAI 的暂停是行业试图自我调节的一个缩影。

何体观点:我不相信 OpenAI 会真的「慢下来」,但公开踩刹车本身是一种战略姿态。它既是对内对齐研究的争取时间,也是对外争夺舆论和监管主动权。真正的博弈在于:谁能在暂停期间偷偷完成下一次跃迁。

Grok 4.6 登陆 AWS Bedrock:xAI 的企业化野心

来源:xAI 官方/亚马逊 Bedrock 页面

内容还原

xAI 宣布 Grok 4.6 正式在亚马逊 Bedrock 上线。Grok 4.6 是最新旗舰模型,专为长期运行的 Agent、雄心勃勃的互动和视觉工作打造,提供 50 万 token 上下文窗口和可配置的推理努力(低/中/高/x高)。定价为输入每 100 万 token 2 美元,输出每 100 万 token 6 美元。亚马逊基岩用户可以通过 AWS 文档开始使用。

深度解读

这是 xAI 商业化的关键一步。过去 Grok 主要面向 X Premium 用户,是一个「社交媒体附赠 AI」。进入 AWS Bedrock 后,Grok 变成了企业可用的 API 模型,与 Claude、GPT、Gemini 在同一擂台竞争。

50 万上下文窗口和可配置推理是两个亮点:前者适合长文档、代码库、多轮 Agent 任务;后者让企业按需选择成本与质量之间的平衡点。定价 2/6 美元在同类中处于中低端,xAI 显然想用价格撬动市场。

行业关联

亚马逊 Bedrock 是 AWS 的统一大模型平台,接入 Grok 说明 AWS 也在拥抱更多元的模型生态,不把所有筹码押在 Anthropic 身上。对 xAI 来说,这是获得企业信任和规模的捷径。

何体观点:Grok 正在努力摆脱「马斯克玩具」的标签。Bedrock 是它的成人礼。但企业市场不比社交媒体,可靠性、合规、SLA 才是硬通货。xAI 能不能 hold 住 B 端,接下来半年见真章。

GPT-6 Astra 传闻:OpenAI 的下一张牌?

来源:@RobertoZqmsk 转发 @hqmank · 发布时间:8月17日 · 互动:140 浏览

内容还原

用户 @hqmank 发文称「GPT Astra 本周即将发布」,并提到「Codex 可能会重置」。另一位用户 @RobertoZqmsk 转发,配图是一个风格简洁的卡片,上面写着「GPT-6 Astra」。

深度解读

这是一条典型的社交媒体传闻,证据薄弱,但它之所以值得注意,是因为它把两个关键词串在了一起:GPT-6 和 Astra。Astra 此前是 Google 在 I/O 大会上展示的「通用 AI Agent」项目名,后来被广泛用来指代下一代实时多模态 Agent。如果 OpenAI 真的把 GPT-6 与 Astra 概念结合,意味着它可能不只是更强的语言模型,而是一个面向实时感知的 Agent 系统。

「Codex 可能会重置」则更耐人寻味。Codex 是 OpenAI 的编程 Agent,如果它要「重置」,可能是架构升级,也可能是合并进更大的 Agent 框架。

行业关联

这种传闻不管真假,都会在行业里快速传播,影响对手的产品节奏和市场预期。在 AI 竞争中,「预期管理」本身就是竞争武器。

何体观点:我对这条持谨慎态度。社交媒体上关于 GPT-5/6 的「本周发布」传闻已经太多了。但它的价值在于反映市场期待:大家已经默认 GPT-6 不会是普通模型升级,而是某种 Agent 或多模态形态的跃迁。

山姆·奥特曼玩命名梗:GPT-6 → GPT-6-7

来源:@sama · 发布时间:2025年10月31日 · 互动:14M 浏览 / 42K 赞

内容还原

OpenAI CEO 山姆·奥特曼发了一条推文:「GPT-6 将更名 GPT-6-7 号,不客气。」配图简洁,只有文字。评论区 4K 条回复,转发 3.8K,点赞 42K,浏览量 14M。

深度解读

这是一条典型的 Sam Altman 式推文:短、神秘、带有自嘲和 meme 感。它可能是在调侃公司之前混乱的命名策略(GPT-4、GPT-4o、GPT-4.5、o1、o3 等让人困惑),也可能是在暗示某种产品合并或新的发布节奏。

从传播角度看,它非常成功:用一句话点燃整个行业猜测。但换个角度看,它也暴露了 OpenAI 在品牌叙事上的某种焦虑——模型代际和命名已经无法清晰对应能力跃迁,只能 CEO 亲自下场玩梗化解。

行业关联

与马斯克那张 2020 年旧推、以及 GPT-6 Astra 传闻形成三角关系:三个人(Altman、Musk、网友)在用不同方式定义 GPT-6 的公众形象。命名的混乱本身说明行业正处于能力爆发与产品化不成熟并存的阶段。

何体观点:Altman 擅长把产品混乱转化为 meme 流量。但玩笑归玩笑,命名混乱是真实问题——用户不知道 GPT-4.5、o1、GPT-5、GPT-6 到底谁更好。如果 OpenAI 不及时理顺,最终会伤害品牌信任。

13. MedAgentBench 完整榜单: Grok、GPT、Gemini 的三国杀

来源:MedAgentBench Standard · Full Dataset(300 cases)

内容还原

这是 MedAgentBench Standard 的完整排行榜,基于 300 个案例、3 次运行取均值 ± 标准差。前十名依次为:1. Grok 4.6(95.9%,xAI,Aug 18 2026);2. GPT-5.6 Sol(94.7%,OpenAI,Jul 18 2026);3. Grok 4.5(93.4%,xAI,Jul 9 2026);4. Gemini 3.7 Flash(92.7%,Google,Aug 14 2026);5. Muse Spark 1.1(92.2%,Meta,Jul 10 2026);6. Gemini 3.1 Pro(91.3%,Google,May 1 2026);7. Gemini 3.6 Flash(90.0%,Google,Jul 23 2026);8. GPT-5.5(89.4%,OpenAI,May 1 2026);9. Claude Opus 4.7(89.0%,Anthropic,Jun 10 2026);10. Fugu(88.7%,Sakana AI,Jun 22 2026)。

深度解读

这张表是一个缩影:头部三家(xAI、OpenAI、Google)的医疗 Agent 能力都在 90% 以上,差距最大不到 6 个百分点。这说明顶级模型在垂直任务上已经进入了「毫厘之争」

值得关注的是第二梯队:Meta 的 Muse Spark、Sakana AI 的 Fugu 也进入前十,说明医疗 Agent 不是只有巨头能玩。Claude Opus 4.7 排名第九,可能与其更保守的安全策略有关——在医疗这种高风险领域, Anthropic 宁可在准确率上让一步,也要避免幻觉风险。

行业关联

MedAgentBench 正在成为一个关键指标,就像当年的 ImageNet、GLUE、MMLU 一样。它考验的不仅是模型知识,更是长链条规划、工具调用、跨模态理解、安全约束等综合 Agent 能力。

何体观点:榜单本身只是快照,真正有趣的是它背后的模型发布节奏。Grok 4.6 刚上线 Bedrock 就来抢第一,明显是 xAI 的「企业+口碑」组合拳。医疗 Agent 的赢家不会由准确率决定,而是由哪个模型能让医院敢签字决定。

🔥 综合研判:6 条贯穿全图的行业主线

1. Agentic AI 从概念变成默认配置

Claude Cowork、Gemini in Chrome 自动浏览、Grok 的 Agent 定位、MedAgentBench 的崛起——几乎所有头部产品都在把「能自主执行任务的 Agent」作为核心卖点。2026 年,Agent 不再是新奇功能,而是大模型的默认形态。

2. 垂直赛道成为主战场

医疗(MedAgentBench)、药物设计(Claude 蛋白质)、视频编辑(Google Vids)、浏览器自动化(Chrome)——通用模型能力开始下沉到具体行业。未来的竞争不是「谁更聪明」,而是「谁在某个场景里更可靠、更省钱、更好接入」。

3. 模型分发进入「平台寄生」阶段

Grok 上 AWS Bedrock、Gemini 进 Chrome、Claude 进移动端——模型公司 increasingly 依赖大平台分发。这很像移动互联网早期的 App Store 格局:模型是应用,平台是入口,入口握有最终议价权。

4. Scaling Law 的「内卷化」

唐杰的文章说明,中国和美国的顶尖实验室同时意识到:继续堆参数收益递减,未来在于数据质量、训练后优化、MoE 效率、推理成本控制。Scaling 没有结束,只是从「大力出奇迹」变成「精打细算」。

5. 安全与能力之间的张力公开化

OpenAI 主动暂停 RL 训练,是一个标志性事件。它表明最前沿的实验室已经摸到需要「踩刹车」的能力边界。接下来行业会面临更激烈的争论:谁来定义暂停标准?暂停会不会成为竞争策略?

6. 命名与传播:一场注意力战争

马斯克旧推、Sam Altman 的 GPT-6-7 梗、GPT-6 Astra 传闻——头部人物越来越擅长用简短、神秘、可 meme 化的信息操控市场情绪。在模型能力差距缩小的情况下,叙事能力本身就是竞争力。

🎯 何体总结:这次图片集给我的最大感受

这 12 张图拼出了一幅清晰的 2026 年 AI 行业图景:模型能力还在涨,但战争的形态已经变了。不再是单一模型的冠亚军之争,而是生态、入口、垂直场景、安全叙事、传播节奏的全方位混战。

Google 靠 Workspace + Chrome 稳扎稳打;Anthropic 靠科学发现和异步 Agent 树立「靠谱」形象;OpenAI 一边推进 GPT-6/Astra 一边高调管理安全叙事;xAI/马斯克则用 Bedrock 企业化和医疗榜单快速补 credibility。

最值得关注的是中国实验室的角色。唐杰这篇关于 scaling 的思考,说明智谱已经不再只是跟随,而是在参与定义规则。中美 AI 竞争正在从「模型对标」进入「方法论竞争」的新阶段。