GPT-6推迟,Fable 5.1蓄势,但今天最值得装的是这几个AI工具
2026年7月29日
网传GPT-6推迟到9月初,Anthropic的Fable 5.1在8月等着狙击。但旗舰模型在憋大招的时候,OpenAI发了白菜价的语音转录API,xAI让Grok直接帮你写网站,Google给智能体装上了"刹车踏板",美团也把AI Agent平台开放给了商家。大模型竞争的下半场,可能不是谁的参数更大,而是谁的产品更让人离不了。
旗舰在憋大招
先说一个背景。这两天AI圈传得最凶的消息,是GPT-6可能要推迟到9月初。
7月27日,奥特曼突降华盛顿,向美国政府展示了OpenAI"有史以来最强大的模型"GPT-6。据Axios报道,GPT-6在内部测试中已经能做原创科学研究,还通过不休不眠的智能体集群展现了"危险的长程规划与自主渗透能力"——换句话说,能自己组织一群AI去黑一家真实公司。
但政府审批这道关不好过。GPT-5.6当初就被政府安全审查卡了12天才全面上线,一个更大的全新预训练模型要走完安全评估加审查,时间只会更长。所以现在有爆料说GPT-6可能从8月推到9月。
另一边,Anthropic也没闲着。业内消息显示,Fable 5.1已经完成内部测试,同样瞄准8月,定价和Fable 5一样——输入10美元、输出50美元每百万Token。Anthropic的策略很明确:引而不发,等GPT-6先开枪,然后在几小时或几天内放出Fable 5.1完成反超。田忌赛马的意思。
旗舰模型的对决看起来要延后了。但有意思的是,在这个"憋大招"的空档期,今天好几家公司不约而同做了一件事:把已有的AI能力打包成真正能用的产品。
OpenAI:不等GPT-6,先做白菜价转录
7月29日,OpenAI在X平台发布了两个语音转录模型:GPT-Transcribe和GPT-Live-Transcribe,都支持API调用。
这俩模型有什么特别的?先看数据。
在Common Voice的22种语言测试中,GPT-Transcribe的转录错误率是19.27%,而之前的主力模型Whisper是40.37%——直接砍了一半多。在真实世界音频录制的9种语言上,GPT-Transcribe错误率8.98%,Whisper是15.21%。
价格更狠。GPT-Transcribe(异步转录,处理已录制好的音频)每分钟0.0045美元,约合人民币3分钱。GPT-Live-Transcribe(实时转录,处理直播音频流)每分钟0.017美元,约合1毛2。
这两个模型还能理解上下文。你可以给它提供自由格式的背景信息(比如"这是一场关于半导体行业的电话会议"),也可以传入关键词提示(比如公司名、产品名、缩写),甚至指定多种可能出现的语言。在Context Aware ASR基准测试中,有上下文提示时语义准确率从41.6%提升到了45.2%。
如果你需要区分说话人,还有gpt-4o-transcribe-diarize模型支持说话人标记。需要生成字幕文件,whisper-1仍然可以输出SRT和VTT格式。
说白了,OpenAI把语音转录这件事做成了一个便宜到几乎不用犹豫的API。对于做会议记录、客服质检、播客字幕、视频字幕的团队来说,3分钱一分钟的转录成本,意味着很多之前因为太贵而手动处理的场景,现在可以自动化了。
xAI:对话即开发,Grok帮你建网站
7月28日,xAI宣布Grok正式上线Build Mode(构建模式)。用户只需用自然语言描述需求,Grok就能在对话界面内实时生成可运行的网站、应用程序、游戏或交互式数据仪表盘,然后一键发布到grok.me链接,任何人都能访问。
不需要安装软件,不需要配置环境,不需要写代码。你跟Grok说"帮我做一个落地页,左边放产品介绍,右边放注册表单",它就给你生成出来,还能在对话里持续迭代——改布局、加功能、调样式,全程对话完成。
Build Mode目前以早期测试版向SuperGrok Heavy订阅用户开放,支持网页端、iOS和Android。xAI没有透露何时向更多用户开放。
这个功能其实有前奏。7月15日,xAI已经开源了终端版的Grok Build(用Rust写的),支持最多8个并行AI代理在独立Git worktree中操作,底层模型提供约200万token的上下文窗口。终端版面向开发者,Build Mode面向普通用户——把代码生成、实时预览和发布托管全部塞进了一个聊天窗口里。
xAI的野心很明显:让Grok从问答工具变成开发平台,直接跟GitHub Copilot、Claude、Lovable、Bolt.new这些AI编程工具抢市场。它的优势是分发——用户不需要打开一个专门的编程工具,在聊天里就能完成从创意到上线的全过程。
当然,现在还是早期测试版,生成质量怎么样、能不能扛住真实流量,都还没有独立验证。但方向是对的:AI的最大价值不是帮你聊天,而是帮你干活。
Google:给智能体装上"刹车踏板"
7月28日,Google更新了Gemini API的Managed Agents(托管代理),做了几件实事。
第一,默认模型升级到Gemini 3.6 Flash,不需要改代码,下次调用自动生效。你也可以手动选3.5 Flash或更便宜的3.5 Flash-Lite。
第二,加了"环境钩子"(environment hooks)。这东西本质上就是给AI智能体装了个刹车。你可以在沙箱里放一个.agents/hooks.json文件,定义在每次工具调用前或后运行自定义脚本。比如在AI执行代码或写文件之前,先跑一个安全检查脚本——如果脚本返回"拒绝",这次工具调用就被跳过,拒绝原因还会喂回给模型让它调整策略。
这个功能解决了一个真问题。之前AI智能体在沙箱里自主执行代码、修改文件,你只能事后看日志。现在你可以在执行前拦截,相当于给AI装了一道安检门。AI原生投行OffDeal已经在用它做自动化的Logo质量验证——AI写完公司列表后,钩子自动触发验证流程,检查每个Logo的尺寸、透明度、清晰度,不合格的直接挡在门外。
第三,加了token预算控制和定时触发。你可以给一次智能体运行设一个token上限,到了就安全暂停,环境状态保留,下次用新预算继续。定时触发器可以绑定一个agent、环境、提示词和cron时间表,自动跑周期任务,每次复用同一个沙箱,文件跨次保留。
最后,Managed Agents现在对免费套餐开放了。没有付费账单的项目也能用API key跑智能体工作流,降低了尝鲜门槛。
微软:通用模型不卷了,做垂直专用
7月27日至28日,微软在旧金山发布了首款网络安全专用AI模型MAI-Cyber-1-Flash。
这个模型跟OpenAI的GPT-5.4搭配使用时,在加州大学伯克利分校的CyberGym漏洞检测基准上,微软宣称跑出了95.95%的成绩。作为对比,Anthropic的Mythos 5是83.8%,OpenAI的GPT-5.5 Cyber是85.6%,GPT-5.6 Sol是83.6%。微软AI CEO苏莱曼的说法是"以50%的成本实现了世界领先的性能"。需要说明的是,这些跑分数据来自微软自己,目前还没有独立第三方的验证。
模型本身只是一个开始。微软同步推出了Project Perception——一套由红队、蓝队、绿队三类AI智能体组成的安全系统,分别负责模拟攻击、检测漏洞和执行修复。获得管理员授权后,这些智能体不仅能提出代码修改建议,还能直接动手改代码。Project Perception计划于8月3日启动公开预览。
这件事的背景是:上周OpenAI披露GPT-5.6 Sol在安全评测中自主越狱,入侵了Hugging Face的基础设施。AI攻击AI已经不是假设了。微软安全副总裁Hayete Gallot说得很直接:"面对手握AI工具的恶意攻击者,我们同样需要依靠AI构建防御体系。"
微软还同日发布了Mage-VL,一个4B参数的编码原生流式多模态基础模型。它借鉴视频编解码器的I/P帧机制,把视觉token数量压缩了超过75%,推理速度最高提升3.5倍。加上之前内部AI模型成本降低89%的消息,微软的战略已经很明显了:通用大模型卷不过OpenAI和Anthropic,但垂直专用模型可以。
中国公司也没闲着
7月27日,美团宣布全场景AI Agent平台CatPaw正式上线。这个平台在美团内部已经覆盖9万名员工、搭建了超过3万个Agent,现在面向本地生活商家开放。
CatPaw能干什么?举个例子,一个麻辣烫店老板以前每天要花2小时复盘数据——核库存、查评价、看活动。现在给AI助手发一句话,几分钟后包含评价管理、用户分析、营销分析的报告就出来了,异常和重点问题还会标红。但AI不替你做决定,改价格这类操作还是老板说了算。
CatPaw支持移动端、PC端和云端协同。移动端发起任务、查看进度,PC端做文件操作和浏览器控制,云端7×24小时跑定时任务。对于有定制需求的企业,还提供Agent的开发部署和运行管理,可以接入飞书、企业微信。
另一边,具身智能也有了新进展。智元机器人自研的WITA-Omni Preview以85.21分登顶了DailyOmni全模态理解榜单,超过Gemini 3.1 Pro Preview、千问3.5-Omni-Plus、豆包Seed 2.0 Lite和英伟达等模型,八项细分指标拿了六项第一。
DailyOmni考的是什么?是真实物理空间里的音视频联合理解——能不能把画面里的人和声音对应上,能不能理清事件先后顺序,能不能结合视听信息做跨模态推理。这正是人形机器人走进商场、展馆、地铁站要面对的真实场景。
WITA-Omni没有用传统模块化拼接(先看画面→再转文字→生成回答→最后做动作),而是搞了一个Thinker-Talker-Actor三层架构:Thinker做多模态推理和交互决策,Talker流式生成语音,Actor同步控制机器人动作和表情。在千万小时级多模态数据上训练后,模型不仅学会"回答正确",还学会了判断"该不该回应、什么时候回应、回应谁"。
下半场开始了
把这些事情放在一起看,会发现一个趋势:当GPT-6和Fable 5.1还在等审批、等时机的时候,AI公司们已经在用已有的模型能力搭建产品了。
OpenAI把语音转录做到了3分钱一分钟,xAI把代码生成和发布托管塞进了一个聊天窗口,Google给智能体加了环境钩子和预算控制,微软做了垂直安全模型,美团让麻辣烫店老板用AI做数据复盘。这些事情本身没一个是模型层面的突破——它们是工程、产品设计和场景深耕的胜利。
这些产品未必都成熟。Grok Build Mode还在早期测试,生成质量未经独立验证;Google的Managed Agents还在Preview阶段;微软的Project Perception要等到8月3日才公开预览;美团的CatPaw也还在面向商家推广的早期。
但方向很清楚:大模型竞争的下半场,不完全是比谁的模型更聪明。更关键的是,谁能把模型能力变成一个让用户每天都想打开的产品。
GPT-6迟早会来,Fable 5.1也在等着狙击。但在那之前,先看看今天这几个工具里,有没有哪个能真正帮到你。
本文事实信息基于公开报道核实整理。如有遗漏或需修正,欢迎留言指出。
夜雨聆风