夜雨聆风学习资料网

ARTICLE · 1111944

AI又变了:OpenAI一口气更新二十多项,Gemini 4也来了

AI又变了:OpenAI一口气更新二十多项,Gemini 4也来了

过去两年,很多人判断AI进步,习惯看“谁在榜单上第一”。但到了2026年9月底,这个观察方法已经不够用了。

因为AI竞争已经同时发生在四层:模型本身、Agent执行能力、工具体系、企业级工作流。

而且就在9月29日至30日,行业连续发生两件很有代表性的事:OpenAI在DevDay一次性发布二十多项产品和开发者能力。Google紧接着公布Gemini 4首款旗舰模型Argon。

把这两天的更新放在一起看,信号其实很清楚:下一阶段AI不再只是“谁更会回答问题”,而是谁能更便宜、更长时间、更可靠地替人完成真实工作。

先看最新排名:Gemini 4 Argon把Google重新拉回第一梯队

9月30日,Google正式公布Gemini 4 Argon。它不是Gemini 3系列的小修小补,而是Gemini 4系列的首款旗舰模型。

Google给它的定位很直接:面向复杂软件工程、法律、金融、网络安全以及长周期企业任务。当前先向少量网络安全合作伙伴开放,尚未全面公开。

第三方Artificial Analysis在9月30日已经加入Gemini 4 Argon(High)的评测。第三方评测只能作为行业参考,受测试集、推理档位和评测方法影响,不等同于厂商官方性能结论。按其Intelligence Index v4.3.2最新结果,Argon得分53。

Claude Opus 5.5Artificial Analysis智能指数:58综合表现处于前列,金融、策略类任务表现突出。
Claude Sonnet 5.5智能指数:56在能力与成本之间保持较好平衡。
Gemini 4 Argon智能指数:53Google重新进入行业前沿,在法律、工程等评测中表现靠前。
GPT-6.1 Sol智能指数:最高52接近Astra能力,但价格明显下降。

这次排名变化有两点值得注意。

第一,Argon并没有直接登上综合第一,但它已经压到GPT-6.1 Sol附近,Google此前在高端模型上的相对弱势明显收窄。

第二,Google自己公布的部分测试里,Argon在知识工作、自动化和网络安全等项目上超过Astra和Opus,但在部分代码基准上仍落后。也就是说,它更像是“全面回到前沿”,而不是“全面碾压”。

Artificial Analysis目前给出的Argon成本约为每个Intelligence Index任务1.99美元,1M上下文。由于它仍处在有限开放阶段,这组数据更适合作为最新快照,而不是最终结论。

价格战也升级了:现在比的是“完成一件事多少钱”

Gemini 4 Argon标准价:输入 $4 / 百万Token,输出 $20 / 百万Token;上下文约1M。
GPT-6.1 Sol输入 $2 / 百万Token,输出 $10 / 百万Token;上下文约1.05M。
Claude Opus 5.5输入 $4 / 百万Token,输出 $20 / 百万Token;上下文约1M。
GLM-5.3国际平台参考价:输入约 $1.4 / 百万Token,输出约 $4.4 / 百万Token;上下文约1M。

*价格口径说明:Gemini 4 Argon标准价格按每百万Token输入4美元、输出20美元计。缓存输入等优惠场景可能出现更低价格。GPT-6.1 Sol等模型也可能因缓存、批处理、地区和调用方式不同而存在差异,实际使用以厂商最新官方计费页面为准。

单看Token价格已经不够。未来企业真正会计算的是:同样一份代码修复、财务分析、合同审核或网页操作,哪个模型成功率更高、调用工具更少、返工更少。

这就是为什么GPT-6.1 Sol特别值得关注。它不是单纯追求榜单第一,而是把接近Astra的能力压到Astra约五分之一的标准Token价格。

高端能力正在快速“平价化”。当能力差距缩小以后,真正拉开成本的可能变成Agent执行效率。

OpenAI DevDay到底发了什么?上一版只写了其中一小部分

9月29日的DevDay不是一次简单的模型发布会。OpenAI公布和更新的项目超过20项,基本覆盖了模型、Agent、Coding、插件体系、团队协作和企业部署。

如果把这些更新放到真实工作场景里看,会更容易明白OpenAI到底想做什么。

先看模型和Agent底座

GPT-6.1 Sol:复杂Coding、Computer Use和专业知识工作能力接近Astra,标准API输入2美元、输出10美元/百万Token,并支持最高max推理强度。

Ultrafast:新的付费高速推理层。OpenAI称Astra在Codex里最高可实现约8倍Token生成速度,在API中最高约6倍。

Agents API:进入公测,托管Agent运行环境、记忆、工具和多Agent协作,不再需要开发者自己拼完整执行框架。

Computer Use:正式进入Agents API,可以让Agent通过图形界面操作网页和软件。

Multi-agent:GPT-6.1 Sol可把任务委派给子Agent并行完成。

Decisions API:有限预览,用Luna完成分类、路由和预设动作决策,更适合企业流程自动化。

Amazon Bedrock Managed Agents:OpenAI模型可以进入AWS托管Agent体系。

Codex正在从写代码走向完整工程流程

Codex Cloud:任务可以在云端继续跑,即使电脑合上也不会停止。

CLI更新:加入双向语音、/agents视图、会话恢复以及worktree工作流。

Code Review:把代码摘要、diff、问题解释直接放进评审流程,自动评审可以在云端执行。

Codex Security Cloud:自动扫描漏洞、调查问题、去重并生成修复方案,还可以按计划定期执行。

这说明Coding Agent已经从“帮你补几行代码”,进入“持续开发 + 评审 + 安全扫描 + 后台运行”的完整工程流程。

插件和外部应用开始真正接入工作流

DevDay还大幅扩展了插件体系。

Plugin extensions支持侧栏入口、交互面板和文件查看器,Figma、Adobe等现场展示了集成。

插件可以在对话过程中被推荐和发现。网站也可以直接调用插件能力,每个用户保留自己的数据连接和权限。

MCP events则更关键:外部应用事件可以直接触发自动化。也就是说,AI不需要等你手动发一句话,系统发生变化时就可以启动任务。

Sign in with ChatGPT让其他产品直接使用ChatGPT账号体系和授权。OpenAI Marketplace则把合作伙伴产品接入企业采购体系。

Dots、Space和团队协作,反而更值得看

Dots是持续运行的Agent,有自己的云端电脑,可以连接应用,并在用户离开聊天界面以后继续工作。

企业版还出现了Specialist dots:给不同Agent分配固定职责,例如研究、销售支持、数据分析或项目协调。

ChatGPT Space则把团队成员、文件、项目上下文和Agent放到同一个工作空间里。

Pages允许人和Agent共同编辑文档、图表和交互式工具。协作式Slides也已经宣布即将上线。

Teams和Team Tasks支持团队共享工作、分配周期任务。ChatGPT还可以直接进入Slack和Microsoft Teams,响应@ChatGPT并使用连接工具。

Meetings插件则会把会议转成纪要和行动项。

企业真正关心的隐私和治理,也开始补齐

OpenAI还公布了Private Intelligence方向,包括ZDR(零数据保留)配合Private Safety Processing,并计划推出Private Inference预览。

Microsoft Agent 365也计划支持管理Specialist dots,把Agent纳入企业已有的安全和治理体系。

这部分看起来没有新模型抢眼,但对于政务、金融、医疗、大企业来说,反而可能决定Agent能不能真正上线。

所以OpenAI真正想做的,已经不是一个更强聊天机器人

把这二十多项更新连起来看,逻辑很清楚:

模型负责思考。Agent负责拆任务和持续运行。Computer Use负责操作软件。插件负责连接业务系统。Space负责积累团队上下文。企业安全体系负责权限和审计。

最终形态更像一个“AI操作层”:人给目标,AI自己调用模型、应用、文件、浏览器和其他Agent,把任务完成后再交回给人确认。

再看国内:不能再用Qwen3.5、V4 Pro这些旧节点代表“当前水平”

国内模型今年的迭代速度同样很快。到9月底,更准确的看法应该按“当前最新主线”来看。

DeepSeek:最新节点已经是V4.1 Flash

9月10日,DeepSeek发布V4.1 Flash。它不是简单的小模型降配版,而是新架构家族的首个模型。

V4.1 Flash总参数552B,但输入阶段只激活8B、输出16B,并原生支持视觉理解。DeepSeek自己的评测里,它在多项Agent基准上已经超过此前V4 Pro。

它还把KV Cache占用大幅压缩,明显针对长时间Agent运行的推理成本进行优化。

所以现在再用“V4 Pro是DeepSeek最新旗舰”来概括就已经不准确。更合理的说法是:V4 Pro仍在服务,但V4.1 Flash代表了DeepSeek下一代架构和成本路线。

阿里Qwen:通用模型之外,9月已经进入3.8 Omni阶段

Qwen3.5-397B-A17B仍然是重要的通用旗舰模型,但Qwen在9月的更新已经往“全模态Agent”继续推进。

9月18日发布的Qwen3.8-Omni-Flash是一款原生全模态模型,目标已经不只是理解图片、音频和视频,而是“理解之后规划任务、调用工具并完成工作”。

同日还有Qwen3.8-LiveTranslate,进一步强化实时同传。9月20日又发布Qwen-Image-2.1,把图片生成与编辑统一到同一模型。

这说明Qwen当前路线已经从“大语言模型家族”,扩展为文本、视觉、语音、实时交互和Agent的完整模型矩阵。

字节Seed:最新通用主线是Seed2.1,外围已经扩到实时音视频和生成模型

Seed2.1目前仍是字节最新通用基础模型系列,提供Pro和Turbo两个版本,重点是跨工具、跨环境Agent以及端到端代码工程交付。

但如果只写Seed2.1,也会低估字节当前的完整能力。7月至8月,Seed又连续推出Seedream 5.0 Pro、Seedance 2.5、SeedRealtime和Seed Audio 1.0。

其中SeedRealtime已经是原生音视频全双工模型,目标是让AI同时看、听、理解时序并实时对话。

也就是说,豆包背后的路线已经从“聊天模型”扩展成Agent + 图像 + 视频 + 实时音视频的组合。

智谱GLM:GLM-5.3已经进入1M上下文和开放权重模型前列

GLM-5.3在8月发布,支持1M上下文和最高131K输出,并已经开放权重。

美国NIST旗下CAISI在9月的独立评估里称,GLM-5.3是其测试过“网络能力最强的开放权重模型”,但在综合网络安全能力上仍落后美国最前沿闭源模型。

这个结果比较有代表性:国产开放权重模型已经非常接近前沿,但在最高端闭源系统上仍存在时间差。

Kimi:K3把开放模型规模推到2.8万亿参数

Kimi K3在7月发布,总参数2.8万亿,原生视觉、1M上下文,定位长周期Coding、知识工作和推理。

它的意义不只是“大”,而是说明国内厂商在开放权重路线同样在向超大规模和长任务Agent推进。

MiniMax:当前主线已经是M3 + H3

MiniMax M3支持1M上下文、原生多模态和桌面操作,定位Coding与Agent。H3则是一款统一理解文本、图像、视频、音频并生成带原生音频视频的全模态生成模型。

MiniMax最新产品页面还已经出现M3.1 Flash Preview,说明文本Agent线仍在继续快速更新。

百度和腾讯:更像是在把模型直接塞进完整产品体系

百度目前通用主线是ERNIE 5.1,重点强化Agent、推理和创作,同时延续5.0的原生全模态路线。

腾讯Hy3则是295B总参数、21B激活参数的MoE模型,支持256K上下文,并已经进入元宝、CodeBuddy、ima等腾讯产品。腾讯还在同步更新HY-Image-3.0、HY-Video-1.5和HY-3D-3.1。

国内和海外现在到底差多少?

如果只看“模型能不能写、能不能推理、能不能Coding”,差距已经远没有两年前那么明显。DeepSeek、GLM、Kimi、Qwen、MiniMax都已经进入全球开放模型前列。

国内更明显的优势是价格、开放权重、中文场景、本地部署和迭代速度。

目前海外头部优势更集中在另一层:持续运行Agent、Computer Use成熟度、跨应用生态、企业权限体系、多Agent协同和完整产品体系。

看到这里,差距其实已经不太像两年前那种“模型会不会答题”的差距了。更现实的问题是:能不能让模型在真实业务里长期、稳定地把事做完。

未来一年,真正值得盯的变化

排行榜的重要性下降,任务成功率上升。企业会越来越少问“榜单第几”,越来越多问“这件事一次做成功的概率是多少”。

Agent从一次性任务走向常驻。后台持续运行、自动检查条件、等待事件触发,会越来越普遍。

Computer Use和API调用会融合。能走API就走API,遇到旧系统或网页再直接操作界面。

多Agent从演示变成工程架构。研究、编码、审核、安全、执行由不同Agent分工。

多模态从“能看懂”走向实时交互。视频、声音、屏幕、摄像头一起进入模型。

模型越来越便宜,长期运行成本成为核心指标。缓存、稀疏激活、推理效率会比单纯扩大参数更重要。

权限、审计和私有推理成为企业AI标配。Agent越能执行,越必须知道它看了什么、改了什么、谁授权。

最后:AI已经从“一个工具”开始变成“工作系统”

如果说2023年的AI核心体验是“聊天”,2024—2025年是“多模态和推理”,那么2026年的关键词已经非常明显:Agent、Computer Use、长任务和协作。

Google用Gemini 4 Argon把最高端模型能力重新拉回前沿。OpenAI则试图把模型、Agent、插件、协作和企业安全连成一整套平台。

国内则在另一边高速推进:DeepSeek V4.1 Flash、Qwen3.8 Omni、Seed2.1、GLM-5.3、Kimi K3、MiniMax M3/H3,都已经不是“聊天机器人”逻辑。

下一阶段真正值得看的,不是哪家公司又多了几分Benchmark,而是谁先把AI做成一个可靠、便宜、可持续运行、能直接接入真实业务的数字工作系统。

你现在更看好“更强的模型”,还是“能真正替人完成工作的Agent”?欢迎留言聊聊。

#人工智能 #AI大模型 #OpenAI #Gemini4 #AI智能体

资料来源:OpenAI DevDay 2026官方开发者资源与API Changelog、GPT-6.1 Sol模型页、Dots官方介绍。Google DeepMind Gemini 4 Argon官方信息及Reuters 2026年9月30日报道。Artificial Analysis Intelligence Index v4.3.2。DeepSeek V4.1 Flash官方发布与API更新日志。Qwen官方2026年9月更新。ByteDance Seed官方模型页。Z.ai GLM-5.3及NIST/CAISI评估。Kimi K3官方发布。MiniMax M3/H3官方资料。百度ERNIE、腾讯混元官方资料。说明:模型榜单会随评测版本、推理档位和模型更新持续变化。Gemini 4 Argon目前仍处于有限开放阶段,第三方评测属于截至2026年9月30日至10月1日的最新快照。API价格、上下文长度和可用区域也可能调整,正式使用前应以厂商最新官方文档为准。

相关学习资料