ARTICLE · 1111944
AI又变了:OpenAI一口气更新二十多项,Gemini 4也来了
过去两年,很多人判断AI进步,习惯看“谁在榜单上第一”。但到了2026年9月底,这个观察方法已经不够用了。
因为AI竞争已经同时发生在四层:模型本身、Agent执行能力、工具体系、企业级工作流。

而且就在9月29日至30日,行业连续发生两件很有代表性的事:OpenAI在DevDay一次性发布二十多项产品和开发者能力。Google紧接着公布Gemini 4首款旗舰模型Argon。
先看最新排名:Gemini 4 Argon把Google重新拉回第一梯队
9月30日,Google正式公布Gemini 4 Argon。它不是Gemini 3系列的小修小补,而是Gemini 4系列的首款旗舰模型。
Google给它的定位很直接:面向复杂软件工程、法律、金融、网络安全以及长周期企业任务。当前先向少量网络安全合作伙伴开放,尚未全面公开。
第三方Artificial Analysis在9月30日已经加入Gemini 4 Argon(High)的评测。第三方评测只能作为行业参考,受测试集、推理档位和评测方法影响,不等同于厂商官方性能结论。按其Intelligence Index v4.3.2最新结果,Argon得分53。
这次排名变化有两点值得注意。
第一,Argon并没有直接登上综合第一,但它已经压到GPT-6.1 Sol附近,Google此前在高端模型上的相对弱势明显收窄。
第二,Google自己公布的部分测试里,Argon在知识工作、自动化和网络安全等项目上超过Astra和Opus,但在部分代码基准上仍落后。也就是说,它更像是“全面回到前沿”,而不是“全面碾压”。
Artificial Analysis目前给出的Argon成本约为每个Intelligence Index任务1.99美元,1M上下文。由于它仍处在有限开放阶段,这组数据更适合作为最新快照,而不是最终结论。
价格战也升级了:现在比的是“完成一件事多少钱”
*价格口径说明:Gemini 4 Argon标准价格按每百万Token输入4美元、输出20美元计。缓存输入等优惠场景可能出现更低价格。GPT-6.1 Sol等模型也可能因缓存、批处理、地区和调用方式不同而存在差异,实际使用以厂商最新官方计费页面为准。
单看Token价格已经不够。未来企业真正会计算的是:同样一份代码修复、财务分析、合同审核或网页操作,哪个模型成功率更高、调用工具更少、返工更少。
这就是为什么GPT-6.1 Sol特别值得关注。它不是单纯追求榜单第一,而是把接近Astra的能力压到Astra约五分之一的标准Token价格。
高端能力正在快速“平价化”。当能力差距缩小以后,真正拉开成本的可能变成Agent执行效率。
OpenAI DevDay到底发了什么?上一版只写了其中一小部分
9月29日的DevDay不是一次简单的模型发布会。OpenAI公布和更新的项目超过20项,基本覆盖了模型、Agent、Coding、插件体系、团队协作和企业部署。
如果把这些更新放到真实工作场景里看,会更容易明白OpenAI到底想做什么。
先看模型和Agent底座
GPT-6.1 Sol:复杂Coding、Computer Use和专业知识工作能力接近Astra,标准API输入2美元、输出10美元/百万Token,并支持最高max推理强度。
Ultrafast:新的付费高速推理层。OpenAI称Astra在Codex里最高可实现约8倍Token生成速度,在API中最高约6倍。
Agents API:进入公测,托管Agent运行环境、记忆、工具和多Agent协作,不再需要开发者自己拼完整执行框架。
Computer Use:正式进入Agents API,可以让Agent通过图形界面操作网页和软件。
Multi-agent:GPT-6.1 Sol可把任务委派给子Agent并行完成。
Decisions API:有限预览,用Luna完成分类、路由和预设动作决策,更适合企业流程自动化。
Amazon Bedrock Managed Agents:OpenAI模型可以进入AWS托管Agent体系。
Codex正在从写代码走向完整工程流程
Codex Cloud:任务可以在云端继续跑,即使电脑合上也不会停止。
CLI更新:加入双向语音、/agents视图、会话恢复以及worktree工作流。
Code Review:把代码摘要、diff、问题解释直接放进评审流程,自动评审可以在云端执行。
Codex Security Cloud:自动扫描漏洞、调查问题、去重并生成修复方案,还可以按计划定期执行。
插件和外部应用开始真正接入工作流
DevDay还大幅扩展了插件体系。
Plugin extensions支持侧栏入口、交互面板和文件查看器,Figma、Adobe等现场展示了集成。
插件可以在对话过程中被推荐和发现。网站也可以直接调用插件能力,每个用户保留自己的数据连接和权限。
MCP events则更关键:外部应用事件可以直接触发自动化。也就是说,AI不需要等你手动发一句话,系统发生变化时就可以启动任务。
Sign in with ChatGPT让其他产品直接使用ChatGPT账号体系和授权。OpenAI Marketplace则把合作伙伴产品接入企业采购体系。
Dots、Space和团队协作,反而更值得看
Dots是持续运行的Agent,有自己的云端电脑,可以连接应用,并在用户离开聊天界面以后继续工作。
企业版还出现了Specialist dots:给不同Agent分配固定职责,例如研究、销售支持、数据分析或项目协调。
ChatGPT Space则把团队成员、文件、项目上下文和Agent放到同一个工作空间里。
Pages允许人和Agent共同编辑文档、图表和交互式工具。协作式Slides也已经宣布即将上线。
Teams和Team Tasks支持团队共享工作、分配周期任务。ChatGPT还可以直接进入Slack和Microsoft Teams,响应@ChatGPT并使用连接工具。
Meetings插件则会把会议转成纪要和行动项。
企业真正关心的隐私和治理,也开始补齐
OpenAI还公布了Private Intelligence方向,包括ZDR(零数据保留)配合Private Safety Processing,并计划推出Private Inference预览。
Microsoft Agent 365也计划支持管理Specialist dots,把Agent纳入企业已有的安全和治理体系。
这部分看起来没有新模型抢眼,但对于政务、金融、医疗、大企业来说,反而可能决定Agent能不能真正上线。
所以OpenAI真正想做的,已经不是一个更强聊天机器人
把这二十多项更新连起来看,逻辑很清楚:
模型负责思考。Agent负责拆任务和持续运行。Computer Use负责操作软件。插件负责连接业务系统。Space负责积累团队上下文。企业安全体系负责权限和审计。
再看国内:不能再用Qwen3.5、V4 Pro这些旧节点代表“当前水平”
国内模型今年的迭代速度同样很快。到9月底,更准确的看法应该按“当前最新主线”来看。
DeepSeek:最新节点已经是V4.1 Flash
9月10日,DeepSeek发布V4.1 Flash。它不是简单的小模型降配版,而是新架构家族的首个模型。
V4.1 Flash总参数552B,但输入阶段只激活8B、输出16B,并原生支持视觉理解。DeepSeek自己的评测里,它在多项Agent基准上已经超过此前V4 Pro。
它还把KV Cache占用大幅压缩,明显针对长时间Agent运行的推理成本进行优化。
所以现在再用“V4 Pro是DeepSeek最新旗舰”来概括就已经不准确。更合理的说法是:V4 Pro仍在服务,但V4.1 Flash代表了DeepSeek下一代架构和成本路线。
阿里Qwen:通用模型之外,9月已经进入3.8 Omni阶段
Qwen3.5-397B-A17B仍然是重要的通用旗舰模型,但Qwen在9月的更新已经往“全模态Agent”继续推进。
9月18日发布的Qwen3.8-Omni-Flash是一款原生全模态模型,目标已经不只是理解图片、音频和视频,而是“理解之后规划任务、调用工具并完成工作”。
同日还有Qwen3.8-LiveTranslate,进一步强化实时同传。9月20日又发布Qwen-Image-2.1,把图片生成与编辑统一到同一模型。
这说明Qwen当前路线已经从“大语言模型家族”,扩展为文本、视觉、语音、实时交互和Agent的完整模型矩阵。
字节Seed:最新通用主线是Seed2.1,外围已经扩到实时音视频和生成模型
Seed2.1目前仍是字节最新通用基础模型系列,提供Pro和Turbo两个版本,重点是跨工具、跨环境Agent以及端到端代码工程交付。
但如果只写Seed2.1,也会低估字节当前的完整能力。7月至8月,Seed又连续推出Seedream 5.0 Pro、Seedance 2.5、SeedRealtime和Seed Audio 1.0。
其中SeedRealtime已经是原生音视频全双工模型,目标是让AI同时看、听、理解时序并实时对话。
也就是说,豆包背后的路线已经从“聊天模型”扩展成Agent + 图像 + 视频 + 实时音视频的组合。
智谱GLM:GLM-5.3已经进入1M上下文和开放权重模型前列
GLM-5.3在8月发布,支持1M上下文和最高131K输出,并已经开放权重。
美国NIST旗下CAISI在9月的独立评估里称,GLM-5.3是其测试过“网络能力最强的开放权重模型”,但在综合网络安全能力上仍落后美国最前沿闭源模型。
这个结果比较有代表性:国产开放权重模型已经非常接近前沿,但在最高端闭源系统上仍存在时间差。
Kimi:K3把开放模型规模推到2.8万亿参数
Kimi K3在7月发布,总参数2.8万亿,原生视觉、1M上下文,定位长周期Coding、知识工作和推理。
它的意义不只是“大”,而是说明国内厂商在开放权重路线同样在向超大规模和长任务Agent推进。
MiniMax:当前主线已经是M3 + H3
MiniMax M3支持1M上下文、原生多模态和桌面操作,定位Coding与Agent。H3则是一款统一理解文本、图像、视频、音频并生成带原生音频视频的全模态生成模型。
MiniMax最新产品页面还已经出现M3.1 Flash Preview,说明文本Agent线仍在继续快速更新。
百度和腾讯:更像是在把模型直接塞进完整产品体系
百度目前通用主线是ERNIE 5.1,重点强化Agent、推理和创作,同时延续5.0的原生全模态路线。
腾讯Hy3则是295B总参数、21B激活参数的MoE模型,支持256K上下文,并已经进入元宝、CodeBuddy、ima等腾讯产品。腾讯还在同步更新HY-Image-3.0、HY-Video-1.5和HY-3D-3.1。
国内和海外现在到底差多少?
如果只看“模型能不能写、能不能推理、能不能Coding”,差距已经远没有两年前那么明显。DeepSeek、GLM、Kimi、Qwen、MiniMax都已经进入全球开放模型前列。
国内更明显的优势是价格、开放权重、中文场景、本地部署和迭代速度。
目前海外头部优势更集中在另一层:持续运行Agent、Computer Use成熟度、跨应用生态、企业权限体系、多Agent协同和完整产品体系。
未来一年,真正值得盯的变化
排行榜的重要性下降,任务成功率上升。企业会越来越少问“榜单第几”,越来越多问“这件事一次做成功的概率是多少”。
Agent从一次性任务走向常驻。后台持续运行、自动检查条件、等待事件触发,会越来越普遍。
Computer Use和API调用会融合。能走API就走API,遇到旧系统或网页再直接操作界面。
多Agent从演示变成工程架构。研究、编码、审核、安全、执行由不同Agent分工。
多模态从“能看懂”走向实时交互。视频、声音、屏幕、摄像头一起进入模型。
模型越来越便宜,长期运行成本成为核心指标。缓存、稀疏激活、推理效率会比单纯扩大参数更重要。
权限、审计和私有推理成为企业AI标配。Agent越能执行,越必须知道它看了什么、改了什么、谁授权。
最后:AI已经从“一个工具”开始变成“工作系统”
如果说2023年的AI核心体验是“聊天”,2024—2025年是“多模态和推理”,那么2026年的关键词已经非常明显:Agent、Computer Use、长任务和协作。
Google用Gemini 4 Argon把最高端模型能力重新拉回前沿。OpenAI则试图把模型、Agent、插件、协作和企业安全连成一整套平台。
国内则在另一边高速推进:DeepSeek V4.1 Flash、Qwen3.8 Omni、Seed2.1、GLM-5.3、Kimi K3、MiniMax M3/H3,都已经不是“聊天机器人”逻辑。
下一阶段真正值得看的,不是哪家公司又多了几分Benchmark,而是谁先把AI做成一个可靠、便宜、可持续运行、能直接接入真实业务的数字工作系统。
你现在更看好“更强的模型”,还是“能真正替人完成工作的Agent”?欢迎留言聊聊。
资料来源:OpenAI DevDay 2026官方开发者资源与API Changelog、GPT-6.1 Sol模型页、Dots官方介绍。Google DeepMind Gemini 4 Argon官方信息及Reuters 2026年9月30日报道。Artificial Analysis Intelligence Index v4.3.2。DeepSeek V4.1 Flash官方发布与API更新日志。Qwen官方2026年9月更新。ByteDance Seed官方模型页。Z.ai GLM-5.3及NIST/CAISI评估。Kimi K3官方发布。MiniMax M3/H3官方资料。百度ERNIE、腾讯混元官方资料。说明:模型榜单会随评测版本、推理档位和模型更新持续变化。Gemini 4 Argon目前仍处于有限开放阶段,第三方评测属于截至2026年9月30日至10月1日的最新快照。API价格、上下文长度和可用区域也可能调整,正式使用前应以厂商最新官方文档为准。