乐于分享
好东西不私藏

AI 风向月报|刘宸丨2026年6月

AI 风向月报|刘宸丨2026年6月
大家好,我是刘宸。
这里「AI可思议」,咱们一起看懂 AI。

开场白

2026 年 6 月,AI 行业的风向从 5 月的“Agent OS”进一步走向“Loop”。如果说上个月大家还在比谁的智能体更能干活,那么 6 月最突出的信号就是:这些智能体开始真正进入循环式执行状态。OpenAI 发布 GPT-5.6,却先以受限预览方式开放;Anthropic 将 Mythos 级别能力包装为 Fable 5,同时用自动降级和可信访问机制控制高风险请求;智谱 GLM-5.2、Kimi K2.7 Code、MiniMax-M3 等国产模型继续把开源、稀疏注意力、长程编码和 Agent 任务推到前台;阿里则把千问能力延伸到具身智能和机器人世界模型。与此同时,DeepSeek 完成大规模融资并计划扩员,xAI/SpaceX 将工程资源压向 Grok,字节和腾讯则继续围绕流量入口、办公场景和智能体平台补齐商业化闭环。6 月不是单纯“谁更聪明”的月份,而是行业开始认真回答另一个问题:当前沿模型已经能写代码、找漏洞、跑长任务、控制工具甚至连接物理世界时,这个“计划、执行、反馈、修正”的循环到底该如何跑得更久、更稳、更可控。

1. OpenAI / ChatGPT

OpenAI 本月的核心动作,是发布 GPT-5.6 系列,但这次发布的重点不只是模型能力,而是“发布方式”本身。6 月下旬,OpenAI 推出 GPT-5.6 模型套件,包括旗舰模型 Sol、中档效率模型 Terra 和面向高频使用的 Luna,并强调 Sol 在编码、网络安全、生物学和长程智能体任务上有明显提升。更值得注意的是,GPT-5.6 并没有直接进入完全开放状态,而是在美国政府要求下采用受限预览,由合作方和部分客户先行使用,且在双用途领域设置更强的监测和拦截机制。OpenAI 还为 Sol 引入更深推理的 max 模式和可调用子智能体的 ultra 模式,这说明它已经把前沿模型从“回答问题”推向“组织任务、调度执行、长期保持目标”的方向。相比 5 月默认体验升级,6 月的 OpenAI 更像是在定义前沿模型的新交付范式:普通用户需要的是稳定、便宜、默认可用的 Luna 或 Terra;高价值企业、网络防御、科研和政府客户则通过更严格的准入获得 Sol。OpenAI 的问题也随之变得更复杂:它既要证明自己仍能比 Anthropic 更快推新模型,又要避免被监管流程拖慢开发者生态,还要让用户相信“受控开放”不是变相削弱产品可用性。

2. Anthropic / Claude

Anthropic 是 6 月“受控开放”叙事最强的公司。月初,Anthropic 发布 Fable 5,这是其首个面向更广泛用户开放的 Mythos 级模型,官方定位是知识工作、软件工程、科研和复杂推理能力全面提升,但它并不是无条件开放。Fable 5 的关键机制,是把高风险请求自动转交给能力较弱的 Claude Opus 4.8,例如涉及进攻性网络安全、生物化学敏感能力和模型蒸馏的请求,会被系统降级处理。与此同时,Claude Mythos 5 仍主要面向 Project Glasswing 相关的网络防御、基础设施和政府合作伙伴,Anthropic 试图用“公开版 Fable + 可信版 Mythos”的方式,同时满足商业增长和安全边界。6 月中下旬,围绕 Mythos 在政府红队测试中的网络安全能力、临时限制以及部分恢复访问的报道,也让 Anthropic 的处境更加微妙:它一方面是最愿意公开谈模型风险的头部实验室,另一方面又必须把高风险能力变成客户真正愿意付费的产品。Claude 的优势仍然是长程任务、代码和可信执行,但 6 月暴露出的核心矛盾是:当一个模型足够强,强到能被政府、云厂商和关键基础设施客户同时盯上,它就不再只是 SaaS 产品,而变成了半基础设施、半战略资产。

3. xAI / Grok / Musk

xAI 本月的关键词是“工程总动员”。6 月底,Musk 对外透露 Grok 4.5 已在 Tesla 和 SpaceX 内部进入私测,并称 SpaceX 正把部分 Starlink、Starship 顶尖工程师投入 Grok 相关工作,同时利用 Cursor 团队和训练数据推进新基础模型。这个信号很重要:xAI 不再只是 Musk 旗下一个挑战 ChatGPT 的模型实验室,而是在 SpaceXAI 叙事下被重新组织为跨公司工程项目。Musk 还提出下半年以更高频率发布从头训练的新模型,这种节奏本身就带有强烈的“硬件公司式冲刺”意味。xAI 的短板也很清楚:Grok 在编码、企业工作流和稳定性上的口碑仍落后于 OpenAI、Anthropic 等公司,因此 6 月的动作更像是一次组织能力补课,而不是单个模型版本的胜利。真正值得关注的是 SpaceX 体系对 AI 基础设施的介入:如果 Starlink、Starship、超级计算集群和未来所谓轨道数据中心都被纳入 AI 叙事,xAI 竞争的就不只是聊天机器人,而是“算力、网络、工程人才和模型”的一体化系统。Grok 4.5 能否追上前沿模型还要看正式发布表现,但 xAI 已经用组织重构说明,它会把 AI 当成 SpaceX 级别的主航道来打。

4. 阿里 / Qwen

阿里 6 月最有代表性的动作,是把千问从语言模型继续推向具身智能。通义实验室推出 Qwen Robot Suite,包含面向操作任务的 Qwen-RobotManip、面向导航的 Qwen-RobotNav,以及面向视频世界建模的 Qwen-RobotWorld,试图让 Qwen 不只停留在文本、代码、图像和办公任务中,而是进入机器人感知、理解、规划和行动链路。这个方向很符合 6 月的行业主线:大模型能力越强,越需要被包装到具体场景里,机器人正是“模型能否连接物理世界”的重要考场。与此同时,阿里也卷入关于模型蒸馏和中美 AI 竞争的舆论风暴,有报道称 Anthropic 指控与阿里相关的操作者通过大量账号访问 Claude,以提取能力用于训练 Qwen 系列模型。无论后续事实如何,这件事至少说明千问已经不再只是国内模型竞争中的一员,而是被放进全球前沿模型能力扩散、知识产权和安全治理的框架里审视。阿里的优势仍然是云、开源生态、企业客户和电商生活服务入口,6 月的新变化是它开始把这些能力延伸到机器人和物理 AI。如果 5 月的阿里是在讲“芯、模、云”一体化,6 月的阿里则是在讲“模型、云和机器人生态”的一体化。

5. 字节 / Doubao

字节跳动 6 月没有像 OpenAI、Anthropic 那样发布一个引爆行业的前沿模型,但它的主线仍然清晰:继续把豆包从流量型 AI 助手推向可计费、可嵌入、可规模化的内容与智能体平台。5 月豆包开始试探更明确的订阅分层后,6 月的关键问题变成了用户是否愿意为更高额度、更强创作、更稳定搜索和生产力任务付费。字节的优势不是某一个旗舰模型参数,而是内容分发、视频生成、搜索推荐、移动端入口和火山引擎企业服务的组合。Seed 系列视频模型、豆包 App、剪映/抖音生态和火山引擎 API 共同构成了一条很字节的路线:先用 C 端高频场景放大模型使用,再把视频、搜索、智能体和企业工作流包装成可售卖能力。6 月的行业监管和高风险模型讨论,对字节反而是一种提醒:当 OpenAI 和 Anthropic 把前沿能力做成白名单产品时,字节更需要证明自己的 AI 能在真实内容生产链路中稳定创造收入,而不是只靠免费流量换增长。豆包本月的看点不是大模型排名,而是商业化耐力:C 端订阅能不能站住,B 端火山引擎能不能把模型路由、视频生成和 Agent 工具变成企业预算里的固定项。

6. 腾讯 / Yuanbao

腾讯 6 月的 AI 叙事仍然围绕“把智能体嵌进既有生态”展开。元宝在今年上半年已经完成从单一混元助手到多模型、多入口 AI 助手的转变,微信、QQ 浏览器、腾讯文档、腾讯会议、腾讯新闻和小程序生态,决定了腾讯不必像纯 AI 创业公司那样重新寻找入口。6 月行业的变化,反而强化了腾讯的策略价值:当前沿模型越来越受限,真正能长期留住用户的,不一定是最强单点模型,而是能否在聊天、办公、搜索、内容消费和企业协作里稳定完成小任务。腾讯云侧的 CodeBuddy、WorkBuddy 和混元能力,也说明腾讯在开发、办公和企业流程里尝试复用同一套 Agent 架构。它的问题仍然是产品声量不如豆包、Kimi、DeepSeek 等更锋利的品牌,用户对元宝的认知还没有完全从“AI 聊天助手”转向“微信生态生产力工具”。但腾讯的优势同样明显:微信关系链、企业微信、腾讯文档、腾讯会议和云服务形成了天然任务流。6 月的腾讯没有靠大模型参数抢头条,却在继续做一件更慢但更符合自身禀赋的事:把 AI 变成已有工作流里的默认按钮。

7. MiniMax

MiniMax 6 月的重点,应该从 M2.7 延续讨论转向 MiniMax Sparse Attention 和 MiniMax-M3。6 月 11 日,MiniMax 发布 MSA 技术论文,核心目标非常明确:解决超长上下文在 Agent 工作流、代码仓库级推理和长期记忆中的成本问题。传统 attention 在百万 token 级上下文下成本过高,而 MSA 用分块稀疏注意力和轻量级索引分支,为每个 GQA 组选择最相关的 key-value block,再只对这些 block 做精确注意力计算。论文中提到,在 109B 参数的原生多模态模型上,MSA 在 1M 上下文下能把每 token attention 计算量降低 28.4 倍,并在 H800 上实现 14.2 倍 prefill 和 7.6 倍 decoding 墙钟时间加速。更关键的是,MiniMax 同步公开了推理 kernel,并在 Hugging Face 上发布了由 MSA 驱动的生产级原生多模态模型 MiniMax-M3。这个动作比单纯谈 M2.7 更能代表 MiniMax 的 6 月:它不是只在模型榜单上比参数,而是在回答长程 Agent 的底层瓶颈问题。Agent Loop 想要跑得久,必须保留更长上下文、反复读写工具结果、跨代码库和多模态信息做判断,这些都直接消耗 attention 成本。MiniMax 6 月的价值就在这里:用稀疏注意力、工程 kernel 和开源模型,把“长循环任务能不能跑得起”变成一个可部署的系统问题。

8. Kimi / 月之暗面

月之暗面 6 月的重点,是 Kimi K2.7 Code 正式进入代码 Agent 竞争,Kimi称它为迄今最强的 Coding model;内部显示K2.7 Code 主打更可靠的长上下文指令跟随和更高的代码任务完成率,并同步提供高速版本。Hugging Face 上的官方模型卡则给出了更细的技术画像:Kimi K2.7 Code 是建立在 Kimi K2.6 之上的 coding-focused agentic model,面向真实长程编码任务做了明显增强;它仍然采用 MoE 架构,总参数 1T、激活参数 32B、上下文长度 256K,并接入 400M 参数的 MoonViT 视觉编码器。模型卡还强调,它相比 K2.6 约减少 30% thinking-token 使用量,采用原生 INT4 量化,支持官方 API、vLLM、SGLang、KTransformers 部署,并默认开启 preserve thinking 模式,用于多轮任务中保留推理内容。对开发者来说,这次更新的关键不在于单轮写代码,而在于 Kimi 正在把“读代码库、改文件、调用工具、根据报错再改”的完整 Agent Loop 产品化。Kimi Code 官网也直接把 K2.7 Code 放进 CLI、IDE 和终端工作流里,强调它能读写文件、执行 shell 命令、搜索代码、抓取网页,甚至派生子 Agent 做并行任务。6 月的 Kimi 因此不只是继续讲长上下文,而是把长上下文、代码能力、工具调用和低成本开放权重,打包成面向开发者的 Agent 底座。

9. GLM / 智谱

智谱 AI 6 月最值得关注的是 GLM-5.2。GLM-5.1 在 4、5 月已经把高速推理、低价 API 和 Agentic Engineering 推到前台,而 GLM-5.2 则进一步把“开源模型能否追近 Mythos 级网络安全能力”变成行业焦点。有媒体报道称,部分研究者认为 GLM-5.2 在漏洞发现和网络安全场景中已经接近 Mythos 的某些能力,这让智谱被放进中美 AI 能力差距和模型开放风险的讨论里。对智谱来说,这是机会也是压力:机会在于 GLM 系列的国际存在感被显著抬高,开源权重、高速推理和企业部署能力让它成为国产模型中更工程化的一支;压力在于,一旦模型被认为具备更强的网络安全能力,外界对其安全评测、访问控制、合规文档和风险披露的要求也会同步提高。智谱的商业路线一直比许多 C 端模型公司更偏基础设施:开发者平台、企业 API、私有化部署、低延迟应用和行业 Agent。6 月之后,这条路线会更吃香,因为企业客户既需要强模型,也需要可解释的治理边界。GLM 的下一步,不只是比 benchmark,更是比谁能把开源能力、商业服务和安全责任放在同一个产品框架里。

10. DeepSeek

DeepSeek 6 月“从技术黑马进入组织扩张”。本月多家媒体报道,DeepSeek 完成超过 74 亿美元的新融资,估值超过 500 亿美元,并计划招聘开发工程师、数据工程师、AI 产品经理、运营以及法务、财务、人力等岗位,整体指向大规模扩员。这个变化很有象征意义:DeepSeek 最初的行业冲击来自低成本、高性能和反传统资本叙事,但到了 2026 年 6 月,它已经不可避免地进入资本化、组织化和企业化阶段。融资和扩员意味着 DeepSeek 要把模型优势转化为持续研发、稳定服务、客户交付和国际竞争能力。市场仍然期待其后续模型在多模态、MCP、企业 Agent 和国产算力适配上的进一步升级,但 6 月最重要的不是某个新模型名,而是公司形态的变化:DeepSeek 正从“技术信仰品牌”变成“被大规模采购、被资本定价、被产业链绑定的 AI 基础设施公司”。这也会改变外界对它的评价标准。过去用户可以因为它便宜、开源、强大而宽容服务波动;未来企业客户会要求 SLA、合规、支持、生态和稳定迭代。DeepSeek 本月站在一个新拐点上:技术神话要开始接受公司化能力的检验。

本月关键词:Loop

6 月最能代表 AI 行业风向的关键词,是Loop。这里的 Loop,不是一个新模型名,也不是某家公司发布的新功能,而是 AI 从聊天工具变成执行系统之后,真正开始运转的底层形态:模型提出计划,调用工具,观察结果,修正动作,再继续执行。过去我们说 AI,是一次问答;现在我们说 AI,是一轮又一轮循环。谁能把这个循环跑得更久、更稳、更便宜、更可控,谁就更接近下一代 AI 产品的核心。
Loop 的第一层含义,是Agent 执行循环成为产品核心。Claude Code 的架构分析里,一个很有代表性的结论是:核心机制其实是一个简单的 while-loop,模型不断思考、调用工具、接收反馈、继续下一步。真正复杂的部分,反而是围绕这个循环建立的权限系统、上下文压缩、会话存储、MCP 扩展、子 Agent 分工和安全隔离。OpenAI Codex 的增长也说明同一件事:用户不再只想让 AI 回答“怎么做”,而是希望它进入代码库、办公文件、浏览器和命令行,把任务一轮轮推进到可交付状态。6 月的 Agent 竞争,表面是模型能力竞争,底层其实是循环系统竞争。
Loop 的第二层含义,是人从执行者变成循环管理者。OpenAI 与高校研究者关于 Codex 的 6 月报告显示,Agent 使用在 2026 年上半年快速增长,越来越多用户开始同时管理多个 Codex 任务,甚至把复杂工作流沉淀成可复用的 skills。这个变化很关键:人的工作不再是亲手写每一行代码、整理每一份材料、点击每一个界面,而是把目标拆给多个 Agent,检查它们的中间结果,决定哪些循环继续跑、哪些循环要暂停、哪些输出需要返工。也就是说,AI 并没有简单替代人,而是把人的位置推到了循环的上层:人负责定义目标、设定边界、评估质量、承担责任。
Loop 的第三层含义,是质量问题也开始循环化。6 月围绕 AI 写代码的讨论里,一个反复出现的词是“Cleanup Tax”,也就是 AI 生成越多,后面清理、测试、重构、追责的成本越高。很多创业公司已经让 AI 写出大部分代码,但随之而来的 bug、架构松散、重复实现和维护困难,也让团队意识到:如果没有测试、审查、回滚、日志和人工验收,Agent Loop 很容易变成 Bug Loop。模型每一轮都看似在前进,但如果反馈信号不干净,循环只会把错误放大。未来工程团队比拼的,不只是会不会用 Claude Code、Codex、Cursor,而是谁能设计出更好的验证循环。
更深层地看,Loop 代表 AI 行业从“模型输出时代”进入“过程治理时代”。单轮回答好不好,已经不足以定义一个 AI 产品;真正重要的是它能不能在长任务中持续观察、修正、验证和交付。一个好的 Agent,不是永远不犯错,而是犯错后能被发现、能被约束、能被拉回正确路径。6 月的行业信号已经很清楚:未来 AI 的竞争单位,不再是一句话、一次生成、一个 benchmark,而是一整套循环系统。模型是循环里的大脑,工具是循环里的手脚,上下文是循环里的记忆,权限是循环里的边界,测试和人工审查则是循环里的刹车。谁能设计出最可靠的 Loop,谁就能把 AI 从“能办事”推进到“能长期托付”。

结束语

2026 年 6 月,是 AI 行业从“模型能力竞赛”走向“循环系统竞赛”的一个月。OpenAI 和 Anthropic 在前沿模型上继续领跑,但真正的差异开始落到任务分解、工具调用、权限控制、反馈修正和长程执行上;国产模型公司则用开源、低成本、编码能力和工程化部署继续追近前沿水平;阿里、腾讯、字节、DeepSeek、xAI 分别从机器人、生态入口、内容平台、资本扩张和基础设施调度切入下一阶段竞争。行业的分水岭正在变得更清楚:未来赢的不只是能训练最强模型的公司,而是能把模型、工具、上下文、测试和人工审查组织成可靠 Loop 的公司。AI 的风向,正在从“能办事”走向“能长期托付”。
AI可思议,陪你看懂AI。
记得关注,别走丢!