2026年6月,智能体正在从模型走向岗位,从问答工具走向执行系统,开始进入企业的真实工作流之中。
🚀国内外模型发布:性能与性价比之争
国内
字节跳动:豆包2.1 Pro + Seedance 2.5

🚀豆包大模型 2.1 Pro 从对话走向Agent执行
豆包大模型 2.1 Pro 是字节跳动在 2026 年 6 月火山引擎 FORCE 大会上发布的新一代模型升级版本,核心变化不再只是能力增强,而是明显转向“可执行任务的AI Agent”。
该模型重点强化了Coding 与任务执行能力,使其可以参与代码生成、调试辅助以及多步骤工程任务处理,并在工具调用与任务拆解能力上进一步增强,更强调长链路任务的持续执行能力与工程可用性。
在应用层面,豆包 2.1 Pro 主要面向企业级开发与自动化工作流场景,包括软件开发辅助、流程编排与复杂任务执行,整体定位更偏向“可落地的生产力工具”。
🎬Seedance 2.5 视频生成模型
Seedance 2.5 同期亮相,是字节在视频生成方向的重要升级,主要强化视频生成的连贯性与可控性,使生成内容更适用于真实内容生产场景。
该模型支持通过文本和图像等多模态输入进行控制生成,提升画面一致性与内容稳定性,主要面向短视频制作、广告生成与内容工业化生产等应用场景。
其发布意味着豆包体系正在从“文本与代码模型”扩展为覆盖视频生成的多模态内容生产系统。
🧠智谱 GLM 系列:强化代码与Agent能力的开源路线
2026年6月中旬,智谱AI推进GLM系列迭代并强化开源版本能力,其中GLM-5.2重点提升了长上下文处理与复杂任务执行能力,使模型更适合多文档信息整合、多步推理以及工具调用类任务。
在实际应用上,该版本更偏向科研与企业场景,例如文献分析、跨文档总结和结构化信息处理,同时支持本地化部署与微调,在金融、政务与高校等对数据安全要求较高的场景中应用更广。
整体来看,GLM-5.2延续了智谱的开源路线,强调“可部署与可定制”,与闭源模型形成互补,推动国内开源模型向生产级应用进一步靠拢。
✨MiniMax M3:把前沿能力带进开源世界的国产旗舰
6月1日,稀宇科技发布新一代旗舰模型MiniMax M3,并于6月中旬开源模型权重,进一步强化其在开源大模型生态中的影响力。该模型的核心特点在于同时强调长上下文处理能力、多模态能力以及代码生成能力,试图在统一架构下覆盖复杂任务处理与内容生成场景。
在技术路线方面,MiniMax M3采用稀疏注意力(Sparse Attention)等架构优化方案,以支持超长上下文输入,在长文档理解、代码库分析以及多轮任务推理等场景中具备更强的处理能力。同时,其在多模态方向也进行了统一建模尝试,使模型能够更好地融合文本与图像等信息,用于复杂内容理解与生成任务。
在应用层面,M3主要面向开发者生态与企业级部署场景,强调本地化可用性与系统集成能力,适用于长文档处理、代码辅助开发、多模态内容生成以及Agent类复杂任务执行等方向。作为开源模型,其开放策略也进一步推动开发者社区在长上下文与多模态统一建模方向上的探索。
整体来看,MiniMax M3代表的是国内开源模型的一条重要路径:在不依赖闭源模型的前提下,通过架构优化与长上下文能力增强,尝试在复杂任务场景中接近生产级AI系统能力。
🚀美团 LongCat 系列:走向国产算力与大规模工程化训练

6月30日,美团发布新一代大模型LongCat系列的升级版本(LongCat-2.0),该模型继续采用MoE架构,并重点强化了长上下文处理能力与复杂任务执行能力,在代码生成与多步骤任务处理场景中进一步优化。
相比以往模型迭代,这一版本更值得关注的并不是单点性能提升,而是其在工程体系上的变化:模型训练与部署更强调对大规模分布式算力系统的依赖,并逐步向国产算力生态迁移,体现出企业在AI基础设施层面的持续投入。
在应用层面,LongCat主要面向复杂任务执行与Agent类工作流场景,包括代码生成、数据分析以及多步骤自动化任务处理等方向,整体更偏向“可执行AI系统”的技术路线,而不仅仅是对话模型。
从行业角度来看,美团的这一系列动作,代表的是国内大厂在大模型领域的另一条路径:不只是模型能力竞争,而是围绕“算力 + 工程化 + Agent应用”的系统级建设。
🧠华为:盘古体系持续升级,强化昇腾生态协同

从技术方向来看,华为持续强化大模型在长上下文处理与企业级部署场景中的能力,同时通过对昇腾算力的深度适配,提高模型在实际推理任务中的效率表现,并进一步推动模型在鸿蒙生态中的应用落地,使其能够更好地服务于端云协同场景。
在战略层面,华为正在逐步构建“算力 + 模型 + 系统生态”的一体化AI体系,通过加强开源与生态建设,推动盘古模型从单一模型能力,向基础设施级AI能力演进。这一方向也意味着其大模型战略正在从早期的相对封闭模式,转向更加开放的生态协同路线,以弥补在模型生态上的时间差。
国外
🌍OpenAI
GPT-5.6“三箭齐发”,却被政府锁在窄门里

6月26日,OpenAI正式发布了GPT-5.6系列,包含旗舰版Sol(太阳)、均衡版Terra(地球)和轻量版Luna(月亮)三款模型。旗舰版Sol在编程测试Terminal-Bench 2.1中得分91.9%,超越Anthropic的Claude Mythos 5(88.0%),在网络安全ExploitBench测试中仅用约三分之一的输出token就达到了竞品同等水平。Sol还引入了“Ultra模式”,能协调多个子智能体协同完成复杂长周期任务。定价上,Sol的价格仅为Anthropic Fable 5的一半左右。
然而,这次发布最大的看点不在性能,而在发布方式。应美国政府要求,GPT-5.6在预览期仅向约20家经“逐客户审批”的可信合作伙伴开放,用户访问权限甚至需要美国政府逐一批准,这在AI发布史上尚属首次。此前,特朗普政府6月2日签署的AI行政令已要求前沿模型发布前须接受政府安全审查;而就在13天前,Anthropic的Claude Mythos 5和Fable 5因被美国商务部援引出口管制法规直接要求全球下线,至今Fable 5仍未解禁。OpenAI虽配合了政府要求,但在公告中罕见表态:“我们不认为这种政府访问审批流程应成为长期默认做法”。
自研芯片落地,时隔六年重返机器人赛道
6月24日,OpenAI与博通联合发布首款自研AI推理芯片Jalapeño,专为大语言模型推理设计,从设计到流片仅用9个月,计划2026年底部署,据称可将算力成本降低50%。6月1日,OpenAI正式成立“OpenAI Robotics”团队,由DALL·E和Sora核心开发者阿迪亚·拉梅什领导,短期聚焦建筑和基建场景的协助型机器人,长期目标是为每个人提供个人机器人。这标志着OpenAI时隔六年重返实体机器人领域——此前其曾在2020年前后解散机器人团队,转而集中资源开发大语言模型。
⚙️Anthropic

Claude Mythos 5:发布三天即全球下线
6月9日,Anthropic推出了两款重磅模型:面向公众开放的Claude Fable 5和仅向特定机构开放的Claude Mythos 5。其中Mythos 5在网络安全测试中表现惊人——在与美国情报机构的联合测试中,该模型在数小时内就自主发现了美国政府系统中的高危漏洞。然而这一能力直接触发了监管红线,发布仅3天后,美国商务部便援引出口管制法规要求两款模型全球下线,连公司内部的外籍员工都无权访问。经过近两周博弈,Mythos 5于6月26日获准向约100家经批准的美国机构和关键基建商重新开放,而Fable 5则于7月1日起恢复全球访问。
Sonnet 5:性价比补位
6月30日,Anthropic又发布了Claude Sonnet 5,一款主打高性价比的中端模型。在代理编程测试SWE-Bench Pro中得分63.2%,性能接近旗舰Opus 4.8(69.2%),但定价仅为Opus 4.8的约40%。该模型面向所有套餐用户默认启用,定位清晰——在能力与成本之间找到平衡,同时因其能力未触及“前沿模型”红线,也规避了被政府封禁的风险。至此,Anthropic在6月完成了从“被封杀”到“有条件复活”再到“差异化补位”的全过程,也折射出美国前沿AI监管正在从原则走向具体执行的复杂博弈。
💡xAI
xAI的Grok 4.3正式登陆Amazon Bedrock,标志着这家马斯克旗下的AI公司首次切入企业级市场。这款模型采用“推理优先”(reasoning-first)架构,推理能力始终在线而非可选项,在多步Agent任务中表现更稳定。核心参数上,Grok 4.3拥有100万token上下文窗口,知识截止至2025年12月,支持文本与图像多模态输入。定价极具竞争力——输入每百万token 1.25美元、输出2.50美元,约为Claude同级模型的1/6到1/10。
此次登陆AWS被视为xAI从“推特AI”向“企业级供应商”转型的关键一步。Grok还拥有一个独特优势——原生接入X平台实时数据流,这在金融分析、合同审查等对信息时效性敏感的场景中形成差异化竞争力。AWS公告点名的适用场景包括合同审查、判例法研究、金融文档问答等企业级工作流。
🚀英伟达:Nemotron 3 Ultra,专为长时智能体设计

6月初,英伟达发布开源模型Nemotron 3 Ultra,总参数量5500亿(激活550亿),原生支持100万token超长上下文,采用混合Mamba-Transformer MoE架构,专为长时间运行的Agent任务设计。推理速度比同级别开源前沿模型最高提升5倍,Agent任务成本最高降低30%,在全球开源模型中首次实现了“高性能+低成本+长时运行”的三角平衡。
该模型已完成对Hermes Agent、LangChain Deep Agent、OpenHands等主流Agent平台的适配,CrowdStrike和Palantir等企业已率先将其用于网络安全防御和复杂任务执行场景。模型权重已通过Hugging Face、OpenRouter等平台以NVIDIA NIM微服务形式向开发者开放,进一步巩固了英伟达在AI基础设施层的统治地位——不仅提供算力芯片,也在模型层为行业树立了“长时智能体”的技术标杆。
🤖智能体进入“工作流时代”:AI开始真正进群上班
2026年6月,智能体(Agent)正在从“工具阶段”快速进入“工作系统阶段”,一个明显变化是AI不再只是单次问答工具,而是开始以持续任务的方式嵌入企业协作流程。
在企业协同场景中,以Anthropic为代表的模型正在与Slack等办公工具深度结合,使AI能够直接进入团队工作流中,参与任务分配、信息总结与项目协作。这类能力正在让AI逐渐从“被调用的工具”,转变为“参与工作的数字成员”。
在数据与企业决策场景中,Databricks等公司正在构建面向企业数据的智能体系统,使AI能够基于企业内部知识进行分析与决策支持,将数据查询从传统BI工具升级为自然语言驱动的智能协作方式。
在信息获取与监测领域,搜索引擎也正在向Agent化演进,通过持续运行的任务型AI能力,实现对新闻、市场与数据变化的动态监控,使信息获取从“搜索行为”转向“持续观察”。
与此同时,从OpenAI内部使用情况来看,智能体工具正在快速渗透企业工作流,逐渐从开发者扩展到法务、财务与运营等非技术岗位,大量复杂任务开始被交由AI以长周期方式执行,这标志着知识工作的基本单位正在发生变化——从“问一次问题”,变成“交付一个任务”。
在科研与医疗等垂直领域,智能体也正在被用于结构化任务处理,包括医学影像分析、科研流程辅助以及安全风险识别等方向,进一步推动AI从通用能力向专业系统渗透。
🧬AI4S进入2026年6月:科研正在被“Agent化重写”
2026年6月,AI for Science(AI4S)领域的变化并不体现在某一个单独模型的发布,而是体现在整个科研体系正在发生结构性升级。从国家科研计划到高校实验室,再到产业界基础设施,AI正在从“科研工具”逐步转变为“科研参与者”。
在新加坡,国家研究基金会正式启动AI4S国家级项目,将AI系统性引入材料科学、生物医学、能源与气候等关键科研方向,推动AI与科学家的深度协同。这类项目不再只是单点算法优化,而是以“AI参与科研流程”为核心设计思路。
与此同时,在全球范围内,AI辅助科学研究的范式正在发生变化,越来越多的研究开始探索“科研Agent”的概念,使AI能够参与文献分析、实验设计甚至科学假设生成,科研流程正在从人工主导向人机协同演化。
在中国方向,科学智能基础设施也在加速建设,通过数据平台、算力系统与实验环境的整合,推动AI从模型能力向科研操作系统演进。
整体来看,AI4S在2026年6月的核心变化不是“模型更强了”,而是——AI正在成为科学发现过程本身的一部分。
夜雨聆风