「外滩AI观察」—— 追踪全球AI技术脉动
这里是你必须要知道的人工智能领域月度资讯。我们捕捉前沿科技,你来洞察智能未来,让AI的世界清晰可见,让AI的变化有迹可循。
「外滩AI观察」7月号
一
要点速读
向上滑动阅览
世界人工智能大会举行,AI治理与产业落地成为核心议题
阿里升级Qwen模型矩阵,发布2.4万亿参数旗舰模型Qwen3.8-Max
国内首个智能体互联国家标准体系发布
华为发布 Atlas(昇腾)950 SuperPoD 超节点
MiniMax 发布 H3 全模态生成模型,支持原生音视频联合生成
字节发布新一代 Seed 创作模型矩阵,覆盖图像、音频等多模态生成能力
月之暗面发布旗舰模型 Kimi K3,支持百万 token 上下文
蚂蚁灵波发布多款具身智能基础模型
腾讯发布并开源混元 Hy3,全面升级 Agent 能力并接入多款核心产品
阿里云发布灵骏真武 M890 超节点算力平台
国内首个全国产十万卡 AI 超集群落成
中国气象局启动“风和”全球开源计划,发布“妈祖”风云卫星 AI 工具箱
美团开源万亿参数大模型 LongCat-2.0,同步开放国产算力推理代码
商汤发布多模态智能体模型 SenseNova U1 Pro
小米发布Xiaomi-Robotics-U0与 Xiaomi-Robotics-1
OpenAI 发布 GPT-5.6 与 ChatGPT Work,推动 AI 从聊天助手迈向工作智能体
Google 扩展 Gemini 产品体系,推出 Flash 与 Cyber 专业模型
微软持续扩展 MAI 自研模型体系,图像语音双模型上线
Meta 推出 Muse Spark 1.1 并开放商业 API,加速 AI Agent 与商业化布局
Anthropic 发布 Claude Opus 5,以更低成本提供旗舰级 AI 能力
NVIDIA 发布 Spectrum-6 网络平台,面向超大规模 AI Factory
Black Forest Labs 发布 FLUX 3 多模态基础模型
Thinking Machines 发布开放权重多模态模型 Inkling
Mistral 发布首个机器人导航模型 Robostral Navigate,布局具身智能
欧盟发布 AI 法案透明度实施指引,8 月起聊天机器人与 AI 内容须履行标识义务
联合国召开首届全球人工智能治理对话,推动建立全球 AI 治理机制
英伟达联合多家头部企业成立 OSAA,聚力开源 AI 安全建设
Google DeepMind 提出 GenCeption,用生成式 AI 构建计算机视觉训练数据
二
国内科技新闻资讯
01
世界人工智能大会举行
AI治理与产业落地成为核心议题
7月17日至20日,2026世界人工智能大会暨人工智能全球治理高级别会议在上海举行。
本届大会以“智能伙伴,共创未来”为主题,吸引1100余家企业参展,并集中发布超过300款新产品。WAIC 已经成为全球规模最大的 AI 产业大会之一,本届大会最大的特点,是智能体、具身智能、国产算力和 AI 治理四条主线同时进入产业落地阶段。
外滩大会有详细报道,请点击——WAIC 2026 观察:AI,正进入经验时代
02
阿里升级Qwen模型矩阵
发布2.4万亿参数旗舰模型Qwen3.8-Max
7月,阿里升级Qwen模型矩阵,覆盖大语言模型、图像生成和语音模型等多个方向。
旗舰大语言模型 Qwen3.8-Max-Preview 正式发布。该模型采用混合专家(MoE)架构,总参数达到 2.4万亿,重点提升复杂推理、代码生成、智能体任务和长上下文处理能力。
围绕多模态能力,阿里同步推出 Qwen-Image 3.0,进一步提升文字生成、复杂版面、知识图示、UI界面、多语言内容以及图片编辑等能力,重点面向设计、教育、办公等生产场景。
在语音方向,阿里连续发布 Qwen-Audio-3.0-TTS、Qwen-Audio-3.0-Realtime,并升级 Fun-ASR-Realtime 语音识别模型。其中,Qwen-Audio-3.0-Realtime 支持全双工实时语音交互,Qwen-Audio-3.0-TTS 提升语音合成的自然度和情绪表达,Fun-ASR-Realtime 则进一步强化多语言、方言及低延迟语音识别能力。
03
国内首个智能体互联国家标准体系发布
《人工智能 智能体互联》GB/Z185-2026 系列七项指导性国家标准发布,建立国内首个覆盖智能体全生命周期的互联标准体系。标准涵盖总体架构、智能体身份码、身份管理、能力描述、跨域发现、协同交互、工具调用七个部分,形成“身份标识—能力描述—供需发现—协同交互—工具调用”的完整规范体系。同期启动智能体身份码发放,首批已发放 2000 余个重点行业智能体身份码,用于智能体统一身份标识、认证和跨平台协作。
04
华为发布
Atlas(昇腾)950 SuperPoD 超节点
2026 WAIC期间,华为首次公开展示 Atlas(昇腾)950 SuperPoD 超节点 AI 计算平台。该平台采用新一代超节点架构,可将大规模昇腾 AI 处理器组成统一计算集群,面向大模型训练与推理场景优化,并展示了从 AI 加速卡、服务器到超节点集群的完整算力方案。
05
MiniMax发布H3全模态生成模型
支持原生音视频联合生成
7月31日,MiniMax 正式发布全模态生成模型 H3。该模型支持对文本、图像、视频和声音组成的多模态上下文进行统一理解,可直接生成带有原生双声道音频的视频内容,最高支持 15 秒、2K 分辨率输出。H3 还支持视频到视频动作迁移、文字与品牌信息呈现,以及基于多模态素材的内容编辑,主要面向广告、电商、品牌设计、UI/UX 和游戏等创作场景。
在技术方案上,H3 增加了专门的 Caption 模型与全模态理解管线,单次素材分析最高可消耗约 10 万 Token,并压缩形成平均约 4000 Token 的结构化描述。其 2K 视频输出未采用独立的传统超分辨率模块,而是由 H3 基础模型结合低分辨率生成结果,通过上下文重新生成高分辨率画面。
06
字节发布新一代 Seed 创作模型矩阵
覆盖图像、音频等多模态生成能力
字节跳动 Seed 团队发布多项生成式 AI 模型升级,包括图像创作模型 Seedream 5.0 Pro 和音频创作模型 Seed Audio 1.0。其中,Seedream 5.0 Pro 支持复杂信息可视化、多参考图融合、交互式精准编辑和多语言文字渲染,面向专业设计与内容创作场景;Seed Audio 1.0 支持语音、环境声和音效的统一生成,并提供精细时间轴控制与可控音色风格,进一步完善了字节在多模态内容创作领域的模型体系。
07
月之暗面发布旗舰模型 Kimi K3
支持百万 token 上下文
月之暗面发布新一代旗舰模型 Kimi K3。K3 采用混合专家架构,总参数规模为 2.8 万亿,原生支持多模态输入和最高 100 万 token 上下文,面向长程编程、知识工作与深度推理任务,并以开放权重形式发布。公开评测中,K3 在编程和智能体知识工作等任务上取得较高排名。
08
蚂蚁灵波发布多款具身智能基础模型
蚂蚁灵波连续开源多款机器人基础模型,包括LingBot-VLA 2.0、LingBot-World 2.0(Infinity)、LingBot-Video 和 LingBot-VA 2.0,覆盖机器人视觉理解、世界建模、动作规划、视频预训练等多个方向。
其中,LingBot-VLA 2.0 是本次发布的核心模型。其预训练数据规模约 6万小时,包括 5万小时机器人轨迹数据 和 1万小时第一人称人类视频数据;训练数据覆盖 17个机器人品牌、20种机器人构型,并扩展支持头部、腰部、移动底盘和灵巧手等更多自由度。
世界模型 LingBot-World 2.0 支持无限时长交互,并提供实时版本,可驱动 720P、60fps 的实时世界模拟;同时发布的 14B 主模型之外,还提供可在单张GPU部署的 1.3B 轻量版本。
09
腾讯发布并开源混元 Hy3
全面升级 Agent 能力并接入多款核心产品
腾讯正式发布并开源新一代混元基础模型 Hy3。Hy3 采用快慢思考结合的混合专家(MoE)架构,总参数规模 2950 亿、激活参数 210 亿,支持 256K 上下文窗口,并采用 Apache 2.0 开源协议发布。Hy3 已接入元宝、CodeBuddy、WorkBuddy、ima、Marvis 等产品,并通过腾讯云 TokenHub 向开发者开放模型服务。此外,腾讯还同步发布科学发现智能体 Hyra、Agent 原生运行平台 Agent Bucket 等产品,进一步完善混元 Agent 生态。
10
阿里云发布
灵骏真武M890超节点算力平台
7月,阿里云发布灵骏真武 M890 超节点。该平台采用64卡GPU超节点架构,通过高速互联组成统一计算单元,面向万亿参数大模型训练与推理场景。M890搭载平头哥自研真武M890 AI芯片,单芯片配备144GB HBM高带宽内存,支持FP32、FP16、BF16、FP8、FP4等多种计算精度,芯片间互联带宽达到800GB/s。WAIC期间,阿里还展示了基于M890打造的盘九(Panjiu)AL128 超节点服务器,并现场演示Qwen系列模型运行。
11
国内首个全国产十万卡 AI 超集群落成
国内首个全国产十万卡 AI 超集群“曙光8000(登峰)”正式落成,并接入国家超算互联网。该系统采用超智融合架构,支持 FP64 至 INT8 全精度计算,覆盖科学计算、大模型训练、AI 推理、工业仿真等场景。集群实现芯片、计算、存储、网络等关键环节国产化,自研 scaleFabric 高速互联网络支撑十万卡级连接,已完成 300 余项超智融合应用优化,覆盖大模型、机器人、新材料、创新药等 20 余个领域。
12
中国气象局启动“风和”全球开源计划
发布“妈祖”风云卫星 AI 工具箱
中国气象局启动“风和”气象大模型全球开源计划,并发布“妈祖”风云卫星 AI 工具箱。“风和”是千亿参数级气象大模型,面向全球开放模型权重、API、云服务和部署方案,支持天气分析、风险评估和公众气象服务;“妈祖”集成风云卫星数据接收、AI 推理、多源数据融合和业务应用能力,支持互联网、卫星直收站和野外应急等场景,面向全球用户提供风云卫星 AI 应用能力。
13
美团开源万亿参数大模型LongCat-2.0
同步开放国产算力推理代码
美团正式发布并开源新一代大模型 LongCat-2.0,同步开放模型权重及国产 AI 芯片推理代码。LongCat-2.0 采用混合专家(MoE)架构,总参数量约 1.6 万亿,支持 100 万 Token 上下文窗口,重点面向 Agent 编程、代码生成和超长文本处理等场景。
14
商汤发布多模态智能体模型
SenseNova U1 Pro
7月18日,商汤科技发布日日新 SenseNova U1 Pro。该模型面向长程多模态任务,可围绕复杂目标持续进行理解、规划、生成、检查和修改,支持最高 8K 分辨率输出,应用范围包括信息图、演示文稿、宣传海报、科普图解和影视分镜等内容创作。
此前,商汤还发布并开源 SenseNova-Vision 统一视觉大模型,将目标检测、图像分割、深度预测、关键点识别和多视角三维几何等视觉任务纳入同一模型,并同步开放包含5000万条样本的 SenseNova-Vision Corpus-50M 视觉指令语料库。
15
小米发布 Xiaomi-Robotics-U0
与 Xiaomi-Robotics-1
小米机器人团队发布并开源两项具身智能基础模型。其中,Xiaomi-Robotics-U0 为 380 亿参数多模态世界基础模型,统一支持具身场景生成、机器人迁移、交互视频生成等任务;Xiaomi-Robotics-1 为视觉-语言-动作(VLA)基座模型,基于 10 万小时真实机器人操作轨迹训练,可直接执行陌生环境中的移动操作任务,并在 RoboCasa365、RoboDojo 等公开基准测试中取得领先成绩。
三
国际科技新闻资讯
01
OpenAI发布GPT-5.6与ChatGPT Work
推动 AI 从聊天助手迈向工作智能体
OpenAI 发布新一代基础模型 GPT-5.6,并同步推出面向复杂工作流程的 ChatGPT Work。GPT-5.6 成为 ChatGPT、Codex、OpenAI API 及 Microsoft 365 Copilot 的核心模型,在推理、编程、工具调用和长时任务等方面进一步提升,并针对企业场景优化模型效率与稳定性。基于 GPT-5.6 的 ChatGPT Work 支持调用文件、网页及团队工具,自主拆解并持续执行多步骤任务,帮助用户完成文档、数据分析、演示文稿等复杂工作。
02
Google 扩展 Gemini 产品体系
推出 Flash 与 Cyber 专业模型
Google 发布 Gemini 3.6 Flash、Gemini 3.5 Flash Cyber 等新模型,进一步扩展 Gemini 产品体系。其中,Gemini 3.6 Flash 面向高吞吐、低延迟的大规模 AI 应用,在保持推理能力的同时优化响应速度和使用成本;Gemini 3.5 Flash Cyber 则针对网络安全场景进行了专门训练,可用于漏洞分析、威胁检测、安全事件调查等任务。Google 持续将 Gemini 从通用模型拓展为覆盖不同专业场景的模型家族,以满足企业开发和 AI Agent 对效率、成本和专业能力的差异化需求。
03
微软持续扩展 MAI 自研模型体系
图像语音双模型上线
微软 7 月 23 日发布两款自研 AI 模型 MAI-Image-2.5-Pro 和 MAI-Voice-2-Flash,分别用于图像生成与编辑、语音生成等场景,并已部署至 Microsoft Foundry、Bing、PowerPoint 等产品。微软表示,MAI 模型体系的目标是根据不同任务选择成本和性能最优的模型,而不是统一依赖大型前沿模型。目前 MAI 家族已覆盖推理、编程、图像、语音生成和语音识别等多个方向,成为微软自研 AI 能力的重要组成部分。
04
Meta推出Muse Spark 1.1并开放商业API
加速AI Agent与商业化布局
Meta 发布多模态推理模型 Muse Spark 1.1,重点提升工具调用、计算机操作、多步推理和编程等 AI Agent 能力,同时首次向开发者开放 Meta Model API,按调用量收费,正式进入企业 AI 模型服务市场。同期,Meta 还发布图像生成模型 Muse Image,已部署至 Instagram 和 WhatsApp,并用于 Meta AI 图像生成和创作功能。
05
Anthropic 发布 Claude Opus 5
以更低成本提供旗舰级 AI 能力
Anthropic 发布新一代旗舰模型 Claude Opus 5。该模型在编程、知识工作、多步推理等任务上的能力接近旗舰模型 Claude Fable 5,但 API 定价维持与上一代 Opus 4.8 相同,为 Fable 5 的约一半。Opus 5 支持最高 100 万 Token 上下文窗口,并新增 Effort(思考强度) 控制,开发者可根据任务复杂度在推理能力、响应速度和成本之间进行权衡。
06
NVIDIA 发布 Spectrum-6 网络平台
面向超大规模 AI Factory
NVIDIA 发布新一代 Spectrum-6 以太网交换平台,单芯片交换容量达到 102.4 Tbps,较上一代提升一倍,并面向数十万 GPU 规模的 AI Factory 设计。新平台支持更高带宽、更低通信延迟以及新的拥塞控制和自适应路由机制,用于提升大规模 AI 模型训练和推理效率。
07
Black Forest Labs
发布 FLUX 3 多模态基础模型
Black Forest Labs 发布新一代多模态基础模型 FLUX 3,采用统一架构联合学习图像、视频、音频和动作预测(Action Prediction),目标是建立对真实世界的统一表示。官方演示显示,模型可生成最长 20 秒、包含原生音频的视频,并支持图像编辑、视频生成及机器人动作预测等任务。目前 FLUX 3 已开放 Early Access,并同步推出面向机器人应用的 FLUX-mimic。
08
Thinking Machines
发布开放权重多模态模型 Inkling
前 OpenAI 首席技术官穆拉蒂创办的 Thinking Machines 发布首个开放权重基础模型 Inkling。该模型采用 MoE 架构,总参数 9750 亿、激活参数 410 亿,支持文本、图像和音频输入,并提供最高 100 万 Token 上下文窗口,可供开发者下载、微调和私有部署。这是美国新一代开放权重模型首次明确吸收中国开源模型路线。
09
Mistral 发布首个机器人导航模型
Robostral Navigate,布局具身智能
Mistral 发布首个机器人导航模型 Robostral Navigate,正式进入具身智能领域。该模型采用约 80 亿参数,仅需单个普通 RGB 摄像头和自然语言指令即可完成室内外自主导航,无需 LiDAR、深度相机或多摄像头系统。在 R2R-CE 导航基准测试中,Robostral Navigate 在未见环境上的成功率达到 76.6%,超过此前采用多传感器方案的最佳结果。模型支持轮式、四足和飞行机器人,主要面向制造、物流、配送和服务机器人等场景。
10
欧盟发布AI法案透明度实施指引
8月起聊天机器人与AI内容须履行标识义务
欧盟委员会发布《AI 法案》第 50 条透明度义务实施指引,明确相关规定将于 2026 年 8 月 2 日开始适用。根据要求,与用户直接交互的 AI 系统需明确告知其 AI 身份;生成或修改的音频、图像、视频等内容需添加 机器可识别(machine-readable)标记;Deepfake 内容须进行明确标识,情绪识别和生物特征分类等特定 AI 系统也需履行透明度要求。相关规则适用于在欧盟提供相关 AI 服务的提供方和部署方。
11
联合国召开首届全球人工智能治理对话
推动建立全球 AI 治理机制
联合国在日内瓦召开首届全球人工智能治理对话,这是联合国大会授权设立的首个政府间 AI 治理平台。会议围绕 AI 安全、国际合作、数字鸿沟、发展中国家能力建设及全球治理框架等议题展开,强调 AI 治理应兼顾创新、安全与包容,提升发展中国家参与能力,并推动建立持续性的国际协调机制。联合国秘书长古特雷斯表示,AI 发展速度已超过治理能力,各国需加强全球合作,确保 AI 服务于全人类。
12
英伟达联合多家头部企业成立 OSAA
聚力开源 AI 安全建设
英伟达联合微软、IBM、Adobe、CrowdStrike、Dell、Hugging Face 等企业成立 Open Secure AI Alliance(OSAA),共同开发和共享 AI 安全开源工具,重点覆盖模型、AI Agent 和 AI 基础设施的安全防护。联盟计划推动漏洞检测、安全评测、Agent 防护等工具的开放协作,以提升 AI 系统的安全性和可信部署。该联盟成立于行业对 AI Agent 安全风险日益关注的背景下,成员将共同维护开放工具和最佳实践。
13
Google DeepMind提出GenCeption
用生成式AI构建计算机视觉训练数据
Google DeepMind 发布 GenCeption,提出利用生成式视频模型自动构建高质量训练数据,再用于训练计算机视觉模型的新方法。研究团队采用阿里巴巴开源视频生成模型 Wan2.1 生成大量合成数据,并用于目标检测、场景理解等视觉任务训练。实验结果显示,在多个基准测试中,使用合成数据训练的模型达到甚至超过部分真实数据训练的效果。Google 认为,这一方法有望降低高质量标注数据获取成本,为自动驾驶、机器人、医疗影像等数据获取困难的领域提供新的模型训练路径。
END
活力、专业、创新的内容呈现
好逛、好玩、好用的科技体验
Inclusion·外滩大会
更多精彩请关注官方公众号
“Inclusion外滩大会”
夜雨聆风