乐于分享
好东西不私藏

元以AI早报-2026年05月21日

元以AI早报-2026年05月21日
1.谷歌I/O大会发布全新旗舰多模态大模型Gemini Omni
2.阿里云发布全新千问Qwen3.7-Max 登顶多项国内大模型权威评测
3.超2000亿参数原生全模态大模型发布!智象未来半月再获亿级融资

元以AI早报

01
谷歌I/O大会发布全新旗舰多模态大模型Gemini Omni
🔍 谷歌2026 I/O大会发布旗舰多模态大模型Gemini Omni⚙️ 依托三大核心技术,支持全模态任意混合输入输出✏️ 支持对话式实时编辑,可交互式迭代优化内容
今日凌晨,谷歌在2026 I/O开发者大会上正式发布了全新旗舰级多模态大模型Gemini Omni。该模型主打“任意输入、任意输出”的核心能力,打破了传统AI不同模态信息割裂的局限,可实现文本、图像、音频、视频等全模态信息的互通理解与自由生成。Gemini Omni依托谷歌成熟的三大核心技术底座搭建,分别是世界模型Genie、图像模型Nano Banana、视频生成模型Veo,以此构建起完整的全模态AI框架。它支持多样化混合输入,用户可将手绘草图、文字描述、图片素材、音视频等任意形式内容组合输入,系统可自主解析信息逻辑、模拟真实物理规则,最终输出符合现实逻辑的高精度多元化内容。本次发布最大的实用亮点是对话式实时编辑能力,解决了传统AI生成工具一次性输出、修改繁琐的痛点,支持生成过程中的交互式迭代优化,用户可通过自然语言精准调整内容细节,且修改不会破坏原有画面逻辑与物理效果,发布会现场直观展现了模型的强大创作能力。
信息来源:https://mp.weixin.qq.com/s/UIPNVnjd9BMgM6dBBiUP7Q
02
阿里云发布全新千问Qwen3.7-Max 登顶多项国内大模型权威评测
🚀 阿里云推出千问Qwen3.7-Max,多评测第一居国内第一梯队
🔧 实现35小时连续运行千次调用零中断,解决行业痛点
💻 架构创新降部署成本,即将上线赋能企业智能化转型
5月20日阿里云峰会上,阿里云正式推出全新千问大模型Qwen3.7-Max,这款产品凭借多项核心技术突破,斩获CLUE、MMLU、AGIEval等多项国内权威评测第一名,综合性能跻身国内大模型第一梯队,部分细分任务表现甚至比肩国际顶尖大模型,打破了国际大模型在核心评测的优势格局。Qwen3.7-Max解决了传统大模型长时运行易中断、工具调用不稳定的行业痛点,创下35小时连续自主执行、1158次工具调用零中断的亮眼成绩,能很好适配企业复杂场景的连续任务需求。它采用创新正交解耦架构,不同运行环境下性能稳定,还兼容OpenAI和Anthropic协议,企业无需大规模改造现有系统就能快速接入,大幅降低部署适配成本。该模型即将通过阿里云百炼平台上线服务,将覆盖多行业赋能企业智能化转型,推动国内大模型产业进入高质量发展新阶段。
信息来源:https://mp.weixin.qq.com/s/Dd5UwfE3psWx2LYjtMS5hg
03
超2000亿参数原生全模态大模型发布!智象未来半月再获亿级融资
🏙️ 智象未来在北京开放日发布超2000亿参数图像大模型
💰 智象未来半个月内再获亿级融资,获资本高度认可
🚀 智象未来形成双轮商业化架构,向AGI目标迈进
5月19日,全球领先多模态生成式AI企业智象未来在北京举办首届开放日,正式发布基于新一代原生全模态模型架构Unified Transformer打造的超2000亿参数图像大模型HiDream-O1-Image-Pro。不同于传统单模态拼接的多模态方案,该模型将图像像素、文本标记与任务条件统一纳入共享表征空间,解决了传统架构在复杂语义理解、高保真细节还原、精准文字渲染等环节的天然瓶颈,在多个主流基准测试中刷新SOTA纪录,充分验证了原生全模态架构的巨大潜力与可扩展性。开放日当天,智象未来同时宣布完成新一轮亿级融资,这是其半个月内再度完成融资,足见资本市场对原生全模态发展方向的高度认可。目前智象未来已经形成“模型+智能体”双轮驱动的商业化架构,三大智能体产品已覆盖多个核心产业场景,落地成果显著,正向着“构建世界模型、实现AGI”的目标稳步迈进。
信息来源:https://mp.weixin.qq.com/s/rzzjbb-ddNM8RAnepBRa0A
04
国产大模型能力升级,Token调用量超美国两倍
📈 国产大模型全面升级,海外Token调用量超美两倍多
🤖 多款迭代国产大模型性能优异,性价比优势突出
🌍 中美大模型性能差距缩小,国产已形成全球竞争力
近期国产大模型迎来密集全面升级,在性能、应用场景和落地能力上全方位提升,在海外开发者平台上,国产大模型的Token调用量已经大幅领先美国。官方数据显示,5月4日至5月10日当周,中国主要大模型周调用量达到7.94万亿Token,是同期美国模型3.76万亿Token的两倍多,多款国产模型已经登顶海外平台排行榜。记者实测多款迭代后的国产大模型,展现出远超以往的惊人能力:Kimi仅用一小时就能完成包含34个旅行目的地、支持跳转购票预约的完整网站开发;国产开源模型DeepSeek-V4率先进入百万token上下文时代,可一次性处理完整的80万字《西游记》,9秒就能准确答出跨章节的问题,还能几分钟生成带搜索功能的动态妖怪图谱网页。DeepSeek-V4百万token输出仅需0.28美元,价格仅为美国顶尖模型GPT-5.5的约百分之一,推理计算量也降至上一代的27%,靠架构创新实现了性能与性价比双升级。当前国产大模型已经深度落地到多个民生和产业场景,斯坦福报告显示中美大模型性能差距已缩小至2.7%,国产大模型凭借高性价比和强大工程化能力已经形成全球竞争力。
信息来源:https://mp.weixin.qq.com/s/8vU09H8N1h-hLR0VHF2kJg
05
AI Coding浪潮席卷全球,蚂蚁灵光领跑国内新赛道
💻 全球头部AI扎堆布局AI Coding赛道,Cursor估值293亿美元
🔥 国内大厂入局AI Coding,蚂蚁灵光7天下载破200万
✊ AI Coding打穿开发门槛,实现生产力平权,开启全民开发新时代
2025年底以来,硅谷风向生变,全球几乎所有头部AI公司都不约而同扎堆布局AI Coding赛道,海外AI Coding独角兽Cursor投后估值已经飙升至293亿美元,根据其官方最新数据,目前Cursor企业客户中,已有75%的代码完全由AI生成,行业变革已经悄然到来。这股热潮也迅速烧到国内,2025年11月蚂蚁发布灵光App,上线仅3天下载量就冲破50万,一举冲上iOS免费工具榜第一,7天下载量更是突破200万,热度远超当时全球最火的AI应用Sora。随后国内百度、字节跳动、腾讯等大厂纷纷入局,掀起国内AI Coding新浪潮。不同于大众认知里“AI只是帮程序员提效”,AI Coding真正的变革是打穿了软件开发的高门槛,让不会写代码的普通人也能一句话生成专属轻应用,正如当年短视频打穿创作门槛一样,正在实现开发能力的生产力平权,开启人人都是开发者的超级个体新时代。
信息来源:https://mp.weixin.qq.com/s/AyCtQ-ugZ0qzxwuHztg70A
06
正式开源!生成式基因组大模型Carbon,开启生命语言GPT新路径
🤝 多机构联合全开源推出生成式基因组大模型Carbon
⚡ 性能超同类模型,运行效率最高提升达275倍
🌍 核心创新降低算力需求,开放供全球研究者使用
AI与基因组学的交叉正推动生命科学进入全新发展阶段,但当前行业陷入堆参数、卷上下文长度的怪圈,极高的算力门槛让大量普通研究者望而却步。近日,北京中关村学院联合国际开源社区Hugging Face等机构,正式全开源推出生成式基因组大模型Carbon,推出了“更小更懂”的基因组大模型开发新思路。Carbon包含500M、3B、8B三个参数版本,其中30亿参数的Carbon-3B就在8项零样本DNA任务上持平70亿参数的Evo2-7B,Carbon-8B更在同参数量下超越Evo2-7B。效率提升更是惊人:Carbon-3B运行速度达到Evo2-7B的275倍,单张A100处理单个人类基因仅需1.5秒,处理全人类基因组不到2天,而Evo2-7B需要超过1.5年。Carbon通过数据提质优化、创新分词方法、改进训练损失函数三项核心创新,在保证精度的同时大幅降低算力需求,真正实现了基因组AI的技术普惠,为未来打通自然语言与基因组的“生命语言GPT”打下了基础,目前模型已全开放供全球研究者使用。
信息来源:https://mp.weixin.qq.com/s/UcswfJGOxCGmxDKXwZ7ntQ
07
腾讯清华联合推出Pixal3D,图像转3D保真度突破天花板
🔍 现有3D生成AI存在像素3D点对应模糊、细节失真问题
🤝 腾讯清华联合推出Pixal3D,论文被SIGGRAPH 2026收录
✨ Pixal3D碾压主流模型,降低高精度3D资产生成门槛
最近3D生成AI火得一塌糊涂,一批新模型已经能生成可用的3D资产,但核心痛点始终没有解决:现有模型大多在规范空间生成3D,再通过注意力机制注入图像信息,导致像素和3D点的对应关系模糊,生成出来的3D模型从原视角看也和原图差异大,细节容易失真。近期腾讯ARC实验室联合清华大学推出的Pixal3D技术,彻底解决了这一行业痛点,相关论文已经被计算机图形学顶会SIGGRAPH 2026收录。Pixal3D打破了原有技术范式,直接在像素对齐的视角下生成3D模型,通过像素反向投影条件机制建立明确的像素-3D关联,从根源消除对应歧义,将像素保真度直接提升到了3D重建级别。和当前主流模型TRELLIS 2、HY3D V3.1相比,Pixal3D在多维度都展现出碾压级优势,还支持多视图生成与场景合成任务,大幅降低高精度3D资产的生成门槛,将推动AIGC从2D向3D深度落地。
信息来源:https://mp.weixin.qq.com/s/RUA3E8Tkx89Ps4GWeXjCpQ
08
后摩智能M50助力联想AI主机P7全球首发,千亿大模型搬进随身口袋
📢 联想在北京发布搭载后摩M50芯片的AI主机P7
💪 P7可本地运行千亿参数大模型,低耗便携护隐私
📅 P77月1日开启众筹,推动大模型下沉消费端
5月19日,联想在北京举办“天禧AI一体多端全场景超能之夜”,正式发布专为智能体打造的AI原生个人家庭边缘设备——联想AI主机P7,该设备搭载后摩智能专为大模型端边侧推理打造的AI芯片M50,凭借存算一体架构,可在手掌大小的机身内流畅运行最高1220亿参数本地大模型,目前M50已进入量产阶段。后摩智能M50为P7提供190TOPS本地AI算力,仅300g重的P7最高支持1220亿参数大模型本地部署,无网环境下推理速度可达50 Tokens/s,搭配最高80GB内存与128K上下文窗口,可流畅处理复杂任务;整机最大功耗仅30W,普通移动电源即可驱动,运行噪音低于35dBA。P7采用“一机双模”设计,智能体模式可本地运行天禧Claw,大模型模式可开放API接入各类AI应用,成为本地免费Token工厂,帮助用户摆脱云端付费焦虑;同时支持7×24小时运行,轻小便携可当随身AI工作站,无网也能提供稳定服务,数据全程本地处理,有效保护隐私。联想AI主机P7将于7月1日正式开启众筹,本次发布标志着千亿参数大模型正式从云端下沉进入消费级AI终端,大幅降低了端边侧AI规模化普及门槛。
信息来源:https://mp.weixin.qq.com/s/ykiQM9Ca5VM5wUW-b4YNJg
09
千寻智能与地瓜机器人达成战略合作 软硬协同加速具身智能产业落地
🤝2026年5月千寻与地瓜机器人达成战略合作,完成软硬适配
🧠Spirit v1.5是国内首个性能超国际标杆的开源VLA模型
🚀双方将推动具身智能规模化商用,助力行业智能化升级
2026年5月20日,千寻智能正式宣布与地瓜机器人达成战略合作,依托千寻在具身模型研发落地的技术优势,结合地瓜机器人高性能端侧AI计算能力,双方已完成千寻智能开源具身模型Spirit v1.5与地瓜机器人旭日S600具身大算力平台的深度适配,合力打造高性能可量产的软硬一体化解决方案,推动具身智能走出实验室落地真实产业场景。Spirit v1.5是国内首个综合性能超越国际标杆Pi0.5的开源VLA基础模型,可融合视觉感知、语言理解与动作生成,能覆盖工业装配等多种复杂场景,具备强泛化性与长程任务稳定性。旭日S600作为地瓜机器人的旗舰级大算力芯片,拥有560TOPS(INT8)的强劲AI算力,可高效适配大参数VLA模型完成稳定推理,运行效率位居行业前列。后续双方将持续深化协同,聚焦工业制造等核心赛道输出成熟方案,降低具身智能商业化落地门槛,加速推动具身智能规模化商用,助力多行业完成智能化升级。
信息来源:https://mp.weixin.qq.com/s/F2nwLsXPqP2aS8uJa7UiIg
10
中国信通院动态博弈测试揭示大模型能力边界
🔬中国信通院开展主流大模型围棋博弈专项测试
📊GPT系列表现突出,高胜率低消耗尚未实现统一
🚀推动大模型评测体系完善,助力AI高质量发展
随着人工智能从“内容生成”向“复杂决策”演进,业界正在探索大模型动态交互能力的边界,近日中国信息通信研究院依托“方升”大模型基准测试体系,围绕围棋博弈场景,对主流大模型的复杂因果推理与决策效率开展了专项测试。本次测试为9×9围棋对战,所有参测大模型均未接受围棋定向训练,仅依靠预训练通用推理能力完成对局,测试设置了公平均衡的对局规则,消除先后手优势、避免模型依赖记忆干扰结果。测试结果显示GPT系列表现突出,国内模型Doubao-seed-2.0-pro位居第三。本次测试也揭示了当前行业的共性难题:高胜率与低推理消耗尚未实现统一,胜率领先的GPT-5.5以最高的Token消耗和对战耗时换取决策深度,而部分模型已经能以较低计算成本获得不错胜率。本次测试也标志着大模型评测从静态指标走向动态对抗闭环的系统工程,将推动大模型评测体系不断完善,助力AI技术高质量发展。
信息来源:https://mp.weixin.qq.com/s/ZQrOwHl7eDyNNev9D7jHRA

早报内容及素材均来自网络公开渠道,版权归原作者所有,仅作信息分享使用。

—— END ——