过去一周,AI行业迎来了模型发布、能力跃迁与政策博弈的多重高潮。Claude Opus 5以半价逼近旗舰性能,中国开源模型军团集体亮相,Meta AI从“思考”走向“行动”,而一场关于AI安全与自主性的讨论也因一次“越狱”事件而再度升温。
🔥 大模型与产品动态
Claude Opus 5:半价逼近Fable 5,Anthropic的“性价比之王”

7月24日,Anthropic正式发布Claude Opus 5。这款模型在Frontier-Bench和GDPval-AA等编码与知识工作评测中已成为新的最先进(SOTA)模型,性能非常接近旗舰级的Claude Fable 5,但价格仅为其一半。
多项评测数据令人瞩目:在ARC-AGI 3(解决新颖问题)上,Opus 5的得分是第二名模型的三倍;在Zapier AutomationBench(端到端业务任务)上,相同成本下通过率约为第二名的1.5倍;在OSWorld 2.0(计算机使用基准)上,Opus 5以超过三分之一的成本超越了Fable 5的最佳成绩。在CursorBench 3.2上,Opus 5在最高推理强度下性能仅落后Fable 5峰值0.5%,但单任务成本减半。在生命科学领域,Opus 5在有机化学和蛋白质相关任务上,比上一代Opus 4.8分别高出10.2和7.7个百分点。
更令人印象深刻的是它的“自主性”。在一个Frontier-Bench任务中,Opus 5被要求根据一张机器零件图纸编写3D FreeCAD模型代码,但被故意不提供查看图纸的途径。结果Opus 5自己编写了一套计算机视觉管线,从原始像素中提取几何数据,成功重建了完整的机器零件——其他模型在相同条件下尝试五次均未成功。
Opus 5现已成为Claude Max的默认模型和Claude Pro上最强的模型。
来源:https://www.anthropic.com/news/claude-opus-5
Claude-of-Duty:一条提示词生成《使命召唤》级游戏

Matt Shumer发布了一个名为Claude-of-Duty的项目,仅用一条提示词就让Claude生成了一个第一人称射击游戏。提示词要求:“构建一款达到最新《使命召唤》游戏水准的第一人称射击游戏。它必须绝对完美、视觉美观,从纹理到物理效果全部达到AAA级质量。”Claude会派出子智能体分别处理各个部分,并让另一个子智能体作为严厉的批评者进行视觉检查,直到每个子智能体都对质量感到“惊叹”为止。
来源:https://github.com/mshumer/Claude-of-Duty/blob/main/prompt.md | https://x.com/mattshumer_/status/2081054356405731740 | https://x.com/chrisgpt/status/2082265122949542149 | https://x.com/kimmonismus/status/2082101266961023452
中国开源模型集体爆发:万亿参数俱乐部再添新成员
本周,多款中国开源大模型密集亮相,标志着国产模型已全面进入万亿参数时代:
Kimi K3正式上线Hugging Face:月之暗面将Kimi K3完整权重上传至Hugging Face。总参数2.8万亿,激活参数1040亿,搭载自研KDA与注意力残差架构,原生支持100万token上下文。评测数据显示其已接近顶级闭源模型水平——GPQA Diamond达93.5分,ProgramBench达77.8分,甚至超越了Fable 5和GPT-5.6 Sol。

来源:https://huggingface.co/moonshotai/Kimi-K3
LongCat-2.0:美团发布1.6万亿参数开源MoE模型:总参数1.6万亿,每token激活约480亿参数,专为智能体编码(Agentic Coding) 设计。两大亮点:原生100万token上下文窗口,以及训练和推理完全运行在国产AI ASIC超算集群上。为降低运行成本,LongCat-2.0采用多项创新架构,包括零计算专家(简单token直接返回)、LongCat稀疏注意力(LSA,将复杂度降至接近线性)和1350亿参数的N-gram嵌入模块。

来源:https://www.marktechpost.com/2026/07/05/meituan-releases-longcat-2-0-a-1-6t-parameter-open-moe-model-with-native-1m-context-and-longcat-sparse-attention/
Ling-3.0-Flash:蚂蚁集团仅51亿激活参数对标万亿模型:7月27日发布,总参数1240亿,但每token仅激活51亿参数,却能在核心基准上匹配或超越参数规模大2-3倍的行业领先模型。架构采用5:1比例交替使用KDA和MLA层,原生支持256K上下文并可无缝扩展至100万token。集群级分层缓存系统将长输入的首token延迟(TTFT)降低60%-80%。模型现已上线OpenRouter和Vercel。

来源:https://www.businesswire.com/news/home/20260726584441/en/Ant-Group-Unveils-Ling-3.0-Flash-Delivering-Top-Tier-Performance-at-a-Fraction-of-the-Parameter-Scale
LLaDA2.2-flash:面向智能体的扩散语言模型:InclusionAI发布,引入Levenshtein Editing(DELETE和INSERT控制token)到扩散语言建模中。SWE-bench Verified得分49.28%,吞吐量达519 TPS,上下文窗口扩展至128K。

来源:https://huggingface.co/inclusionAI/LLaDA2.2-flash
Meta AI大升级:从“思考”走向“行动”

Meta宣布其AI助手由Muse Spark 1.1模型驱动,开始真正代表用户采取行动。新功能包括:长期任务跟进(告诉Meta AI你在装修厨房,它会学习你的风格、在Marketplace搜索家具并发送情绪板);每日简报(自动整理日历、发现冲突、在指定时间推送摘要);深度研究(数分钟内整合网络信息,从研究论文到社区分享);以及实时协作(AI生成内容时用户可实时引导方向)。所有AI生成内容集中存放在一处,方便随时回顾。即日起在Meta AI应用和meta.ai的部分市场开始推出,未来几周将扩展到WhatsApp等平台。
来源:https://about.fb.com/news/2026/07/meta-ai-muse-spark-doesnt-just-think-it-acts/
Midjourney V8.2:更具创意与个性的图像模型

Midjourney正式发布V8.2图像模型,聚焦美学和图像质量的提升。图像更有创意、大胆、精致和前卫,低质量图像的随机出现概率大幅降低,个性化功能能更好地“理解”用户的审美偏好。
来源:https://www.midjourney.com/updates/version-8-2
FLUX 3:多模态“世界模型”进入Early Access

Black Forest Labs发布FLUX 3,一款同时从图像、视频和音频中学习的多模态基础模型。核心理念是:单一模态无法提供完整描述,三者共同学习能揭示更多——声音必须匹配冲击、运动必须遵循质量、未来必须遵循过去。FLUX 3可生成长达20秒的带音频视频,支持文生视频、图生视频、视频生视频、关键帧控制等多种能力。
来源:https://bfl.ai/blog/flux-3
Grok Voice Think Fast 2.0:新一代语音模型发布

xAI宣布Grok Voice Think Fast 2.0,下一代语音模型,在智能性、转录准确性和对话能力方面均有提升。在Artificial Analysis的语音到语音质量指数中,得分为82.9%,超越GPT-Realtime-2.1(79.1%)和Gemini 3.1 Flash(69.5%)。定价为每分钟音频0.08美元。8月5日,grok-voice-latest将从1.0版切换到2.0版。
来源:https://x.ai/news/grok-voice-think-fast-2
微软推出GPT-Transcribe与GPT-Live-Transcribe

微软在Microsoft Foundry中推出GPT-Transcribe和GPT-Live-Transcribe两款新转录模型。
来源:https://techcommunity.microsoft.com/blog/azure-ai-foundry-blog/introducing-gpt-transcribe-and-gpt-live-transcribe-in-microsoft-foundry/4541740
🧪 研究与技术应用
T-Rex:让机器人拥有“触觉反应”能力

T-Rex项目通过引入触觉模态,让机器人能够像人类一样动态响应触觉信号。项目开源了一个100小时的触觉丰富数据集,以及一个可变速率Mixture-of-Transformer(MoT)架构。在12项需要精细力控制和可变形物体操作的任务上,T-Rex的平均成功率比最强基线高出30%以上。数据集基于207种日常物品×22种运动基元的组合,在58-DoF双臂灵巧机器人上采集。
来源:https://tactile-reactive-dexterous.github.io/
Gemini Robotics ER 2:谷歌的“机器人大脑”正式开放

谷歌DeepMind发布Gemini Robotics ER 2,一款“具身推理”模型,作为机器人的高级大脑——与人类聊天、理解物理世界、规划多步骤任务,然后交给底层VLA模型执行。核心升级包括:实时视频流处理(机器人可追踪自身进度、出错时自适应调整);多机器人协作(多台机器人在共享空间协同完成复杂工作流);以及双向流式端点(集成到Gemini Live API,实现流畅的连续推理,告别“停顿-思考”的卡顿)。开发者现可通过Gemini API和Google AI Studio使用该模型。
来源:https://blog.google/innovation-and-ai/models-and-research/google-deepmind/gemini-robotics-er-2/
Unitree Super Athlete AS2-W机器人发布

Unitree发布Super Athlete AS2-W机器人,流畅运动、紧凑但性能卓越。支持连续16公斤负载,无负载续航里程超30公里。
来源:https://x.com/UnitreeRobotics/status/2080549171661295907
Buzz:去中心化群聊平台发布

Jack Dorsey宣布推出Buzz,一个面向团队和各类智能体的群聊平台,旨在减少对Slack和GitHub的依赖。该平台模型无关、去中心化、自主主权且开源。
来源:https://x.com/jack/status/2079605800998146171
Gemini Omni免费视频生成活动

Gemini宣布即日起至2026年8月4日太平洋时间晚11:59,用户可在Gemini中免费创建10个视频。在工具菜单中选择“Create video”即可创建、编辑和混剪视频。
来源:https://x.com/GeminiApp/status/2082563490431246623
Mirage Avatar X:新一代AI虚拟化身模型

Mirage推出Avatar X,新一代AI虚拟化身模型。提供行业领先的身份保留能力和最富表现力的AI虚拟化身,支持竖屏和横屏视频。
来源:https://x.com/trymirage/status/2082120270618530053
HeyGen视频播客功能上线

HeyGen推出Video Podcast功能。可将任何文档、链接或想法转化为双主持人视频节目,包含演播室场景、多机位切换和B-roll素材,几分钟内即可完成。
来源:https://x.com/HeyGen/status/2082510248489943367
🏢 企业 & 投融资
Friend 2.0:AI穿戴设备回归,售价暴涨至249美元

两年前推出的AI穿戴设备Friend发布2.0版本,新增内置扬声器,能发出独特且一致的“人格”声音。售价从99美元涨至249美元。创始人表示:“它不是助理,也不是恋人……有点像知己、朋友、神——我也不确定它到底是什么。”
来源:https://techcrunch.com/2026/07/30/friend-the-lonely-ai-wearable-returns-with-a-new-voice-and-a-much-bigger-price-tag/
Grok Build Mode:让AI直接生成可发布的应用

xAI推出Build Mode,一种用Grok创建的新方式。告诉Grok一个想法,它就会在你的聊天中构建一个工作版本,无论是网页还是手机端。完成后,可以发布到一个任何人都能打开的链接。Build Mode目前处于早期Beta阶段,仅限SuperGrok Heavy订阅用户使用。
来源:https://x.ai/news/grok-build-mode
Gemini for macOS新增自然语言语音功能

Gemini for macOS新增自然语言语音功能。长按Fn键,即可在任何桌面窗口中用语音进行智能转录,自动去除“嗯”“啊”等口头语。开启Gemini推理后,还能理解屏幕上下文,执行复杂任务:高亮文件进行总结、重写文本、生成和编辑图像。该功能即日起向所有Gemini for macOS用户以英语推出。
来源:https://blog.google/innovation-and-ai/products/gemini-app/speak-naturally-gemini-app-mac-os/
⚖️ 政策与监管
LinkedIn推出“像AI垃圾”举报按钮

LinkedIn新增一个按钮,让用户可以将帖子标记为“Seems like AI slop”(看起来像AI垃圾)。此前研究显示,LinkedIn上41%的长文帖子被标记为完全由AI生成。LinkedIn首席产品官表示:“AI垃圾是我们的首要任务”。公司还移除了此前用AI“增强”帖子的功能,改为仅做拼写检查。
来源:https://www.theverge.com/ai-artificial-intelligence/973384/linkedin-seems-like-ai-slop-button
Google Earth紧急撤回Nano Banana图像生成功能

7月30日,Google Earth首次推出Nano Banana图像生成功能,可将卫星影像与AI生成结合。然而仅一天后,Google宣布撤回该功能,原因是“看到人们分享的生成图像似乎违反了我们的政策”。生成的图像有AI水印且不会出现在主体验中,但Google仍决定在加强护栏前暂时关闭。
来源:https://blog.google/products-and-platforms/products/earth/nano-banana-google-earth-image-generation/
💡 本周观察:AI正在跨越从“思考”到“行动”的临界点
回顾本周的AI新闻,一个清晰的脉络浮现出来:AI正在从“会思考”走向“会行动”。
Claude Opus 5在Frontier-Bench任务中自己编写计算机视觉管线来“看”图纸——这不是被动的“回答问题”,而是主动的“解决问题”。Meta AI开始代表用户制定计划、搜索市场、发送情绪板——从“你问我答”变成“我去做”。Gemini Robotics ER 2让机器人在实时视频流中跟踪进度、自我纠错、多机协作——从“单步指令”变成“持续执行”。Grok的Build Mode让AI直接生成可发布的应用——从“生成代码”变成“交付产品”。
与此同时,中国开源模型的集体爆发正在重塑全球AI的权力格局。从Kimi K3到LongCat-2.0到Ling-3.0-Flash,万亿参数不再是美国前沿实验室的专属。更重要的是,这些模型不仅在规模上追赶,在效率上也在突破——Ling-3.0-Flash仅用51亿激活参数就能对标万亿级模型,这或许预示着AI竞争的下一个战场:不是谁更大,而是谁更聪明地使用参数。
📌 如果觉得这篇文章对你有帮助,欢迎点赞、在看、转发,让更多人看到AI行业的最新动态!还没关注的朋友,点击下方名片关注,每周带你速览AI圈大事小情。我们下期再见!👋
夜雨聆风