乐于分享
好东西不私藏

能直接@真人帮你P图?Meta新AI画图工具上线就是全球第二|本周智选

能直接@真人帮你P图?Meta新AI画图工具上线就是全球第二|本周智选

你见过哪个AI画图工具,拿到需求之后不急着出图,而是先"想一想"的?

昨天Meta扔了个大的——Muse Image,一个号称"像Agent一样画画"的图像生成模型。上线直接冲到Arena竞技场全球第二,文生图、单图编辑、多图编辑三个榜单全拿了亚军,只输给了OpenAI的GPT Image 2,把谷歌Nano Banana压在身下。

但这篇文章不想只聊排行榜,因为Muse Image真正让我觉得有意思的,不是它画得多好,而是它画画的方式变了

它不是"接到指令就出图",它是"想清楚了再动手"

说实话,用了几十款AI画图工具,大部分的工作流都一样:你输入一段话,模型吐出几张图,好不好全看运气。

Muse Image不太一样。

据Meta官方介绍,你给它一个需求之后,它会先拆解创作思路——不是直接渲染像素,而是先想清楚怎么构图、要不要查资料、有没有需要精确计算的部分。

举个例子。你让它画"今天纽约时代广场的样子",它真的会去搜索网上的实时信息,看看今天时代广场实际长什么样。让它画一个图表或者二维码,它会自己写一段代码来算,而不是靠"脑补"。画完之后,它还会自己复盘一遍画面,发现哪里不对就局部修改,直到满意了才把成品交给你。

Meta把这套流程叫做Agentic Image Generation——智能体式图像生成。

换句话说,Muse Image不是一个简单的"文字转图片"工具。它是一个有规划能力、能调用工具、会自我纠错的Agent,只不过它的产出物是一张图。

💡 AI画图工具的下一次升级,不是"画得更像",而是"画之前先想清楚"。

能@你的Instagram好友,这个功能只有Meta做得出来

说实话,如果Muse Image只是一个"会思考的画图Agent",我不会专门写一篇文章来聊它。因为GPT Image 2也能做类似的事,谷歌的Nano Banana 2也在追。

真正让Muse Image变得不可替代的,是它把Instagram社交关系直接长进了图像模型里。

Meta做了一个功能叫Native Social Context。简单来说:你可以在提示词里@一个Instagram账号,Muse Image会自动拉取这个账号公开发布的照片,作为视觉参考融入你的创作。

这意味着什么?

你可以@一个朋友,让AI参考他的穿搭风格,帮你生成一套类似风格的营销图。你可以@一个设计师账号,让AI学习对方的色彩搭配,给你出一版类似调性的海报。你甚至可以上传自己的照片、一张喜欢的风景照、一张参考穿搭,让它把三张图里的元素合成到一张图里——提示词图文混着来都行。

这个能力,放眼整个AI行业,只有Meta做得到。因为它坐拥Instagram这个全球最大的图片社交平台,社交图谱是别人抄不了的壁垒。

当然,隐私问题肯定有人会问。Meta的方案是:所有Instagram用户都可以在设置里选择opt-out,禁止别人用你的公开照片做AI二创。同时,所有AI生成的图片都带有Content Seal隐形水印,裁剪、压缩、截图都去不掉。

这套组合拳打得还算体面——功能够大胆,安全措施也跟上了。

榜单表现怎么样?免费能用吗?

Arena竞技场的数据摆在这里:

  • 文生图
    :Muse Image 1280分,全球第二。GPT Image 2以1385分排第一,谷歌Nano Banana 2以1270分排第三
  • 单图编辑
    多图编辑:同样是第二

注意,这不是单项第二——是三项全能第二。一个刚发布的模型,在三个赛道同时碾压了谷歌、xAI和一堆老牌图像模型,说实话挺猛的。

价格方面,通过Meta AI应用可以免费使用,每天有一定额度。超出的话需要订阅Meta付费方案。目前已经在Meta AI应用、Instagram Stories(美国地区)和WhatsApp(部分国家)上线。后续还会接入Facebook、Messenger,广告主也能通过Advantage+ creative调用它来生成营销素材。

另外,Meta同步预览了Muse Video视频生成模型,在Arena排名全球第三,排在谷歌Gemini Omni Flash和字节Seedance 2.0之后。跟Muse Image同底座训练,原生支持音频生成。不过音画同步和快速运动场景的物理准确性还有提升空间,预计几个月后正式发布。

💡 当所有人都在卷"谁画得更逼真"的时候,Meta换了个赛道——把社交关系变成了AI生图的燃料。

背后的人:两位从OpenAI出走的华人

Muse Image的带队者余家辉,中科大少年班出身、UIUC博士,在谷歌做过Gemini多模态视觉联合负责人,在OpenAI参与过GPT-4o到o4-mini的研发。Muse全系列底层总负责人赵晟佳,清华本科、斯坦福博士,全程参与了从初代ChatGPT到o3的预训练。两人2025年6月一起加入Meta,不到一年就交出了这份答卷。

本周其他AI工具动态

除了Muse Image,这周还有几件事值得关注:

OpenAI GPT-5.6本周四全量上线

OpenAI刚宣布,GPT-5.6 Sol、Terra、Luna三个版本将于本周四正式公开发布。此前因为美国政府审查,只面向部分企业开放有限预览。现在商务部已经放行。

三个版本各有定位:Sol是旗舰版,性能最强,价格和GPT-5.5一样但更强;Terra是均衡型,性能媲美GPT-5.5但价格只有一半;Luna主打快速和便宜。

值得注意的是,这次放行是因为OpenAI跟美国商务部完成了多轮补充测试。就在上周,Anthropic的Fable 5也被解除了出口管制,订阅用户免费使用窗口延长到了7月12日。大模型之间的博弈,越来越跟政策绑在一起了。

对普通用户来说,最大的变化是——ChatGPT的天花板又高了一截。

腾讯"吐司"iOS版上线,零门槛生成App

腾讯的AI应用生成平台"吐司"正式上线iOS,实现了双平台全覆盖。核心卖点是:你用自然语言描述需求,AI自动拆解功能、生成应用原型、多轮对话调整,然后一键打包成APK安装包。

对不会写代码的人来说,这等于从"想一个App"到"用上这个App",中间只差一段话。8月还会开放开发者上架服务。

ChatGPT项目模板 + Claude批量文件处理 + Gemini仓库分析

这周开发者工具三巨头各出了一招:

  • ChatGPT
    上线了项目模板库,预置了几十个开发/文档/工作流模板,新项目不用从零配置
  • Claude
    推出批量文件处理,一次性上传整个项目文件夹,自动扫描建索引,做代码质量分析、生成架构文档
  • Gemini
    支持直接输入GitHub仓库地址,自动分析项目结构和代码逻辑

简单总结就是:ChatGPT适合开新项目,Claude适合分析已有项目,Gemini适合快速理解开源项目。三家各占一个身位。

写在最后

这周的AI工具圈,节奏越来越快了。

Meta用Muse Image证明了一件事——AI生图工具的竞争,已经不只是"谁画得更好"了。谁能把生图能力嵌进自己的生态、谁能让用户在自己的社交场景里直接用起来,谁才真正占住了位置。

而OpenAI GPT-5.6的全量上线、腾讯吐司的跨平台覆盖、开发者工具的三足鼎立,都在指向同一个趋势:AI工具正在从"能用"走向"好用",从"通用"走向"场景化"。

对普通用户来说,这其实是最好的时候——选择越来越多,门槛越来越低,很多以前要花大价钱请设计师、写代码才能做的事,现在打几句话就能搞定。

免费AI工具推荐说了一期又一期,但真正值得停下来认真聊的,永远是那些不只是"多了一个工具",而是"换了一种思路"的产品。Muse Image就是这种——它让你重新想象AI生图到底可以做什么。

这周你最想试哪个工具?评论区聊聊?

如果觉得有用,转发给一个也需要AI工具的朋友,我们一起跟上这波变化。

AI工具智选 · 每周帮你挑出最值得关注的AI工具