项目仓库: https://github.com/QwenLM/Qwen-MM-Plugins
一、它是个什么东西
7 月底阿里开源了一个项目,名字挺拗口,叫 Qwen-MM-Plugins。名字不用记,记住它是干嘛的就行:一套给 AI 工具补多模态能力的插件。
为什么专门聊它?因为它解开的,是把多模态能力接进 AI 工具这件事。现在能看图的模型不少,但怎么把这能力接进 Claude Code、Codex 这些真正干活的家伙里,各家一直各搞各的,接法乱,标准不统一。阿里这套东西,想把这个接法统一成一套插件,装上去就能用。
先解释什么叫多模态。AI 模型分两种。一种只认字,给它一张图、一段视频,它看不懂,这种叫纯文本模型。另一种除了认字还能看图,这种叫多模态模型。现在主流的 Claude、GPT 都是后者。
再说什么叫插件。AI 模型自己没法干活,得给它配个壳,让它能读文件、跑命令、调工具,这个壳业内叫 Harness,Claude Code、Codex 都是。这套东西,就是往这些壳里装的能力包,装上去,壳里的模型就多一堆本事,能看图、能看视频、能翻 PDF、能改图纸。
项目 7 月 29 日上线,一个月 star 涨到两千七百多,还在涨。能装的壳特别多,Claude Code、Codex 这些主流的全能装,一共十几个。

官方架构图:左边八个能力包,每个能力包由一套技能加一个服务组成,右边装进各个 AI 工具(来源项目官方仓库)
二、它是怎么让 AI 工具能看东西的
拆开看,里头有两套东西在干活。一套是本地的小程序,不要钱;一套是云端的模型,要钱。
本地的小程序干什么?搬格式。视频模型看不了,就用 ffmpeg 把画面抽成一张张图。三维模型、CAD 图纸模型不认识,就渲染成平面图。PDF 排版复杂,就一页页转成图。这些活纯粹是格式转换,跟 AI 没啥关系,全用现成的开源程序干,所以免费。
云端的模型干什么?真懂。看图、认字、找东西、转语音,这些是要动脑子的活,得靠阿里的视觉和语音模型。这部分按次收费,走阿里云。
简单说,本地的负责把东西摆成模型能看的样子,云端的负责真正看懂。一前一后,配合干活。
这套工具还有个挺聪明的设计。每个能力包里都装了两样东西,一样是说明书,告诉模型这个工具什么时候用、怎么用;一样是干活的程序,真正去执行。模型看说明书决定用哪个,程序负责把活干完。这样写一次说明书,装到哪个壳里都能用,不用给每个壳单独重写一份。

三、模型本来就会看图,这东西还有用吗
有用,而且用处不小。现在的主流模型,Claude、GPT 这些,本来就认图,但认图不代表什么都能干。
有些格式它看不了。视频没法直接看,得抽帧。三维模型、CAD 图纸、医学影像根本不认识,得先变成平面图。这些活谁来做?这套插件来做。
有些活它干不精。让它圈出图里的猫,能圈,但让它给出精确坐标,把一张图里的人像素级抠出来,把一段会议录音按说话人分开还带上时间戳,这些精细活不擅长。这时候外挂一个专门干这个的模型,更靠谱。
还有些细节它看不清。截图里特别小的字,直接看容易看花,插件会把图缩放到合适大小再给它看。
所以对本来就会看图的模型来说,这套插件不是给它装眼睛,它自己有眼睛。是给它补手,补那些看不了的格式,干不细的活。
四、模型不会看图,这东西怎么让它看见
更有意思的是另一种情况。有些模型压根不会看图,只认字,就是纯文本模型。本地跑的很多模型就是这样。
对这类模型,这套插件有个巧办法。它里头有个开关,默认开着,叫原生模式。开着的时候,插件直接把图给模型看,反正模型会看。把开关关掉,插件换个玩法:每张图先送到阿里的视觉模型那里,让它把图翻译成一段文字,再交回给主模型。
主模型读到的是文字,但内容就是图里的东西。等于插件借了别人的眼睛,看一遍,再用嘴说给模型听。这样,只认字的模型也能知道图里有什么了。
举个例子。给纯文本模型看一张表格截图,插件会把图送到云端,视觉模型返回一段文字,说这张表第一列是年份、第二列是销量、第三行的数字是多少。纯文本模型拿到这段文字,就等于看到了整张表。
不过有个代价。图要发到阿里云去翻译,等于把图传出去了。公司内部的截图、私密文档,别这么干。

五、八个能力包,用哪个装哪个
整套东西拆成八个能力包,各自独立,用哪个装哪个,不用的不装。
最基础的是 core,读图读视频看文档,本地免费。剩下看需求,看长视频装 video-memory,画三维装 blender,做 CAD 装 freecad,做讲题视频装 edu-agent,还有三个联网的 api、search、video-edit。
几个官方给的用法很直观。引用一份 PDF,让它总结第三页并提取表格。引用一段会议录音,让它转写并标出说话人和时间戳。引用一张照片,让它判断拍摄地点再联网核实。装好能力后,直接引用文件提问就行。

六、泼点冷水
这套东西听着好,几个坑得说在前头。
一是大头要钱。免费的只有 core 那个基础包,其他联网的能力全走阿里云,要掏钱,按次算。有人说得很直白,这就是给阿里云的收费接口做的一个开源外壳。这话没错,但东西本身确实好用,用不用看愿不愿意为这个接口付钱。
二是慢。本地视觉模型处理一张图要几秒到一百秒,特别大的表格图能拖到一百秒以上。
三是挑平台。Windows 原生用不了,得开 WSL2。要做抠图还得自己搭一个 GPU 服务。
四是前途未卜。这套插件现在吃香,是因为主流的壳还没把多模态做透。哪天 Claude Code、Codex 自己把多模态做进内核了,这个插件的空间就会被挤压。
七、总结
总结一下,这套插件值不值,看用的是哪类模型。
用的模型本来就会看图,那它帮着补格式、干精细活,有用。用的是只会认字的本地模型,那它能借只眼睛给模型,更有用。
阿里这步棋也挺精明。它没去再造一个新模型,而是把自家模型的能力打包成插件,塞进十几个 AI 工具里。谁家的壳火,它的能力就进谁家,推理的流量最后都流回阿里云。不抢入口,抢管道。这比再造一个模型,更像一门稳生意。
数据来源:项目官方仓库与代码、配置文档、第三方实测 x7peeps https://github.com/QwenLM/Qwen-MM-Plugins
夜雨聆风