乐于分享
好东西不私藏

阿里开源的多模态插件,给AI工具装上眼睛和手

阿里开源的多模态插件,给AI工具装上眼睛和手

项目仓库: https://github.com/QwenLM/Qwen-MM-Plugins

一、它是个什么东西

7 月底阿里开源了一个项目,名字挺拗口,叫 Qwen-MM-Plugins。名字不用记,记住它是干嘛的就行:一套给 AI 工具补多模态能力的插件。

为什么专门聊它?因为它解开的,是把多模态能力接进 AI 工具这件事。现在能看图的模型不少,但怎么把这能力接进 Claude Code、Codex 这些真正干活的家伙里,各家一直各搞各的,接法乱,标准不统一。阿里这套东西,想把这个接法统一成一套插件,装上去就能用。

先解释什么叫多模态。AI 模型分两种。一种只认字,给它一张图、一段视频,它看不懂,这种叫纯文本模型。另一种除了认字还能看图,这种叫多模态模型。现在主流的 Claude、GPT 都是后者。

再说什么叫插件。AI 模型自己没法干活,得给它配个壳,让它能读文件、跑命令、调工具,这个壳业内叫 Harness,Claude Code、Codex 都是。这套东西,就是往这些壳里装的能力包,装上去,壳里的模型就多一堆本事,能看图、能看视频、能翻 PDF、能改图纸。

项目 7 月 29 日上线,一个月 star 涨到两千七百多,还在涨。能装的壳特别多,Claude Code、Codex 这些主流的全能装,一共十几个。

官方架构图:左边八个能力包,每个能力包由一套技能加一个服务组成,右边装进各个 AI 工具(来源项目官方仓库)

二、它是怎么让 AI 工具能看东西的

拆开看,里头有两套东西在干活。一套是本地的小程序,不要钱;一套是云端的模型,要钱。

本地的小程序干什么?搬格式。视频模型看不了,就用 ffmpeg 把画面抽成一张张图。三维模型、CAD 图纸模型不认识,就渲染成平面图。PDF 排版复杂,就一页页转成图。这些活纯粹是格式转换,跟 AI 没啥关系,全用现成的开源程序干,所以免费。

云端的模型干什么?真懂。看图、认字、找东西、转语音,这些是要动脑子的活,得靠阿里的视觉和语音模型。这部分按次收费,走阿里云。

简单说,本地的负责把东西摆成模型能看的样子,云端的负责真正看懂。一前一后,配合干活。

这套工具还有个挺聪明的设计。每个能力包里都装了两样东西,一样是说明书,告诉模型这个工具什么时候用、怎么用;一样是干活的程序,真正去执行。模型看说明书决定用哪个,程序负责把活干完。这样写一次说明书,装到哪个壳里都能用,不用给每个壳单独重写一份。

三、模型本来就会看图,这东西还有用吗

有用,而且用处不小。现在的主流模型,Claude、GPT 这些,本来就认图,但认图不代表什么都能干。

有些格式它看不了。视频没法直接看,得抽帧。三维模型、CAD 图纸、医学影像根本不认识,得先变成平面图。这些活谁来做?这套插件来做。

有些活它干不精。让它圈出图里的猫,能圈,但让它给出精确坐标,把一张图里的人像素级抠出来,把一段会议录音按说话人分开还带上时间戳,这些精细活不擅长。这时候外挂一个专门干这个的模型,更靠谱。

还有些细节它看不清。截图里特别小的字,直接看容易看花,插件会把图缩放到合适大小再给它看。

所以对本来就会看图的模型来说,这套插件不是给它装眼睛,它自己有眼睛。是给它补手,补那些看不了的格式,干不细的活。

四、模型不会看图,这东西怎么让它看见

更有意思的是另一种情况。有些模型压根不会看图,只认字,就是纯文本模型。本地跑的很多模型就是这样。

对这类模型,这套插件有个巧办法。它里头有个开关,默认开着,叫原生模式。开着的时候,插件直接把图给模型看,反正模型会看。把开关关掉,插件换个玩法:每张图先送到阿里的视觉模型那里,让它把图翻译成一段文字,再交回给主模型。

主模型读到的是文字,但内容就是图里的东西。等于插件借了别人的眼睛,看一遍,再用嘴说给模型听。这样,只认字的模型也能知道图里有什么了。

举个例子。给纯文本模型看一张表格截图,插件会把图送到云端,视觉模型返回一段文字,说这张表第一列是年份、第二列是销量、第三行的数字是多少。纯文本模型拿到这段文字,就等于看到了整张表。

不过有个代价。图要发到阿里云去翻译,等于把图传出去了。公司内部的截图、私密文档,别这么干。

五、八个能力包,用哪个装哪个

整套东西拆成八个能力包,各自独立,用哪个装哪个,不用的不装。

最基础的是 core,读图读视频看文档,本地免费。剩下看需求,看长视频装 video-memory,画三维装 blender,做 CAD 装 freecad,做讲题视频装 edu-agent,还有三个联网的 api、search、video-edit。

几个官方给的用法很直观。引用一份 PDF,让它总结第三页并提取表格。引用一段会议录音,让它转写并标出说话人和时间戳。引用一张照片,让它判断拍摄地点再联网核实。装好能力后,直接引用文件提问就行。

六、泼点冷水

这套东西听着好,几个坑得说在前头。

一是大头要钱。免费的只有 core 那个基础包,其他联网的能力全走阿里云,要掏钱,按次算。有人说得很直白,这就是给阿里云的收费接口做的一个开源外壳。这话没错,但东西本身确实好用,用不用看愿不愿意为这个接口付钱。

二是慢。本地视觉模型处理一张图要几秒到一百秒,特别大的表格图能拖到一百秒以上。

三是挑平台。Windows 原生用不了,得开 WSL2。要做抠图还得自己搭一个 GPU 服务。

四是前途未卜。这套插件现在吃香,是因为主流的壳还没把多模态做透。哪天 Claude Code、Codex 自己把多模态做进内核了,这个插件的空间就会被挤压。

七、总结

总结一下,这套插件值不值,看用的是哪类模型。

用的模型本来就会看图,那它帮着补格式、干精细活,有用。用的是只会认字的本地模型,那它能借只眼睛给模型,更有用。

阿里这步棋也挺精明。它没去再造一个新模型,而是把自家模型的能力打包成插件,塞进十几个 AI 工具里。谁家的壳火,它的能力就进谁家,推理的流量最后都流回阿里云。不抢入口,抢管道。这比再造一个模型,更像一门稳生意。

数据来源:项目官方仓库与代码、配置文档、第三方实测 x7peeps https://github.com/QwenLM/Qwen-MM-Plugins