你的AI助手突然会"看"了:阿里开源Qwen-MM-Plugins
素材来源:X:通义千问官方(@Alibaba_Qwen)、GitHub:QwenLM/Qwen-MM-Plugins | 2026-08-10
你把一张4K截图丢给Claude Code,让它"把仪表盘上每个数字读出来"。它盯着文件路径,回你一句:我看不了图片。
这个场景,今天开始变了。
8月10日,阿里Qwen官方在X上官宣开源 Qwen-MM-Plugins——一个让任意Agent框架原生支持多模态的插件包。装上它,你的Claude Code、Codex、Gemini CLI,都能读图、看视频、OCR,甚至驱动Blender给你建模渲染。
Qwen不缺多模态模型,缺的是把模型塞进Agent手里的那根管子
先说个容易被忽略的事实:模型会看,不等于智能体会用。
Qwen自家的多模态家底很厚——Qwen3.8-Max看得懂图,Qwen-Omni听得懂音视频,qwen3-asr负责转写,还有SAM3做分割。但这些东西默认都躺在API里,Agent框架平时只会跟纯文本工具打交道。
图像、视频、3D文件,对它们来说就是一堆看不懂的二进制。Qwen-MM-Plugins要打通的,就是这层墙。
官方那句话点题:从多模态模型,到多模态智能体。模型是眼睛,插件是神经——把视觉信号接进Agent的决策回路。
一个能力包 = 一个skill + 一个MCP服务,认知和执行分开管
插件的架构值得拆一下。每个能力包都由两层组成:一个skill,让模型知道"我有这些工具";一个可选的MCP server,承载工具本体。
skill管认知——模型读到工具清单,知道什么场景该调什么;MCP管执行——工具由uvx按需拉起,不用手动pip装依赖。两层分离的好处是:GUI框架和命令行框架共用同一份配置,装一次到处用。
仓库一口气给了7个能力包:
▸ core | 读图/读视频/读文档/读3D,动态分辨率 + OCR + grounding + 分割 + ASR + 联网搜索
▸ video-memory | 长视频分层图记忆,2小时视频也能带时间戳问答
▸ omni-av | 音视频理解:说话人标签、事件计数、音乐打标
▸ video-edit | 视频剪辑 + 图像/视频/音频生成工作流
▸ blender | thin client驱动运行中的Blender,22个工具
▸ freecad | thin client驱动运行中的FreeCAD,14个工具,支持STEP/STL与FEM
▸ edu-agent | 把数学/科学题变成分步讲解视频(纯skill)
每个包独立安装、按需取用——只要core,就只装core。
图1 | Qwen-MM-Plugins 双层架构:skill 认知层 + MCP 执行层,对接六种 Agent 框架(示意图,依据官方README绘制)
两个设计细节,值得单独拎出来说
第一个:动态分辨率读取。每张图片、每个视频帧、每页文档,都会被自动缩放到视觉模型的patch网格上。"4K截图里的小字和缩略图,都以它们需要的细节进来"——不用手动resize,也不会因为压缩丢掉关键信息。
这是"能读"和"读得准"的分水岭。不少多模态工具链死在第一步:图太大塞不进模型,图太小看不清细节。
第二个:thin client驱动重型软件。Blender和FreeCAD不是被"调API",而是被一个Python薄客户端直接驱动正在运行的实例。你说一句"建模一个低多边形木凳,加一盏暖色主光,渲染出来",它就在你开着的Blender里真刀真枪地干。
22个工具覆盖建模、材质、灯光、渲染;14个工具覆盖参数化建模、属性编辑、STEP/STL导入导出、FEM有限元分析。这不是demo级的"生成一张图",是工程级的"操作你的生产工具"。
怎么装:四步走,装完就能用
官方给了一条龙安装脚本,一条命令覆盖install/configure/verify/uninstall:
curl -fsSL https://raw.githubusercontent.com/QwenLM/Qwen-MM-Plugins/main/install.sh | bash
装完按框架挂能力包。以Claude Code为例:
claude plugin marketplace add https://github.com/QwenLM/Qwen-MM-Plugins.git
claude plugin install qwen-mm-plugins-core@qwen-mm-plugins
Codex、Qoder、OpenClaw、Qwen Code、Gemini CLI同样支持,命令格式见仓库README。
然后配两个Key:DASHSCOPE_API_KEY(视觉对话/OCR/grounding/转写),SERPER_API_KEY(联网搜索)。注意:原生读图、读视频、读文档不需要任何Key——这部分能力本地完成。
最后一步,直接开用:把图拖进对话,说"OCR这张发票并汇总";或者对Blender说"把这只凳子渲染出来"。
⚠ 一个现实提醒:Windows用户需要WSL2环境,原生Windows还没验证;SAM3分割要自托管一个GPU服务。
图2 | 同一个 Agent 装上插件前后的能力对比(示意图,依据官方README与Cookbook整理)
说几个有意思的点
→ 阿里这步棋没押在"新模型"上,押在存量模型的能力变现。多模态模型早就有了,缺的是把它们接进Agent生态的管道。管道比模型更靠近用户,也更靠近入口。
→ skill+MCP的双层结构,正在成为2026年下半年的标准姿势。OpenClaw、Qoder这些国产框架全在抢plugin marketplace的生态位,这个仓库一次兼容了六家。
→ 738颗星、Apache-2.0协议、仓库今天还在活跃更新。新是新的,但背后是QwenLM官方团队,不是个人玩具。
多模态正在变成Agent的标配外设。
插件生态会赢家通吃,还是每个框架长出原生多模态?
评论区站个队——你押插件生态,还是押框架原生?
参考来源:
1. X:@Alibaba_Qwen 官方宣布帖(2026-08-10)
2. GitHub:QwenLM/Qwen-MM-Plugins(Apache-2.0,738⭐)
3. 官方Cookbook:cookbooks/core/usage.md(工具清单与用例)
夜雨聆风