一行命令,给 Claude Code、Codex、Qwen Code 等任意 Agent 装上「眼睛」和「耳朵」。
一、先讲一个痛点
这两年 AI 编程助手、Agent 工具遍地开花,但大多数仍是**「文本原生」**的:
你把一张 4K 截图丢给它,它只能看到模糊的缩略图,仪表盘上的小数字一个都读不出来; 你给它一段 2 小时的会议视频,它干瞪眼; 你想让它读个 PDF、看个 3D 模型、把一张图纸变成 CAD,更是无从下手。
模型本身有多模态能力,但外面的 Agent 壳子没有对应的「工具通道」——这是当下很多 Agent 工作流里最大的断层。
Qwen 官方最近开源的一个项目,就是冲着这个问题来的。
二、这是什么项目
Qwen-MM-Plugins(https://github.com/QwenLM/Qwen-MM-Plugins)是阿里 QwenLM 团队官方出品的多模态插件库,一句话定位:
Make any agent harness multimodal-native —— 让任何 Agent 框架都具备原生多模态能力。
它不绑定某个特定工具,而是做了一套通用插件机制:无论你用的是 Claude Code、Codex、Qoder、Qwen Code、OpenClaw、Gemini CLI,还是 opencode、pi、QwenPaw,装上插件就能读图、看视频、听音频、甚至驱动 Blender 建模。项目采用 Apache-2.0 协议,完全开源,发布不久 GitHub 上已经积累了 2000+ Star。
官方架构图(来源:官方仓库 docs/assets/architecture.svg):

三、插件机制:skill + MCP server 双件套
这是整个项目设计上最巧妙的地方。每个能力由两部分组成:
| skill | |
| MCP server |
每个能力单独安装、按需加载,不会给你的 Agent 塞一堆用不上的工具。MCP server 通过 uvx 按需拉起,Python 依赖自动装进隔离缓存,不需要手动 pip。
四、八大门类能力一览
目前项目一共提供了 8 个能力,覆盖「看、听、查、剪、造、教」:
| core | ||
| api | ||
| search | ||
| video-memory | ||
| video-edit | ||
| blender | ||
| freecad | ||
| edu-agent |
官方 cookbook 实测截图(来源:官方仓库 cookbooks/ 目录,均为真实运行案例):






注意最后三个:blender 和 freecad 不是「调用 API」,而是给正在运行的软件写脚本——相当于 AI 直接上手操作你的三维建模软件;edu-agent 则是纯 skill 实现,很适合教育场景。
五、三个值得细说的亮点
1. 动态分辨率读取(core 的灵魂)
普通多模态工具读图是「一刀切缩放」,小字糊掉、细节丢失。Qwen-MM-Plugins 会对每张图片、每帧视频、每页文档自动缩放到 VL 模型的 patch grid:
一张 4K 截图上的细小文字和一张小缩略图,都能以各自需要的清晰度读进来,无需手动缩放。
2. 本地优先,免费优先
读图、读视频、读文档这类核心能力全部本地完成,不需要任何 API Key;只有云端 API 类能力才需要配置 DashScope / Serper 的 key。写进统一的 ~/.qwen-mm-plugins/config,一次配好,GUI 启动的 harness 也能读到。
3. 从「看懂」到「动手」
这个项目的野心不只是让 AI 看懂内容,而是让它产出内容:剪视频、生成图片、建模渲染、导 STEP 文件、生成讲题视频——多模态的完整闭环。
六、怎么安装
官方推荐用引导式安装器,一个脚本覆盖 install / configure / verify / uninstall 四个动作,并且底层调用各 harness 自己的原生安装,不重造轮子:
curl -fsSL https://raw.githubusercontent.com/QwenLM/Qwen-MM-Plugins/main/install.sh | bash支持 Claude Code · Codex · Qoder · OpenClaw · Qwen Code · Gemini CLI;opencode、pi、QwenPaw 等可以手动注册 skill + MCP。Windows 用户推荐 WSL2。
装好后自检环境:
bash install.sh verify它会确认 API Key、报告缺哪些系统工具(核心需要 ffmpeg)。
七、上手体验:几句话就能干活
装好插件后,直接在对话里引用文件提问即可,模型会自动调用对应工具。挑几个 README 里的例子感受一下:
# core —— 读图读文档@dashboard-4k.png 读出这张仪表盘里的每一个数字。@report.pdf 总结第 3 页。# api —— OCR / 定位 / 会议转写@receipt.jpg OCR 这张小票并把各行金额加总。@meeting.mp4 带说话人标签和时间戳转写这段会议。# search —— 以图搜图核验@place.jpg 这张照片是在哪拍的?# video-memory —— 长视频问答@lecture-2h.mp4 这段视频的主要观点是什么?带上时间戳。# blender —— 直接建模建一个低多边形木凳,加一盏暖色主光,然后渲染出来。# edu-agent —— 讲题@geometry-problem.png 把这道题的解法讲清楚,做成带旁白的视频。
每个能力还配了完整的 cookbook(含工具清单、安装步骤、实测案例),照着抄就能跑通。
八、视频与资料:想直接看效果?这几期讲得很透
项目发布后,社区已经有一批上手评测视频。下面按推荐度整理(截止文章发布时的检索结果,数据来自各平台页面):
1.【B站】阿里通义千问开源 Qwen-MM-Plugins:让 AI Agent 获得视觉、语音、视频、3D 全模态能力!开发者必看
UP 主:鲲鹏Talk(视频时长约 5 分 23 秒) 链接:https://www.bilibili.com/video/BV1t1uz67EwY/ (YouTube 同步:https://www.youtube.com/watch?v=_7VsysxUlsA ) 内容:目前最完整的中文讲解之一。带大家实际体验项目——图片理解、PDF 解析、视频分析、音频识别、3D/CAD 自动化,并介绍整体架构和接入 Claude Code、Codex、Qwen Code 的具体方法。
2.【YouTube】阿里重磅开源Qwen-MM-Plugins,我居然能把多模态能力直接套进别家Agent里?
频道:AI Toolbox 链接:https://www.youtube.com/watch?v=fbAXsJtlKUA 内容:中文上手向,从「为什么能套进别家 Agent」讲起,含安装步骤和核心能力实测。
3.【YouTube】Qwen MM Plugins Give AI Agents Eyes, Video Memory, and CAD
频道:TechWealth Hub(英文) 链接:https://www.youtube.com/watch?v=bvZvrlgPaB8 内容:英文视角,重点展示「眼睛(读图)、视频记忆、CAD」三大能力。
4.【YouTube】The Future of AI Agents Is Multimodal | Qwen-MM-Plugins
频道:LUMI AI(Telugu 语) 链接:https://www.youtube.com/watch?v=xascTJ2w6Q8 内容:多模态 Agent 趋势解读 + 插件介绍,海外社区视角。
5. 各大 AI 日报的报道(新闻速览向,适合快速了解动态):
infinite灵感港《8月10日AI日报第483期》https://www.bilibili.com/video/BV11zud6sE34/ 阿梨Aria早鸟报《8.11 AI早报》https://www.bilibili.com/video/BV1HCuY6sEqK/ 绿鸭Lvya《【绿鸭AI早报 0810】》https://www.bilibili.com/video/BV1XJu96hEfC/
以上视频均为第三方 UP 主 / 频道制作,版权归原作者所有,引用仅供学习交流。
九、谁适合用
重度 Agent 用户:整天跟截图、PDF、发票、会议录音打交道的人,装上 core + api 立省 80% 的「手动转文本」时间; 内容创作者:video-edit 能直接让 Agent 帮你剪片、出图、出音频; 工程师 & 设计师:用自然语言驱动 Blender / FreeCAD 建模,参数化 CAD 工作流有了新玩法; 老师 & 家长:edu-agent 把一道题变成讲题视频,AI 助教初见雏形。
十、结语
多模态模型已经很强了,而 Qwen-MM-Plugins 做的事情是:把这份能力真正接到你每天都在用的 Agent 工作流里。它没有发明新的模型,却用一套干净的「skill + MCP」机制,让「模型能看」变成「Agent 会用」。
项目还在快速迭代中,感兴趣的可以直接去 GitHub 看 README 和 cookbook:
🔗 https://github.com/QwenLM/Qwen-MM-Plugins
看完顺手点个 Star,也欢迎在评论区聊聊你用它做了哪些有意思的事。
夜雨聆风