你用 AI 助手写代码、查资料,一天下来很顺手。但有个尴尬:它是个"文盲"——只认文本。丢给它一张截图问"这个报错什么意思",它只能说"我看不到图片"。
Qwen-MM-Plugins 解决的就是这个。通义千问官方出的多模态插件集,给主流 AI Agent 装上眼睛和耳朵。项目上个月底刚开源,Apache-2.0 协议。
装完之后,引用文件的方式很自然——直接把文件 @ 给 AI:
@report.pdf 总结第 3 页,提取里面的表格
@meeting.mp4 转写这段会议,带上说话人和时间戳
@place.jpg 识别这张照片在哪拍的,并在网上核实
@lecture-2h.mp4 列出两小时讲座的要点,带时间戳PDF、视频、图片,AI 自己会判断该用什么工具处理,不用你操心格式。core 能力读媒体时会自动调分辨率,手动缩放基本不需要。

2、八个能力,按需装
整套插件拆成 8 个独立能力,每个都是一对"技能 + 可选 MCP 服务",想用哪个装哪个:
- • core:读图片视频,可视化文档、代码、数据、3D 文件。本地工具,不需要任何 API key
- • api:视觉、OCR、定位、语音转写、分割、音视频理解,走通义千问的云 API
- • search:网页搜索、页面提取、以图搜图(需要搜索服务的 key)
- • video-memory:给长视频建分层记忆,做长视频问答
- • video-edit:图片、视频、音频的生成和编辑工作流
- • blender:在 Blender 里建模、贴图、打光、渲染
- • freecad:参数化 CAD、STEP/STL 导出、有限元分析
- • edu-agent:生成中文数学、科学讲解视频和互动页面
最有意思的是 blender 和 freecad——AI 不只是"看"图,还能直接上手 3D 建模和 CAD 工程图,这两个都是本地开源软件驱动。

3、core 免费用,这点很实在
很多多模态方案上来就要 API key、按量计费。这套插件的 core 能力是纯本地的:读图片、看视频、可视化文档,跑在你自己的机器上,一分钱不用花。
只有要用云模型的能力(api、search、video-edit 这些)才需要对应的 key。想先试试水,装 core 就够了。
4、怎么装
一条命令:
curl -fsSL https://raw.githubusercontent.com/QwenLM/Qwen-MM-Plugins/main/install.sh | bash安装器带引导,支持 Claude Code、Codex、Qwen Code、Gemini CLI 等主流 Agent 框架,每个都走框架自己的原生安装命令,配置统一放在 ~/.qwen-mm-plugins/。装完跑一遍它的"配置"和"验证",依赖齐不齐一目了然。
5、适合谁,不适合谁
适合:日常重度用 AI 助手、又经常要处理截图/PDF/视频的人——客服截图、会议录像、产品文档,直接 @ 进去问。做 3D 或机械设计的,blender 和 freecad 两个能力值得单独装。
不适合:只用 AI 聊天的轻度用户,装上用不上;另外云能力需要国内访问通义千问 API 的网络条件。
一个 @ 符号让 AI 睁开眼睛,这件事官方出手做得比社区插件更省心。
总结
Qwen-MM-Plugins 用"技能 + MCP"的方式给 AI Agent 加多模态能力,8 个能力独立安装,core 本地免费,@ 引用文件即可问答。
核心要点:
- 1. @ 即问答 — @ 图片/PDF/视频,AI 自动选工具处理
- 2. core 全免费 — 本地看图读视频,不需要 API key
- 3. 8 个能力按需装 — 视觉/搜索/视频编辑/Blender/CAD 各取所需
- 4. 官方维护 — 通义千问出品,Apache-2.0
- 5. 一条命令安装 — 支持 6 个主流 Agent 框架
建议收藏,下次 AI 助手说"我看不到图片"的时候,@ 一下。
项目地址:https://github.com/QwenLM/Qwen-MM-Plugins
你平时会丢图片、PDF 给 AI 看吗?评论区聊聊,觉得有用也顺手点个在看。
夜雨聆风