Qwen-MM-Plugins 是通义千问团队开源的原生多模态理解插件集(Apache 2.0),让任何 Agent Harness(Claude Code / Codex / Gemini CLI / OpenClaw 等)都能获得原生多模态能力——看图、看视频、读文档、OCR、目标检测、语音转写、视频剪辑、Blender 建模、FreeCAD 参数化 CAD、教育讲题视频,一个插件市场装上就能用。

六大能力模块
| core | qwen-mm-plugins-core | |
| video-memory | qwen-mm-plugins-video-memory | |
| video-edit | qwen-mm-plugins-video-edit | |
| blender | qwen-mm-plugins-blender | |
| freecad | qwen-mm-plugins-freecad | |
| edu-agent | qwen-mm-plugins-edu-agent |
使用示例
装好后在 Agent 里直接 @文件提问,模型自动调用对应工具:
# 看图 / 读文档
@dashboard-4k.png 读出这张仪表盘里的每一个数字。
@report.pdf 总结第 3 页。
@receipt.jpg OCR 这张小票并把各行金额加总。
# 目标检测
@street.jpg 把画面里每一辆车都框出来。
# 长视频问答
@lecture-2h.mp4 这段视频的主要观点是什么?带上时间戳。
# 视频剪辑 + 生成
@/path/to/media 帮我把这个视频剪到大约 3 分钟。
生成一张 1024×1024 的图:小熊猫在深夜敲代码。
# Blender 建模
建一个低多边形木凳,加一盏暖色主光,然后渲染出来。
# FreeCAD 参数化 CAD
建一颗 M6 六角螺栓、长 30 mm,导出成 STEP。
# 教育讲题
@geometry-problem.png 把这道题的解法讲清楚,做成带旁白的视频。动态分辨率
读取是自适应的——4K 截图上的细小文字和小缩略图都能以各自需要的清晰度读进来,无需手动缩放。
安装方法
引导式安装器(推荐)
一个脚本搞定安装/配置/验证/卸载,覆盖 Claude Code、Codex、Qoder、OpenClaw、Qwen Code、Gemini CLI:
curl -fsSL https://raw.githubusercontent.com/QwenLM/Qwen-MM-Plugins/main/install.sh | bash交互式菜单引导,选择要装的能力和目标 Agent。
手动安装(Claude Code 为例)
# 添加市场
claude plugin marketplace add https://github.com/QwenLM/Qwen-MM-Plugins.git
# 安装某个能力
claude plugin install qwen-mm-plugins-core@qwen-mm-plugins
claude plugin install qwen-mm-plugins-blender@qwen-mm-plugins配置 API Key
原生读图/视频/文档不需要 API Key。以下功能需要:
• DASHSCOPE_API_KEY:vision_chat / OCR / grounding / 语音转写 / 生成类 / video-memory• SERPER_API_KEY:联网搜索 / 网页提取 / 图片搜索
架构设计
每个能力 = 一个 Skill(让模型知道有这套工具)+ 一个可选 MCP Server(工具本体)
• Skill 告诉模型"你现在会看图了" • MCP Server 提供实际的工具调用端点 • 用 uvx按需拉起,依赖隔离,不污染全局环境
支持的 Agent Harness
应用场景
场景 1:代码+截图一起审查
传统痛点:想让 Agent 看一眼 UI 截图指出问题,但 Agent 只能处理文本
解决方案:@screenshot.png 这个页面的布局有什么问题? —— Agent 直接看图回答
场景 2:视频内容理解
传统痛点:两小时的讲座视频,想快速找到某个知识点在哪,只能自己拖进度条
解决方案:video-memory 构建层次化记忆,问"模型最大的观点是什么?带时间戳"直接定位
场景 3:AI 驱动 3D 建模
传统痛点:想用 AI 帮忙建模,但 Blender/FreeCAD 的 API 太复杂,不知道怎么对接
解决方案:22 个 Blender 工具 / 14 个 FreeCAD 工具封装成 MCP,用自然语言描述就能建模
场景 4:文档批量处理
传统痛点:一堆 PDF 小票要 OCR 再加总金额,手动做要半天
解决方案:@receipt.jpg OCR 这张小票并把各行金额加总 —— Agent 自动完成
场景 5:数学讲题视频
传统痛点:教师想把一道题的解法做成讲解视频,手动制作太费时
解决方案:@题目.png 把这道题的解法讲清楚,做成带旁白的视频 —— edu-agent 自动生成
常见问题
Q:必须用通义千问模型吗?
插件设计上是面向 Qwen 模型优化的,但 Skill + MCP 架构是标准化的,任何支持 MCP 的 Agent 都能用。
Q:core 模块读图需要联网吗?
读图/视频/文档本身调用 DashScope API,需要 DASHSCOPE_API_KEY。但是 OCR 和 grounding 也走这个 key,不需要额外配置。
Q:Blender / FreeCAD 怎么对接?
"瘦客户端"模式——你先启动 Blender / FreeCAD,插件通过 Python 脚本远程驱动它。不需要改 Blender/FreeCAD 的安装。
Q:Windows 支持吗?
推荐 WSL2(Ubuntu)。原生 Windows 尚未完成验证。
资源链接
• GitHub 仓库: https://github.com/QwenLM/Qwen-MM-Plugins
夜雨聆风