↑阅读之前记得关注+星标⭐️,😄,每天才能第一时间接收到更新
大家好,我是杰克王,AI 算法 6 年老兵。
一个用户在 Qwen-MM-Plugins 的 issue #35 里说:他们用 DeepSeek 或者单位部署的大模型,明明告诉它“要看图就调插件”,可跑到验证环节时,模型还是把图片塞给那个没有视觉能力的模型,然后任务直接断掉。
这个 issue 有 5 条评论,是仓库 open issues 里评论最多的一条。它戳中的痛点很真实:很多 Agent 不是没有工具,而是工具接上了,模型还是不知道图片该怎么进脑子。
这篇文章你能拿到三样东西:第一,Qwen-MM-Plugins 到底解决什么问题;第二,它的能力清单、安装方式和真实用户吐槽;第三,我把 README 中文全文完整附在文末,方便你直接判断要不要装。

一句话定位:让任何 Agent Harness 原生多模态
README 中文第一句写得很清楚:面向 Qwen 模型的原生多模态理解插件,让任何 Agent Harness 都具备原生多模态能力。
英文描述更直接:Make any agent harness multimodal-native.
截至我写稿的 2026-08-20 晚上,GitHub API 返回:2,734 Stars、159 Forks、Apache-2.0 License,仓库创建于 2026-07-29,主语言字段显示为 HTML。仓库里没有 Releases 页面条目,版本管理走 plugin-versions.json:distribution_version 是 1.0.7,核心能力 core 1.0.4、api 1.0.5、search 1.0.4、video-memory 1.0.3。

它不是“又一个视觉工具”,是把多模态拆成可安装能力
Qwen-MM-Plugins 的结构是:每个能力独立安装,由一个 Skill 加一个可选 MCP server 组成,安装名统一为 qwen-mm-plugins-<capability>。
能力清单里最关键的是 core:本地读取图片和视频,可视化文档、代码、数据、3D 文件,默认原生图片模式不需要 API key。api 负责 Qwen VL/Omni 视觉理解、OCR、grounding、ASR、分割和音视频理解,依赖 DashScope。再往外是 search、video-memory、video-edit、blender、freecad、edu-agent。
这个拆法的好处是,你不需要一上来装一个庞然大物。只想让 Agent 看懂 PDF 表格和截图,装 core/api 就够;要做长视频问答,再补 video-memory;要做中文数理讲解视频,再装 edu-agent。
安装和体验
README 给的安装方式是一行脚本:
curl -fsSL https://raw.githubusercontent.com/QwenLM/Qwen-MM-Plugins/main/install.sh | bash更新某个 harness 里已安装能力:
curl -fsSL https://raw.githubusercontent.com/QwenLM/Qwen-MM-Plugins/main/install.sh | bash -s -- update引导式安装器支持 Claude Code、CodeBuddy、Codex、Qoder、OpenClaw、Qwen Code 和 Gemini CLI;WorkBuddy、QoderWork、QwenWork 走应用内安装;DeepSeek Harness、Hermes Agent、opencode、pi、QwenPaw 有手动安装文档。
安装后用法很朴素:引用文件,直接提问。
@report.pdf 总结第 3 页,并提取其中的表格。@meeting.mp4 带说话人标签和时间戳转写这段会议。@place.jpg 判断照片拍摄地点,并联网核实。@lecture-2h.mp4 按时间戳列出这段长视频的主要观点。真实用户卡点,比 README 更值得看
issue #35 的痛点是“图片还是会被传给没有视觉的模型”。这不是 Qwen-MM-Plugins 一家的问题,是所有 text-only 模型外挂视觉方案都会遇到的问题:工具在,但模型决策链路不稳,不知道什么时候该把图转成文字,什么时候该调用视觉工具。
issue #7 想要可插拔搜索后端。用户已经买了 Exa/Tavily,不想再为 Serper 单独开账号。这个需求很典型:Agent 工具链最后拼的不是 demo 效果,是现有订阅、现有 key、现有合规出口能不能复用。
issue #31 是 Windows 下 stdio MCP server 跑 3D 文件 visualize 会挂起。最扎心的是,同一个 worker、同一个解释器,在普通 Python 进程里 0.4 到 3.5 秒能跑完;一进 MCP server 进程就超过 150 秒不返回。这说明问题不在渲染算法,在 Windows 管道、子进程和 asyncio stdio 的交界。
issue #39 更有意思,有用户直接提案做 vision-proxy:在本地起一个常驻 HTTP 代理,自动拦截 Claude Code / Codex / Qwen Code 请求里的图片,先用 VLM 转成文字描述,再转发给上游纯文本模型。目标是让纯文本模型“表现像原生看图”,而不是依赖它偶尔想起来调工具。
closed issue #12 也值得记住:用户把 DASHSCOPE_BASE_URL 指向自托管 vLLM 或 Fireworks,vision_chat 和 ocr 能跑,只有 grounding 因为固定塞 enable_thinking 被严格校验的端点 400 拒绝。这个坑很工程:兼容 OpenAI 不等于兼容所有 OpenAI-compatible。
我的判断
Qwen-MM-Plugins 的价值不在“Qwen 又出了几个工具”,而在它把多模态能力做成 harness 可插拔层。过去是某个 Agent 应用自己接视觉、接 OCR、接视频;这个项目想把这层变成公共插件,让 Claude Code、Codex、OpenClaw、Qwen Code 甚至 DeepSeek Harness 都能复用。
但它现在还不是无脑装的生产件。原因有三个:第一,仓库才创建三周多,issue 里已经能看到 Windows、搜索后端、非 DashScope 端点这些真实摩擦;第二,很多高级能力依赖 DashScope 或系统程序,环境成本不低;第三,它要改的是 Agent 运行链路,出错时比普通脚本更难排查。
适合现在下场的人:做 Agent 基建的、做企业内部 harness 的、被“纯文本模型看图”折磨过的团队。只适合围观的人:只想找个工具总结一下 PDF 的普通用户,先用成熟应用更稳。
仓库:https://github.com/QwenLM/Qwen-MM-Plugins
附录:README 中文全文
下面是 README.zh.md 全文,来源:https://raw.githubusercontent.com/QwenLM/Qwen-MM-Plugins/main/README.zh.md,拉取时间 2026-08-20。
Qwen-MM-Plugins
English[1] · 中文
面向 Qwen 模型的原生多模态理解插件,让任何 Agent Harness 都具备原生多模态能力。
架构

安装
引导式安装器支持 Claude Code、CodeBuddy、Codex、Qoder、OpenClaw、Qwen Code 和 Gemini CLI。 共享配置位于 ~/.qwen-mm-plugins/config。
WorkBuddy、QoderWork 与 QwenWork 的应用内安装,以及 DeepSeek Harness、Hermes Agent、 opencode、pi 和 QwenPaw 的手动安装方式见其他 Harness 安装[2]。
curl -fsSL https://raw.githubusercontent.com/QwenLM/Qwen-MM-Plugins/main/install.sh | bash更新某个 harness 中已安装的能力:
curl -fsSL https://raw.githubusercontent.com/QwenLM/Qwen-MM-Plugins/main/install.sh | bash -s -- update正式能力使用彼此独立且不可变的发布 tag。本地 checkout、版本回退、手动 skill + MCP 安装、 依赖以及 Windows/WSL2 说明见安装文档[3]。
能力
每个能力独立安装,由一个 Skill 和可选的 MCP server 组成;安装名统一为 qwen-mm-plugins-<capability>。
core | |||
api | |||
search | |||
video-memory | |||
video-edit | |||
blender | |||
freecad | |||
edu-agent |
快速体验
安装能力后,引用文件并直接提问即可;Skill 会选择对应的 MCP 工具。
@report.pdf 总结第 3 页,并提取其中的表格。@meeting.mp4 带说话人标签和时间戳转写这段会议。@place.jpg 判断照片拍摄地点,并联网核实。@lecture-2h.mp4 按时间戳列出这段长视频的主要观点。core 会以动态分辨率读取媒体,通常无需手动缩放。
依赖与配置
uv[12] 提供uvx,按需安装 Python 依赖。本地 core工具在默认原生图片模式下无需 API key;纯文本图片描述 fallback、云端和搜索能力 需要对应服务的凭证。视频、文档、浏览器、Blender 和 FreeCAD 工作流可能需要系统程序。
通过安装器的 Configure 和 Verify 操作设置凭证并检查依赖。系统要求见 安装文档[13],全部设置见配置参考(英文)[14]。
文档
安装[15] 配置参考(英文)[16] 贡献指南[17] · 本地开发[18] 添加能力[19] · 测试[20]
许可证
Apache-2.0,见 LICENSE[21]。Blender 与 FreeCAD 集成的第三方署名分别见 Blender NOTICE[22] 和 FreeCAD NOTICE[23]。
觉得有收获,点个在看支持一下 👇 感谢阅读。我是杰克王,欢迎加微交流 🚀
引用链接
[1]English: README.md
[2]其他 Harness 安装: docs/zh/manual_harnesses.md
[3]安装文档: docs/zh/installation.md
[4]Cookbook: cookbooks/core/usage.md
[5]Cookbook: cookbooks/api/usage.md
[6]Cookbook: cookbooks/search/usage.md
[7]Cookbook: cookbooks/video-memory/usage.md
[8]Cookbook: cookbooks/video-edit/usage.md
[9]Cookbook: cookbooks/blender/usage.md
[10]Cookbook: cookbooks/freecad/usage.md
[11]Cookbook: cookbooks/edu-agent/usage.md
[12]uv: https://docs.astral.sh/uv/
[13]安装文档: docs/zh/installation.md#%E4%BE%9D%E8%B5%96
[14]配置参考(英文): docs/en/configuration.md
[15]安装: docs/zh/installation.md
[16]配置参考(英文): docs/en/configuration.md
[17]贡献指南: CONTRIBUTING.md
[18]本地开发: docs/zh/local_development.md
[19]添加能力: docs/zh/how_to_add_new_capability.md
[20]测试: docs/zh/testing.md
[21]LICENSE
[22]Blender NOTICE: src/capabilities/blender/NOTICE.md
[23]FreeCAD NOTICE: src/capabilities/freecad/NOTICE.md
夜雨聆风