乐于分享
好东西不私藏

Qwen 开源多模态插件:DeepSeek 也能看图读视频

Qwen 开源多模态插件:DeepSeek 也能看图读视频

核心论点

Qwen 开源多模态插件:DeepSeek 也能看图读视频

Make any agent harness multimodal-native · Qwen 团队开源 · Apache-2.0

01

THE PROBLEM

你的 Agent,其实是个“瞎子”

先说一个很多人没意识到的事实。

你跑 Agent 用的那些 coding 模型,DeepSeek V4 Flash、GLM-5.2,写代码一个比一个强。但它们都是纯文本模型:字进去,字出来。截图、PDF、视频,根本递不到它们面前。

不是框架不行,是模型没有眼睛。框架搭得再好,感官这件事,要么模型自己长,要么有人替它长。

前两天,阿里通义 Qwen 团队开源了一个项目,专门治这个病:Qwen-MM-Plugins。口号很直接,Make any agent harness multimodal-native——让任何 Agent 框架原生拥有多模态能力。

7 月 29 日开源,Apache-2.0 协议,十来天冲到 650 多个 star。

你的 Agent 其实是个瞎子

02

ARCHITECTURE

它是什么:一个 skill + 一个 MCP server

这套插件的设计很干净。每个能力包拆成两件东西:

一个 skill,告诉模型“你有这些工具可以用”;

一个 MCP server,工具本体,用 uvx 按需拉起,不用你手动 pip 装依赖。

装的时候按能力单独装,想用哪个装哪个,不是一坨全家桶塞给你。

对纯文本模型,这套插件等于外挂了一双 Qwen 的眼睛:OCR、视觉问答、目标定位这些活,由插件工具里的 Qwen 多模态模型干完,结果以文本形式回到你的 Agent。模型自己不需要有视觉,也能使唤视觉。

架构:一个 skill + 一个 MCP server

一共 7 个能力包:

能力
干什么
core
基础视觉:读图/视频/文档/3D 模型,OCR、目标定位、分割、语音识别、网页搜索
video-memory
长视频记忆:层级图记忆,两小时的课也能问答
omni-av
音视频理解:带时间戳和说话人的转写、时序定位、事件计数、音乐打标
video-edit
视频剪辑 + 图片/视频/音频生成
blender
驱动正在运行的 Blender 建模、打光、渲染(22 个工具)
freecad
驱动 FreeCAD 参数化建模,STEP/STL 导出、FEM 分析(14 个工具)
edu-agent
把数学/科学题变成分步讲解视频(纯 skill,无 MCP server)

核心是那个 core。装上它,你的 Agent 立刻会看图、读 PDF、OCR 发票、给照片里的物体画框。

七个能力包速览

03

INSTALL

上手:五分钟装完

四步上手

第一步:安装

推荐用官方引导脚本,一条命令搞定安装、配置、验证、卸载四件事:

curl -fsSL https://raw.githubusercontent.com/QwenLM/Qwen-MM-Plugins/main/install.sh | bash

它支持 Claude Code、Codex、Qoder、OpenClaw、Qwen Code、Gemini CLI 六个框架,底层走的是各框架自己的原生安装命令,没有重复造轮子。

Windows 用户注意:只支持 WSL2。在 WSL 里 clone 仓库再跑脚本,别放 /mnt/c 下面。

如果你就想手动装 core 一个包,用 Claude Code 的插件市场命令也行:

claude plugin marketplace add https://github.com/QwenLM/Qwen-MM-Plugins.git

claude plugin install qwen-mm-plugins-core@qwen-mm-plugins

用 Codex 的读者记一个坑:marketplace add 不会刷新已添加的市场,装新能力前要先跑 codex plugin marketplace upgrade qwen-mm-plugins

第二步:配 API key

这里有个好消息:原生读图、读视频、读文档不需要任何 key

只有调云端 API 的工具才要:

DASHSCOPE_API_KEY:OCR、视觉对话、目标定位、语音转写、生成类工具用,去阿里云百炼平台申请;

SERPER_API_KEY:网页搜索三件套用,serper.dev 注册有免费额度。

key 写到 ~/.qwen-mm-plugins/config 文件里,或者直接跑 bash install.sh configure 让脚本帮你写。GUI 启动的框架也能读到这份配置。

第三步:自检

bash install.sh verify

它会检查 key 配没配对、系统工具缺不缺。视频和音频处理需要 ffmpeg,这个要自己装;Python 依赖不用管,uvx 首次启动自动装。

第四步:直接用

装完之后,没有任何新语法要学。@ 一个文件,说人话就行:

@dashboard-4k.png  读出这个仪表盘上的每个数字

@report.pdf     总结第 3 页

@receipt.jpg     OCR 一下,把金额加起来

@street.jpg     给画面里每辆车画个框

装了其他能力包,玩法更多:

@lecture-2h.mp4   讲讲主要观点,带上时间戳

@meeting.mp4     转写这段会议,标出谁在什么时候说话

           建一个低多边形木凳,加一盏暖色主光,渲染出来

           建一个 M6 六角螺栓,30 毫米长,导出 STEP

04

TOOLBOX

core 包里到底有哪些工具

core 的 14 个工具

给你一份清单,心里有数:

读取类:read_image 读图、read_video 自动抽帧读视频、visualize 通吃 PDF/Office/CSV/代码/SVG/3D/LaTeX 等十几种格式

API 类:vision_chat 视觉对话、ocr 文字识别、grounding 像素级目标定位、segmentation 分割、transcribe_audio 语音转写(输出 SRT/文本/JSON)

出图类:crop 裁剪、draw_bbox 画标注框、save_view 把文档页或视频帧存成独立图片

网页类:web_search 搜索、web_extractor 抓正文、image_search 以图搜图

05

KEY TECH

一个值得说的技术点:动态分辨率

动态分辨率

读图这件事,难的不是“读”,是“读清”。

4K 截图上的小字,压成缩略图就糊了;小图标用高分辨率处理又浪费。Qwen-MM-Plugins 的做法是动态分辨率:每张图、每帧视频、每页文档,自动缩放到视觉模型的 patch 网格最匹配的尺寸。

结果是,4K 仪表盘的细字和小缩略图,都以各自需要的清晰度读进来。你不用手动 resize,模型自己决定看多重。

这也是为什么它敢说“原生”。图片不是先 OCR 成文本再喂给模型,而是直接以视觉模态进入上下文。

06

HONEST NOTES

几句实话

装之前知道这三件事

最后,几点诚实的提醒。

一,文档还在收尾。README 里 6 个非 core 能力包的 cookbook 挂着 TBD 标签,不过点进去会发现内容其实已经补齐了。开源才十来天,这种细节没跟上很正常。

二,分割功能要自托管 SAM3。segmentation 不是调 API,需要你自己起一个带 GPU 的 SAM3 服务器。没显卡的话这个工具用不了,其他不受影响。

三,key 的钱要自己出。DashScope 和 Serper 都是按量计费的云服务,虽然都有免费额度,重度使用前先看看定价。

但这些都不妨碍一个判断:这是目前把多模态塞进 Agent 框架最省事的一条路。不用换模型,不用写胶水代码,装个插件,跑在纯文本模型上的 Agent 也能长出眼睛。

我自己最有感触的是最后这点。过去要给 Agent 加视觉能力,得自己接 API、写转换层、维护一堆脚本。现在变成了一条 curl 命令的事。工具成熟的标准从来不是功能多,而是用的人忘了它的存在。

Agent 的下半场,比的可能不再是谁更会写代码,而是谁看得更多、听得更清。这个项目值得你去 star 一下,然后亲手跑一遍。

装个插件,Agent 长出眼睛

我是 Spero AI,热衷于分享 AI 观察与干货。

如果你觉得今天这篇有收获,欢迎点赞、在看、转发三连,我们下篇见。