乐于分享
好东西不私藏

你的 AI 助手看不了图?@ 给它就能看懂

你的 AI 助手看不了图?@ 给它就能看懂

你用 AI 助手写代码、查资料,一天下来很顺手。但有个尴尬:它是个"文盲"——只认文本。丢给它一张截图问"这个报错什么意思",它只能说"我看不到图片"。

Qwen-MM-Plugins 解决的就是这个。通义千问官方出的多模态插件集,给主流 AI Agent 装上眼睛和耳朵。项目上个月底刚开源,Apache-2.0 协议。

装完之后,引用文件的方式很自然——直接把文件 @ 给 AI:

@report.pdf          总结第 3 页,提取里面的表格
@meeting.mp4         转写这段会议,带上说话人和时间戳
@place.jpg           识别这张照片在哪拍的,并在网上核实
@lecture-2h.mp4      列出两小时讲座的要点,带时间戳

PDF、视频、图片,AI 自己会判断该用什么工具处理,不用你操心格式。core 能力读媒体时会自动调分辨率,手动缩放基本不需要。

2、八个能力,按需装

整套插件拆成 8 个独立能力,每个都是一对"技能 + 可选 MCP 服务",想用哪个装哪个:

  • core:读图片视频,可视化文档、代码、数据、3D 文件。本地工具,不需要任何 API key
  • api:视觉、OCR、定位、语音转写、分割、音视频理解,走通义千问的云 API
  • search:网页搜索、页面提取、以图搜图(需要搜索服务的 key)
  • video-memory:给长视频建分层记忆,做长视频问答
  • video-edit:图片、视频、音频的生成和编辑工作流
  • blender:在 Blender 里建模、贴图、打光、渲染
  • freecad:参数化 CAD、STEP/STL 导出、有限元分析
  • edu-agent:生成中文数学、科学讲解视频和互动页面

最有意思的是 blender 和 freecad——AI 不只是"看"图,还能直接上手 3D 建模和 CAD 工程图,这两个都是本地开源软件驱动。

3、core 免费用,这点很实在

很多多模态方案上来就要 API key、按量计费。这套插件的 core 能力是纯本地的:读图片、看视频、可视化文档,跑在你自己的机器上,一分钱不用花。

只有要用云模型的能力(api、search、video-edit 这些)才需要对应的 key。想先试试水,装 core 就够了。

4、怎么装

一条命令:

curl -fsSL https://raw.githubusercontent.com/QwenLM/Qwen-MM-Plugins/main/install.sh | bash

安装器带引导,支持 Claude Code、Codex、Qwen Code、Gemini CLI 等主流 Agent 框架,每个都走框架自己的原生安装命令,配置统一放在 ~/.qwen-mm-plugins/。装完跑一遍它的"配置"和"验证",依赖齐不齐一目了然。

5、适合谁,不适合谁

适合:日常重度用 AI 助手、又经常要处理截图/PDF/视频的人——客服截图、会议录像、产品文档,直接 @ 进去问。做 3D 或机械设计的,blender 和 freecad 两个能力值得单独装。

不适合:只用 AI 聊天的轻度用户,装上用不上;另外云能力需要国内访问通义千问 API 的网络条件。

一个 @ 符号让 AI 睁开眼睛,这件事官方出手做得比社区插件更省心。

总结

Qwen-MM-Plugins 用"技能 + MCP"的方式给 AI Agent 加多模态能力,8 个能力独立安装,core 本地免费,@ 引用文件即可问答。

核心要点:

  1. 1. @ 即问答 — @ 图片/PDF/视频,AI 自动选工具处理
  2. 2. core 全免费 — 本地看图读视频,不需要 API key
  3. 3. 8 个能力按需装 — 视觉/搜索/视频编辑/Blender/CAD 各取所需
  4. 4. 官方维护 — 通义千问出品,Apache-2.0
  5. 5. 一条命令安装 — 支持 6 个主流 Agent 框架

建议收藏,下次 AI 助手说"我看不到图片"的时候,@ 一下。

项目地址:https://github.com/QwenLM/Qwen-MM-Plugins

你平时会丢图片、PDF 给 AI 看吗?评论区聊聊,觉得有用也顺手点个在看。