Qwen开源插件Qwen-MM-Plugins,让任何Agent智能体原生拥有多模态能力
Lv.2潜力创作者
目前在灵犀专业版中使用自定义模型时,如果自定义模型本身不具备生图能力(比如DeepSeek的API目前就尚未支持多模态能力),就需要调用灵犀自带的生图能力,而体验版用户每日仅可免费生图10张。
但现在,大家可以安装https://github.com/QwenLM/Qwen-MM-Plugins,只消耗自己的大模型Token,就可以享用完全自由的生图能力,Make any agent harness multimodal-native。
Qwen-MM-Plugins目前包含以下能力,每个能力由一个 skill+ 一个可选的 MCP server组成。详见Qwen-MM-Plugins/cookbooks at main · QwenLM/Qwen-MM-Plugins。
能力 | 做什么 | 安装名 |
core | 本地 I/O 插件:动态分辨率读取图片与视频,可视化任意文件(如文档、3D 等)——外加一些图像工具(裁剪 / 标注 / 抽帧) | qwen-mm-plugins-core |
api | 云端 API 理解媒体,按模型族划分:VL(视觉对话、OCR、grounding)、Omni 音视频(带时间戳或说话人标签的 ASR / 多说话人分离、分段描述、时序定位、事件计数),外加 ASR 与分割(SAM3);目前支持 DashScope | qwen-mm-plugins-api |
search | 联网 + 反查图搜索用于事实核验:网页搜索、网页抽取、反查图;目前支持 Serper | qwen-mm-plugins-search |
video-memory | 长视频记忆:层次化图记忆,支撑超长视频问答 | qwen-mm-plugins-video-memory |
video-edit | 视频剪辑 + 生成:剪辑工作流 + 图片 / 视频 / 音频生成 | qwen-mm-plugins-video-edit |
blender | Blender 三维建模:对一个正在运行的 Blender 写 Python(瘦客户端,22 工具)—— 建模 / 材质 / 灯光 / 渲染 | qwen-mm-plugins-blender |
freecad | FreeCAD 参数化 CAD:驱动一个正在运行的 FreeCAD(瘦客户端,14 工具)—— 建模、改属性、STEP/STL 导入导出、FEM 分析 | qwen-mm-plugins-freecad |
edu-agent | 讲题视频:把一道数学 / 理科题或题目图片变成一步步讲解的中文视频 / 交互页面(纯 skill,无 MCP server) | qwen-mm-plugins-edu-agent |
安装
向Agent发出指令,让其根据https://github.com/QwenLM/Qwen-MM-Plugins/blob/main/docs/en/installation.md安装Qwen-MM-Plugins即可。
配置
原生读图 / 视频 / 文档不需要配置API。
调用以下能力需要配置相应的API key :
DASHSCOPE_API_KEY —— vision_chat / ocr / grounding / transcribe_audio / Omni 音视频理解 / 生成类 / video-memory 构建
打开 bailian.console.aliyun.com,头像 → 专属 API Key → 创建→ 复制→ 设置环境变量 DASHSCOPE_API_KEY即可。
SERPER_API_KEY —— web_search / web_extractor / image_search
插件安装完成后,Agent会引导你进行相应的配置。
使用
装好某个能力后,在 harness 里引用文件直接提问,模型会自动调用对应工具。读取是动态分辨率的:每张图片、每帧视频、每页文档都会自动缩放到 VL 模型的 patch grid —— 一张 4K 截图上的细小文字和一张小缩略图都能以各自需要的清晰度读进来,无需手动缩放。