Qwen开源插件Qwen-MM-Plugins,让任何Agent智能体原生拥有多模态能力

快乐小子新
快乐小子新 Lv.2 潜力创作者

Lv.2潜力创作者

目前在灵犀专业版中使用自定义模型时,如果自定义模型本身不具备生图能力(比如DeepSeek的API目前就尚未支持多模态能力),就需要调用灵犀自带的生图能力,而体验版用户每日仅可免费生图10张。

但现在,大家可以安装https://github.com/QwenLM/Qwen-MM-Plugins,只消耗自己的大模型Token,就可以享用完全自由的生图能力,Make any agent harness multimodal-native。

Qwen-MM-Plugins目前包含以下能力,每个能力由一个 skill+ 一个可选的 MCP server组成。详见Qwen-MM-Plugins/cookbooks at main · QwenLM/Qwen-MM-Plugins

能力

做什么

安装名

core

本地 I/O 插件:动态分辨率读取图片与视频,可视化任意文件(如文档、3D 等)——外加一些图像工具(裁剪 / 标注 / 抽帧)

qwen-mm-plugins-core

api

云端 API 理解媒体,按模型族划分:VL(视觉对话、OCR、grounding)、Omni 音视频(带时间戳或说话人标签的 ASR / 多说话人分离、分段描述、时序定位、事件计数),外加 ASR 与分割(SAM3);目前支持 DashScope

qwen-mm-plugins-api

search

联网 + 反查图搜索用于事实核验:网页搜索、网页抽取、反查图;目前支持 Serper

qwen-mm-plugins-search

video-memory

长视频记忆:层次化图记忆,支撑超长视频问答

qwen-mm-plugins-video-memory

video-edit

视频剪辑 + 生成:剪辑工作流 + 图片 / 视频 / 音频生成

qwen-mm-plugins-video-edit

blender

Blender 三维建模:对一个正在运行的 Blender 写 Python(瘦客户端,22 工具)—— 建模 / 材质 / 灯光 / 渲染

qwen-mm-plugins-blender

freecad

FreeCAD 参数化 CAD:驱动一个正在运行的 FreeCAD(瘦客户端,14 工具)—— 建模、改属性、STEP/STL 导入导出、FEM 分析

qwen-mm-plugins-freecad

edu-agent

讲题视频:把一道数学 / 理科题或题目图片变成一步步讲解的中文视频 / 交互页面(纯 skill,无 MCP server)

qwen-mm-plugins-edu-agent

安装

向Agent发出指令,让其根据https://github.com/QwenLM/Qwen-MM-Plugins/blob/main/docs/en/installation.md安装Qwen-MM-Plugins即可。

配置

原生读图 / 视频 / 文档不需要配置API。

调用以下能力需要配置相应的API key :

  • DASHSCOPE_API_KEY —— vision_chat / ocr / grounding / transcribe_audio / Omni 音视频理解 / 生成类 / video-memory 构建

打开 bailian.console.aliyun.com,头像 → 专属 API Key → 创建复制→ 设置环境变量 DASHSCOPE_API_KEY即可。

  • SERPER_API_KEY —— web_search / web_extractor / image_search

插件安装完成后,Agent会引导你进行相应的配置。

使用

装好某个能力后,在 harness 里引用文件直接提问,模型会自动调用对应工具。读取是动态分辨率的:每张图片、每帧视频、每页文档都会自动缩放到 VL 模型的 patch grid —— 一张 4K 截图上的细小文字和一张小缩略图都能以各自需要的清晰度读进来,无需手动缩放。

广东省
浏览 365
1
4
分享
4 +1
1 +1
全部评论