阿里把多模态做成了智能体插件
阿里又发布了一个好玩的东西:Qwen-MM-Plugins。它要做的,是把读图、读视频、处理文档、剪辑视频和操作3D软件的能力,直接挂到你现在用的智能体上。
阿里今天又发布了一个好玩的东西,它是一个大模型外置插件,叫做Qwen-MM-Plugins。
它的作用是,让你现在用的智能体,拥有读图、读视频、处理文档、剪辑视频和操作3D软件等一系列能力。比如你正在用WorkBuddy,接上这套插件后,它可以多出反向搜图、音视频转写、长视频记忆和操作Blender、FreeCAD等功能。
目前,Qwen-MM-Plugins官方列出了8个功能,接下来我一个一个讲,看看有没有你用得上的。
第一个core,它是这套Skill的底层基座,完全是在本地电脑上运行,负责读取本地图片、视频和文档,还能对图片进行裁剪、标注,以及对视频抽帧。
第二个api,你可以把它理解为一个云端的技能强化包。它可以做图像对话、OCR文字识别、物体定位和画面分割。而且,它还能给音视频生成带时间戳、说话人标签的转写,你给它一个视频,它还能在视频里找事件、做计数。要注意的是,其中大部分云端理解能力默认走阿里云DashScope,需要配置API Key。
第三个是search,它负责的是网页搜索、网页正文提取和反向搜图。反向搜图这个功能还真挺少见的,你丢给智能体一张照片,它可以描述画面,还可以继续上网核实拍摄地点或图片来源。