腾讯云音视频甩出“WAND”:六大自研模型+60项AI能力,让Agent自己就能剪视频

作者: 智享AI发布日期: 2026/6/6阅读时间: 3分钟
腾讯云音视频甩出“WAND”:六大自研模型+60项AI能力,让Agent自己就能剪视频 封面图

6月5日,腾讯云音视频在AI产业应用大会上甩出一张新牌——AI原生能力底座WAND。简单说,就是让AI Agent(智能体)也能像人一样,直接调用腾讯云20多年积累的音视频处理能力,不用再切换各种工具,一条命令跑通全程。

WAND本质上是一个三层架构的“工具箱”。最底层是六大自研模型:编解码、增强、擦除、生成、理解、音频。这些模型专门补上了通用大模型在媒体生产中的短板——比如你让大模型“把这段视频的背景杂音去掉,再自动添加字幕”,它可能直接懵掉,但WAND的音频和生成模型能无缝配合搞定。中间能力层把60多项媒体AI能力重新打包,按生成、理解、处理、编码四大类归类,通过三种方式开放:API接口、预编排工作流(Agentic Workflow)、以及Skills模式。最方便的是,Agent可以自己按需调取这些能力,像搭乐高一样自动跑通整条链路,全程不用人点鼠标。

实际效果已经验证过。在电商场景里,WAND的生成模型能根据不同商品类别(比如衣服、数码产品)自动调整处理策略,大幅降低图片出错率,提高可用性。短漫剧创作更是直接起飞——从剧本生成到角色形象保持一致,WAND把各个环节串成自动化流水线,平均生产效率提升了90%。目前国内超过80%的头部长漫剧平台都在用它。其AI增强和无痕擦除技术甚至拿下了NAB Show 2026年度产品奖。

面对高并发、极低延迟的赛事直播,WAND的自研模型协同调度,把识别、生成、合成、编码整合成一个全自动流程,相比传统方案能节省超过50%的码率。它已经累计支撑了数千场全球顶级赛事。

作为连续11年中国及出海市场份额第一的玩家,腾讯云音视频这一步棋很明确:让音视频能力不再是“需要单独调用”的工具,而是变成Agent体系里可被统一调度的“基础技能”。未来,开发者甚至不需要懂音视频底层,Agent自己就能搞定剪辑、增强、生成——这才是AI时代视听应用该有的样子。

aitechtoolproduct
精选评论
评论加载中…
发表讨论 »