8亿+
每日处理分钟数超8亿
90%+
国内头部视频平台接入率超90%
20年+
超20年技术与数据积累
No.1
IDC 报告连续多年份额第一;获 NAB Show 年度产品奖

多模态生成 WAND-Vega-Video/Image

WAND-Vega-Video 多模态视频生成模型——

WAND-Vega-Video 支持文生视频、首尾帧与参考生视频,可输入文字、图片、视频、音频多模态参考;多版本可选,兼顾高性价比与真实物理表现;分辨率覆盖 768p–4K、时长 4–15 秒,生成成本同比下降 30%+。

WAND-Vega-Image 多模态图片生成模型——

WAND-Vega-Image 支持文生图与参考图生成,可输入文字、图片等多模态参考;支持复杂指令理解、细节纹理像素级还原与多规格高清输出;配合 Prompt 优化与画质增强、超分等后处理,直出高分辨率成品。提供多档可选,覆盖从日常配图到电商主图、海报素材、动漫制作等专业场景,同档效果下更具性价比。

多模态理解 WAND-Vega-VL

WAND-Vega-VL 可以看懂画面、听懂声音、读懂文字——

依托多年音视频技术积累与海量业务实践打造,WAND-Vega-VL模型支持视频、音频、图文输入,适用于视频内容总结、商品识别分类、演奏点评、具身智能数据打标等多种理解场景。

模型提供多版本,从高性价比到效果最优按需选择、按量计费;通过自动 Encoder Token 优化与前后处理工程,实现更大理解窗口、更高准确率与更低成本。同时,针对听歌识曲、K 歌点评、电商商品理解等高频场景,提供沉淀自真实业务的垂直专用模型,专业场景效果更佳。

AI 音频 WAND-Vega-Audio

WAND-Vega-Audio 是面向音视频行业场景的音频 AI 模型

依托腾讯多年音视频技术积累,提供自研语音识别、字幕提取&翻译、AI 配音、人声分离、音频降噪等原子模型能力,覆盖音频生成、识别、分离、增强、修复等完整能力。面向业务场景提供一站式方案,如 AIGC 音色修复、多语种配音译制、AI 直播流实时解说等。

AI 编解码 WAND-Codec+

WAND-Codec+ 是 VLM 大模型驱动的编码模型——

传统转码依赖固定的规则引擎,无法感知现实业务的复杂场景。WAND-Codec+ 引入 VLM 大模型驱动底层编码决策,让大模型真正“看懂”每一帧画面的语义内容,并在编码内核引入去噪、修复的 AI 预处理能力,结合语义进行修复、码率分配和视频压缩。除此之外, WAND-Codec+ 还针对 AV1、H.266 等复杂编码引入 AI 划分决策加速,大幅提升编码速度。WAND-Codec+ 相对开源编码器可节省 50%+ 的码率,提升处理速度 2 倍+,覆盖 10+ 种主流协议,头部平台的接入率达 90%。

AI 画质增强 WAND-Enhance+

WAND-Enhance+ 是基于 DiT 大模型的实时画质增强模型——

传统增强方案基于 CNN 网络,只能做有限的锐化和降噪,细节生成能力弱,处理复杂场景容易出现伪影。WAND-Enhance+ 用 DiT(Diffusion Transformer)架构做画质重建,利用全局上下文建模能力,生成更真实自然的纹理细节,画面清晰度和通透感实现跨代提升。同时,WAND-Enhance+引入了 MoE 架构,针对不同的场景进行优化,并针对电商、游戏、秀场、AI 短剧等业务进行深入 Co-Design 优化基模能力。能力覆盖 4K 超分、智能插帧(最高 120 FPS)、去压缩伪影、SDR2HDR、人脸增强等,为业务带来显著 QoE 提升收益。

AI 无痕擦除 WAND-EraseVibe+

WAND-EraseVibe+ 是基于隐空间 Transformer 的生成式无痕擦除模型——

传统擦除方案基于图像修复(inpaint)算法,本质是用周围像素做插值填充,处理后画面模糊、边缘不自然,视频场景下还会逐帧闪烁。WAND-EraseVibe+ 采用"编码器-Transformer-解码器"的端到端架构,先将画面压缩到隐空间提取深层语义特征,Transformer 在特征层精准剥离字幕/水印信号并推断被遮挡区域的内容分布,再由解码器重建回像素空间。配合大规模构建的“原画-字幕”成对数据训练,实现零伪影的高保真画面还原,帧间高度一致、连续播放无闪烁。支持多目标同时擦除,日处理量超 10 万分钟,头部短剧客户 80% 以上在用。

AIGC Studio

主流 SOTA 多模态模型合作,提供全场景多模态一站式能力

全场景:视觉模型、语音模型、3D模型

联合主流 SOTA 模型合作,覆盖生图、生视频、语音、3D等完整能力,兼顾第三方模型接入与自有部署融合,一站式接入,适配各类垂直业务场景。具备接口容灾、故障自动兜底能力,满足 B 端多样化业务落地需求。

深度工程化调优,差异化模型增强

在基础模型之上,支持叠加 WAND 自研前后处理与 Harness 工程深度调优。例如 Prompt 级联后训练对齐、时空维度画质后处理增强、异常 Case 自动拦截重试、画面崩坏修复等,实现更高输出质量与服务稳定性。

WAND 产品家族

WAND 底层 AI 模型与应用能力,已融入媒体处理 MPS、云点播 VOD、TokenHub等产品。前往对应控制台,即可调用相关能力。

WAND 热门 AI 应用

  • AI 横转竖
  • AI 实时解说
  • AI 配音译制
  • AI 精彩集锦
  • 智能字幕
  • 大模型视频摘要

AI 横转竖

基于 WAND 多模型协同,支持批量将横屏视频转换为竖屏视频。

  • WAND-Sense 识别画面中的感兴趣区域(ROI),智能追踪球、球员等运动主体,确保裁切始终跟随关键内容;同时检测比分牌、信息牌等元素
  • 由 WAND-EraseVibe+ 将比分牌从原画面无痕提取,重新放置到竖屏画面的合适位置,避免关键信息丢失
  • 支持直播流:支持直播过程中实时处理

了解更多

WAND 热门行业方案

  • 体育赛事直播
  • 短漫剧 AIGC 制作
  • 电商图片处理
  • 视频转译出海
  • 在线教育

基于 WAND 多模型协同,为体育赛事提供从内容理解、生产到分发的 AI 辅助制播方案,大幅减少后期人工

AI 实时解说:WAND-Sense 理解赛事画面生成解说文本,WAND-Sonic 实时合成解说语音,支持多语种
AI 高光集锦:自动识别进球、扑救等精彩时刻,剪辑生成集锦短视频
智能横转竖:WAND-Sense 追踪球和球员智能裁切,WAND-EraseVibe+ 无痕提取比分牌重新放置到竖屏画面,关键信息不丢失
多语种字幕:实时语音转文字 + 多语言翻译
直播画质增强:WAND-Enhance+ 实时提升直播流画质
实时转码分发:WAND-Codec+ 高清低码率压缩,节省带宽成本,同时嵌入不可见数字水印,版权溯源保护

方案价值: 六大模型各司其职,一场比赛进来,AI 辅助完成从理解到生产到分发的全流程。头部体育平台已规模化使用。

WAND 底层 AI 能力,已融入媒体处理 MPS、云点播 VOD、TokenHub等产品。前往对应控制台,即可调用相关能力。