WAND-Vega-Video 支持文生视频、首尾帧与参考生视频,可输入文字、图片、视频、音频多模态参考;多版本可选,兼顾高性价比与真实物理表现;分辨率覆盖 768p–4K、时长 4–15 秒,生成成本同比下降 30%+。
WAND-Vega-Image 支持文生图与参考图生成,可输入文字、图片等多模态参考;支持复杂指令理解、细节纹理像素级还原与多规格高清输出;配合 Prompt 优化与画质增强、超分等后处理,直出高分辨率成品。提供多档可选,覆盖从日常配图到电商主图、海报素材、动漫制作等专业场景,同档效果下更具性价比。
依托多年音视频技术积累与海量业务实践打造,WAND-Vega-VL模型支持视频、音频、图文输入,适用于视频内容总结、商品识别分类、演奏点评、具身智能数据打标等多种理解场景。
模型提供多版本,从高性价比到效果最优按需选择、按量计费;通过自动 Encoder Token 优化与前后处理工程,实现更大理解窗口、更高准确率与更低成本。同时,针对听歌识曲、K 歌点评、电商商品理解等高频场景,提供沉淀自真实业务的垂直专用模型,专业场景效果更佳。

依托腾讯多年音视频技术积累,提供自研语音识别、字幕提取&翻译、AI 配音、人声分离、音频降噪等原子模型能力,覆盖音频生成、识别、分离、增强、修复等完整能力。面向业务场景提供一站式方案,如 AIGC 音色修复、多语种配音译制、AI 直播流实时解说等。

传统转码依赖固定的规则引擎,无法感知现实业务的复杂场景。WAND-Codec+ 引入 VLM 大模型驱动底层编码决策,让大模型真正“看懂”每一帧画面的语义内容,并在编码内核引入去噪、修复的 AI 预处理能力,结合语义进行修复、码率分配和视频压缩。除此之外, WAND-Codec+ 还针对 AV1、H.266 等复杂编码引入 AI 划分决策加速,大幅提升编码速度。WAND-Codec+ 相对开源编码器可节省 50%+ 的码率,提升处理速度 2 倍+,覆盖 10+ 种主流协议,头部平台的接入率达 90%。
传统增强方案基于 CNN 网络,只能做有限的锐化和降噪,细节生成能力弱,处理复杂场景容易出现伪影。WAND-Enhance+ 用 DiT(Diffusion Transformer)架构做画质重建,利用全局上下文建模能力,生成更真实自然的纹理细节,画面清晰度和通透感实现跨代提升。同时,WAND-Enhance+引入了 MoE 架构,针对不同的场景进行优化,并针对电商、游戏、秀场、AI 短剧等业务进行深入 Co-Design 优化基模能力。能力覆盖 4K 超分、智能插帧(最高 120 FPS)、去压缩伪影、SDR2HDR、人脸增强等,为业务带来显著 QoE 提升收益。
传统擦除方案基于图像修复(inpaint)算法,本质是用周围像素做插值填充,处理后画面模糊、边缘不自然,视频场景下还会逐帧闪烁。WAND-EraseVibe+ 采用"编码器-Transformer-解码器"的端到端架构,先将画面压缩到隐空间提取深层语义特征,Transformer 在特征层精准剥离字幕/水印信号并推断被遮挡区域的内容分布,再由解码器重建回像素空间。配合大规模构建的“原画-字幕”成对数据训练,实现零伪影的高保真画面还原,帧间高度一致、连续播放无闪烁。支持多目标同时擦除,日处理量超 10 万分钟,头部短剧客户 80% 以上在用。



基于 WAND 多模型协同,支持批量将横屏视频转换为竖屏视频。
方案价值: 六大模型各司其职,一场比赛进来,AI 辅助完成从理解到生产到分发的全流程。头部体育平台已规模化使用。
