首页
学习
活动
专区
圈层
工具
发布

千问大模型发布语音合成大模型Qwen-Audio-3.0-TTS

7月20日,千问大模型宣布正式发布语音合成大模型Qwen-Audio-3.0-TTS,包含面向实时交互的Flash版本(首包延时300ms级别)和面向高质量生成的Plus版本。

据介绍,新模型在细粒度标签控制、freestyle指令遵循、多语种与方言覆盖以及复杂声学鲁棒性等方面实现系统性提升,让合成语音从“能说话”走向“会表达”。

Qwen-Audio-3.0-TTS支持在文本中嵌入结构化标签,用户可直接对语气、情绪细节进行精准调控。

此外,Qwen-Audio-3.0-TTS支持Free-style自然语言指令控制。用户可直接用自然语言描述角色、情绪、场景和语速,无需掌握专业声学或标注知识,即可灵活定义情绪、角色、场景、语速等维度。

目前,Qwen-Audio-3.0-TTS-Plus覆盖16种语言以及20种方言。

  • 发表于:
  • 原文链接https://page.om.qq.com/page/Oim8rvCp2xQvlLN4Gekkh8WA0
  • 腾讯「腾讯云开发者社区」是腾讯内容开放平台帐号(企鹅号)传播渠道之一,根据《腾讯内容开放平台服务协议》转载发布内容。
  • 如有侵权,请联系 cloudcommunity@tencent.com 删除。

相关快讯

领券