大家好,我是 Tontaube 的联合创始人我和弟弟刚发布了 TontaubeV1,这是一个拥有 29 亿参数的开源权重语音合成模型,主打富有表现力的语音长文本生成以及低延迟的本地推理
模型主要面向英语和德语,支持用最多一分钟的参考音频进行零样本音色克隆技术上,它由四个独立的自回归模型组成,从粗语义结构到声学细节逐级生成编码流,越往高层 codebook 的模型越小;采用字符级文本分词,文本与音频共享逻辑位置,并通过滚动上下文窗口实现流式几乎无限长度的长文生成,推理基于 vLLM,可跨请求与声学阶段批处理
在预热的 RTX 5090 上,单条文本实时比约 0.08,批处理下最低到 0.02(约 50 倍实时),流式首包延迟约 200 毫秒当前版本低显存和均衡模式需至少 24GB 显存,高吞吐模式需 32GB,主因是 vLLM 实现带来了高并发和低延迟我们计划推出量化版以适配小显卡和端侧,并支持微调
我们还跑了 400 段的 LLM 评测基准:在韵律上,TontaubeV1 对 ElevenLabs Flash v2.5 的偏好率 50.1%,优于 Fish Audio S2 ProGradium 和 Cartesia Sonic 3人工听测仍是金标准,我们近期会通过 TTS Arena V2 等做真实听众测试欢迎反馈装机体验其他显卡显存占用和异常案例