概述
Tokenhub 已上线 MiniMax 音色复刻能力,通过语音合成接口下的
sync_clone 端点实现,本文基于 MiniMax 官方 voice_clone 接口编写,调用参数与原厂基本一致,详情请参见 MiniMax API 文档。功能说明: 音色复刻(voice clone)指上传一段参考音频,由系统提取并复刻其中的说话人音色特征,生成一个可复用的自定义音色(返回唯一
voice_id)。后续在 TTS 语音合成接口传入该 voice_id,即可让任意文本以此音色朗读。复刻过程返回的试听音频由 model 指定的语音模型合成。说明:
复刻得到的临时音色若 7 天内未正式调用,系统会删除该音色。
调用本接口获得复刻音色时,不会立即收取音色复刻费用。音色的复刻费用将在首次使用此复刻音色进行语音合成时收取。试听字符根据选择的试听模型收费。具体价格请参见 模型价格。
前提条件
已 注册腾讯云 账号并开通 TokenHub 服务。
已在 TokenHub 控制台 获取 API Key。
接口信息
项 | 值 |
地址 | https://tokenhub.tencentmaas.com/v1/wand/minimax-tts/sync_clone |
方法 | POST |
Content-Type | application/json |
鉴权 | Authorization: Bearer YOUR_API_KEY |
请求体
请求示例
curl -X POST 'https://tokenhub.tencentmaas.com/v1/wand/minimax-tts/sync_clone' \\-H 'Authorization: Bearer YOUR_API_KEY' \\-H 'Content-Type: application/json' \\-d '{"model": "minimax-voice-clone","audio_url": "https://example.com/clone-source.wav","tts_model":"minimax-speech-2.8-hd","text": "A gentle breeze sweeps across the soft grass(breath), carrying the fresh scent along with the songs of birds.","output_format": "url"}'
请求参数
说明:
参数 | 类型 | 必选 | 说明 |
model | string | 是 | 固定填 minimax-voice-clone。 |
audio_url | string | 否 | 待复刻音频的 URL 地址(http/https 链接)。音频规范:mp3 / m4a / wav,建议时长 10 秒–5 分钟,大小 ≤ 20MB。 |
audio_data | string | 否 | 待复刻音频的 base64 音频。( audio_url 或 audio_data 至少传一个) |
tts_model | string | 否 | 试听用的 TTS 语音合成模型,取值为 tokenhub 已上线的 speech 模型(如 minimax-speech-2.8-hd)。 |
voice_id | string | 否 | 自定义音色 id;不传则自动生成并返回唯一 id。长度 [8, 256],首字符须为英文字母,允许字母/数字/ -/_,末位不可为 -/_。 |
text | string | 否 | 复刻试听文本,≤ 1000 字符;提供后将以复刻音色朗读并返回试听音频(按 T2A 标准计费)。 |
text_validation | string | 否 | 音频复刻样本的预期文本,≤ 200 字符;服务做 ASR 识别并比对相似度,低于 accuracy 则拒绝。 |
accuracy | number | 否 | ASR 相似度阈值,默认 0.7,范围 [0, 1]。 |
output_format | string | 否 | 试听音频返回形式,默认 hex,可选 url / hex(url 有效期 24h)。 |
返回体
返回示例
{"voice_id": "MiniMax001-xxxxxxxx","input_sensitive": false,"demo_audio": "https://...试听音频链接","extra_info": {"audio_length": 11124,"audio_sample_rate": 32000,"audio_size": 179926,"bitrate": 128000,"word_count": 18,"usage_characters": 18},"base_resp": {"status_code": 0,"status_msg": "success"},"usage":{"total_token":1920}}
返回字段
说明:
字段 | 类型 | 说明 |
voice_id | string | 复刻成功返回的音色 id,可用于后续语音合成。 |
input_sensitive | boolean | 输入音频是否命中风控。 |
demo_audio | string | 试听音频链接(形式取决于 output_format);仅当请求传入 text 时返回,否则为空。 |
extra_info | object | 试听音频的元信息与计费信息,仅当传入 text(触发试听合成)时返回。 |
extra_info.audio_length | integer | 音频时长(毫秒)。 |
extra_info.audio_sample_rate | integer | 音频采样率。 |
extra_info.audio_size | integer | 音频文件大小(字节)。 |
extra_info.bitrate | integer | 音频比特率。 |
extra_info.word_count | integer | 已发音字数。 |
extra_info.usage_characters | integer | 计费字符数。 |
base_resp | object | 本次请求的状态码与详情。 |
base_resp.status_code | integer | 状态码(0 表示正常,详见下方错误码)。 |
base_resp.status_msg | string | 状态详情。 |
usage | object | 用量。 |
usage.total_token | integer | 消耗 token 总量。 |