帮你快速理解、总结文档立即下载

MiniMax 音色复刻

最近更新时间:2026-08-10 12:39:30
我的收藏

概述

Tokenhub 已上线 MiniMax 音色复刻能力,通过语音合成接口下的 sync_clone 端点实现,本文基于 MiniMax 官方 voice_clone 接口编写,调用参数与原厂基本一致,详情请参见 MiniMax API 文档
功能说明: 音色复刻(voice clone)指上传一段参考音频,由系统提取并复刻其中的说话人音色特征,生成一个可复用的自定义音色(返回唯一 voice_id)。后续在 TTS 语音合成接口传入该 voice_id,即可让任意文本以此音色朗读。复刻过程返回的试听音频由 model 指定的语音模型合成。
说明:
复刻得到的临时音色若 7 天内未正式调用,系统会删除该音色。
调用本接口获得复刻音色时,不会立即收取音色复刻费用。音色的复刻费用将在首次使用此复刻音色进行语音合成时收取。试听字符根据选择的试听模型收费。具体价格请参见 模型价格

前提条件

注册腾讯云 账号并开通 TokenHub 服务。
已在 TokenHub 控制台 获取 API Key。

接口信息

地址
https://tokenhub.tencentmaas.com/v1/wand/minimax-tts/sync_clone
方法
POST
Content-Type
application/json
鉴权
Authorization: Bearer YOUR_API_KEY

请求体

请求示例

cURL
curl -X POST 'https://tokenhub.tencentmaas.com/v1/wand/minimax-tts/sync_clone' \\
-H 'Authorization: Bearer YOUR_API_KEY' \\
-H 'Content-Type: application/json' \\
-d '{
"model": "minimax-voice-clone",
"audio_url": "https://example.com/clone-source.wav",
"tts_model":"minimax-speech-2.8-hd",
"text": "A gentle breeze sweeps across the soft grass(breath), carrying the fresh scent along with the songs of birds.",
"output_format": "url"
}'

请求参数

说明:
以下为请求参数的简要说明,各参数的完整取值范围、枚举明细等请参见 MiniMax API 文档
参数
类型
必选
说明
model
string
固定填 minimax-voice-clone
audio_url
string
待复刻音频的 URL 地址(http/https 链接)。音频规范:mp3 / m4a / wav,建议时长 10 秒–5 分钟,大小 ≤ 20MB。
audio_data
string
待复刻音频的 base64 音频。(audio_urlaudio_data 至少传一个)
tts_model
string
试听用的 TTS 语音合成模型,取值为 tokenhub 已上线的 speech 模型(如 minimax-speech-2.8-hd)。
voice_id
string
自定义音色 id;不传则自动生成并返回唯一 id。长度 [8, 256],首字符须为英文字母,允许字母/数字/-/_,末位不可为 -/_
text
string
复刻试听文本,≤ 1000 字符;提供后将以复刻音色朗读并返回试听音频(按 T2A 标准计费)。
text_validation
string
音频复刻样本的预期文本,≤ 200 字符;服务做 ASR 识别并比对相似度,低于 accuracy 则拒绝。
accuracy
number
ASR 相似度阈值,默认 0.7,范围 [0, 1]
output_format
string
试听音频返回形式,默认 hex,可选 url / hex(url 有效期 24h)。

返回体

返回示例

{
"voice_id": "MiniMax001-xxxxxxxx",
"input_sensitive": false,
"demo_audio": "https://...试听音频链接",
"extra_info": {
"audio_length": 11124,
"audio_sample_rate": 32000,
"audio_size": 179926,
"bitrate": 128000,
"word_count": 18,
"usage_characters": 18
},
"base_resp": {
"status_code": 0,
"status_msg": "success"
},
"usage":{
"total_token":1920
}
}

返回字段

说明:
以下为返回字段的简要说明,各字段的完整含义与边界说明等请参见 MiniMax API 文档
字段
类型
说明
voice_id
string
复刻成功返回的音色 id,可用于后续语音合成。
input_sensitive
boolean
输入音频是否命中风控。
demo_audio
string
试听音频链接(形式取决于 output_format);仅当请求传入 text 时返回,否则为空。
extra_info
object
试听音频的元信息与计费信息,仅当传入 text(触发试听合成)时返回。
extra_info.audio_length
integer
音频时长(毫秒)。
extra_info.audio_sample_rate
integer
音频采样率。
extra_info.audio_size
integer
音频文件大小(字节)。
extra_info.bitrate
integer
音频比特率。
extra_info.word_count
integer
已发音字数。
extra_info.usage_characters
integer
计费字符数。
base_resp
object
本次请求的状态码与详情。
base_resp.status_code
integer
状态码(0 表示正常,详见下方错误码)。
base_resp.status_msg
string
状态详情。
usage
object
用量。
usage.total_token
integer
消耗 token 总量。

错误码

请参见 API 错误码说明