帮你快速理解、总结文档立即下载

Hy 同步语音识别

最近更新时间:2026-08-11 14:26:30
我的收藏

概述

Tokenhub 已上线语音识别(ASR)能力,本文对应混元非实时语音识别同步接口。接口接收音视频文件地址,同步返回识别文本结果。

前提条件

注册腾讯云 账号并开通 TokenHub 服务。
已在 TokenHub 控制台 获取 API Key。

接口信息

地址
https://tokenhub.tencentmaas.com/v1/wand/asrproxy/sync_transcribe
方法
POST
Content-Type
application/json
鉴权
Authorization: Bearer YOUR_API_KEY

支持模型

模型名称
model(调用参数)
能力说明
Hy-ASR-3.0-Preview
hy-asr-3.0-preview
中文普通话+英语+多方言混合引擎,除中英外,支持多种方言,包括粤语、东北话、河南话、陕西话、成都话、重庆话、武汉话、贵阳话、青岛话、济南话、长沙话、合肥话等。

请求体

请求示例

cURL
curl -X POST 'https://tokenhub.tencentmaas.com/v1/wand/asrproxy/sync_transcribe' \\
-H 'Authorization: Bearer YOUR_API_KEY' \\
-H "Content-Type: application/json" \\
-d '{
"model": "hy-asr-3.0-preview",
"input_url": "https://cos.example.com/xxx.mp4"
}'

请求参数

参数
类型
必选
说明
model
string
模型名称,固定为 hy-asr-3.0-preview
input_url
string
二选一
待识别的音视频文件地址(支持常见音视频格式)。
data
string
二选一
音频 Base64(标准 base64,含 padding);与 input_url 同时传则以 data 为准。
source
string
识别语种:zh / en 等;缺省时后端自动检测。
voice_encode_format
string
音频编码:pcm / wav/ ogg / mp3等;缺省 auto。

返回体

返回示例

{
"id": "th_251416641_700001910665_asrproxy_2dc6dad8df55a082a5a17b01f2426a20",
"object": "asr.task",
"created_at": 1721808000,
"status": "completed",
"request_id": "fd8a1c2f-feb6-48ff-b904-e14056693b9c",
"output": {
"source": "zh",
"duration_ms": 15230,
"text": "大家好,欢迎来到今天的会议 今天我们讨论产品规划",
"sentences": [
{ "begin_ms": 500, "end_ms": 3200, "text": "大家好,欢迎来到今天的会议" },
{ "begin_ms": 3500, "end_ms": 5800, "text": "今天我们讨论产品规划" }
],
"subtitle_url": "https://xxx.cos.ap-guangzhou.myqcloud.com/subtitle/xxx.srt"
},
"usage": { "total_token": 761 }
}

返回字段

字段
类型
说明
output.source
string
实际识别的语种。
output.duration_ms
int64
音频总时长(毫秒)。
output.text
string
全文识别文本(自动拼接所有分句)。
output.sentences[]
array
分句时间戳:{ begin_ms, end_ms, text }。
output.subtitle_url
string
字幕文件下载 URL(SRT 格式)。
usage.total_token
int64
消耗 token 总数。

错误码

请参见 API 错误码说明