帮你快速理解、总结文档立即下载
文档中心>实践教程>媒体处理>媒体 AI 接入>智能字幕(混元 ASR 3.0 preview)接入

智能字幕(混元 ASR 3.0 preview)接入

最近更新时间:2026-08-05 20:55:54
我的收藏

概述

Hy ASR 3.0 preview 是腾讯混元发布的新一代语音识别模型,基于最新一代大语言模型 Hy3 的语言理解能力,在复杂真实输入中能给出准确、连贯、更接近用户意图的转写结果。其重点提升能力包括:
通用识别更准确:提升通用语音、方言、中英混说等场景识别准确性,减少错字、漏字及长音频中的错误累积。除中文、英文外,支持20种方言,包括粤语、东北话、河南话、陕西话、成都话、重庆话、武汉话、贵阳话、青岛话、济南话、长沙话、合肥话、河北话、昆明话、 兰州话、 银川话、南昌话、 北京话、 四川话、天津话等。
更能理解用户意图:结合上下文精准捕捉语境,智能纠错同音词,消除语义歧义。
更容易适配专业场景:支持热词注入增强,快速识别品牌、产品名、人名及行业术语。
复杂环境更稳定:面向高噪、耳语、悄悄话等声学场景专项优化。
西南官话示例
粤语示例
吴语绕口令
金融专词场景
中英混及专词识别场景
高噪复杂场景
耳语复杂场景
智能纠错
腾讯云媒体处理(MPS)已集成 Hy ASR 3.0 preview,提供两种接入方式:
接入方式
API 接口
是否支持控制台发起任务
说明
异步字幕提取
支持
提交视频/音频任务,底层调用 Hy ASR 3.0 preview 完成字幕识别,异步返回字幕结果。
同步音频识别
暂不支持
直接传入音频数据,同步返回识别文本,指定引擎 provider 使用 Hy ASR 3.0 preview。

计费说明

收取 “ASR 提取字幕” 费用,详细定价请参考 按量计费。

接入前置操作

在使用本功能前,您需完成以下前置操作:
腾讯云账号注册/登录,登录 MPS 控制台开通 MPS 产品、完成服务角色授权。具体请参考 快速入门。
若您使用腾讯云子账号,还需要保证账号有足够权限使用 MPS 产品。具体请参考 账号授权相关。

一、异步发起字幕提取任务

输入输出示例

示例
输入音频(带有明显背景音噪音):单击查看音频
输出 WebVTT 字幕文件:



控制台发起任务

登录媒体处理控制台,单击创建任务 > 快速创建离线处理任务。
1. 指定输入文件
您可以选择腾讯云 COS 存储桶中的视频文件,或提供视频下载 URL。当前智能字幕暂不支持以 AWS S3 为输入文件来源。
2. 处理输入文件
选择创建编排,插入“智能字幕”节点。

选择 307预设模板(底层使用 Hy ASR 3.0 preview),无需自定义模板。

3. 指定输出路径
指定输出文件的保存路径。
4. 发起任务
单击创建,发起任务。

API 发起任务

通过 ProcessMedia 接口、指定 SmartSubtitlesTask.Definition = 307,即可发起基于 Hy ASR 3.0 preview 的智能字幕提取任务。任务为异步执行,提交后返回 TaskId,稍后通过 TaskId 查询结果。

关键请求参数

参数
类型
必填
说明
InputInfo.Type
String
是
输入文件来源类型,支持 URL 、COS 等。
InputInfo.UrlInputInfo.Url
String
条件必填
Type 为 URL 时填写媒体下载地址。
InputInfo.CosInputInfo.Bucket
String
条件必填
Type 为 COS 时填写存储桶名称。
InputInfo.CosInputInfo.Region
String
条件必填
Type 为 COS 时填写存储桶地域。
InputInfo.CosInputInfo.Object
String
条件必填
Type 为 COS 时填写对象路径。
SmartSubtitlesTask.Definition
Integer
是
智能字幕模板 ID,固定填 307(预置模板,底层使用 Hy ASR 3.0 preview)。
OutputStorage.Type
String
是
输出存储类型,固定为 COS
OutputStorage.CosOutputStorage.Bucket
String
是
输出存储桶名称。
OutputStorage.CosOutputStorage.Region
String
是
输出存储桶地域。
OutputDir
String
否
输出目录路径。

请求示例

示例一:URL 输入(模板 307)
{
"InputInfo": {
"Type": "URL",
"UrlInputInfo": {
"Url": "https://your-bucket-1250000000.cos.ap-guangzhou.myqcloud.com/input/video.mp4"
}
},
"SmartSubtitlesTask": {
"Definition": 307
},
"OutputStorage": {
"Type": "COS",
"CosOutputStorage": {
"Bucket": "your-bucket-1250000000",
"Region": "ap-guangzhou"
}
},
"OutputDir": "/output/subtitle/"
}
示例二:COS 输入
{
"InputInfo": {
"Type": "COS",
"CosInputInfo": {
"Bucket": "your-bucket-1250000000",
"Region": "ap-guangzhou",
"Object": "/input/video.mp4"
}
},
"SmartSubtitlesTask": {
"Definition": 307
},
"OutputStorage": {
"Type": "COS",
"CosOutputStorage": {
"Bucket": "your-bucket-1250000000",
"Region": "ap-guangzhou"
}
},
"OutputDir": "/output/subtitle/"
}
说明:
提交成功后,接口返回 Response.TaskId,请保存该 TaskId 用于后续查询结果。

二、查看异步任务结果

异步字幕任务提交后,可通过以下方式获取结果。

方式一:接口查询

调用 DescribeTaskDetail 接口,传入 TaskId 查询任务详情与字幕输出结果。响应示例如下:


{
"TaskType": "ScheduleTask",
"Status": "FINISH",
"CreateTime": "2026-08-05T09:02:55Z",
"BeginProcessTime": "2026-08-05T09:02:55Z",
"FinishTime": "2026-08-05T09:03:19Z",
"WorkflowTask": null,
"ScheduleTask": {
"TaskId": "2600021132-ScheduleTask-abcdefg",
"Status": "FINISH",
"ErrCode": 0,
"Message": "SUCCESS",
"InputInfo": {
"Type": "URL",
"CosInputInfo": {
"Bucket": "",
"Region": "",
"Object": ""
},
"UrlInputInfo": {
"Url": "http://xxxxx.cn/Case/Case1.wav"
},
"S3InputInfo": null,
"VODInputInfo": null
},
"MetaData": {
"AudioDuration": 86.171,
"AudioStreamSet": [
{
"Bitrate": 256000,
"Codec": "pcm_s16le",
"SamplingRate": 16000,
"Channel": 1,
"Codecs": "",
"Loudness": 0,
"Duration": 86.171
}
],
"Bitrate": 256007,
"Container": "wav",
"Duration": 86.17,
"Height": 0,
"Rotate": 0,
"Size": 2757540,
"VideoDuration": 0,
"VideoStreamSet": [],
"Width": 0
},
"ActivityResultSet": [
{
"SkipNode": 0,
"ActivityType": "SmartSubtitles",
"PredriveIndex": [
0
],
"ReardriveIndex": [
2
],
"ActivityResItem": {
"TranscodeTask": null,
"AnimatedGraphicTask": null,
"SnapshotByTimeOffsetTask": null,
"SampleSnapshotTask": null,
"ImageSpriteTask": null,
"AdaptiveDynamicStreamingTask": null,
"RecognitionTask": null,
"ReviewTask": null,
"AnalysisTask": null,
"QualityControlTask": null,
"SmartSubtitlesTask": {
"Status": "SUCCESS",
"ErrCode": 0,
"ErrCodeExt": "",
"Message": "",
"BeginProcessTime": "2026-08-05T09:02:55Z",
"FinishTime": "2026-08-05T09:03:19Z",
"Input": {
"Definition": 307,
"UserExtPara": "",
"RawParameter": {
"SubtitleEmbedId": 0,
"VideoSrcLanguage": "",
"SubtitleFormat": "",
"SubtitleType": 0,
"TranslateSwitch": "",
"TranslateDstLanguage": "",
"AsrHotWordsConfigure": null,
"ExtInfo": "",
"ProcessType": 0,
"SelectingSubtitleAreasConfig": null,
"SpeakerMode": 0,
"SpeakerLabel": 0
}
},
"Output": [
{
"Type": "AsrFullTextRecognition",
"AsrFullTextTask": {
"Status": "SUCCESS",
"ErrCode": 0,
"ErrCodeExt": "",
"Message": "SUCCESS",
"Progress": 100,
"BeginProcessTime": "2026-08-05T09:02:55Z",
"FinishTime": "2026-08-05T09:03:19Z",
"Input": {
"Definition": 307,
"UserExtPara": "",
"RawParameter": {
"SubtitleEmbedId": 0,
"VideoSrcLanguage": "",
"SubtitleFormat": "",
"SubtitleType": 0,
"TranslateSwitch": "",
"TranslateDstLanguage": "",
"AsrHotWordsConfigure": null,
"ExtInfo": "",
"ProcessType": 0,
"SelectingSubtitleAreasConfig": null,
"SpeakerMode": 0,
"SpeakerLabel": 0
}
},
"Output": {
"OutputStorage": {
"Type": "COS",
"CosOutputStorage": {
"Bucket": "mybucket",
"Region": "ap-guangzhou"
},
"S3OutputStorage": null,
"VODOutputStorage": null
},
"SubtitlePath": "http://mybucket.cos.ap-guangzhou.myqcloud.com/subtitle_output/Case1_smartsubtitle_307.vtt",
"SegmentSet": [
{
"Text": "在那个寒冷的冬日,李医生在诊室里接待了一位年迈的患者张大爷。张大爷咳嗽不止,面色苍白,显然是重感冒。李医生仔细检查后开了药方,叮嘱他按时服药。然而张大爷却面露难色,犹豫着说,医生,这药能不能便宜点?",
"StartTimeOffset": 0.116,
"EndTimeOffset": 22.116,
"Confidence": 100,
"Wordlist": [],
"ExtResult": "",
"SpeakerId": "",
"SpeakerGender": "",
"Emotion": ""
},
{
"Text": "我手头紧,实在舍不得买。李医生心中一酸,瞬间明白了张大爷的困境,他默默记下了。",
"StartTimeOffset": 22.116,
"EndTimeOffset": 30.476,
"Confidence": 100,
"Wordlist": [],
"ExtResult": "",
"SpeakerId": "",
"SpeakerGender": "",
"Emotion": ""
},
{
"Text": "微笑着说,大爷您先回去休息,药的事我来想办法。张大爷感激地点点头,颤颤巍巍地离开了诊室。当天下午,李医生悄悄去药店买了张大爷所需的药,还特意多买了一些感冒常用药",
"StartTimeOffset": 30.496,
"EndTimeOffset": 47.265,
"Confidence": 100,
"Wordlist": [],
"ExtResult": "",
"SpeakerId": "",
"SpeakerGender": "",
"Emotion": ""
},
{
"Text": "第二天,他将药送到张大爷家,轻描淡写地说:“大爷,这是医院给您的免费药,您放心用,身体要紧。”张大爷接过药,眼眶湿润。",
"StartTimeOffset": 47.265,
"EndTimeOffset": 60.496,
"Confidence": 100,
"Wordlist": [],
"ExtResult": "",
"SpeakerId": "",
"SpeakerGender": "",
"Emotion": ""
},
{
"Text": "紧紧握住李医生的手,声音哽咽,李医生,你真是好人,我这辈子都不会忘记你的恩情。李医生微笑着摆摆手,大爷,您别客气,治病救人是我的职责,您好好养病,我随时会来看您。这件事李医生从未对任何人提起,他只是默默地用自己的方式。",
"StartTimeOffset": 60.464,
"EndTimeOffset": 83.31,
"Confidence": 100,
"Wordlist": [],
"ExtResult": "",
"SpeakerId": "",
"SpeakerGender": "",
"Emotion": ""
},
{
"Text": "守护着患者的健康与尊严。",
"StartTimeOffset": 83.31,
"EndTimeOffset": 86.164,
"Confidence": 100,
"Wordlist": [],
"ExtResult": "",
"SpeakerId": "",
"SpeakerGender": "",
"Emotion": ""
}
],
"Path": "/subtitle_output/Case1_smartsubtitle_307.vtt",
"SubtitleInfo": {
"Path": "/subtitle_output/Case1_smartsubtitle_307.vtt",
"Status": "Success"
},
"Speakers": []
}
},
"TransTextTask": null,
"PureSubtitleTransTask": null,
"OcrFullTextTask": null
}
],
"Progress": 100
},
"ExecRuleTask": null,
"SmartEraseTask": null
}
}
]
},
"LiveScheduleTask": null,
"EditMediaTask": null,
"LiveStreamProcessTask": null,
"EvaluationTask": null,
"TaskNotifyConfig": null,
"TasksPriority": 0,
"SessionId": "",
"SessionContext": "",
"ExtInfo": "",
"RequestId": "628b0366-0ee7-4e57-9798-dd405cee27e2"
}

方式二:控制台查询

2. 找到对应任务,当子任务状态显示「成功」后,单击查看结果即可预览或下载字幕文件。


方式三:事件通知回调

通过 ProcessMedia 接口发起任务时,配置 TaskNotifyConfig,任务完成后 MPS 会向指定 URL 推送通知。
{
"TaskNotifyConfig": {
"NotifyType": "URL",
"NotifyUrl": "https://your-domain.com/callback"
}
}
收到回调后,使用 ParseNotification 接口解析通知内容。

三、发起同步音频识别任务(RecognizeAudio)

RecognizeAudio 为同步接口,传入 base64 编码的音频数据后直接返回识别文本,适用于实时性要求高、音频较短的语音识别场景。通过 Source 指定语种、并在 UserExtPara 中传入 force_asr_engine_provider: 15 即可指定使用 Hy ASR 3.0 preview 引擎。

请求参数

参数
类型
必填
说明
AudioData
String
是
base64 编码的音频数据。
Source
String
否
识别目标语言,为空默认 auto 自动识别语种;建议指定语种提升准确率。中文填 zh
AudioFormat
String
否
音频格式,默认 pcm。支持 pcm(16k 单声道 16bit)、ogg-opus(16k/24k/48k 单声道 opus)。
SampleRate
Integer
否
音频采样率,pcm 为 16000;ogg-opus 为 16000/24000/48000。
UserExtPara
String
否
扩展参数。指定 Hy ASR 3.0 preview 需传 {"force_asr_engine_provider":15}

请求示例

指定 Hy ASR 3.0 preview 识别中文音频(pcm 格式)
{
"Source": "zh",
"AudioFormat": "pcm",
"SampleRate": 16000,
"AudioData": "KwDn/zIA5v///wUA0v8D",
"UserExtPara": "{\\"force_asr_engine_provider\\":15}"
}
说明:
AudioData 为 base64 编码后的音频内容,此处为示意值,实际请传入真实音频的 base64 字符串。

响应参数

参数
类型
说明
Text
String
整段音频的识别结果。
AudioLength
Float
音频长度,单位秒。
Sentence
Array
分句识别结果,包含每句起止时间(Start/End)、文本(Text)及字词级时间戳(WordsInfo)。
RequestId
String
唯一请求 ID,定位问题时需提供。

响应示例

{
"Response": {
"AudioLength": 4.2,
"Text": "张大爷感激地点点头,颤颤巍巍地离开了诊室。",
"Sentence": [
{
"Start": 0.03,
"End": 3.59,
"Text": "张大爷感激地点点头,颤颤巍巍地离开了诊室。",
"WordsInfo": [
{ "Start": 0.03, "End": 0.27, "Word": "张" },
{ "Start": 0.27, "End": 0.43, "Word": "大" },
{ "Start": 0.43, "End": 0.51, "Word": "爷" }
]
}
],
"RequestId": "f27f3866-3882-4c18-a4ac-3b3d83fd2f5a"
}
}