帮你快速理解、总结文档立即下载
文档中心>媒体处理>媒体处理接入教程>媒体 AI 接入>智能字幕(混元 ASR 3.0 preview)接入

智能字幕(混元 ASR 3.0 preview)接入

最近更新时间:2026-08-05 20:55:54
我的收藏

概述

Hy ASR 3.0 preview 是腾讯混元发布的新一代语音识别模型,基于最新一代大语言模型 Hy3 的语言理解能力,在复杂真实输入中能给出准确、连贯、更接近用户意图的转写结果。其重点提升能力包括:
通用识别更准确:提升通用语音、方言、中英混说等场景识别准确性,减少错字、漏字及长音频中的错误累积。除中文、英文外,支持20种方言,包括粤语、东北话、河南话、陕西话、成都话、重庆话、武汉话、贵阳话、青岛话、济南话、长沙话、合肥话、河北话、昆明话、 兰州话、 银川话、南昌话、 北京话、 四川话、天津话等。
更能理解用户意图:结合上下文精准捕捉语境,智能纠错同音词,消除语义歧义。
更容易适配专业场景:支持热词注入增强,快速识别品牌、产品名、人名及行业术语。
复杂环境更稳定:面向高噪、耳语、悄悄话等声学场景专项优化。
西南官话示例
粤语示例
吴语绕口令
金融专词场景
中英混及专词识别场景
高噪复杂场景
耳语复杂场景
智能纠错
腾讯云媒体处理(MPS)已集成 Hy ASR 3.0 preview,提供两种接入方式:
接入方式
API 接口
是否支持控制台发起任务
说明
异步字幕提取
支持
提交视频/音频任务,底层调用 Hy ASR 3.0 preview 完成字幕识别,异步返回字幕结果。
同步音频识别
暂不支持
直接传入音频数据,同步返回识别文本,指定引擎 provider 使用 Hy ASR 3.0 preview。

计费说明

收取 “ASR 提取字幕” 费用,详细定价请参考 按量计费

接入前置操作

在使用本功能前,您需完成以下前置操作:
腾讯云账号注册/登录,登录 MPS 控制台开通 MPS 产品、完成服务角色授权。具体请参考 快速入门
若您使用腾讯云子账号,还需要保证账号有足够权限使用 MPS 产品。具体请参考 账号授权相关

一、异步发起字幕提取任务

输入输出示例

示例
输入音频(带有明显背景音噪音):单击查看音频
输出 WebVTT 字幕文件:



控制台发起任务

登录媒体处理控制台,单击创建任务 > 快速创建离线处理任务
1. 指定输入文件
您可以选择腾讯云 COS 存储桶中的视频文件,或提供视频下载 URL。当前智能字幕暂不支持以 AWS S3 为输入文件来源。
2. 处理输入文件
选择创建编排,插入“智能字幕”节点。

选择 307预设模板(底层使用 Hy ASR 3.0 preview),无需自定义模板。

3. 指定输出路径
指定输出文件的保存路径。
4. 发起任务
单击创建,发起任务。

API 发起任务

通过 ProcessMedia 接口、指定 SmartSubtitlesTask.Definition = 307,即可发起基于 Hy ASR 3.0 preview 的智能字幕提取任务。任务为异步执行,提交后返回 TaskId,稍后通过 TaskId 查询结果。

关键请求参数

参数
类型
必填
说明
InputInfo.Type
String
输入文件来源类型,支持 URLCOS 等。
InputInfo.UrlInputInfo.Url
String
条件必填
Type 为 URL 时填写媒体下载地址。
InputInfo.CosInputInfo.Bucket
String
条件必填
Type 为 COS 时填写存储桶名称。
InputInfo.CosInputInfo.Region
String
条件必填
Type 为 COS 时填写存储桶地域。
InputInfo.CosInputInfo.Object
String
条件必填
Type 为 COS 时填写对象路径。
SmartSubtitlesTask.Definition
Integer
智能字幕模板 ID,固定填 307(预置模板,底层使用 Hy ASR 3.0 preview)。
OutputStorage.Type
String
输出存储类型,固定为 COS
OutputStorage.CosOutputStorage.Bucket
String
输出存储桶名称。
OutputStorage.CosOutputStorage.Region
String
输出存储桶地域。
OutputDir
String
输出目录路径。

请求示例

示例一:URL 输入(模板 307)
{
"InputInfo": {
"Type": "URL",
"UrlInputInfo": {
"Url": "https://your-bucket-1250000000.cos.ap-guangzhou.myqcloud.com/input/video.mp4"
}
},
"SmartSubtitlesTask": {
"Definition": 307
},
"OutputStorage": {
"Type": "COS",
"CosOutputStorage": {
"Bucket": "your-bucket-1250000000",
"Region": "ap-guangzhou"
}
},
"OutputDir": "/output/subtitle/"
}
示例二:COS 输入
{
"InputInfo": {
"Type": "COS",
"CosInputInfo": {
"Bucket": "your-bucket-1250000000",
"Region": "ap-guangzhou",
"Object": "/input/video.mp4"
}
},
"SmartSubtitlesTask": {
"Definition": 307
},
"OutputStorage": {
"Type": "COS",
"CosOutputStorage": {
"Bucket": "your-bucket-1250000000",
"Region": "ap-guangzhou"
}
},
"OutputDir": "/output/subtitle/"
}
说明:
提交成功后,接口返回 Response.TaskId,请保存该 TaskId 用于后续查询结果。

二、查看异步任务结果

异步字幕任务提交后,可通过以下方式获取结果。

方式一:接口查询

调用 DescribeTaskDetail 接口,传入 TaskId 查询任务详情与字幕输出结果。响应示例如下:


{
"TaskType": "ScheduleTask",
"Status": "FINISH",
"CreateTime": "2026-08-05T09:02:55Z",
"BeginProcessTime": "2026-08-05T09:02:55Z",
"FinishTime": "2026-08-05T09:03:19Z",
"WorkflowTask": null,
"ScheduleTask": {
"TaskId": "2600021132-ScheduleTask-abcdefg",
"Status": "FINISH",
"ErrCode": 0,
"Message": "SUCCESS",
"InputInfo": {
"Type": "URL",
"CosInputInfo": {
"Bucket": "",
"Region": "",
"Object": ""
},
"UrlInputInfo": {
"Url": "http://xxxxx.cn/Case/Case1.wav"
},
"S3InputInfo": null,
"VODInputInfo": null
},
"MetaData": {
"AudioDuration": 86.171,
"AudioStreamSet": [
{
"Bitrate": 256000,
"Codec": "pcm_s16le",
"SamplingRate": 16000,
"Channel": 1,
"Codecs": "",
"Loudness": 0,
"Duration": 86.171
}
],
"Bitrate": 256007,
"Container": "wav",
"Duration": 86.17,
"Height": 0,
"Rotate": 0,
"Size": 2757540,
"VideoDuration": 0,
"VideoStreamSet": [],
"Width": 0
},
"ActivityResultSet": [
{
"SkipNode": 0,
"ActivityType": "SmartSubtitles",
"PredriveIndex": [
0
],
"ReardriveIndex": [
2
],
"ActivityResItem": {
"TranscodeTask": null,
"AnimatedGraphicTask": null,
"SnapshotByTimeOffsetTask": null,
"SampleSnapshotTask": null,
"ImageSpriteTask": null,
"AdaptiveDynamicStreamingTask": null,
"RecognitionTask": null,
"ReviewTask": null,
"AnalysisTask": null,
"QualityControlTask": null,
"SmartSubtitlesTask": {
"Status": "SUCCESS",
"ErrCode": 0,
"ErrCodeExt": "",
"Message": "",
"BeginProcessTime": "2026-08-05T09:02:55Z",
"FinishTime": "2026-08-05T09:03:19Z",
"Input": {
"Definition": 307,
"UserExtPara": "",
"RawParameter": {
"SubtitleEmbedId": 0,
"VideoSrcLanguage": "",
"SubtitleFormat": "",
"SubtitleType": 0,
"TranslateSwitch": "",
"TranslateDstLanguage": "",
"AsrHotWordsConfigure": null,
"ExtInfo": "",
"ProcessType": 0,
"SelectingSubtitleAreasConfig": null,
"SpeakerMode": 0,
"SpeakerLabel": 0
}
},
"Output": [
{
"Type": "AsrFullTextRecognition",
"AsrFullTextTask": {
"Status": "SUCCESS",
"ErrCode": 0,
"ErrCodeExt": "",
"Message": "SUCCESS",
"Progress": 100,
"BeginProcessTime": "2026-08-05T09:02:55Z",
"FinishTime": "2026-08-05T09:03:19Z",
"Input": {
"Definition": 307,
"UserExtPara": "",
"RawParameter": {
"SubtitleEmbedId": 0,
"VideoSrcLanguage": "",
"SubtitleFormat": "",
"SubtitleType": 0,
"TranslateSwitch": "",
"TranslateDstLanguage": "",
"AsrHotWordsConfigure": null,
"ExtInfo": "",
"ProcessType": 0,
"SelectingSubtitleAreasConfig": null,
"SpeakerMode": 0,
"SpeakerLabel": 0
}
},
"Output": {
"OutputStorage": {
"Type": "COS",
"CosOutputStorage": {
"Bucket": "mybucket",
"Region": "ap-guangzhou"
},
"S3OutputStorage": null,
"VODOutputStorage": null
},
"SubtitlePath": "http://mybucket.cos.ap-guangzhou.myqcloud.com/subtitle_output/Case1_smartsubtitle_307.vtt",
"SegmentSet": [
{
"Text": "在那个寒冷的冬日,李医生在诊室里接待了一位年迈的患者张大爷。张大爷咳嗽不止,面色苍白,显然是重感冒。李医生仔细检查后开了药方,叮嘱他按时服药。然而张大爷却面露难色,犹豫着说,医生,这药能不能便宜点?",
"StartTimeOffset": 0.116,
"EndTimeOffset": 22.116,
"Confidence": 100,
"Wordlist": [],
"ExtResult": "",
"SpeakerId": "",
"SpeakerGender": "",
"Emotion": ""
},
{
"Text": "我手头紧,实在舍不得买。李医生心中一酸,瞬间明白了张大爷的困境,他默默记下了。",
"StartTimeOffset": 22.116,
"EndTimeOffset": 30.476,
"Confidence": 100,
"Wordlist": [],
"ExtResult": "",
"SpeakerId": "",
"SpeakerGender": "",
"Emotion": ""
},
{
"Text": "微笑着说,大爷您先回去休息,药的事我来想办法。张大爷感激地点点头,颤颤巍巍地离开了诊室。当天下午,李医生悄悄去药店买了张大爷所需的药,还特意多买了一些感冒常用药",
"StartTimeOffset": 30.496,
"EndTimeOffset": 47.265,
"Confidence": 100,
"Wordlist": [],
"ExtResult": "",
"SpeakerId": "",
"SpeakerGender": "",
"Emotion": ""
},
{
"Text": "第二天,他将药送到张大爷家,轻描淡写地说:“大爷,这是医院给您的免费药,您放心用,身体要紧。”张大爷接过药,眼眶湿润。",
"StartTimeOffset": 47.265,
"EndTimeOffset": 60.496,
"Confidence": 100,
"Wordlist": [],
"ExtResult": "",
"SpeakerId": "",
"SpeakerGender": "",
"Emotion": ""
},
{
"Text": "紧紧握住李医生的手,声音哽咽,李医生,你真是好人,我这辈子都不会忘记你的恩情。李医生微笑着摆摆手,大爷,您别客气,治病救人是我的职责,您好好养病,我随时会来看您。这件事李医生从未对任何人提起,他只是默默地用自己的方式。",
"StartTimeOffset": 60.464,
"EndTimeOffset": 83.31,
"Confidence": 100,
"Wordlist": [],
"ExtResult": "",
"SpeakerId": "",
"SpeakerGender": "",
"Emotion": ""
},
{
"Text": "守护着患者的健康与尊严。",
"StartTimeOffset": 83.31,
"EndTimeOffset": 86.164,
"Confidence": 100,
"Wordlist": [],
"ExtResult": "",
"SpeakerId": "",
"SpeakerGender": "",
"Emotion": ""
}
],
"Path": "/subtitle_output/Case1_smartsubtitle_307.vtt",
"SubtitleInfo": {
"Path": "/subtitle_output/Case1_smartsubtitle_307.vtt",
"Status": "Success"
},
"Speakers": []
}
},
"TransTextTask": null,
"PureSubtitleTransTask": null,
"OcrFullTextTask": null
}
],
"Progress": 100
},
"ExecRuleTask": null,
"SmartEraseTask": null
}
}
]
},
"LiveScheduleTask": null,
"EditMediaTask": null,
"LiveStreamProcessTask": null,
"EvaluationTask": null,
"TaskNotifyConfig": null,
"TasksPriority": 0,
"SessionId": "",
"SessionContext": "",
"ExtInfo": "",
"RequestId": "628b0366-0ee7-4e57-9798-dd405cee27e2"
}

方式二:控制台查询

2. 找到对应任务,当子任务状态显示「成功」后,单击查看结果即可预览或下载字幕文件。


方式三:事件通知回调

通过 ProcessMedia 接口发起任务时,配置 TaskNotifyConfig,任务完成后 MPS 会向指定 URL 推送通知。
{
"TaskNotifyConfig": {
"NotifyType": "URL",
"NotifyUrl": "https://your-domain.com/callback"
}
}
收到回调后,使用 ParseNotification 接口解析通知内容。

三、发起同步音频识别任务(RecognizeAudio)

RecognizeAudio同步接口,传入 base64 编码的音频数据后直接返回识别文本,适用于实时性要求高、音频较短的语音识别场景。通过 Source 指定语种、并在 UserExtPara 中传入 force_asr_engine_provider: 15 即可指定使用 Hy ASR 3.0 preview 引擎。

请求参数

参数
类型
必填
说明
AudioData
String
base64 编码的音频数据。
Source
String
识别目标语言,为空默认 auto 自动识别语种;建议指定语种提升准确率。中文填 zh
AudioFormat
String
音频格式,默认 pcm。支持 pcm(16k 单声道 16bit)、ogg-opus(16k/24k/48k 单声道 opus)。
SampleRate
Integer
音频采样率,pcm 为 16000;ogg-opus 为 16000/24000/48000。
UserExtPara
String
扩展参数。指定 Hy ASR 3.0 preview 需传 {"force_asr_engine_provider":15}

请求示例

指定 Hy ASR 3.0 preview 识别中文音频(pcm 格式)
{
"Source": "zh",
"AudioFormat": "pcm",
"SampleRate": 16000,
"AudioData": "KwDn/zIA5v///wUA0v8D",
"UserExtPara": "{\\"force_asr_engine_provider\\":15}"
}
说明:
AudioData 为 base64 编码后的音频内容,此处为示意值,实际请传入真实音频的 base64 字符串。

响应参数

参数
类型
说明
Text
String
整段音频的识别结果。
AudioLength
Float
音频长度,单位秒。
Sentence
Array
分句识别结果,包含每句起止时间(Start/End)、文本(Text)及字词级时间戳(WordsInfo)。
RequestId
String
唯一请求 ID,定位问题时需提供。

响应示例

{
"Response": {
"AudioLength": 4.2,
"Text": "张大爷感激地点点头,颤颤巍巍地离开了诊室。",
"Sentence": [
{
"Start": 0.03,
"End": 3.59,
"Text": "张大爷感激地点点头,颤颤巍巍地离开了诊室。",
"WordsInfo": [
{ "Start": 0.03, "End": 0.27, "Word": "张" },
{ "Start": 0.27, "End": 0.43, "Word": "大" },
{ "Start": 0.43, "End": 0.51, "Word": "爷" }
]
}
],
"RequestId": "f27f3866-3882-4c18-a4ac-3b3d83fd2f5a"
}
}