帮你快速理解、总结文档立即下载

混元 ASR(内测版)

最近更新时间:2026-08-04 11:44:30

我的收藏

混元语音识别(ASR)

本文将介绍混元 ASR(内测版)的信息,本次版本仅支持实时语音识别,以接口形式(PaaS 级)提供产品服务,计费详情仅适用于大模型2.0计费方案,详情请参见 计费概述(在线版)
语音识别
基础产品
功能简介
免费并发路数
时效性
常见应用场景
支持语种(算法引擎)
可识别长时间传入的语音流数据,实时返回识别结果,实现“边说边出文字”的效果
20路
实时
适配 IM 即时语音转写、实时音视频通话字幕识别、智能助手语音指令实时解析等短时低延迟人机语音交互场景
大模型2.0引擎:
Hy-ASR-3.0-preview 中英大模型:中文普通话+英语+多方言混合引擎,除中英外,支持20种方言,包括粤语、东北话、河南话、陕西话、成都话、重庆话、武汉话、贵阳话、青岛话、济南话、长沙话、合肥话、河北话、昆明话、 兰州话、 银川话、南昌话、 北京话、 四川话、天津话等。
说明:
当前为内测版本仅作为体验,部分功能暂不支持,包括但不限于以下:
仅支持1分钟以内的语音识别;仅支持16k 单声道 pcm 音频格式输入。
不支持话者分离、vad、词汇替换、噪音参数阈值等功能。
上下文传入和热词功能即将开放体验。

快速接入

1.开通语音识别服务

请先参考 一分钟接入服务端 API,开通语音识别服务。




2.新建密钥

进入 控制台 新建密钥,生成 AppID、SecretID 和 SecretKey,用于 API 调用时生成签名,签名将用来进行接口鉴权。




3.调用服务

调用服务时请参考实时语音识别 API 文档 实时语音识别(WebSocket)进行调用,engine_model_type 参数选择 Hy-ASR-3.0-preview 即为使用混元语音识别。