社会的拿破仑
Qwen3-ASR 从 PyTorch 迁移到 vLLM:一次信创环境下的推理路径改造实录
原创
关注作者
腾讯云
开发者社区
文档
建议反馈
控制台
登录/注册
首页
学习
活动
专区
圈层
工具
MCP广场
文章/答案/技术大牛
搜索
搜索
关闭
发布
社会的拿破仑
社区首页
>
专栏
>
Qwen3-ASR 从 PyTorch 迁移到 vLLM:一次信创环境下的推理路径改造实录
Qwen3-ASR 从 PyTorch 迁移到 vLLM:一次信创环境下的推理路径改造实录
社会的拿破仑
关注
发布于 2026-07-31 10:30:57
发布于 2026-07-31 10:30:57
82
0
举报
概述
Qwen3-ASR 从 PyTorch 迁移到 vLLM:一次信创环境下的推理路径改造实录
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系
cloudcommunity@tencent.com
删除。
语音识别
智能硬件
智能硬件 AI 语音助手
人工智能
目录
一、模型没有变,为什么还要更换推理路径?
二、为什么信创环境更容易出现两条路径表现不一致
三、改造前的 PyTorch 路径
四、PyTorch 路径在信创设备上的几个实际问题
1. 能运行,不代表所有算子都进入最佳路径
2. 版本组合过多
3. 并发需要业务层自己管理
4. 流式能力难以平滑接入
五、迁移目标:业务接口保持不变
六、先不要删除旧环境,单独创建 vLLM 环境
七、第一种改法:在 Python 中使用 vLLM 后端
八、第二种改法:独立启动 vLLM 服务
信创环境下的参数不要直接照搬 CUDA 示例
九、业务适配层如何调用 vLLM
十、保留统一接口,避免业务层绑定 vLLM
十一、前后性能测试怎么做
测试环境记录模板
前后性能对比表
十二、写一个简单的双路径测试脚本
十三、迁移过程中最容易踩的几个坑
1. gpu_memory_utilization 不是越高越好
2. vLLM 启动慢不代表推理慢
3. 硬件插件版本必须和 vLLM 匹配
4. 流式路径和离线文件路径仍需分别测试
5. 时间戳仍可能需要独立服务
十四、上线时采用双服务灰度,而不是原地覆盖
十五、从迁移结果看,vLLM真正解决了什么
十六、总结:信创适配不能只看模型能否启动
问题归档
专栏文章
快讯文章归档
关键词归档
开发者手册归档
开发者手册 Section 归档