首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >Qwen3-ASR 从 PyTorch 迁移到 vLLM:一次信创环境下的推理路径改造实录

Qwen3-ASR 从 PyTorch 迁移到 vLLM:一次信创环境下的推理路径改造实录

作者头像
社会的拿破仑
发布2026-07-31 10:30:57
发布2026-07-31 10:30:57
820
举报
概述
Qwen3-ASR 从 PyTorch 迁移到 vLLM:一次信创环境下的推理路径改造实录

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

目录
  • 一、模型没有变,为什么还要更换推理路径?
  • 二、为什么信创环境更容易出现两条路径表现不一致
  • 三、改造前的 PyTorch 路径
  • 四、PyTorch 路径在信创设备上的几个实际问题
    • 1. 能运行,不代表所有算子都进入最佳路径
    • 2. 版本组合过多
    • 3. 并发需要业务层自己管理
    • 4. 流式能力难以平滑接入
  • 五、迁移目标:业务接口保持不变
  • 六、先不要删除旧环境,单独创建 vLLM 环境
  • 七、第一种改法:在 Python 中使用 vLLM 后端
  • 八、第二种改法:独立启动 vLLM 服务
    • 信创环境下的参数不要直接照搬 CUDA 示例
  • 九、业务适配层如何调用 vLLM
  • 十、保留统一接口,避免业务层绑定 vLLM
  • 十一、前后性能测试怎么做
    • 测试环境记录模板
    • 前后性能对比表
  • 十二、写一个简单的双路径测试脚本
  • 十三、迁移过程中最容易踩的几个坑
    • 1. gpu_memory_utilization 不是越高越好
    • 2. vLLM 启动慢不代表推理慢
    • 3. 硬件插件版本必须和 vLLM 匹配
    • 4. 流式路径和离线文件路径仍需分别测试
    • 5. 时间戳仍可能需要独立服务
  • 十四、上线时采用双服务灰度,而不是原地覆盖
  • 十五、从迁移结果看,vLLM真正解决了什么
  • 十六、总结:信创适配不能只看模型能否启动
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档