首页
学习
活动
专区
圈层
工具
发布
首页标签腾讯技术创作特训营S12#AI进化论

#腾讯技术创作特训营S12#AI进化论

Hy-MT2-30B-A3B模型私有化部署速度慢怎么解决?

紫风十五年服务端架构专家,用高可用承载亿级流量,用高性能支撑毫秒级响应。为业务增长提供坚实的技术底座。
问题不在模型,在推理引擎。transformers 是训练调试用的,生产推理直接换 vLLM 或 SGLang,30B-A3B 是 MoE 结构,激活才 3B,vLLM 跑在 A100 80G 上吞吐比 transformers 高一个数量级很正常。一行命令就能起:vllm serve 模型路径,自带 OpenAI 兼容接口。另外你的用法也在拖后腿:20 页文档应该按段落切开并发请求,batch 一起跑,而不是单条排队串行。长输入记得开 chunked prefill,翻译这种固定前缀的场景 prefix caching 也有收益。这套改完,25 分钟压到一两分钟是合理预期,能追上在线 API 的体感。... 展开详请
领券