腾讯云
开发者社区
文档
建议反馈
控制台
登录/注册
首页
学习
活动
专区
圈层
工具
MCP广场
文章/答案/技术大牛
搜索
搜索
关闭
发布
首页
标签
腾讯技术创作特训营S12#AI进化论
#
腾讯技术创作特训营S12#AI进化论
关注
专栏文章
(1.1K)
技术视频
(7)
互动问答
(1)
最新优先
最热优先
Hy-MT2-30B-A3B模型私有化部署速度慢怎么解决?
1
回答
部署
、
翻译
、
优化
、
腾讯技术创作特训营S12#AI进化论
、
#Techo开发者嘉年华
紫风
十五年服务端架构专家,用高可用承载亿级流量,用高性能支撑毫秒级响应。为业务增长提供坚实的技术底座。
问题不在模型,在推理引擎。transformers 是训练调试用的,生产推理直接换 vLLM 或 SGLang,30B-A3B 是 MoE 结构,激活才 3B,vLLM 跑在 A100 80G 上吞吐比 transformers 高一个数量级很正常。一行命令就能起:vllm serve 模型路径,自带 OpenAI 兼容接口。另外你的用法也在拖后腿:20 页文档应该按段落切开并发请求,batch 一起跑,而不是单条排队串行。长输入记得开 chunked prefill,翻译这种固定前缀的场景 prefix caching 也有收益。这套改完,25 分钟压到一两分钟是合理预期,能追上在线 API 的体感。...
展开详请
赞
0
收藏
0
评论
0
分享
问题不在模型,在推理引擎。transformers 是训练调试用的,生产推理直接换 vLLM 或 SGLang,30B-A3B 是 MoE 结构,激活才 3B,vLLM 跑在 A100 80G 上吞吐比 transformers 高一个数量级很正常。一行命令就能起:vllm serve 模型路径,自带 OpenAI 兼容接口。另外你的用法也在拖后腿:20 页文档应该按段落切开并发请求,batch 一起跑,而不是单条排队串行。长输入记得开 chunked prefill,翻译这种固定前缀的场景 prefix caching 也有收益。这套改完,25 分钟压到一两分钟是合理预期,能追上在线 API 的体感。
热门
专栏
腾讯云开发者社区头条
486 文章
68.6K 订阅
禅林阆苑
145 文章
43 订阅
Web行业观察
282 文章
107 订阅
IT技术分享社区
519 文章
31 订阅
领券