首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >LLM 量化技术详解:GPTQ、AWQ 与 GGUF 的选型与实践

LLM 量化技术详解:GPTQ、AWQ 与 GGUF 的选型与实践

作者头像
贺公子之数据科学与艺术
发布2026-08-14 16:18:41
发布2026-08-14 16:18:41
2720
举报
概述
随着大语言模型参数规模从 7B 一路增长到 70B、405B 甚至更大,显存和推理成本成为落地部署的最大瓶颈。以 FP16 精度为例,一个 7B 模型仅权重就需要约 14GB 显存,70B 模型则超过 140GB,普通消费级显卡根本无法加载。
文章被收录于专栏:人工智能人工智能

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档