首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >量化大模型的能耗与质量:同一次运行里的两本账

量化大模型的能耗与质量:同一次运行里的两本账

原创
作者头像
用户9867296
发布2026-09-11 10:47:26
发布2026-09-11 10:47:26
220
举报

量化大模型省电吗?我们在一张 RTX 4090 上做了配对实验:五个规模(0.5B–7B),NF4 与 INT8 两种量化,每次运行同时记录能耗与困惑度,FP16 基线也在同一次运行中测得——两列数字来自同一份权重、同一个进程。

只看能耗列,3B 用 NF4 最划算,省 15% 焦耳;质量列上它却最差,困惑度上升 27.6%。反过来,INT8 几乎不伤质量(五个规模里三个只升约 0.5%),能耗却灾难性地高:最严重时是 FP16 的近七倍,因为解码吞吐掉到个位数 tok/s,而显卡仍维持 85–100W。

再加一条"困惑度恶化不超 1%"的硬过滤,这组数据会否决所有 NF4 配置、放行除 3B 外的全部 INT8——与能耗排名完全相反。两条诚实的测量,给出两个相反的结论。我们拒绝把能耗除以困惑度合成单一"质量调整能耗"指标:那权重没人同意过,还会掩盖分歧本身。质量轴应当做过滤器,而不是分母。

另一个不安的发现:同一型号显卡,七月与八月两轮会话相比,INT8 的能耗惩罚放大了 2–2.5 倍;次日五个 INT8 配置各重复三次,变异系数仅 0.6–3.9%,不是噪声。嫌疑指向 kernel 随 torch 版本变化,未经检验。能复现的是"形状":NF4 惩罚随规模单调下降,约在 1.4–3.2B 转为净节省,INT8 永不省电;幅度则不保证复现。单实例单次测得的量化能耗惩罚可能偏差一倍。

边界:困惑度不等于任务质量;数据仅覆盖 GPU 封装功耗与解码阶段。

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档