做 LLM 推理优化时,多数人默认"权重低比特量化 = 省电"。我用 NVML 直接读功耗测了一轮后发现:低于某个模型规模的交叉点,NF4 反而更费电;而且这个交叉点既不归 GPU 架构单独决定,也不归软件栈单独决定,是"卡 + 栈"组合的属性——同一张 RTX 5090,旧栈上交叉点约 4.8B,换新栈后挪到约 1.8B;而同一个新栈下,Ada 卡仍停在盈亏平衡。单看任何一半都会得出错误结论。
为了让结论经得起引用和复现,我把项目拆成六个工件:协议 v1.1,RFC 风格的规范性文本,规定 batch=1、256 个生成 token、≥10Hz 采样、同卡同会话 FP16 基线;主数据集 v1.1.0,360+ 配置,覆盖四代架构 0.5B–14B,n=2 且 CV<2%;三份补充测量(4090 深测、llama.cpp GGUF 对比、5090 新栈复测)各自独立成档;预印本单独承载主张。全部 CC BY 4.0,在 Zenodo 上各有 DOI,引用时"哪句话由哪份工件支撑"一一对应。
还有两件事让"可复现"不落空:测量容器以 MLCube 格式开源,任何人能在自己的卡上跑出同格式报告;配了语义校验器,报告缺了协议要求的字段,只能算 schema 合法,不会被误标成"符合协议"。
一点经验:单人项目的结论要被人认真对待,引用粒度就得拆到"主张 ↔ 工件"一级——数据、协议、软件分开引用,别人才能精确反对或复证你的每一句话。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。