GGUF(GGML Universal Format)是由 llama.cpp 生态定义的端侧大模型标准格式,已成为开源社区的事实标准。
GGUF 是文件格式而非量化算法,规定"量化好的大模型如何存成文件"。其核心设计思想是"单文件自包含"——将模型权重、分词器、架构参数、上下文长度、Prompt 模板、量化元数据全部打包在一个 .gguf 文件中,下载即可运行,无需额外配置。
GGUF 内部按张量分块存储,支持内存映射(mmap)加载,模型文件不需要全量加载进内存,按需将当前层的权重页载入物理内存。这让普通设备也能运行超大模型。GGUF 还原生支持 K-quant 混合精度量化,同一个文件中可混合使用 Q4_K、Q6_K、F32 等不同精度档位。
GGUF 已成为端侧大模型的通用标准格式,Hugging Face、Ollama、LM Studio、KoboldCpp 等主流工具均支持 GGUF 格式。llama.cpp 社区通过持续迭代,已支持从 Q2_K 到 Q8_0 的多种量化档位以及 MXFP4(Microscaling FP4)等新一代量化格式,为端侧模型提供了丰富的精度-速度选择空间。