首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >端侧大模型 >GGUF 格式是什么?为什么它成为端侧大模型的主流格式?

GGUF 格式是什么?为什么它成为端侧大模型的主流格式?

词条归属:端侧大模型

GGUF(GGML Universal Format)是由 llama.cpp 生态定义的端侧大模型标准格式,已成为开源社区的事实标准。

1. GGUF 的核心特点

GGUF 是文件格式而非量化算法,规定"量化好的大模型如何存成文件"。其核心设计思想是"单文件自包含"——将模型权重、分词器、架构参数、上下文长度、Prompt 模板、量化元数据全部打包在一个 .gguf 文件中,下载即可运行,无需额外配置。

2. GGUF 的技术优势

GGUF 内部按张量分块存储,支持内存映射(mmap)加载,模型文件不需要全量加载进内存,按需将当前层的权重页载入物理内存。这让普通设备也能运行超大模型。GGUF 还原生支持 K-quant 混合精度量化,同一个文件中可混合使用 Q4_K、Q6_K、F32 等不同精度档位。

3. GGUF 的生态地位

GGUF 已成为端侧大模型的通用标准格式,Hugging Face、Ollama、LM Studio、KoboldCpp 等主流工具均支持 GGUF 格式。llama.cpp 社区通过持续迭代,已支持从 Q2_K 到 Q8_0 的多种量化档位以及 MXFP4(Microscaling FP4)等新一代量化格式,为端侧模型提供了丰富的精度-速度选择空间。

相关文章
GGUF、GPTQ、AWQ、EXL2、MLX、VMLX...运行大模型,为什么会有这么多格式?
最早的大模型,只存在于超级 GPU 集群里。看 GPT-3、PaLM、Claude,感觉它们像一种遥远的云端能力,离普通开发者很远。你知道它很强,但你并不觉得自己真的能拥有它。
掘金安东尼
2026-06-19
2000
喂给大模型的文档,为什么Markdown格式效果最好?
第一种,直接把 Word 导出的文本糊成一团丢给模型;第二种,先转成结构清晰的 Markdown,再丢过去。
小铭2026
2026-07-19
630
AI大模型生成的图表为什么倾向使用Mermaid格式?
最近因为工作需要,频繁跟AI协作,也就是我负责提问,AI负责回答。不过我发现关于大模型生成的图表格式,大多是一种Mermaid的格式,我就在想AI大模型为啥会倾向使用Mermaid格式,所以我问了下DeepSeek。
巫山老妖
2025-06-16
9520
一个全新的大模型压缩工具,极限量化
DeepSeek-R1 满血版 671B,光模型文件就几百 GB,普通人想都别想。就算用 Ollama 跑个量化版,4-bit 的 7B 模型也得 6-8 GB 显存起步。
Ai学习的老章
2026-03-02
1.2K0
大模型"瘦身"革命:量化、蒸馏与边缘部署——端侧AI的工程化实战指南
【量子位/TinyML社区综合报道】 2026年5月,高通在Computex大会上正式发布新一代骁龙X Elite芯片,内置的Hexagon NPU算力突破100 TOPS(万亿次整数运算/秒),并现场演示了在笔记本端本地运行量化后的700亿参数大模型,推理速度达到惊人的38 tokens/s。与此同时,苹果在WWDC 2026上宣布,iOS 20将内置基于MLX框架优化的3B端侧模型,支持完全离线的Siri智能体交互。据IDC《2026端侧AI市场报告》显示:全球已有超过40%的AI推理负载从云端迁移至边缘设备执行,"Cloud-only"的大模型时代正在被"Cloud-Edge-Device"三级协同架构彻底颠覆。
用户12583550
2026-07-12
2290
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券