2025—2026 年,端侧大模型推理框架已形成成熟的生态,主流框架各有侧重,覆盖从极客用户到应用开发者的不同需求。
llama.cpp 是端侧部署的事实标准,由 Georgi Gerganov 开源,基于纯 C/C++ 实现,零依赖、极致轻量。其 GGUF 单文件格式和丰富的量化档位使其成为社区最广泛使用的端侧推理方案,支持 CPU、CUDA、Metal、Vulkan、QNN(高通 NPU)等多种硬件后端。
Ollama 是面向开发者的开箱即用本地 LLM 服务,一条命令即可下载、量化并运行模型,自动适配硬件并暴露兼容 OpenAI 的本地 API。其底层使用 GGUF 格式的 llama.cpp 引擎,适合快速原型验证和跨平台开发。
ExecuTorch 是 Meta 推出的移动端推理框架,50KB 的基础运行时是所有框架中最小的,支持 Apple Core ML、高通 QNN/Hexagon NPU、Arm XNNPACK 等 12 种以上硬件后端。已应用于 Instagram、WhatsApp、Quest 3 等数十亿用户的产品中。
MLC-LLM 基于 Apache TVM 机器学习编译器,将模型编译为目标硬件的高效内核。其杀手锏是 WebGPU 支持,可在浏览器中接近原生 80% 的性能运行模型,适合浏览器端推理场景。
MNN-LLM 是阿里巴巴推出的移动端推理框架,在小米 14 等设备上实现了比 llama.cpp 高 8.6 倍的预填充加速。其自动区域融合和 DRAM-Flash 混合存储技术可在内存受限设备上支持长上下文推理。