首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >端侧大模型 >端侧大模型有哪些主流开源推理框架?

端侧大模型有哪些主流开源推理框架?

词条归属:端侧大模型

2025—2026 年,端侧大模型推理框架已形成成熟的生态,主流框架各有侧重,覆盖从极客用户到应用开发者的不同需求。

1. llama.cpp

llama.cpp 是端侧部署的事实标准,由 Georgi Gerganov 开源,基于纯 C/C++ 实现,零依赖、极致轻量。其 GGUF 单文件格式和丰富的量化档位使其成为社区最广泛使用的端侧推理方案,支持 CPU、CUDA、Metal、Vulkan、QNN(高通 NPU)等多种硬件后端。

2. Ollama

Ollama 是面向开发者的开箱即用本地 LLM 服务,一条命令即可下载、量化并运行模型,自动适配硬件并暴露兼容 OpenAI 的本地 API。其底层使用 GGUF 格式的 llama.cpp 引擎,适合快速原型验证和跨平台开发。

3. ExecuTorch

ExecuTorch 是 Meta 推出的移动端推理框架,50KB 的基础运行时是所有框架中最小的,支持 Apple Core ML、高通 QNN/Hexagon NPU、Arm XNNPACK 等 12 种以上硬件后端。已应用于 Instagram、WhatsApp、Quest 3 等数十亿用户的产品中。

4. MLC-LLM

MLC-LLM 基于 Apache TVM 机器学习编译器,将模型编译为目标硬件的高效内核。其杀手锏是 WebGPU 支持,可在浏览器中接近原生 80% 的性能运行模型,适合浏览器端推理场景。

5. MNN-LLM

MNN-LLM 是阿里巴巴推出的移动端推理框架,在小米 14 等设备上实现了比 llama.cpp 高 8.6 倍的预填充加速。其自动区域融合和 DRAM-Flash 混合存储技术可在内存受限设备上支持长上下文推理。

相关文章
端侧 AI 的推理加速:手机端大模型怎么提速?
我们常用的云端模型可以依赖服务器和数据中心,但手机上的模型就没这么强大的后盾。不仅如此,它还要顾及电池、内存、发热,还有尽量别让用户等太久。
七牛开发者
2026-06-29
1480
⽬前 主流的开源模型体系 有哪些?
目前主流的开源大语言模型(LLM)体系和生态主要可以分为几个方向,从模型研发主体和技术路线来看,大致如下(截至 2024 年):
福大大架构师每日一题
2025-12-19
2.3K0
五大主流数据库模型有哪些_五大主流品牌
导读:无论是关系型数据库还是非关系型数据库,都是某种数据模型的实现。本文将为大家简要介绍5种常见的数据模型,让我们来追本溯源,窥探现在流行的数据库解决方案背后的神秘世界。
全栈程序员站长
2022-09-20
2.4K0
能在 CPU 上运行的开源大模型推理框架
如今,大模型的发展势头迅猛,而且,大模型的演进出现了两种分化趋势:一方面,开源大模型的规模不断扩大,从最初的数十亿参数迅速扩展到数千亿参数,照这个趋势,很快就会突破万亿级的超大规模。这类巨型模型通过引入更丰富的语义理解、复杂的推理能力和跨领域知识整合,展现出强大的智能。各大厂商开展军备竞赛,为了追求更高的准确率和更强的泛化能力,大模型的“无上限”扩展不断突破技术和硬件的边界。
云水木石
2025-01-23
1.5K0
端侧AI推理,高效部署PyTorch模型:官方新工具开源,Meta已经用上了
在 2023 年 PyTorch 大会上,一个深受大家关心的推理问题得到了很好的解决,会上宣布了一个用于在边缘和移动设备上实现 AI 推理的解决方案:ExecuTorch,并且还是开源的,而促成这一研究的,正是 Meta AI 与 PyTorch 基金会。
机器之心
2023-10-24
9600
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券