选择端侧大模型需要综合考虑硬件配置、任务复杂度、精度要求和部署成本等因素。
设备类型 | 推荐模型规模 | 量化档位 | 典型速度 |
|---|---|---|---|
4GB 内存手机 | 1B | Q2_K / Q3_K | 40—60 tok/s |
6—8GB 内存手机 | 3B | Q4_K_M | 30—50 tok/s |
旗舰手机(8GB+) | 3B—7B | Q4_K_M / Q5_K_M | 18—55 tok/s |
16GB 内存笔记本 | 8B—14B | Q4_K_M | 20—40 tok/s |
Mac(48GB+) | 32B—70B | Q4_K_M | 15—25 tok/s |
简单分类、提取、短文本生成等轻量任务适合 1B—3B 小模型;文档分析、代码辅助、多轮对话等中等复杂度任务推荐 4B—8B 模型;长文本处理、复杂推理等高难度任务建议 8B—32B 模型配合长上下文优化。
优先选择 INT4(Q4_K_M)作为默认量化档位,在精度和速度之间取得最佳平衡。对精度要求极高的场景可选用 INT8 或 FP16;对资源极度受限的场景可考虑 INT2/2-bit 量化,但需接受更大的精度损失。
llama.cpp 提供最广泛的硬件兼容性和量化选项,适合技术用户和嵌入式部署;Ollama 适合快速原型开发和跨平台应用;ExecuTorch 适合移动端 App 集成。选择框架时应考虑目标硬件的原生支持情况和社区生态成熟度。