端侧大模型的离线运行依赖模型的本地存储和推理引擎的离线执行能力。
1. 模型本地存储
GGUF 格式的模型文件可直接存储在本地磁盘中,推理引擎通过内存映射(mmap)按需加载权重,无需网络下载。用户可提前下载所需模型,断网环境下直接加载运行。
2. 推理引擎离线执行
llama.cpp、Ollama 等主流推理框架均支持完全离线运行,不依赖任何云端服务。模型启动后所有推理计算在本地 CPU/GPU/NPU 上完成,响应延迟仅取决于硬件性能。
3. 端侧 RAG 离线链路
本地知识库的索引和检索均可在离线状态下完成。嵌入模型、向量数据库和大模型三者均部署在本地,形成完整的离线问答能力。