端侧大模型可结合本地向量数据库和 RAG(检索增强生成)技术,在完全离线的条件下实现知识库问答能力。典型架构是:使用量化嵌入模型(如 nomic-embed-text、mxbai-embed-large)在本地将文档分块并生成向量索引,存入本地向量数据库;查询时,嵌入模型将用户问题向量化,检索相关文档片段,与端侧大模型结合生成回答。
整个流程无需网络传输,数据全程不出设备,适合处理敏感文档(如医疗病历、法律文件、财务报表等)。嵌入模型体积通常在 100MB—800MB,可在消费级设备上流畅运行。
端侧 RAG 的检索效率受本地向量数据库性能限制,通常适用于 1 万条以内的文档集合。对于更大规模的知识库,可采用混合模式:本地完成初步检索和摘要,复杂查询路由至云端处理。