首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >端侧大模型 >端侧大模型的离线运行能力如何实现?

端侧大模型的离线运行能力如何实现?

词条归属:端侧大模型

端侧大模型的离线运行依赖模型的本地存储和推理引擎的离线执行能力。

1. 模型本地存储

GGUF 格式的模型文件可直接存储在本地磁盘中,推理引擎通过内存映射(mmap)按需加载权重,无需网络下载。用户可提前下载所需模型,断网环境下直接加载运行。

2. 推理引擎离线执行

llama.cpp、Ollama 等主流推理框架均支持完全离线运行,不依赖任何云端服务。模型启动后所有推理计算在本地 CPU/GPU/NPU 上完成,响应延迟仅取决于硬件性能。

3. 端侧 RAG 离线链路

本地知识库的索引和检索均可在离线状态下完成。嵌入模型、向量数据库和大模型三者均部署在本地,形成完整的离线问答能力。

相关文章
端侧 AI 的推理加速:手机端大模型怎么提速?
我们常用的云端模型可以依赖服务器和数据中心,但手机上的模型就没这么强大的后盾。不仅如此,它还要顾及电池、内存、发热,还有尽量别让用户等太久。
七牛开发者
2026-06-29
1480
苹果AI手机发布后,端侧AI大模型前景如何?
9月10日凌晨1点,被称为“科技春晚”的苹果发布会拉开序幕。其中苹果介绍了其第一台AI手机:iPhone 16。这是第一台搭载了AI大模型的手机,能够依据用户的输入进行但不限于AI消图、总结文本、邮件回复等等。
算法一只狗
2024-09-26
1.5K0
大模型搬进你的手机,端侧AI时代来了
一次简单的对话,几毛钱。一天几亿次对话,几千万美元。一年下来,光电费就够买一支英超球队了。
老周聊架构
2026-05-29
5130
骁龙最强AI芯能力下放:小旗舰8s发布,端侧运行10B大模型,小米Civi首发
但AI性能丝毫不减:支持100亿参数大模型端侧运行,是骁龙8Gen 3同款配置。可运行Baichuan-7B,Google Gemini Nano、Llama2和ChatGLM等模型。
量子位
2024-03-20
6630
小米小爱同学:资源受限下,实现端侧大模型的高性能推理
随着大模型能力持续提升,如何将其有效部署到端侧设备,成为产业界面临的重要工程挑战。手机、车载、IoT 等设备对模型体积、推理时延、功耗和更新机制都提出了极高要求,也让端侧推理成为融合系统优化、模型压缩和软硬件协同的复杂问题。
深度学习与Python
2025-06-25
1.3K0
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券