本地大模型部署 · 显卡救星
2026.08
想本地跑大模型这么久
终于有人
让 4GB 显卡也能扛 70B
26K Star · 无需量化 / 蒸馏 / 剪枝
lyogavin/airllm · 让 70B 在单张 4GB GPU 上跑起来
逐层加载 · MoE 流式 · 开源 Apache-2.0
开源Apache-2.0
做本地 AI 开发的朋友问我:手里就一张 4GB 的 1060 / 3050,是不是这辈子跟 70B 大模型彻底无缘了?想跑个 Llama 3 70B,常规得要两三张 A100(80G 起步),量化能压一压但掉精度、还得改架构——普通人手里的消费级卡,基本只能看个 README。
问题不是模型不够好,是你的显存放不下它
这个 26K Star 的项目想干这件事
lyogavin/airllm 的定位很纯粹:不量化、不蒸馏、不剪枝,把 70B 乃至 405B 的大模型,塞进单张 4GB / 8GB 的消费级显卡跑起来。它做的是推理时的显存调度,不是偷偷把模型变小——精度基本是原汁原味的全精度。
把「显卡装不下」变成「显卡跑得动,就是慢点」。
它是怎么做到的
01逐层加载,GPU 上永远只留一层
AirLLM 一次只把模型的一层放进显存,算完立刻换下一层。所以你需要的显存只跟「单层大小」有关,跟模型总参数量无关——70B 全精度也就约 4GB 显存,4GB 卡因此能跑。
02MoE 逐专家流式加载
像 DeepSeek-V3(671B)、Kimi K3(2.8T)这种稀疏 MoE,它一次只加载 token 实际路由到的那个专家,而不是整层。Kimi K3 实测显存 3.72GB,硬是塞进了 4GB 卡。
03统一 AutoModel 接口,一行切模型
from airllm import AutoModel,用法跟 HuggingFace Transformers 几乎一样。Llama、Qwen、DeepSeek、Mistral、Gemma、ChatGLM……换个模型 ID 就能跑,新模型经常发布当天就支持。
04可选块量化压缩,再快 3 倍
只量化权重、不量化激活,精度损失几乎可忽略,速度最高提升 3x(v2.0+)。v2.5 还加了预取,重叠加载与计算,再快约 10%。
怎么用
装一个包、换个模型 ID,三步就能把 32B 模型跑起来。注意先腾好磁盘——模型要按层分解存进 HuggingFace 缓存,下文注意事项里细说。
用法 · 安装后几行推理
# 1. 安装
pip install airllm
# 2. 几行就能跑起一个 32B 模型
from airllm import AutoModel
model = AutoModel.from_pretrained("Qwen/Qwen3-32B")
input_text = ["What is the capital of United States?"]
input_tokens = model.tokenizer(input_text,
return_tensors="pt", return_attention_mask=False,
truncation=True, max_length=128, padding=False)
generation_output = model.generate(
input_tokens["input_ids"].cuda(),
max_new_tokens=20, use_cache=True,
return_dict_in_generate=True)
output = model.tokenizer.decode(generation_output.sequences[0])
print(output)
显存占用
Qwen3 / Mistral / Phi(≈8B)
~1–2 GB
Qwen3-30B / Mixtral(MoE)
~1–3 GB
Qwen3-235B(MoE)
~3 GB
Llama 3.x 70B(全精度)
~4 GB
Llama 3.1 405B
~8 GB
DeepSeek-V3 671B
~12 GB
注意事项
吃磁盘:模型要先按层分解存进 HuggingFace 缓存,70B 得腾出上百 GB 本地空间,别光看显存乐。
慢:逐层换进换出要走 PCIe / 磁盘,首 token 延迟高,适合「跑得动」而非「跑得快」,别拿它当线上服务。
平台:Linux 为主;Mac(Apple Silicon,v2.8.2+)、CPU(v2.10.1+)也能跑,但更慢,纯属能跑。
协议 Apache-2.0 商用友好;README 里夹了几条第三方广告(游戏精灵之类)跟功能无关,别理。
写在最后
说实话,显卡焦虑是这一代本地 AI 玩家的集体痛点。AirLLM 没把 4GB 变成 80GB,它只是把「跑不动」变成了「跑得动但慢」——对想试用开源大模型、又不想买 A100 的人来说,这已经是质变。它不是生产环境的水桶机,但作为「尝鲜、学习、验证想法」的垫脚石,值 26K 个星。我的建议:手里有老显卡、又想本地把玩 Qwen / DeepSeek 的朋友,先 pip install 跑通示例;真要低延迟上线,还是得正经算力。把它当「让大模型触手可及」的钥匙,比当「替代云 GPU」的银弹更合适。
👉 项目地址
https://github.com/lyogavin/airllm