项目简介
airllm 是由 lyogavin 开源的一个大语言模型推理优化库,目标是让超大参数模型在消费级 GPU 上也能跑起来。它的核心卖点非常直观:单张 4GB 显存即可运行 70B 模型,405B 的 Llama 3.1 只需要 8GB,而 671B 的 DeepSeek-V3 也只需约 12GB 显存。最近该项目还因为支持了 2.8T 参数的 Kimi K3,在 3.72GB 显存下完成端到端推理,再次引爆了社区关注。
技术亮点
AirLLM 的关键思路是分层流式加载:推理时只在 GPU 上保留当前计算所需的一层,计算完就卸载,下一层再从磁盘或缓存中加载。配合 safetensors、压缩与量化(4bit/8bit block-wise),它在不显著损失精度的前提下,把显存占用降到了极限。项目提供统一的 AutoModel.from_pretrained(...) 接口,几乎支持所有主流开源模型:Llama、Qwen、DeepSeek、Mistral/Mixtral、Phi、Gemma、ChatGLM、Baichuan、InternLM 等。
快速上手
|
|
|
|
为什么值得看
- 显存需求与模型总参数量解耦,只取决于单层大小。
- 无需自己量化、蒸馏或剪枝,一行代码即可运行超大模型。
- 支持 CPU 推理、MacOS Apple Silicon、FP8 与 MoE 逐 expert 加载。
数据快照
- 仓库:@lyogavin/airllm
- 语言:Jupyter Notebook
- 协议:Apache-2.0
- 今日新增 Star:833
- 总 Star:29,334
- Fork:3,141