AirLLM 是一个开源的推理内存优化框架,仓库位于 github.com/lyogavin/airllm,用 Python 实现。它回答了一个很直接的问题:Transformer 各层在推理时是严格串行执行的,那为什么非要把整个模型都塞进显存?做法是逐层把权重从磁盘加载进 GPU、算完即弃,把显存峰值从“整个模型大小”压到“单层最大大小”——于是单张 4GB 显卡就能跑 70B 推理,约 8GB 显存可跑 405B 的 Llama 3.1,甚至能在 3.7GB 下尝试超大 MoE。关键是不靠量化、蒸馏或剪枝,纯推理优化保住精度。 定价:免费开源,无商业套餐。编辑评分:⭐ 4.5。
AirLLM 是什么?
AirLLM 是一个开源的推理内存优化框架,仓库位于 github.com/lyogavin/airllm,用 Python 实现。它回答了一个很直接的问题:Transformer 各层在推理时是严格串行执行的,那为什么非要把整个模型都塞进显存?它的做法是逐层把权重从磁盘加载进 GPU、算完即弃,把显存峰值从“整个模型大小”压到“单层最大大小”——于是单张 4GB 显卡就能跑 70B 推理,约 8GB 显存可跑 405B 的 Llama 3.1,甚至能在 3.7GB 下尝试超大 MoE。关键是不靠量化、蒸馏或剪枝,纯推理优化保住精度。
核心功能
- 逐层推理卸载:每层按需从磁盘加载执行,显存只装单层。
- 极低显存门槛:4GB 跑 70B、8GB 跑 405B,无需昂贵显卡。
- 保精度:不走量化 / 蒸馏 / 剪枝,模型能力不被压缩。
- 一键使用:pip install airllm,把模型名传给 AutoModel.from_pretrained 即可。
- 可选块级压缩:4bit / 8bit 块级权重压缩能把加载带宽缩到 1/4,换取约 3 倍提速。
版本/套餐对比
AirLLM 为开源免费项目,无商业套餐;安装即用,适合低频、对速度不敏感的本地产出场景。
值不值得用?
AirLLM 解决的是“能不能跑”而非“能不能快”。它的代价很明显:每层都要从磁盘读,I/O 成为新瓶颈,速度远低于全量加载,也不支持高并发 KV Cache 共享。但对你只有一张老显卡、又想亲自跑跑 70B 验证想法的人来说,能跑起来本身就值回票价。
使用建议
准备足够大的磁盘空间存放切分后的 shard(和原始模型差不多大);把它用在探索、测试、低频报告生成等“速度不敏感”的场景;不要在需要实时响应或高并发的生产环境使用;Apple Silicon Mac 同样可以尝试。块级压缩能在可接受精度损失下明显提速,适合反复调用的场合。
适合谁用?
- 个人开发者:显存有限却想本地体验大模型。
- 研究者 / 学生:用普通设备验证新模型想法。
- 探索型用户:低频推理、对响应速度不敏感者。