【低显存跑大模型】AirLLM|3.29 万 Star,4GB 显存跑 70B 模型,分层加载极致省显存

显卡显存不够,大模型跑不起来?AirLLM 是一个让普通显卡也能运行超大语言模型的推理工具,3.29 万 Star。它不把整个模型一次性塞进显存,而是按层或按需加载到 GPU 计算,有人用它在 4GB 显存上跑起了 70B 模型。

项目定位

这是一个低显存大模型推理工具,定位是「小显卡跑大模型的解决方案」。通过分层加载、按需计算的方式,突破显存限制,让消费级显卡也能运行超大参数模型。

核心亮点

  1. 4GB 显存跑 70B 模型,极致省显存

    核心能力。把模型拆开按层加载到 GPU 计算,不一次性占用全部显存,4GB 显存也能跑 70B 级别的大模型。

  2. 支持量化和预加载

    支持模型量化进一步降低资源需求,还支持预加载优化,在省显存和速度之间灵活平衡。

  3. 兼容多种主流模型

    支持多种主流大模型架构,不是只支持某一个模型,通用性强。

  4. 3.29 万 Star,低显存推理热门

    3 万 + Star,说明 “显卡不够但想跑大模型” 是很多人的刚需。

代价说明

代价是需要足够的硬盘和内存,频繁搬运模型数据会降低生成速度。用时间换显存,适合没有高端显卡但不着急速度的场景。

适用场景

低显存设备跑大模型、消费级显卡体验大参数模型、学习和研究用途、对速度要求不高的离线推理。

项目信息

没有大显卡也想玩大模型,AirLLM 用分层加载实现了 “四两拨千斤”。速度慢点没关系,能跑起来就是胜利