显卡显存不够,大模型跑不起来?AirLLM 是一个让普通显卡也能运行超大语言模型的推理工具,3.29 万 Star。它不把整个模型一次性塞进显存,而是按层或按需加载到 GPU 计算,有人用它在 4GB 显存上跑起了 70B 模型。
项目定位
这是一个低显存大模型推理工具,定位是「小显卡跑大模型的解决方案」。通过分层加载、按需计算的方式,突破显存限制,让消费级显卡也能运行超大参数模型。
核心亮点
-
4GB 显存跑 70B 模型,极致省显存
核心能力。把模型拆开按层加载到 GPU 计算,不一次性占用全部显存,4GB 显存也能跑 70B 级别的大模型。
-
支持量化和预加载
支持模型量化进一步降低资源需求,还支持预加载优化,在省显存和速度之间灵活平衡。
-
兼容多种主流模型
支持多种主流大模型架构,不是只支持某一个模型,通用性强。
-
3.29 万 Star,低显存推理热门
3 万 + Star,说明 “显卡不够但想跑大模型” 是很多人的刚需。
代价说明
代价是需要足够的硬盘和内存,频繁搬运模型数据会降低生成速度。用时间换显存,适合没有高端显卡但不着急速度的场景。
适用场景
低显存设备跑大模型、消费级显卡体验大参数模型、学习和研究用途、对速度要求不高的离线推理。
项目信息
- 仓库:lyogavin/airllm
- Star:3.29 万
- 技术:分层 / 按需加载
- 项目地址:https://github.com/lyogavin/airllm
没有大显卡也想玩大模型,AirLLM 用分层加载实现了 “四两拨千斤”。速度慢点没关系,能跑起来就是胜利