一张只有4GB显存的显卡,通常装不下70B参数的大模型。AirLLM的思路像从仓库逐箱取货:不把整个模型同时塞进显卡,而是只载入眼下要计算的一层,用完便换下一层。项目作者称,这让70B模型能在单张4GB显卡上完成推理——也就是让训练好的模型生成回答——而且不必量化、蒸馏或剪枝,不靠缩小或改造模型来省显存。
省下显存的代价是频繁搬运数据。模型权重主要留在系统内存或磁盘,显卡每算一层就要读取下一层,因此速度未必理想;首次运行前,AirLLM还会拆分模型并按层保存,需要预留足够磁盘空间。它的价值不是让旧显卡突然跑得飞快,而是把“能不能在本地运行”与“能跑多快”拆成两个问题:对愿意等待的玩家和开发者,4GB显存也能成为尝试70B模型的入口。上述容量与运行效果来自项目作者说明,材料未提供统一硬件下的完整速度测试。