你知道吗,以前跑那种七百亿参数的大模型,得搬出好几张上万块的显卡,跟攒一台小服务器似的。我见过实验室里为了跑个模型,机柜里插满卡,风扇嗡嗡响,电费都够吃顿好的。所以今天在GitHub上看到这个叫AirLLM的项目,我第一反应是:又来一个吹牛的。
结果它还真不是。你看它写的:70B的模型,一张4GB的入门显卡就能跑。4GB什么概念?现在手机内存都12GB了。它还不做量化、不砍层数、不搞蒸馏,就是硬跑。更离谱的是后面——405B的Llama 3.1,8GB显存跑;DeepSeek-V3那个671B的,12GB跑;最新的Kimi K3,号称2.8T参数,最大的开源模型,一张卡3.72GB显存就跑了。
它怎么做到的呢?说穿了其实不复杂。以前的模型是一层一层整个加载,每层都得全塞进显存。它改成一次只加载一个专家——你知道MoE模型吧,就是那种里面有很多个"专家",每个token只走其中几个。它就把这些专家一个个地调进来用,用完就扔,跟流水席似的。
我一下子想起宋应星写《天工开物》,序里那句"于功名进取毫不相关"。他考不上功名,转身去把造纸、冶铁、榨油这些活计一道工序一道工序记下来,竹子怎么泡、石灰怎么蒸、纸怎么抄,一笔都不省。当时谁觉得这事儿有用?现在倒成了研究明代技术最要紧的底本。这个AirLLM的作者大概也是这么个人——大家都在堆显卡拼算力的时候,他蹲下来琢磨怎么把一张破卡用到极致。
反正我看了下,它连MacOS都能跑70B了。就那种感觉,以前得跪着求算力中心批资源的事,现在自己笔记本上就办了。至于能跑多快,我没试过,但光是"能跑"这件事本身,搁两年前谁信啊。