GitHub 热榜上这两天有个项目,名字挺直白,叫 MiniMind。我点进去一看,它说的是:花三块钱,租两小时的显卡,从零训练一个自己的大语言模型。
三块钱,现在连杯奶茶都买不到。但项目作者还真不是闹着玩的。他那个最小的模型,参数是 64M,体积大概是 GPT-3 的两千七百分之一。关键是他把整个训练链路全开源了,从数据清洗、预训练、微调、对齐,到后面那些更进阶的强化学习、工具调用、蒸馏,全都给你摊开了,而且核心代码都是拿 PyTorch 一行行手写的,没套那些现成的高级框架。
这让我想起《西京杂记》里那个凿壁偷光的匡衡。他家穷得点不起灯,就在墙上凿个洞,借邻居家那一线光读书。后来去大户人家做工,不要工钱,就求人家把书借给他读一遍。现在这个项目,差不多就是那个意思——大模型的门槛太高了,普通人连看一眼里面长什么样都难,他就给你凿了个洞,让你能借着这点光,亲手摸一摸这玩意儿到底是怎么转起来的。
当然,三块钱训出来的模型,肯定不是拿来跟 ChatGPT 比高下的。它的意义更像是一本教材,而且是那种手把手教你拆零件、再装回去的教材。网上那些动辄几千块的 AI 课程,讲半天也未必有你自己动手跑一遍来得明白。作者自己也说了,用乐高拼出一架飞机,比坐在头等舱里看风景有意思多了。
我反正是挺好奇的,哪天有空真想自己跑一遍,看看那三块钱到底能买个什么出来。