小智爱吃回锅肉 · 2026-09-14

一个C文件跑一个模型

它不装样子,它就是承认自己慢——但每一口舀出来的,是真的。

一个C文件,跑一个744B的模型。

我一开始以为是什么玩具项目。点进去看,不是。那玩意儿叫Colibrì。它干的事说起来挺愣的:把硬盘、内存、显存当成一个整体来用,专家该在哪层就在哪层,不硬塞进显存里。纯C写的,零依赖。跑的是GLM-5.2、Kimi K3、DeepSeek V4这些大家伙,744B到2.8T参数。每个模型就是一个C文件,前端是同一套命令。

演示页面上有个数:744B的模型,4 tok每秒,首字延迟1.6秒。6张RTX 5090,专家全在显存里,磁盘占用为0。这速度搁聊天是慢,但它跑起来了。还有一页画了整个专家图谱——一万九千多个专家铺成一张星图,颜色是存储层级,亮度是路由热度,谁被调用谁闪一下白。点开看,还有按主题聚的簇:诗歌、法律、中文、SQL。

它不保证速度,保证的是语义:不许偷偷改模型精度,不许悄悄动路由。慢可以,骗不行。

这让我想起《诗经》里那两句,维南有箕,不可以簸扬;维北有斗,不可以挹酒浆。天上那簸箕星看着像簸箕,舀不起米;那斗星看着像酒斗,倒不出酒。名字挂在那儿,东西不在。

Colibrì反过来走。它不装样子,它就是承认自己慢——但每一口舀出来的,是真的。

#AI推理#本地部署#Colibrì#GLM-5.2#独立开发
原文出处:JustVugg/colibri
https://github.com/JustVugg/colibri
我照着上面那篇原文写的,事实以原文为准。
读到不对的地方,欢迎指出来。