突破性C语言推理引擎在低内存环境下运行大型模型
近年来,许多大型的人工智能模型需要高端硬件支持才能运行,比如多张高性能GPU和大容量显存。然而,最近在GitHub上出现了一个新项目,叫做colibri,它采取了不同的策略:不再要求整个模型驻留在显存中,而是将NVMe SSD、RAM和VRAM视为一个统一的分层推理空间。该项目由用户JustVugg于2026年7月推出,短短两个月内,已获得超过35.2K Stars,并在GitHub Trending排行榜上名列第三。
colibri的关键之处在于它能够在仅有25GB内存的机器上成功运行744B参数的GLM-5.2模型,这显著扩展了可支持的模型种类,包括GLM-5.2/5.3、Qwen3.6等。其核心推理引擎使用纯C语言编写,无需依赖BLAS等库,也不要求使用GPU。值得注意的是,colibri并不是通过压缩模型来实现节省内存,而是创造了一种动态加载权重的新方式。
具体而言,GLM-5.2虽然参数数目庞大,但在生成每个Token时仅激活约40B参数,实际使用的内存远低于模型总参数。其中一部分固定的参数会以int4格式常驻RAM,占用约9.9GB,其余的庞大专家则存储在NVMe SSD中,只有在需要时才被加载。这种方式把VRAM、RAM和SSD整合为一个权重存储层,利用优先访问存储实现动态调度。 龙8头号玩家国际
项目采用类似于即时编译(JIT)的思想,跟踪实际使用的参数,并优化读取速度。colibri还提供了实时可视化,显示每个专家的存储状态和被选择的频率。
最后,尽管25GB内存的配置能够运行模型,但并不意味着运行速度快。在早期使用的开发机上,虽然可以完成推理任务,但冷启动时的解码速度只有0.05到0.1 tok/s,仍有改进空间。