机房级显存买不起时,有人把SSD当成「慢显存」,只把正在干活的专家捞进内存——Colibrì把这套思路做成了可下载的小引擎。
Colibrì是GitHub上走红的分层推理框架,公开材料称纯C实现、零引擎依赖,Star已达约3.2万。核心针对MoE:如GLM-5.2总参约744B、每token激活约40B,Attention与共享专家等稠密部分int4后约9.9GB常驻RAM,上万路由专家放在NVMe,由Router点名后再读盘。作者称在12核CPU+25GB RAM开发机上验证过路径;推荐约24GB内存起跑int4权重(约372GB盘占用),GPU非必须。冷缓存早期约0.05–0.1 token/s;靠LRU、专家热度与邻层可预测性(公开称约71.6%)预取后,128GB纯CPU桌面约1.8 token/s,六张RTX 5090全专家常驻可达约5.8–6.8 token/s。
覆盖面上,项目称已支持九个模型家族,从Qwen、DeepSeek V4 Flash、GLM-5.2/5.3到约975B的Inkling,以及约2.8T总参的Kimi K3(约1.6TB盘、RAM约32GB起)。设计原则是专家住哪一层只影响速度,不改变路由与精度。对爱好者与边缘场景,这是「能跑起来」的工程胜利;对生产,吞吐、延迟抖动与盘寿命仍是硬约束。项目地址见公开仓库 JustVugg/colibri。