实测记录colibri 跑 GLM-5.2 的速度与资源占用——兼核实 Mixtral-8x7B 支持 传闻【免费下载链接】colibriRun frontier MoE models on hardware you already own — pure C, zero deps, experts streamed from disk. Tiny engine, immense model. 项目地址: https://gitcode.com/GitHub_Trending/colibri3/colibricolibri 最近在国内社区的热度来自两条线索一是纯 C 推理引擎、25 GB 内存跑 744B 参数的极限叙事二是一些技术文章声称它是面向 MoE 大模型的 C 语言原生推理引擎支持 Mixtral-8x7B 等前沿模型。热度是一回事实测是另一回事。本文不重复宣传口径而是直接以仓库内公开发布的实测记录docs/benchmarks.md 及 docs/experiments 下的实验日志为准整理 GLM-5.2 在不同机器上的速度与资源占用数据并对Mixtral-8x7B 支持做一次源码级核实。核心干货colibri 真实的吞吐曲线、磁盘 I/O 与内存如何分布、以及宣传数字与实测结果之间每一处差距。先说核实结论仓库里没有 Mixtral-8x7B对仓库全文检索源码、文档、测试、工具脚本找不到任何mixtral相关的引擎文件或说明。colibri 的模型支持是一族一个 .c 文件的架构——c/colibri.cGLM-5.2/5.3、c/inkling.c、c/kimi_k3.c、c/deepseek_v4.c、c/qwen38.c、c/qwen36.c、c/olmoe.c——当前九大家族里没有 Mixtral 的位置。社区那篇支持 Mixtral-8x7B的说法属于未经源码验证的宣传放大。不过这并不影响本文的阅读价值。Mixtral-8x7B 是约 47B 总参、13B 激活的传统稠密激活 MoEint4 全量约 20-25 GB普通台式机内存即可全驻留根本用不上 colibri 的磁盘流式能力真正让 colibri 出名的始终是 GLM-5.2 这条 744B / 40B 激活的极限线。下面的实测全部围绕它展开——两个引擎在同一台机器上的对比比两个模型更能说明问题。同机对比一6×RTX 5090 上的 colibri 与 vLLM-MoetGLM-5.2 六卡 5090 实验日志记录了一台机器6× RTX 5090 32 GiB、双路 Xeon Silver 4510 24 物理核、251 GiB 内存、本地 NVMe上同一天的两轮实测是理解 colibri 速度区间的最佳样本运行时与布局GPU 使用TTFT解码速度关键观察colibri int4上午部分驻留6 卡约 42 s0.12 tok/sGPU 热层开启但稠密计算仍在 CPUcolibri int4下午全驻留6 卡 24 核—6.28–6.84 tok/s19,456 个专家全部驻留 VRAMRAM磁盘等待为零vLLM-Moet TP412 GiB/卡专家缓存0-3 卡2.03 s中位 2.5 tok/s覆盖率 25.3%每次专家未命中整体重放vLLM-Moet TP2×PP36 卡5.39 s1.78 tok/s覆盖率更高但串行 PP 与通信抵消了收益上午的 colibri 生成 16 个 token 用了 132.46 秒GPU 热层占 77.48 GB内存峰值 175.94 GB专家命中率仅 71%最大开销依次是专家矩阵乘81.37 s、磁盘读取29.31 s、注意力14.28 s。下午把全部专家放进显存与内存9,343 个专家 176.73 GB 在 GPU、10,113 个约 191.3 GB 在 RAM后磁盘彻底退出解码路径colibri 首次在单请求解码上压过 vLLM-Moet——它从不因专家未命中而重放整步。日志作者明确写道这台机器上 20-30 tok/s 仍未达成6.84 tok/s256 token 贪心是当前天花板。这组数字的戏剧性还在于布局差一个量级速度差两个量级。同样一台机器同样是 colibri0.12 与 6.28 之间相差的不是硬件而是专家是否驻留。同机对比二4×RTX A6000 上的 colibri 与 llama.cppGLM-5.2 四卡 A6000 报告提供了另一台机器上 colibri 与 llama.cpp 的直接对决EPYC 7402P24 核 Zen 2、无 AVX-512、251.6 GiB DDR4-2400、4× RTX A6000 48 GB、两块 NVMe 因插槽限制分别只跑 PCIe 3.0 x4 与 x2。prefill解码VRAM 占用llama.cpp-cmoe专家全放内存239 tok/s1.58 tok/s26 GBcolibri 生产配置198 tok/s1.56 tok/s176 GB这个对照比谁更快更有信息量在这台机器上colibri 的逐专家放置机制并没有买到任何东西。原因是 GGUF 把每层 256 个专家熔进单个ffn_*_exps张量llama.cpp 根本无法逐专家放置而该主机的瓶颈是 CPU 侧专家读取带宽——报告量化出只有19.67 GB/s占 8 通道 DDR4-2400 约 85 GB/s 的 23%因此每个 token 触碰的专家权重 8 专家 × 20.1 MB × 75 层 12.1 GB 其中非驻留54.4% 6.6 GB 按实测 19.67 GB/s 计算 → 333 ms/token → 3.0 tok/s ← 当前天花板同机的配置矩阵进一步说明资源与速度的非线性关系起始配置 C099 GB RSS1.53 tok/s开CUDA_DENSE1把稠密层搬上 GPU 后跳到 4.26 tok/s×2.8报告称这是README 从未提及但回报率最高的开关去掉磁盘隐藏用的URING/PILOT系列再 26% 到 5.38。调优收尾阶段同一台机器从 2.35 爬到 3.64 tok/s靠的是OMP_NUM_THREADS24物理核数、CACHE_ROUTE133%路由一致性 99.1%和CUDA_EXPERT_GB188。没有任何单一参数让速度翻倍每一点增益都要在受控协议下单独验证。磁盘 I/O 与内存占用资源曲线到底长什么样先给出一组贯穿所有实验的基础数字GLM-5.2 的 int4 容器约 372 GB 在盘稠密部分注意力、共享专家、嵌入约 17B 参数以 int4 常驻内存约9.9 GB19,456 个路由专家75 层 × 256 MTP 头留在磁盘上按需流式加载。一个冷 token 需要读约11 GB 的专家权重——所以引擎的基准测试工具 c/iobench.c 用 19 MB 的块恰好是单个 int4 专家的尺寸来测盘实测的磁盘数字分布很广四卡 A6000 机器的两块 Gen3 NVMe4M 随机读 QD4 分别是 2619 MB/s 与 1521 MB/s每专家 7.0 ms 与 12.2 ms六卡 5090 机器在全驻留后解码期磁盘读取为 0 MB/sO_DIRECT的效果则完全看盘——项目文档记录在部分 Blackwell/Windows 机器上DIRECT1让解码 34%iobench 从 4.25 到 9.69 GB/s但 QLC/无 DRAM 缓存盘可能无收益甚至为负先测再决定是官方建议。内存占用曲线的两个特征值得单独强调。其一冷启动时磁盘 I/O 是主角预热后 compute 是主角四卡 A6000 机器在生成 64 token 时的PROF分布为专家矩阵乘 46.2%、注意力 26.2%、磁盘等待 13.3%、其他 14.3%profiling 页面的可视化展示了同样的逐阶段拆解。其二显存与内存不是越多越快同报告中把 RAMVRAM 推到最大176 GB RSS 188 GB VRAM反而从 1.53 掉到 1.41 tok/s在 M1 Max 的 Metal 数据点上更大的--ram一致地更慢也被明确记录。KV 缓存的膨胀是另一个隐藏成本——MLA 压缩态在 fp32 下每 token 179.7 KB262,144 上下文时高达 47.1 GB而同模型 llama.cpp 用 f16 KV 只要 0.098 MB/token约为 colibri0.316 MB/token的三分之一。宣传数字与实测结果的差距清单综合仓库实验日志与社区传播口径逐条对照如下社区/宣传说法仓库实测记录差距说明支持 Mixtral-8x7B 等前沿模型九个模型家族中无 Mixtral无对应 .c 引擎源码级核实为不实若真跑 8x7B 也无需磁盘流式约 25 GB 可全驻留25 GB 内存就能跑 744B 模型属实但冷启动仅 0.05–0.1 tok/s开发机约 1 GB/s 的 NVMe能跑是真的跑得动是另一回事官方自嘲为项目起点与诚实的基线5.8–6.8 tok/s仅在 6×RTX 5090 全驻留 核绑定布局达成同机部分驻留只有 0.12 tok/s速度由驻留决定宣传数字从不附上前提5.46 tok/s四卡 A6000同一配置在受控协议下复测为 2.78 tok/s差距来源是.coli_usage学习缓存特化过基准 prompt特化 profile 值约 ×2一旦历史被真实使用稀释即失效MTP 推测解码提升速度int4 MTP 头接受率 0–4%缺陷int8 头接受率 69–79%但全驻留下净收益 −5%四卡机上DRAFT3净损失 50%推测解码的收益取决于缓存温度与专家批并集宽度提升不是无条件成立双 SSD 提升带宽两块独立控制器的 NVMe 37.5%文件级拆分非块级条带只有 5.5%机制差异约 5% 对 37%共享控制器时可能零收益GPU 专家层更快9950X3D 机器上 AVX-512 CPU 与 RTX 5090 专家矩阵乘打平7900 XTX 的 HIP 专家层跑输 AVX2 CPUGPU 只在 CPU 是短板时才有价值且必须附正确性校验曾有后端同速但困惑度 727 的记录并发提升总吞吐连续批处理 1→8 会话4.84 → 8.30 tok/s饱和点约等于单流基线 8.90官方结论是尚未构成吞吐倍增器不得如此宣传这张清单背后有一条方法论主线colibri 明确声明对速度无 SLA对语义有硬保证见 README.md。项目要求每个实验必须端到端可复现基准协议规定固定TEMP0、固定 token 数、在每次配置切换前对.coli_usage做快照/恢复——因为这份学习型路由档案会随重启持续增长58,240 条 → 17,697,640 条记录会让两个看似相同的配置测出相差一倍的结果。任何拿社区数字做购买决策的人都应该先确认对方是否遵守了这套协议。对读者意味着什么如果你关心的是我能用这台机器跑什么磁盘决定冷启动速度的上限RAM 决定专家缓存容量24 GB 内存的机器自动把缓存压到每层 2 槽此时瓶颈是内存不是盘而引擎的逐层 LRU 学习型钉住热层会让同一台机器越用越快——但历史过拟合也会让基准 prompt 变成缓存的分布外样本。colibri 的工程价值在于把744B 模型跑在消费级硬件上从口号变成了带全套测量协议的事实它的代价也在同一批实测里写得明明白白从 0.05 tok/s 的 25 GB 地板到 6.84 tok/s 的六卡天花板中间每一步都需要磁盘、内存与 CPU 内核的配合。Mixtral-8x7B 的传言不必再信但 GLM-5.2 的实测记录值得读完——那才是这个项目真正拿得出手的东西。【免费下载链接】colibriRun frontier MoE models on hardware you already own — pure C, zero deps, experts streamed from disk. Tiny engine, immense model. 项目地址: https://gitcode.com/GitHub_Trending/colibri3/colibri创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考