最近很火的Bonsai 2 27B 在8G显卡上真的能跑,也没有想象的那么笨
Bonsai 2 27B 实测8G显卡真跑起来了附厂商没有的速度数据这几天这个模型到处都是27B 的模型压到 5.9 GB厂商说保留了 98.2% 的能力RTX 5090 上跑到 143 tok/s。两天下载量 40 万。我一开始是被一个词搞住的。有人说它是三进制有人说是三值量化我看了半天没搞清这俩是不是一回事。后来查明白了正确的说法是三值网上写三进制的是 ternary 一词多义串台了数学里的 ternary 指三进制记数法苏联 Setun 那种LLM 里的 ternary 指权重只能取三个值。两边都用到 -1、0、1 这三个符号所以混了。然后我注意到一个更实际的问题厂商那张速度表里一张 8GB 显卡都没有。5090、RTX 6000 Ada、4090、L40S、H100、A100、L4、M5 Max、M5 Pro都是 24GB 起步的卡和苹果新芯片。而本地玩家手里占大头的恰恰是 3070、3060 这批 8G、12G 的老卡。所以我把 5.9 GB 的那个版本下下来塞进了我的 RTX 3070 8GB。一、Bonsai 2 27B 到底做了什么事简单说就三步拿阿里的 Qwen3.8-27B27.36B 参数原本 FP16 要占 54 GB 左右当底子架构一行没改。把每个权重从浮点数改成三个值之一-1、0、1。再给每 128 个权重配一个 FP16 的缩放系数把数值大小找回来。打包成 GGUF落盘 5.95 GB。那个1.72 bit是这么来的这笔账大部分稿子没算给你看三个状态的信息量 log2(3) 1.585 bit 每128个权重分摊1个 FP16缩放系数 16÷128 0.125 bit 1.710 bit 不到 0.1% 的张量必须留高精度循环状态、归一化层 1.72 bit实测均值出两个打包文件装的是同一份权重只是打包方式不同文件位宽大小说明PTQ1_01.75 bit/权重5.95 GBtrits 紧密打包省地方PQ2_02.13 bit/权重7.21 GB每个权重占 2-bit 槽解包省事多数新卡上更快8GB 卡其实没得选。只有 5.95 GB 那个塞得进去。顺带说清一件事它跟微软的 BitNet 不是一条路。BitNet 是从头训练时就按三值约束去训代价高Bonsai 2 是拿已经训好的Qwen3.8-27B 做事后三值化本质是后处理。有稿子写它从头训练那个说法不对。许可 Apache 2.0能商用。二、我的 RTX 3070 8G把它跑起来了先说结论跑起来了而且不用把层卸载到内存64 层全在显卡上。机器配置RTX 3070 8GB / R9-7900 / 64GB DDR5 5200。启动命令这行可以直接抄llama-server.exe -m ”D:\AI_Models\Ternary-Bonsai-2-27B-PTQ1_0.gguf” -ngl 99 -fa on -c 16384 --parallel 1 --cache-type-k q8_0 --cache-type-v q8_0 --host 0.0.0.0 --port 8080几个参数的白话版-ngl 99所有层都丢给显卡算别让 CPU 掺和-c 16384上下文给 16K--parallel 18G 卡的保命参数。默认开 4 个槽会多占好几个 G直接爆--cache-type-k/v q8_0上下文缓存用 8 位存省显存-fa on闪存注意力省显存⚠️ 一个前提必须换 llama.cpp。厂商原版跑不了这个文件得用 PrismML 自己的分支我这个版本是 build 10709。原因后面那期细说这里先记一句用原版跑7.21 GB 那个文件会被拒绝加载5.95 GB 那个会静默加载然后吐乱码。后者更坑因为它不报错。显存实测占用约 6 GB。8G 卡还剩两个 G。三、38 tok/s放在厂商那张表里是什么位置这是这次重点想补的数据。稳态生成速度38 tok/s。具体几次跑下来是 38.14 到 38.56长任务随着上下文变长会掉到 3436。把它放进厂商那条刻度尺里都用 PTQ1_0 打包、都是生成速度显卡生成速度来源RTX 5090120.5 tok/s厂商RTX 409091.1 tok/s厂商H100 SXM86.9 tok/s厂商A100 SXM54.7 tok/s厂商我的 RTX 3070 8G38.x tok/s本次实测L472W 亮机卡32.1 tok/s厂商RTX 3060 12G约 30 tok/s第三方实测看出来什么大约是 4090 的 42%比同为 812G 档的 RTX 3060 12G 快约 27%位置卡在 A10054.7和 L432.1之间⚠️ 关于口径厂商宣传里常见的5090 上 143 tok/s和上表的 120.5 tok/s是两套测法不是数据打架。上表统一用 llama-bench 口径128 token 生成、深度 0、batch 1、PTQ1_0 打包我这边也是同一套口径所以能直接比。跨口径比速度是很容易翻车的地方这也是我把厂商表里那列数字重列一遍的原因。还有一个数但我得把它说准读 prompt 的速度波动很大从 29 到 264 tok/s 都有。原因出在这儿读得快不快读得快不快跟这次有多少内容能命中上一轮的缓存复用直接相关。我这几次里长 prompt132371 token能跑到176264 tok/s短 prompt1653 token算出来只有 2978 tok/s真因是固定开销被摊到几个 token 上把平均值拉下来了。所以结论只有一句让它读长文档是不痛苦的痛苦的是等它一个字一个字往外吐。顺带辟一个直觉三值模型不吃模型越小越快那套估算。厂商数据里5090 上 5.95 GB 的权重按显存带宽本该跑到 300 tok/s实测只有 120因为瓶颈是解包三值权重所需的计算指令不是搬运数据的速度。你要是拿体积除以带宽去估它会高估一倍。四、为什么 5.9GB 的模型显存只占 6GB这条是这篇重点想讲清楚的事也是它能塞进 8G 卡的真正原因。5.9 GB 是硬盘上的文件大小不是它运行时要的显存。正常的模型权重之外还要给上下文缓存留地方就是模型记住你前面说过什么的那块内存它会随着你聊得越长而越长。厂商数据这个模型开满 262K 上下文f16 缓存要22.9 GB。我的 8G 卡开 16K 只用 6 GB多出来的那一丁点是哪来的靠的是它的架构混合注意力。64 层里大约 75% 是线性注意力层只有约 25% 是全注意力层。人话版大部分层用的是一种不用记住每一个历史 token的算法几乎不吃上下文缓存真正吃缓存的只有那十几层。所以上下文涨到 16K缓存也没涨多少。这就是为什么同样是 27B别的模型在 8G 卡上连门都进不去它能进去。但也要说清楚代价厂商标的 262K 上下文在 8G 卡上是纯纸面数字。我这边 16K 是稳的q8_0 缓存再往上要换更小的缓存类型速度也要打折。想跑满 262K你还是需要一张大卡。五、它真能干活写作和数学都过了跑分是跑分我用自己会碰到的活试了两项。写作。我让它以文学系大学生的水平写一篇 800 字的异乡人思念陕南秋天。出来的东西我贴一段陕南的秋天不是落下来的是沉下来的。汉江上的雾先起来一层一层像谁在江面上拉了一张白桌布。然后山里的叶子才慢慢变色不是北方那种一刀就红到发烈的样子是绿的、黄的、褐的混在一起像一桌没吃完的菜。我奶奶家的院墙在晒柿子。一排一排挂上去红得像一嘴一嘴的皮上带着薄薄一层霜。……我那时大概十三四岁每天放学回来看那墙柿子哪颗最软就掰哪颗。不急着咬先拿指甲在皮上刮一下汁水顺着指缝流出来甜酸有点涩。就像你站在河边水在你脚边流过你认得出那是汉江的水——但够不着。这个水平我给过。有具体的感官细节不堆形容词收得住。当然那句“红的像一嘴一嘴的”实在是没崩住。数学。一道带矛盾条件的四色花园题对角守恒 相邻差值 ≤7 总数 100 已知红色 28它一步步推答案正确验证也完整。这两项加起来能说明一件事日常会碰到的活这个 6GB 的 27B 扛得住。六、一道让它跑了 8 分钟、一个字都没写的题然后我给了它一道代码题。题目是这样的写个 Python 函数找出列表里出现次数为奇数的元素要求不能用额外数据结构、时间 O(n)、空间 O(1)然后回答这些要求能不能同时满足如果不能就证明为什么。结果数字生成了16210 个 token花了469.7 秒7 分 50 秒结束方式撞到 16K 上限被硬截断正式答案零那个输出文件我看了59K 字符几乎都是思考过程思考块结束标记后面是空的。它连一个字的正式答案都没开始写。思考收尾时硬断在半句话上。有个细节特别有意思它在思考的前 200 个 token 就把答案想出来了原话大意是返回所有和返回任意一个这两句要求互相矛盾应该指出这一点。然后它没停自己给自己开了个更难的子问题如果只要求返回任意一个O(n) 加 O(1) 到底可不可能一路钻到向量空间、位运算、算法验证直到把自己绕进去、撞在上下文上限上。这里我要替它说一句公道话这不代表它 coding 不行。厂商数据里它的编码是强项HumanEval 95.12比满血版的 93.29 还高。问题出在这道题的性质上它要的是证明这个要求本身能不能成立没有天然的收敛点得靠模型自己判断我想够了。而它恰恰缺这个判断。所以更准确的分类是封闭题有明确答案的数学 ✅、写作 ✅开放/陷阱题要自己判断何时收手的❌ 陷进去了为什么以及怎么治我放到下一期因为解法我找到了而且是一行参数的事。七、现在能下的结论先把这期能定的部分定下来8G 卡真能跑而且不用卸载到内存全 64 层上显卡稳态 38 tok/s显存占约 6 GB。能塞进去靠的是混合注意力约 75% 层不吃上下文缓存不是靠三值本身省显存。三值省的是硬盘空间和每个 token 的计算量。日常活扛得住我试的写作和数学都过关写作那篇质量是真的好。262K 上下文在 8G 卡上是纸面参数16K 是稳的。更大的隐藏成本落在工具链上。你得换掉正在用的 llama.cpp。三值这条路我觉得是真有东西的它跟常规 2-bit 不一样的地方在于常规量化是尺子刻度变粗还能读数三值是把尺子换成三个档位的开关。厂商数据里常规 2-bit 在 AIME26 上从 94.58 塌到 57.50它在同一题上是 95.83这就是那条低比特会选择性崩塌的路线它绕过去了。当然98.2% 是厂商自己的数第三方还没复现完长程任务那部分还另有一笔账。下期说两件事那道跑满 8 分钟的题我用一行参数让它 4 分钟交了卷以及这个方案本身有哪些还没解决的问题。本文数据均来自本人机器实测速度对照中的厂商数字引自 PrismML 模型卡llama-bench128 token 生成深度 0batch 1第三方数字引自公开实测。更新相关实测可以关注同名GZH获取。

相关新闻

社交App拉黑界面开发实战:从数据模型到状态同步的完整指南

社交App拉黑界面开发实战:从数据模型到状态同步的完整指南

最近刚把App里的拉黑界面这一整块做完,从需求评审到UI还原再到接口联调、自测上线,踩了不少坑,也沉淀出一些值得记录的细节。很多团队在排期时会把"拉黑"当做一个普通列表页来估时,实际上它牵扯到的交互状态、数据同步和…

2026/9/24 23:10:04 阅读更多 →
彻底搞懂CIDR:从子网划分到路由聚合的实战指南

彻底搞懂CIDR:从子网划分到路由聚合的实战指南

1. 为什么要聊CIDR:从一次真实的上网困境说起说实话,网络技术里CIDR这个概念,教科书上翻来覆去就那几页,但真正把它用明白的人不多。我最早接触CIDR是在做IDC机房网络规划的时候,当时公司拿到一个/22的地址段&#xff…

2026/9/24 23:10:04 阅读更多 →
Modbus TCP以太网温湿度变送器选型与调试实战指南

Modbus TCP以太网温湿度变送器选型与调试实战指南

机房动环监控里,温湿度变送器算得上是最基础也最刚需的一类传感器。尤其是现在的中小型机房、IDC托管区、配电室、弱电井,都在推Modbus TCP以太网接口的温湿度变送器——原因很简单:新机房基本都布了网线,POE交换机也常见&#xf…

2026/9/24 23:10:04 阅读更多 →

最新新闻

基于SSM的停车场停车缴费管理系统开发实战解析

基于SSM的停车场停车缴费管理系统开发实战解析

写论文、搞课程设计、应付毕设答辩的时候,很多同学一听到“Java项目源码”第一反应就是去下载一个成品然后改个名字交上去。但说句实话,作为一个这些年看过无数份毕业设计代码的老开发,停车缴费管理系统这个题目属于“看着简单、做起来全是细…

2026/9/24 23:55:38 阅读更多 →
从标定到视差:Python+OpenCV双目视觉测距全流程详解

从标定到视差:Python+OpenCV双目视觉测距全流程详解

简介:一套基于PythonOpenCV实现的双目立体视觉实战资源,聚焦维视MV-VS220平台,完整覆盖相机标定、图像预处理、SIFT/SURF特征提取与匹配、视差计算与深度测距流程,适合高校学生、课程设计者及OpenCV开发者参考。包体共213个文件&a…

2026/9/24 23:55:38 阅读更多 →
AI Agent无人值守实战:定时任务的可靠性设计与效果验证

AI Agent无人值守实战:定时任务的可靠性设计与效果验证

做无人值守 Agent 有个很有意思的分水岭:开发环境里跑通一次,和让它每天凌晨自动跑完还能自己处理异常,完全是两码事。我最近把一个定时自动化任务从“人盯着跑”改造成“无人值守”,中间踩的坑比我预想的多一整个量级。这篇文章不…

2026/9/24 23:55:38 阅读更多 →
Java SSM儿童教育在线学习系统PTC管理设计与实现解析

Java SSM儿童教育在线学习系统PTC管理设计与实现解析

java_ssm19儿童教育在线学习系统PTC管理系统的设计与实现_idea项目源码这两年陆陆续续帮人看过不少课程设计和毕业设计的SSM项目,说实话,儿童教育类在线学习系统算是一个很典型的选题方向。最近正好又有人在问这套java_ssm19的源码,我就借着拆…

2026/9/24 23:55:38 阅读更多 →
SSM员工考勤管理系统设计与实现详解:从零搭建到功能扩展

SSM员工考勤管理系统设计与实现详解:从零搭建到功能扩展

作为一个在Java开发这条路上摸爬滚打了好几年的人,我太清楚SSM员工考勤管理系统这类项目在大家学习生涯中的分量了。基本上每个学Java的、做课程设计的、准备毕业设计的,都会遇到这个“员工考勤管理系统”,它几乎成了SSM框架入门和综合运用的…

2026/9/24 23:55:37 阅读更多 →
MCP实战:一行配置接入GitHub工具,让AI直接操作代码仓库

MCP实战:一行配置接入GitHub工具,让AI直接操作代码仓库

MCP 这阵子在开发圈里算是彻底火了。不管是 Claude Desktop、Codex、Trae 这些 AI 客户端,还是各种自研的编辑器插件,都在往 MCP(Model Context Protocol,模型上下文协议)上靠。我自己的体验是,真正把一个 …

2026/9/24 23:54:37 阅读更多 →

日新闻

基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程

基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程

简介:这是一套面向计算机、人工智能、自动化等专业学生与教师的毕业设计级项目资源,围绕YOLOv8实现渔船作业监控系统,可用于毕设、课程设计、大作业或项目立项演示。压缩包共97个文件,约24.21MB,以70个Python源码文件为…

2026/9/24 0:00:19 阅读更多 →
单细胞注释实战:基于Scanpy的标记基因与参考映射流程解析

单细胞注释实战:基于Scanpy的标记基因与参考映射流程解析

简介:一份基于单细胞RNA测序数据的细胞类型注释算法研究Python毕业设计源码,针对计算机相关专业正在做毕设或需要项目实战的学习者,可用于课程设计与期末大作业。项目代码完整、经导师指导评审通过,可直接运行,覆盖数据…

2026/9/24 0:00:19 阅读更多 →
C#源生成器实战:用增量生成器替代反射,告别AOT崩溃

C#源生成器实战:用增量生成器替代反射,告别AOT崩溃

第一次在项目里被反射卡住,是在一个老旧的WinForms模块里:几十个类依赖PropertyChanged通知,运行时反射读属性、发通知,每次启动慢半拍不说,一上.NET Native/AOT裁剪模式几乎全面崩盘。后来我把这段逻辑全部改成C#源生…

2026/9/24 0:00:19 阅读更多 →

周新闻

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

直接铺开项目本身吧。这几个月我一直在折腾一件事:用Flutter给OpenHarmony做一款游戏集合类的App,说白了就是把若干小游戏塞进一个壳里,用统一入口分发。这个方向本身不算新鲜,真正让我花了不少心思的,是首页那堆游戏卡…

2026/9/24 14:34:13 阅读更多 →
Word表格编号全攻略:从列表编号到题注交叉引用

Word表格编号全攻略:从列表编号到题注交叉引用

写Word文档,最让人头疼的往往是那些“看起来不起眼”的小问题。比如表格编号这事:今天在表后面多加了两个空白行,明天给客户交稿前发现整个章节的编号全部错位,光是挨个改序号就能耗掉大半个下午。我前阵子帮人整理一份上百页的技…

2026/9/24 9:10:42 阅读更多 →
从第一个站到第二个站:独立开发者的静态网站选型与落地实践

从第一个站到第二个站:独立开发者的静态网站选型与落地实践

1. 项目概述1.1 核心需求解析做独立开发者这几年,说实话,第一个网站上线的那天晚上我兴奋得没睡着。但等它跑了半年,流量惨淡、功能臃肿、代码自己都懒得看第二遍之后,我才慢慢琢磨明白一个道理:第一个网站是练手&…

2026/9/24 14:33:56 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/24 12:50:34 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/24 14:33:48 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/24 12:49:17 阅读更多 →