语言模型刚刷屏文生图也来了Bonsai Image 曝光PrismML 在下一盘端侧全家桶大棋【免费下载链接】Ternary-Bonsai-2-27B-mlx-2bit项目地址: https://ai.gitcode.com/hf_mirrors/prism-ml/Ternary-Bonsai-2-27B-mlx-2bit从 7 月 Bonsai 27B 被冠以手机 AI 的 DeepSeek 时刻刷屏到 9 月 Bonsai 2 27B 以不到 1/9 内存占用保留基模 98.2% 性能再度占领科技头条PrismML 的低比特路线已经连续制造了两轮热点。而就在这波语言模型热度尚未平息之际社区情报中又出现了文生图模型 Bonsai Image的曝光信号。当能说会道的端侧语言模型开始向看图、作画延展PrismML 所押注的显然不止是一个 27B 的聊天模型——本文结合社区真实舆情与本仓库Ternary-Bonsai-2-27B-mlx-2bit的源码细节拆解这条端侧全家桶的产品逻辑与技术支撑。Bonsai Image 是什么从 27B 语言模型到文生图的延展先厘清时间线。2026 年 7 月PrismML 基于 Qwen 3.6 27B 微调的 Bonsai 27B 发布推出 1-bit3.9GB、约 1.125 bits/weight与 Ternary5.9GB、约 1.71 bits/weight两个版本首次让 27B 级模型在 12GB 内存的 iPhone 17 Pro 上原生运行AnythingLLM 创始人因此给出了AI 的真正 DeepSeek 时刻的评价。9 月Bonsai 2 27B 接棒基模升级为 Qwen3.8 27B推理、编程、视觉、长程智能体能力全面刷新以约 5.9GB 的体积不足基模 54GB FP16 的 1/9取得基模 98.2% 的综合基准分数。本仓库正是该模型的 MLX 打包版本8.60GB 磁盘占用7.67GB 打包语言权重 0.92GB 视觉塔27.36B 总参数Apache 2.0 开放。紧接着社区出现了文生图模型 Bonsai Image的曝光信息。虽然目前公开细节有限但从 PrismML 已有的技术资产看这一步并不突兀——本仓库的 config.json 中components.vision: true明确声明这是一个携带视觉塔的多模态包0.46B 参数、27 层、patch size 16、输出对齐 5120 维语言隐藏层的官方 Qwen 视觉塔以 FP16 原样未量化随包分发。配套的 runtime/vision_artifact.py 提供了完整的 VLM 加载链路构建 Qwen3VL 处理器、将 402 个已打包模块安装进语言模型、处理|im_start|图像 token 与多模态 chat 模板。也就是说看图理解图像输入在 Bonsai 2 27B 上已经是开箱即用的能力——README 中 MMMU-Pro 75.49、OCR Bench v2 56.88 的视觉基准成绩即是证据。从读图到生图是一个自然的模态延展方向但技术上并非同一件事。语言模型的低比特方法论三值权重 FP16 分组缩放 Hadamard 旋转基可以直接迁移到扩散或自回归图像生成模型的骨干上端侧文生图恰恰被公认卡在两条约束上一是生成模型权重与 KV/中间激活的带宽压力远高于纯文本推理二是图像生成对长程一致性、细节保真度的要求让低比特压缩的容错空间更小。PrismML 在此前 1-bit/三值路线上的核心卖点——训练阶段即约束低比特格式、无高精度逃生通道见 README.md 与 hadamard.json 的 manifest 声明——如果能在图像生成模型上复现Bonsai Image 就具备与语言模型同源的差异化故事。反之如果只是对开源文生图模型做事后量化则难以与已有方案拉开代差。这是观察其后续发布时最值得盯住的判断点。PrismML 端侧全家桶的产品布局猜想把社区情报与仓库证据放在一起PrismML 的产品版图已经相当清晰且每一块都能在本仓库找到落点第一层语言智能底座。从 Bonsai-8B-GGUF1.15GB、Q1_0 格式、93% 存储压缩到 Bonsai 27B 的 1-bit/三值双版本再到 Bonsai 2 27B产品线覆盖了从 8B 到 27B、从手机到笔记本到单 GPU 服务器的完整档位。本仓库的 README.md 给出了这一层的核心指标语言模型 1.72 bits/weight 的真实表示成本理想化约 9.3 倍 vs FP16、262K 上下文、混合注意力骨干约 75% 线性注意力 25% 全注意力见 config.json 的layer_types与full_attention_interval: 4以及跨平台吞吐——RTX 5090 上 PQ2_0 解码 129.9 tok/s72W 的 L4 上约 30 tok/sApple M5 Pro 上约 28 tok/s 且 GPU 轨功耗仅 27.5W。第二层多模态感知。视觉塔随语言模型同包分发是仓库里最明确的信号——config.json 的components: {text: true, vision: true, mtp: false}与 runtime/vision_artifact.py 的完整 VLM 运行时共同构成语言 视觉双能力包。而高通携手 PrismML 发布 1-bit Bonsai AI、主打 AI 眼镜离线识图问答的报道说明这层能力已被芯片厂商当作端侧落地场景来合作。MIT 科技评论把 8B 模型塞进 iPhone、功耗省掉 80%、苹果被曝接洽 PrismML 评估在 iPhone 上直接运行更大规模模型等消息则从产业链侧印证了该技术路线的吸引力。第三层内容生成Bonsai Image 的信号。从语言到视觉理解再到图像生成正是端侧 AI 全家桶的最后一环本地既懂文本、能读图还能按需作画。Bonsai Image 的曝光与 PrismML 已披露的视觉资产0.92GB FP16 视觉塔、mlx-vlm 运行时、多模态 chat 模板形成了技术拼图的互补关系——先解决理解再攻生成符合端侧芯片功耗、内存预算的渐进释放节奏。支撑这套布局的还有工程生态层本仓库同时提供 MLXApple Silicon、含 iOS/macOS 的 Swift 分支与 CUDA 后端GGUF 伴生包提供 PTQ1_05.95GB、密集三值编码与 PQ2_07.21GB、2-bit 槽位两种打包runtime/codec.py 实现了两种 GGUF 格式到 MLX affine 2-bit 的无损转码reload-validation.json 记录 402 个打包模块的逐位验证quickstart.py 一行命令即可跑通文本与视觉推理。社区侧Bonsai-demo 的增量下载、Docker GPU 部署、Brave Search MCP 集成等教程密集涌现说明围绕该模型已形成实际可用的部署生态而不仅是发布会上的 PPT 指标。端侧多模态会成为下一轮竞争焦点吗把视角拉远端侧 AI 的叙事正在经历一次范式的显式化。36Kr 在报道中使用的措辞颇具代表性——AI 进化从规模转向智能密度。本仓库 README.md 恰好定义并量化了这个指标D -log2(1 - score/100) / size_GBBonsai 2 27B 达到 0.469 1/GB是传统 2-bit 构建IQ2_XXS0.199的 2.3 倍以上是 FP16 基模0.053的近 9 倍。当每 GB 能换来多少可用智能成为度量衡多模态恰恰是拉大密度差距的杠杆同一份内存预算里能看能画的模型比纯文本模型边际价值更高这正是 Bonsai Image 出现的逻辑土壤。但端侧多模态要真正成为下一轮竞争焦点仍需跨过几道现实门槛。其一低比特在生成任务上的质量拐点语言模型上 98.2% 的保留率不等于图像生成上同样乐观——图像对高频细节、全局一致性的敏感度更高README.md 中视觉类别MMMU-Pro 66.19 vs FP16 71.36已是全类别中差距最大的一项生成任务只会更苛刻。其二端侧带宽与功耗的现实约束文生图的前向计算量远超文本推理即便权重被压到 1.72 bits/weight自回归扩散的步数叠加仍会考验 NPU/GPU 的峰值吞吐社区对 Bonsai 1-bit 版的实测也提示了 tool calling 等 Agent 能力在极端量化下的下降数个百分点生成类能力大概率面临同样的选择性退化。其三生态纵深llama.cpp、MLX 的定制内核目前围绕语言推理优化图像生成需要新的算子与内存规划这是从能跑到好用的工程鸿沟。结论上端侧多模态几乎是确定的方向——隐私、离线、低延迟的诉求在手机、眼镜、车载等场景同样指向看与画而 PrismML 的差异化不在模态本身而在低比特方法论能否泛化到生成模型这个关键假设上。Bonsai Image 若真能兑现训练期约束 无逃生通道的三值/1-bit 图像生成端侧全家桶将从产品叙事变成技术事实若只是跟随式量化则大概率停留在又一个端侧生图 demo的层级。无论结果如何从 Bonsai 27B 到 Bonsai 2 27B 再到 Bonsai ImagePrismML 已经用连续三轮的节奏证明了一件事这场竞争的主战场正从云端参数量竞赛转向端侧每 GB 智能密度的贴身肉搏。【免费下载链接】Ternary-Bonsai-2-27B-mlx-2bit项目地址: https://ai.gitcode.com/hf_mirrors/prism-ml/Ternary-Bonsai-2-27B-mlx-2bit创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考