【免费下载链接】turboquant_plus项目地址https://gitcode.com/gh_mirrors/tu/turboquant_plus点击查看免费下载本文基于 TurboQuant 仓库研究文档《Speculative Decoding on GDN Hybrid Architectures: A 31-Experiment Investigation》整理。核心主题是在不借助预训练草稿模型、外部训练基础设施的前提下能否让投机解码speculative decoding在 Qwen3.5/3.6 的 GatedDeltaNetGDN混合架构上动态生效。读者读完可掌握GDN 混合架构对投机解码的理论加速上限、31 组实验的经验教训含 28 组失败实验、Mamba 状态损坏问题的 tape-replay 回滚解法以及 z-lab DFlash 配方的逆向工程结论与四条可行前进路径。导读本指南完整记录了一次为期 5 天、共 31 组实验的系统性研究尝试在 Qwen3.5/3.6 GatedDeltaNetGDN混合架构上实现免预训练草稿模型、免外部训练、免用户复杂度的运行时动态投机解码。文章不仅给出了每条技术路线的验收数据还揭示了三个关键结论单隐藏状态条件化在 36% 接受率处触顶多层级目标特征可以打破该天花板GDN 循环状态带来的验证成本下限将理论加速限制在约 1.33x75% GDN 架构。同时给出了 Mamba 状态损坏问题的 tape-replay 回滚解法以及 z-lab DFlash 配方的完整逆向工程清单可作为在混合架构上研究投机解码的参考手册。1. 动机为什么要在 GDN 混合架构上做动态投机解码DFlashz-lab2026宣称通过 block diffusion 草稿机制实现6x 无损解码加速比 EAGLE-3 快 2.5 倍。但该技术的代价是每个目标模型都需要一个预训练的草稿模型约 500M-1B 参数从 HuggingFace 下载。本调查的目标是在不额外下载、不训练、不增加用户复杂度的前提下获得类似加速——这与 TurboQuant 的哲学一致开箱即用、适配任意模型的后训练优化见 README.md 中对该项目定位的描述Python 参考实现、验证论文与基准数据的研究之家。目标平台Apple SiliconM 系列运行 Qwen3.6-35B-A3B-4bit40 层30 层 GDN 10 层全注意力。2. 架构背景GDN 混合架构对投机解码的深层影响2.1 Qwen3.5/3.6 的混合架构Qwen3.5/3.6 交替两种层类型GatedDeltaNetGDN循环结构Mamba 风格。Conv1D 状态 gated delta 状态。存在顺序依赖每个 token 的状态依赖前一个 token 的状态。全注意力Full attention标准多头注意力 KV cache。可并行N 个 token 可以在一次 matmul 中完成验证。full_attention_interval4意味着注意力层位于第 3、7、11、15、19、23、27、31、35、39 层其余 30 层全部是 GDN。仓库内另一篇研究 layer-aware-v-compression.md 对这类混合架构的 KV 层分布有直接佐证Qwen3.5-35B MoE Q8_0 共 40 层、仅 10 个 KV 注意力层Qwen3.5-27B Dense 共 64 层、仅 16 个 KV 层每隔 4 层一个 KV attention的规律与本调查的 40 层/10 个注意力层结构完全一致。2.2 对投机解码的推论验证成本地板在多 token 验证multi-token verification期间注意力层占 25%并行。验证 N 个 token 的成本 ≈ 验证 1 个 token。GDN 层占 75%顺序。验证 N 个 token 的成本 N × 验证 1 个 token。总验证成本0.25 0.75 × N个单 token 等价单位。因此当 N→∞ 且接受率为 100% 时理论最大加速为$$\text{speedup}_\text{max} \frac{1}{0.25 0.75/N} \to 1.33\times$$对比纯注意力模型验证成本恒为 1与 N 无关最大加速为 N×。这一上限是架构性的不是算法性的——无论草稿质量多高都无法改变。重要更新2026-04-25pupposandro 与 davideciffa 在同一混合架构上使用树感知 GDN 内核ggml_ssm_conv_tree、ggml_gated_delta_net_tree_persist实现了 3.43-5.46x 加速——这些内核直接遍历 DDTree 结构穿过循环状态绕开了顺序瓶颈。本调查的 1.33x 上限分析假设 GDN 验证是顺序的树感知内核可能使这一约束失效。3. 完整实验日志31 组实验逐项复盘以下 8 个阶段完整覆盖了从层跳过自草稿到全尺寸 z-lab 配方复现的全部探索过程含所有失败实验的原始数据供后续研究参考。3.1 Phase 1层跳过自草稿实验 1-3假设用目标模型的前 K 层作为快速草稿器。同样的权重层数更少每 token 成本更低。实验 1无状态自草稿Stateless self-draft。每个草稿 token 只通过 K 层看到它自己的 embedding没有 KV cache 历史。草稿层数tok/s平均接受vs 基线10/40 (25%)1133.1/41.13x20/40 (50%)642.5/40.64x30/40 (75%)522.5/40.52x输出是乱码ofabah ofsworth...。接受纯靠运气——LM head 期望的是第 40 层的输出空间而不是第 10 层。实验 2缓存感知自草稿Cache-aware self-draft。给草稿器自己的 KV cache。草稿 token 通过 K 层看到完整上下文。退出层跳过的层数接受率成本节省39 (skip 1)171.8%1.8%38 (skip 2)234.9%~4%36 (skip 4)418.1%~8%32 (skip 8)83.4%~18%两个互补的悬崖接受率在 8 层内从 72% 崩塌到 3%LM head 读不懂中间层状态而跳过 1 层只节省 1.8% 算力。节省 × 接受的乘积从未超过 1.0。最佳理论情形exit39, N3, α0.72也只有 0.80x即 20% 减速。实验 3线性对齐器Linear aligner。从 prefill 隐藏状态拟合 W lstsq(h_K, h_40)。4M 参数约 100ms 拟合完成。校准结果skip-8 时提升 7.5x2.1% → 15.9%。但解码结果为全深度 0%。根因prefill/decode 分布漂移。prefill 期间所有位置双向注意力decode 期间每个位置只能通过 KV cache 看到左侧上下文。对齐器学到的映射在 decode 空间中根本不存在。3.2 Phase 2训练草稿头实验 4-6实验 4prefill 训练的 MLP。2M 参数 MLP在 prefill 的 (h_t, next_token) 对上训练。训练准确率 5 个 epoch 达 100%。解码接受率1%。与实验 3 相同的分布漂移。实验 5decode 路径 MLP小规模。在真实 decode 隐藏状态带 KV cache 的自回归生成上训练。2K 样本、1M 参数、10 epochs5-7% 接受率。优于 prefill 训练但太小。实验 6decode 路径 MLP全规模。100K decode 路径 token、59M 参数、100 epochs19,600 梯度步。训练耗时17 分钟数据收集 40 分钟训练。提示类型接受率哲学42.0%代码B-tree C38.0%科学核聚变32.7%创意法式洋葱汤33.3%分析民主 vs 威权35.3%总体36.3%扩展轨迹规模数据参数Epochs步数接受率Tiny2K1M10~405%Small10K17M20~40013%Medium50K17M20~2K15%Large20K59M15~60017%Full100K59M10019,60036%数据量和训练时长都重要。这就是单隐藏状态天花板仅用 h_t 条件化即使全规模也只有 ~36%。3.3 Phase 3端到端集成实验 7-8实验 7投机解码端到端Speculative decode E2E。版本方法速度输出v1无缓存修复1.68x乱码Mamba 损坏v2快照 重放已接受0.49xN/A重放太贵v3快照 恢复 刷新0.54x位置 2 处发散GDN 损坏问题部分拒绝时目标 Mamba 状态包含了被拒绝 token 的贡献。快照/恢复会丢失已接受 token 的贡献。重放每轮至少需要 2 次完整前向。实验 8独立草稿模型。21.5M 参数草稿自带 GDN 式循环层、独立 cache、与目标无关。结果仍然是乱码。问题出在验证期间目标侧的 Mamba而不是草稿的 cache。部分拒绝时目标 Mamba 被恢复 → 已接受 token 的贡献丢失 → KV/Mamba 不一致 → 退化。DFlash 能绕过这一点的数学85% 接受率下P(全部 8 个匹配) 27%这些轮次获得 9 token / 1 次前向的巨大收益。而 36% 接受率下P(全部 4 个匹配) 1.7%太罕见。block diffusion 的 85% 接受率对 GDN 投机解码的经济性而言是必需品不是可选项。3.4 Phase 4并行预测实验 9-10实验 9Medusa 并行头。8 个独立预测头共享一个主干每个头从 h_t 预测不同未来位置。46M 参数、20K 样本、30 epochs。各位置接受率2.3-4.7%。P(全部 N 匹配)N≥2 时为 0.0%。实验 10block diffusion自注意力无目标条件化。与 Medusa 相同但位置间使用双向自注意力。234.9M 参数、4 个 RefineBlock 层、3 步细化。20K token、30 epochs。各位置接受率0.8-2.8%。自注意力没有帮助。根因单一隐藏状态的预测彼此独立只有 2-5%。初始预测全错时位置间自注意力无法补救——用垃圾精炼垃圾只能得到垃圾。没有目标中间状态的条件化并行预测从根本上受限。3.5 Phase 5多层条件化实验 11-16实验 11多层特征Multi-layer features。从 7 个目标层 [0, 1, 10, 20, 30, 38, 39] 提取隐藏状态依据 TurboQuant 层敏感性研究发现做边界加权见下文第 6 节。对目标特征做交叉注意力 位置间自注意力。位置v2单 h_tv3多层DFlash参考t12.8%13.0%~88%t22.2%5.7%~88%t31-2%1-2%~88%多层特征在 t1 提供 5x 提升。信号随距离急剧衰减。方向正确但欠训练、规模不足。实验 12z-lab 架构匹配v4A。5 个目标条件化层、GQA 注意力、单遍。406M 参数、20K token。结果全位置 2-4%。欠训练。实验 13100K 数据规模v4B。同架构、100K token、cosine LR。结果3-4% 平线。在如此规模的架构下数据规模不是瓶颈。实验 14KL 蒸馏损失v4C。Top-64 logit 蒸馏T2。结果1-2%。更差。软损失稀释了梯度。模型需要尖锐的 token 级反馈而不是模糊的概率匹配。实验 15忠实复刻论文架构v5。匹配 DFlash 的真实架构KV 注入草稿 K/V 投影、指数位置加权γ4、anchor 采样每序列 512 个。结果全部 16 个位置 13-15% 平线。架构有效——每个位置都有平坦的接受率不只是 t1。但 15% 的位置接受率 ≠ 15% 的连续接受率P(4 连中 15%) 0.05%。实验 16v5 端到端速度测试。结果0% 连续接受、0.30x 有效速度。在此接受率水平下草稿成本完全是纯开销。3.6 Phase 6预训练草稿实验 17-18实验 17z-lab 3.5 草稿用在 3.6 目标上。67% 接受率、0.69x 慢 31%。草稿无法跨模型版本迁移。实验 18z-lab 3.6 草稿WIP2000 训练步。75% 接受率、0.92x 慢 8%。即便 z-lab 本人在测试时也尚未攻克 3.6。3.7 Phase 7训练干预实验 19-27实验 19计划采样Scheduled samplingv6。Teacher forcing 比率从 1.0 衰减到 0.3。结果2-4% 平线、0.03 连续。比 v5更差。训练中被迫条件化于自己的坏预测时模型变得过度保守。实验 20-24消融扫描。实验变更t1 接受vs v5 基线208 个草稿层更多容量2.3%更差过拟合218 个目标特征更多条件化2.7%更差过拟合228L 8F 组合2.7%更差2360 epochs更多训练2.5%饱和24多样测试提示1.6%最差过拟合风格在 20K 训练 token 下增加容量或特征反而更差过拟合。更多 epochs 饱和。瓶颈是训练数据规模和梯度步数不是架构。实验 25-27诊断。Top-k oracle正确 token 是否在 top-5/10 内、单批过拟合架构能否记忆 256 个 token、v5 的规模计划。实验 27 被实验 28 取代。3.8 Phase 8全规模复现实验 28-31实验 28-29完整 z-lab 配方。800K 目标生成 token114 tok/s 下收集 117 分钟。474M 参数草稿、6 epochs。Run 10.4% 接受率。掩码 bug——训练把所有 16 个 ground truth token 当作噪声输入喂入。草稿学会了复制输入而不是预测。Run 2掩码修复7.1% 接受率。健康的损失曲线27.0 → 0.11正在泛化但欠训练。实验 30MTP 层作为零训练草稿器。Qwen3.6-35B-A3B 自带内置 MTPmulti-token prediction层1 个完整 MoE transformer 层4-bit 下 475MB。spiritbuun 报告在 Qwen3.5 上无需训练即可获得 80% 接受率。但 mlx_lm 转换器会剥离 MTP 权重需要手动提取deep-copy 真实模型层构建前向。结果0%。前向 bug专家权重格式不匹配、缺少 chat template、RoPE 偏移处理错误MTP 注意力需要目标的 KV cache 偏移而不是新 cache。状态因前向 bug 搁置。MTP 覆盖约 20-30% 的主流模型Qwen、DeepSeek。对这些模型而言零训练 80% 接受率是投机解码中最划算的方案。实验 31bstnxbt 模型类 全规模。使用 bstnxbt 真实的DFlashDraftModel类gated Q 注意力。474M 参数、800K token、12 epochs、12,624 梯度步。损失29.3 → 0.008每 epoch 干净减半。接受率0.6%。比 v513-15%更差。根因模式坍缩到边际分布。草稿对每个提示都预测 a thinking process :——这是 Qwen3.6 最常见的思考前缀。在 134K 样本下预测常见 token 比学习特征到 token 的映射损失更低。架构验证20 样本过拟合测试 → 98% 准确率。从 z-lab 权重微调 → 50 步内 100%。架构是有效的。规模训练动态导致模式坍缩。z-lab 用完整序列上下文Flex Attention、持久草稿 cache 累积解决此问题本调查的单位置特征提供的条件化信号不足。4. Tape-Replay 回滚解决 Mamba 状态损坏对 bstnxbt/dflash-mlx 的分析揭示了实验 7-8 中 Mamba 损坏问题的解法tape-replay 回滚。投机验证期间为每个 GDN 时间步记录一条创新磁带innovation tapetape[t]创新增量 δ——形状 [B, T, Hv, Dv]tape_k[t]键——形状 [B, T, Hk, Dk]tape_g[t]衰减门——[B, T, Hv] 或 [B, T, Hv, Dk]tape_qkv[t]用于 conv 状态的原始 embedding部分接受接受前 n 个 / N 个时恢复快照到验证前状态仅重放已接受的步state state * g[t] k[t] * tape[t]t 0..n-1conv 状态从 qkv 磁带最后 (conv_kernel_size - 1) 个 token 重建成本O(n_accepted)而非 O(context_length)。每个 Mamba 层一次 Metal 内核分发。本调查尝试过两个极端忽略状态 → 损坏完全重放 → 太贵。tape-replay 是中间路线记录所需的最少信息δ、k、g通过廉价的循环内核只重放已接受的步。5. z-lab 配方逆向工程依据z-lab/Qwen3.5-35B-A3B-DFlash的 config.json 与 dflash.py参数值草稿参数~500M8 层、2048 隐藏、GQA 32Q/4KV目标层5 层[1, 10, 19, 28, 37]均匀Block 大小每周期 16 个 token训练数据~800K 样本目标生成优化器AdamWlr6e-4cosine0.04 warmupEpochs6~300K 梯度步损失指数衰减 CEw_k exp(-(k-1)/γ)γ7与目标共享Embedding LM head冻结草稿注意力Block 内双向无因果掩码KV 注入目标特征投影进草稿 K/V与草稿自身 K/V 拼接与本调查实验的关键差异500M 参数vs 本调查的 438K-59M。是真正的小型 transformer不是一个头。目标生成的训练数据。消除分布漂移实验 4 的致命点。~300K 梯度步vs 本调查的 ~1K-20K。优化量多 15-300 倍。6. 与 TurboQuant 既有研究的交叉引用以下来自 KV cache 与权重压缩研究的发现可迁移到投机解码K V 决定预测质量asymmetric-kv-compression.mdK 通过 softmax 的指数放大决定注意力路由。草稿模型应优先保证 K 空间的保真度。这正是实验中多层特征条件化里 KV 注入优先于纯 logit 匹配实验 14 的教训的底层原因。边界层承载不成比例的信息layer-aware-v-compression.md首尾 2 层敏感性高 37-91%。多层条件化应过采样边界层——实验 11 的 7 层特征集 [0, 1, 10, 20, 30, 38, 39] 正是边界加权设计并在 t1 取得 5x 提升。更简单 更复杂turbo4-resurrection.md移除 QJL 修正提升了 turbo4 质量。更多细化步数未必更好。32K 下 90% 注意力稀疏sparse-v-dequant.md长上下文中草稿模型的任务更容易。block diffusion 应比自回归草稿扩展性更好。误差放大因模型家族而异weight-compression-tq4.mdLlama 传播量化误差比 Qwen 激进 6-8 倍。草稿准确率会因模型家族而不同。7. 汇总结果表实验架构条件化接受率状态1无状态自草稿无0%已死2缓存感知自草稿自有 cache3-72%已死成本悬崖3线性对齐器lstsq(h_K, h_40)decode 0%已死分布漂移4Prefill MLPh_t (prefill)1%已死分布漂移5Decode MLP2Kh_t (decode)5-7%太小6Decode MLP100Kh_t (decode, 扩展)36%单 h_t 天花板7投机解码 E2Eh_t cache 管理N/A已死Mamba 损坏8独立 GDN 草稿自有循环模型N/A已死目标 Mamba9Medusa 并行h_t, 独立2-5%已死无位置间10Block diffusion v2h_t, 自注意力2-3%已死信号不足11多层 v37 个目标层t1 13%方向正确12z-lab 架构 v4A5 层, GQA2-4%欠训练13100K 数据 v4B5 层, 100K3-4%数据非瓶颈14KL 蒸馏 v4CTop-64 logit, T21-2%更差梯度稀释15忠实论文 v5KV 注入 指数权重13-15% 平线架构有效16v5 E2E 速度同草稿0% 连续15% 下不可行17z-lab 3.5→3.6预训练草稿67%不可迁移18z-lab 3.6WIP预训练草稿75%0.92x仍慢19计划采样v5 teacher 衰减2-4%更差保守20-24消融扫描多种1.6-2.7%全更差过拟合25-27诊断——规划中28z-lab 配方损坏474M, 800K, 全 GT0.4%掩码 bug29z-lab 配方修复474M, 掩码噪声7.1%泛化中30MTP 层内置, 零训练0%前向 bug31bstnxbt 类474M, 800K, 12 ep0.6%模式坍缩8. 可行路径结论MTP 方案对内置 MTP 层的 Qwen/DeepSeek 模型零训练。已报告 80% 接受率。需要实现正确的 RoPE 偏移处理的 MTP 前向。微调 z-lab 草稿从预训练权重出发适配 Config-I 量化或新模型版本。训练量远少于从零开始。树感知 GDN 内核pupposandro davideciffa 的ggml_ssm_conv_tree与ggml_gated_delta_net_tree_persist已证明用 DDTree 验证在 GDN 混合架构上可达 3.43-5.46x。移植到 Metal 将打破顺序验证天花板。纯注意力模型的小型草稿50M 参数收敛快 10 倍。纯注意力模型Llama、GPT、Phi没有 GDN 天花板——即使 36% 接受率也能得到 1.6x。9. 关键经验总结纵观 31 组实验可沉淀为五条对混合架构投机解码研究具有普遍参考价值的原则验证路径决定上限GDN 的顺序验证成本是架构性的硬约束1.33x 理论极限除非引入树感知内核或完全避免顺序路径。任何草稿质量改进都改变不了这条数学。单隐藏状态条件化有天花板~36% 是 h_t-only 条件化的极限无论模型规模与训练时长。突破必须依赖多层目标特征实验 11、15 证明方向正确。训练动力学比架构更难模式坍缩实验 31、过拟合实验 20-24、分布漂移实验 3-4都不是架构 bug而是数据规模与梯度步数不足或不当的产物。z-lab 的 300K 梯度步是本调查 1K-20K 的 15-300 倍。状态管理决定工程可行性tape-replay 回滚记录 δ/k/g、只重放已接受步是快照/恢复与完全重放之间的正确平衡点。免训练方案的窗口真实存在内置 MTP 层Qwen/DeepSeek 约 20-30% 模型覆盖率以零训练成本提供 80% 接受率是目前最务实的起点。10. 参考文献DFlash 论文与 z-lab 预训练草稿、dflash-mlx 实现、DDTree 相关外部资料详见原文档 dflash-self-draft-investigation.md 第 9 节外部链接不在此展开。仓库内可继续深入的相关研究asymmetric-kv-compression.md、layer-aware-v-compression.md、turbo4-resurrection.md、sparse-v-dequant.md、weight-compression-tq4.md。项目背景与架构总览README.md混合架构 KV 层分布佐证layer-aware-v-compression.md 的 Addendum Part 3。赞分享【免费下载链接】turboquant_plus项目地址https://gitcode.com/gh_mirrors/tu/turboquant_plus点击查看免费下载相关推荐DSpark 草稿模型训练指南基于 DFlash 骨干与 Markov 头的半自回归投机解码Model-OptimizerDSpark 草稿模型训练指南基于 DFlash 骨干与 Markov 头的半自回归投机解码Model Optimizer 本文是 NVIDIA Mode人工智能大模型模型优化模型量化模型压缩MAX 统一 DFlash 投机解码架构深度解析Gemma4 31B 目标模型与块级草稿模型的融合图实现MAX 统一 DFlash 投机解码架构深度解析Gemma4 31B 目标模型与块级草稿模型的融合图实现 本篇技术指南围绕 MAX 仓库中的 max.pipe人工智能大模型编程语言编译器标准库算子库模型推理服务模型量化Model-Optimizer 投机解码草稿模型训练实战指南EAGLE3 / DFlash / DSpark / Domino 流水线配置、排障与验收Model Optimizer 投机解码草稿模型训练实战指南EAGLE3 / DFlash / DSpark / Domino 流水线配置、排障与验收 投机解人工智能大模型模型优化模型量化模型压缩上一篇C读取传感器数据并用OpenGL绘制实时曲线ndk-samples sensor-graph完整实战教程下一篇如何用百度网盘API解决Python自动化文件管理难题创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考