RedKnot如何给注意力头分门别类?70–90%算力节省背后的Head分类策略详解
RedKnot如何给注意力头分门别类70–90%算力节省背后的Head分类策略详解【免费下载链接】RedKnotEfficient Long-Context LLM Serving with Head-Aware KV Reuse and SegPagedAttention项目地址: https://gitcode.com/gh_mirrors/re/RedKnotRedKnot是一款面向长文本场景的 LLM 推理加速框架Head-aware KV Reuse SegPagedAttention构建于 SGLang 之上。它的核心思路非常直白把模型里成千上万个注意力头分门别类让不同性格的头走不同的注意力路径从而在质量回退不超过 1 个百分点的前提下实现 2–5× 的 TTFT 加速和70–90% 的算力账本节省。本文带你读懂这套 Head 分类策略的原理、信号来源和实际配置。为什么长上下文推理这么贵大模型处理长上下文比如 RAG 里一次塞入几十万个 token时Prefill 阶段的注意力计算量随序列长度平方级增长。传统优化多是一刀切要么整体重算要么整体复用。但 RedKnot 的观察是不同的注意力头对复用历史前缀的态度截然不同。有的头对前缀极其敏感前缀一变输出就变必须在线重算有的头天然只看最近的窗口 开头的注意力汇attention sink前缀怎么复用都几乎不受影响可以放心复用。把这个性格摸清就能只把算力的刀刃用在真正需要的头上。四类头型local / global / retrieval / denseRedKnot 中每个(层, KV头)组合都会被分配四种策略之一定义位于 head_config.py头型注意力范围复杂度角色定位global全量前缀 KVO(L²)前缀敏感头必须在线重算local开头 sink 最近滑窗O(L·W)可复用头离线预制 KVretrieval全量 KV 但只保留 top-p 重要 token稀疏PTR 式检索头️dense全量 KV RoPE 重对齐O(L²)首/尾若干层的安全网其中两个默认参数值得记住滑窗默认window512注意力汇默认sink4即每层每头都会保留开头 4 个 token防止注意力塌陷。dense类型是个保险丝RedKnot 会把前几层强制设为 densedense_prefix_layers保留早期的细粒度信号再让中间的层大胆省。分类的两大信号前缀敏感度 边缘质量那么性格怎么测离线分析器 head_profiler.py 用一个小规模校准语料给每个头打两个分数前缀敏感度prefix sensitivity把同一段文本放到不同前缀后面 vs. 放在开头头的注意力输出变化有多大变化大 → 全局头几乎不变 → 局部头。边缘质量edge-mass该头的注意力有多少比例落在最近窗口 sink之外落在远处 token 上的比例越高说明它是长程依赖的全局头。判定规则刻意保守两个信号任一超标就标为 global。因为把全局头误判成局部头会伤输出质量而把局部头误判成全局头只是少省一点算力——质量优先于速度这正是 RedKnot 敢把质量回退压在 1 个百分点以内的底气。分析结果会固化为一份Head Policy JSON存放在 test/srt/redknot/head_class/ 目录包含kv_head_classification每个头的类型矩阵kv_head_max_distance每个头的滑窗大小非 local 头为 -1kv_head_sink_size/global_head_ids/local_head_idsdense_prefix_layers等安全参数由于头型是模型固有属性论文 §3.2只需离线分析一次线上所有请求零开销复用。真实案例DeepSeek V4 Flash 的冻结头策略看一下 DeepSeek V4 Flash 发布版冻结的配置 deepseek_v4_flash_0731_redknot.jsonMLA 共 64 个头每层 8 个 global 头编号 0、8、16、24……56均匀分布在 64 个头中每层 56 个 local 头滑窗 128 tokensink 4 token第 0–2 层与第 40–42 层整层 dense前 3 层由dense_prefix_layers3强制保护也就是说42 层中的 37 个中间层里约 87.5% 的头走了 O(L·W) 的廉价路径这正是70–90% 算力账本节省的直接来源节省 ≈ 可复用局部头占比 × 上下文长度放大效应 56/64 的 head × 长上下文的 O(L²) → O(L·W) 降维⚠️ 注意该算力账本有意排除了访存、kernel 启动和 TP 通信开销衡量的是注意力计算本身的账目而非整机能耗。窗口还会自适应离线配置里写死的窗口只是起点。HeadClassConfig.set_local_window()支持按请求上下文长度动态缩放例如window ctx_len // 2长请求自动放大局部视野兼顾精度与速度。头分类如何落到执行SegPagedAttention分类只是图纸真正的执行靠SegPagedAttentionKV 页和可见性按头 段两个维度组织global、local、retrieval 头各自消费不同范围的上下文而不必挤在同一种统一的 cache 布局里。相关实现位于 segpaged.py 与 python/sglang/srt/layers/attention/redknot/。这套头级节省还会与另外两条机制叠加稀疏 FFNtoken 级重要性决定哪些行进入昂贵的 FFN 计算sweep_sparse_ffn.py自适应 Expert Top-KMoE 路由器分布需要时才多分配专家快速上手验证头分类策略想亲眼看看效果仓库内置了多个模型族的基准入口cd test/srt/redknot # DeepSeek V4 Flash 冻结套件64K/128K/256K/440K ./run_deepseek_v4_flash_reproduction.sh # 其它模型 python benchmark_RedKnot_Qwen3_RAG.py python benchmark_RedKnot_Mistral_RAG.py 不同模型族的基准不要直接互相比数字——输入、精度与测量协议不同。完整协议见 test/srt/redknot/README_DEEPSEEK_V4_FLASH.md共享 KV 后端说明见 head_kv README。关键文件导航 文件说明head_config.py四类头型定义与 HeadClassConfig 加载/校验head_profiler.py离线头分析前缀敏感度 边缘质量 → Head Class Maptest/srt/redknot/head_class/各模型冻结的头策略 JSON 发布物segpaged.py按头/段组织的 KV 分页注意力执行test/srt/redknot/基准入口、发布脚本与数据集总结RedKnot 的 Head 分类策略可以浓缩为一句话用离线一次性分析摸清每个注意力头的性格global / local / retrieval / dense让 85% 的局部头走廉价滑窗路径只把在线重算留给真正前缀敏感的少数全局头再用首尾 dense 层兜底质量。这就是它不靠投机、不靠近似精度就能在长上下文 RAG 场景中拿下 2–5× TTFT 加速与 70–90% 算力节省的完整逻辑。✨【免费下载链接】RedKnotEfficient Long-Context LLM Serving with Head-Aware KV Reuse and SegPagedAttention项目地址: https://gitcode.com/gh_mirrors/re/RedKnot创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

圣禾堂在线是什么?电子元器件采购平台入门指南

圣禾堂在线是什么?电子元器件采购平台入门指南

一句话答案:圣禾堂在线是一家总部位于深圳的电子元器件采购平台,2011年成立,专注分立器件、主控芯片、被动器件、连接器、国产器件五大品类,提供现货供应、BOM配单、国产替代、品质检测一站式服务。一、它和普通的电子元器件商城有…

2026/9/30 16:52:41 阅读更多 →
【计算机毕业设计】基于Springboot的“智慧食堂”设计与实现+LW

【计算机毕业设计】基于Springboot的“智慧食堂”设计与实现+LW

博主介绍:✌全网粉丝3W,csdn特邀作者、CSDN新星计划导师、Java领域优质创作者,掘金/华为云/阿里云/InfoQ等平台优质作者、专注于Java技术领域和学生毕业项目实战,高校老师/讲师/同行前辈交流✌ 技术范围:SpringBoot、Vue、SSM、HLMT、Jsp、PHP、Nodejs、…

2026/9/30 16:50:37 阅读更多 →
重磅收官!中钰沐森高值浴室柜 2027 品牌战略暨新品发布会成功举办

重磅收官!中钰沐森高值浴室柜 2027 品牌战略暨新品发布会成功举办

秋风送爽,聚力启新。9月27日—28日,"利刃秋闱,放榜市场"中钰沐森高值浴室柜2027年品牌战略暨新品发布会隆重召开,来自全国各地的中钰沐森经销商家人、行业商会领导、供应链伙伴、行业实战专家齐聚一堂,围绕行…

2026/10/1 19:03:36 阅读更多 →

最新新闻

显存不够?先测量再决策:LLM训练优化实战

显存不够?先测量再决策:LLM训练优化实战

做 LLM 训练调优这几年,我最大的感觉是:很多人一碰到显存不足就急着改代码、调参数,甚至直接换大卡,却很少有人先做一件事——把显存占用“测”清楚。这篇是“大模型显存优化篇”的 task3,核心就两个字:测量…

2026/10/1 19:43:18 阅读更多 →
从零开始落地AI工程:数据、实验、部署与监控全链路指南

从零开始落地AI工程:数据、实验、部署与监控全链路指南

"ai-engineering"这个词现在热度很高,但你要是去问十个自称做AI工程的人"你具体在做什么",大概率能收获十种完全不同的答案。有人觉得是调API、套LangChain,有人觉得是训模型、调超参,还有人觉得是写推理代码…

2026/10/1 19:43:18 阅读更多 →
AI工程实战:从Prompt到RAG与Agent的完整落地路径

AI工程实战:从Prompt到RAG与Agent的完整落地路径

在AI圈子里泡了几年,我越来越觉得一个残酷的事实:会调API的人和会做AI工程的人,完全是两种物种。前者是“用户”,后者是“构建者”。标题里的ai-engineering-from-scratch,说的就是从零开始、不依赖现成框架、亲手把AI…

2026/10/1 19:43:18 阅读更多 →
马德拉岛与马德拉酒:火山海岛、加强酒工艺与旅行全攻略

马德拉岛与马德拉酒:火山海岛、加强酒工艺与旅行全攻略

第一次听到“Madeira”,大多数人脑子里会同时冒出好几样东西:地图上那个葡萄牙小岛、酒瓶上印着“Madeira”的加强酒、西餐厅菜单里的马德拉酱汁。我在真正踏上这座岛之前,也只把它当成一个模糊的地名。直到在丰沙尔待了一周,我才…

2026/10/1 19:43:18 阅读更多 →
Model-Optimizer实战:量化、剪枝与蒸馏,让模型又快又小

Model-Optimizer实战:量化、剪枝与蒸馏,让模型又快又小

前阵子一个做工业质检的朋友跟我诉苦:缺陷检测模型在实验室跑mAP有96.4%,一上到现场那台老工控机,单张推理要900多毫秒,流水线早就停在那儿等它了。这类问题我太熟了——训练阶段大家比的是精度,部署阶段拼的是时延和体…

2026/10/1 19:43:18 阅读更多 →
EasyExcel导出合计行的正确实现方案

EasyExcel导出合计行的正确实现方案

1. 为什么“合计行”是 EasyExcel 导出中最容易被低估的硬伤你有没有遇到过这样的场景:业务方发来一份 Excel 模板,最后一行写着“合计”,字体加粗、背景色浅灰、数字右对齐,还带千分位分隔符;你吭哧吭哧用 EasyExcel …

2026/10/1 19:42:18 阅读更多 →

日新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/1 0:00:30 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/1 0:00:30 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/1 1:01:17 阅读更多 →

周新闻

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解 【免费下载链接】spirula-studio Cross-vendor 3D Gaussian Splatting trainer - video to splat to mesh, Vulkan or CUDA. 项目地址: https://gitcode.com/GitHub_Trending/sp/spirula-studio Sp…

2026/10/1 19:40:48 阅读更多 →
SEO怎么推广速查手册新手避坑实战指南

SEO怎么推广速查手册新手避坑实战指南

SEO怎么推广速查手册新手避坑实战指南 模板网站太丑不够用?别急着加滤镜,那是治标不治本。很多老板盯着后台流量掉得眼红,却还在纠结首页Banner的圆角是不是3像素。这就像穿着西装去挖土,姿势不对,努力白费。我整理这份 速查手册…

2026/10/1 19:41:40 阅读更多 →
FireRed-OpenStoryline少样本仿写深度解析:AI Agent如何复刻你的独特文案风格与节奏

FireRed-OpenStoryline少样本仿写深度解析:AI Agent如何复刻你的独特文案风格与节奏

FireRed-OpenStoryline少样本仿写深度解析:AI Agent如何复刻你的独特文案风格与节奏 【免费下载链接】FireRed-OpenStoryline FireRed-OpenStoryline is an AI video editing agent that transforms manual editing into intention-driven directing through natural language …

2026/9/30 13:14:49 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/1 0:00:30 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/1 0:00:30 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/1 1:01:17 阅读更多 →