247、【AI】【模型部署】基座模型研究:RoPE 用在前向还是反向——训练、推理与 KV cache
【声明】本博客所有内容均为个人业余时间创作所述技术案例均来自公开开源项目如GithubApache基金会不涉及任何企业机密或未公开技术如有侵权请联系删除标题247、【AI】【模型部署】基座模型研究RoPE 用在前向还是反向——训练、推理与 KV cache背景上篇 blog【AI】【模型部署】基座模型研究RoPE 的维度与频率——32 对、多频率与 rope_theta把频率讲透了第i ii对的角速度是inv_freq [ i ] 1 / θ 2 i / d \text{inv\_freq}[i]1/\theta^{2i/d}inv_freq[i]1/θ2i/dhead_dim64得到 32 个频率它们按几何级数排开、低维转得快近处、高维转得慢远处波长2 π θ 2 i / d 2\pi\,\theta^{2i/d}2πθ2i/d随i ii指数增长最慢的波长决定能分辨多远rope_theta越大波长越长、量程越宽Qwen2 取10 6 10^6106是为长上下文还提到 partial rotary 与位置 0 的 cos 全是 1。到这里RoPE 的数学245点积只依赖n − m n-mn−m和频率设计24632 对、多尺度都清楚了。本篇从数学转到工程回答一个很实际的问题旋转到底发生在哪个阶段——前向还是反向训练还是推理它和243篇的 KV cache 又是怎么配合的模型部署先给结论旋转只发生在每一层注意力的前向里训练和推理都做而且它没有任何可训练参数。这四个关键词——前向、训练、推理、无参数——每个都值得展开尤其是和 KV cache 的配合因为那正是243篇留下的接口。理解了这一篇227篇里那些apply_rotary_pos_emb的调用时机、以及为什么缓存的是旋转后的 K就都串起来了。旋转发生在前向RoPE 不是训练前预处理也不是训练后补丁而是每一层注意力前向计算的一部分拿到q , k q,kq,k之后、算q ⋅ k q\cdot kq⋅k之前按位置把它们旋转一下。计算图上是这样一条链图 1 上半部分是前向q , k q,kq,k先乘上R ( m θ ) R(m\theta)R(mθ)完成旋转再送入注意力、算出损失。没有位置参数、没有查表、没有预处理开关——旋转就是一次固定的乘加藏在注意力里面。它有没有可训练参数没有。245篇的旋转角由位置和频率算出来频率又是inv_freq 1/θ^{2i/d}这条公式现算的在实现里作为 buffer 存在不是nn.Parametercos/sin 也可以预先算好缓存。所以优化器不会、也不该去学习旋转角反向传播里没有RoPE 的权重梯度这一项训练前后RoPE 的这部分计算完全不变——它是固定的几何操作不是学出来的层。这一点常被误解成RoPE 是某种可学习的位置嵌入。不是它是公式驱动的旋转参数只有配置层面的rope_theta超参数不参与梯度更新。反向传播时发生什么虽然 RoPE 没有参数但它是可微的梯度会穿过它。旋转是线性正交变换它的转置就是反向旋转如果前向是乘R ( m θ ) R(m\theta)R(mθ)那么反向回传的梯度就乘R ( m θ ) ⊤ R ( − m θ ) R(m\theta)^\topR(-m\theta)R(mθ)⊤R(−mθ)。回到图 1 的下半部分前向按位置把q , k q,kq,k转过去反向只是把梯度按同样角度反向转回来继续传给前面的层。因为旋转保长度245 245245篇这一步既不会放大也不会缩小梯度非常干净。所以RoPE 用在反向这个说法要修正反向里发生的是梯度的反向旋转不是位置编码本身被更新。训练整段并行训练时序列是完整已知的位置编号就是0 , 1 , … , L − 1 0,1,\dots,L-10,1,…,L−1。注意力对所有位置并行计算RoPE 也一次性把整段的q , k q,kq,k都旋转好——每个位置用它自己的角。这和在序列上逐个处理在数学上等价只是训练可以并行、效率更高。图 2 左边画的就是训练以及推理里的 prefill所有位置一起处理位置编号从 0 排到L − 1 L-1L−1。推理prefill 与 decode推理分成两段243篇讲过prefill一次并行处理 prompt 的全部位置编号0 00到L − 1 L-1L−1decode之后逐个生成 token。RoPE 在两段都做区别只是位置编号prefill和训练一样一次性旋转整段decode每生成一个 token就用它在整段里的位置编号等于已经有多少个 token旋转这个新 token 的q , k q,kq,k。图 2 右边是 decode位置编号继续L , L 1 , L 2 , … L, L1, L2,\dotsL,L1,L2,…递增。关键是无论训练还是推理同一个位置永远用同一个角度、同一个公式——这一点后面会再强调。和 KV cache 怎么配合这是本篇的核心。243篇说 KV cache 缓存的是k , v k,vk,v那么缓存里的k kk到底是旋转前还是旋转后的答案是旋转后的。原因藏在相对位置里。设缓存里第n nn个位置的键已经旋转成R ( n θ ) k R(n\theta)kR(nθ)k当前新 token 在位置t tt它的查询旋转成R ( t θ ) q R(t\theta)qR(tθ)q。两者做点积( R ( t θ ) q ) ⊤ ( R ( n θ ) k ) q ⊤ R ( ( t − n ) θ ) k \big(R(t\theta)q\big)^\top\big(R(n\theta)k\big)q^\top R\big((t-n)\theta\big)k(R(tθ)q)⊤(R(nθ)k)q⊤R((t−n)θ)k只有( t − n ) (t-n)(t−n)正是想要的相对距离。如果缓存里存的是没旋转的原始k kk那每生成一步就得把缓存里所有历史K KK各自按它们的位置重新旋转一遍——缓存的意义就没了。存旋转后的 K才能做到新查询转一次、旧键直接拿来用。图 3 画了这个流程新 token 的k kk旋转后用当前位置追加进缓存它的q qq也旋转后去和缓存里全部已旋转的 K做点积。V VV不参与旋转245篇讲过原因原样缓存。243那句缓存k / v k/vk/v补全起来是缓存旋转后的k kk、未旋转的v vv。一次 decode 的完整数据流把上面几步串成一个 decode 步的清单就非常清楚了新 tokenx t x_txt​进入这一层投影出q t , k t , v t q_t,k_t,v_tqt​,kt​,vt​用位置编号t tt把q t , k t q_t,k_tqt​,kt​旋转v t v_tvt​不动把旋转后的k t k_tkt​和原样的v t v_tvt​追加进缓存q t q_tqt​与缓存里全部K KK做点积、softmax、对全部V VV加权求和得到输出。第 4、5 步就是243篇的缓存流程而本篇补上了缓存前先旋转、V VV不旋转这两个细节。每一层都重复这套动作位置编号在各层之间是一致的。训练与推理必须一致由此能推出一个实践上很重要的规则训练用的旋转方式推理时必须一模一样。具体来说位置编号要对齐训练0.. L − 1 0..L-10..L−1推理也从0 00开始连续递增不跳号、不重置频率、rope_theta、配对方式、要旋转的维度训练和推理必须相同不能在推理时把旋转关掉。一旦关掉模型看到的是没有位置的q , k q,kq,k与训练分布严重不符输出会明显退化。常见的坑也来自这里列几个错误做法后果推理时关闭旋转模型看不到位置输出严重退化缓存里存未旋转的 K只转新q qq新旧键不在同一坐标相对偏移错乱把已旋转的 K 再转一次位置角翻倍点积含义被破坏位置编号每步从 0 重来相对偏移整体错位长文本尤其明显训练与推理的rope_theta/维度不一致频率对不上等于换了套位置编码推理位置远超训练长度落入未见过的角度区间效果下降外推问题见#249/#250这些错误的共同点都是破坏了同一个位置用同一个角度这条约定。只要训练和推理严格共用同一套旋转参数与编号规则RoPE 就不会出问题。这套设计换来了什么回到最初的三个问题可以给出一个统一的回答前向还是反向——旋转本身在前向反向只是把梯度反向旋转一次、继续回传没有 RoPE 权重更新训练还是推理——两者都做且必须一致和 KV cache 的关系——缓存旋转后的 K、未旋转的 V使新查询一次旋转 旧键直接复用成为可能。好处也很清楚无参数不占权重、不增加训练变量、相对位置点积只依赖n − m n-mn−m、和缓存天然兼容旋转后的 K 可以直接存。这三条合起来就是 RoPE 成为主流位置编码的工程原因。三个常见疑问“缓存的 K 是旋转前还是后”后。这是为了让新查询旋转一次就能和历史键直接点积、自动得到相对距离存旋转前的 K 会逼着每步重算违背缓存初衷。“推理时新 token 的位置编号取多少”取它前面已有多少个 token。prompt 有L LL个 token那第一个生成 token 的位置是L LL依此类推。“RoPE 有参数是不是也算训练的一部分”它参与前向和反向的计算但没有可训练参数——rope_theta、频率都是配置或公式优化器不更新它们。训练到底改的还是W q , W k , W v W_q,W_k,W_vWq​,Wk​,Wv​这些投影权重。一句话记忆RoPE 只发生在每层注意力的前向里训练和推理都做它没有可训练参数反向传播只是把梯度反向旋转乘R ⊤ R^\topR⊤后继续回传。训练整段并行、位置0.. L − 1 0..L-10..L−1推理按 prefill并行 decode逐 token给位置编号。和243的 KV cache 配合的关键是缓存里存的是旋转后的 K、未旋转的 V这样新查询转一次就能和历史键点积、自动得到相对偏移( t − n ) (t-n)(t−n)。训练与推理的旋转方式必须严格一致推理时不能关闭旋转。下一篇换一个方向不旋转还有哪些位置编码方案各自适合什么场景。OK本篇先到这里如有疑问欢迎评论区留言讨论祝各位功力大涨技术更上一层楼更多内容见下篇 blog

相关新闻

MATLAB调试实战:报错定位、断点使用与性能优化技巧

MATLAB调试实战:报错定位、断点使用与性能优化技巧

MATLAB跑着跑着突然甩出一段红色报错,绝大多数人的第一反应是:哪一行出问题了?我处理过很多不同类型的数据处理项目,一个很明显的现象是——大家把报错当作“敌人”,恨不得立刻消灭它,却很少有人愿意先花一…

2026/10/12 4:46:50 阅读更多 →
手机生产厂家口碑评估:绕开榜单,用公开信息交叉验证

手机生产厂家口碑评估:绕开榜单,用公开信息交叉验证

每年到了新的产业周期,我都会收到一两张类似的榜单截图。标题通常是“2026年某制造业重镇某头部手机品牌生产厂家TOP5”,配一个看似专业的排序和几句像模像样的评语。来问的人都想知道同一件事:这里面,到底哪家最值得信任&#xf…

2026/10/12 4:46:50 阅读更多 →
CSS核心机制:层叠裁决、包含块与渲染管线

CSS核心机制:层叠裁决、包含块与渲染管线

这个系列写到第五篇,前面把盒模型、选择器和 Flex/Grid 这些高频知识点都踩过一遍了。今天这篇我打算换一个角度,不往前进新特性,而是把浏览器从拿到一个元素到最终画出它,这条链路上的几个核心机制完整拆开:层叠裁决、…

2026/10/12 4:46:50 阅读更多 →

最新新闻

第 15 章 政务/制造业落地案例:用 TaoToken 统一 Key 跑通 DeepSeek-V3 信创推理链路

第 15 章 政务/制造业落地案例:用 TaoToken 统一 Key 跑通 DeepSeek-V3 信创推理链路

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/12 5:36:17 阅读更多 →
YOLO训练指针式仪表数据集 仪表仪器数据集 目标检测和语义分割模型 指针式仪表分割数据集

YOLO训练指针式仪表数据集 仪表仪器数据集 目标检测和语义分割模型 指针式仪表分割数据集

使用深度学习框架(如PyTorch/YOLO)训练指针式仪表的目标检测和语义分割模型,并建立推理代码及可视化界面,训练指针式仪表数据集 检测和分割数据集 文章目录使用深度学习框架(如PyTorch/YOLO)训练指针式仪表…

2026/10/12 5:36:17 阅读更多 →
Vibe Coding 从概念到生产:AI 辅助开发工作流的重构

Vibe Coding 从概念到生产:AI 辅助开发工作流的重构

Vibe Coding 从概念到生产:AI 辅助开发工作流的重构 先划条线:什么才算 Vibe Coding Vibe Coding 不是"用 AI 写代码"的同义词。这个词由 Andrej Karpathy 在 2025 年 2 月提出,最初描述的工作流是:开发者基本不再思考代…

2026/10/12 5:36:17 阅读更多 →
显存账本与量化部署:vLLM 生产环境的实战调优

显存账本与量化部署:vLLM 生产环境的实战调优

显存账本与量化部署:vLLM 生产环境的实战调优 一个反直觉的事实:推理的瓶颈不在算力,而在显存带宽 把一个大模型部署上线、稳定服务并发请求,难度远超多数人的预期。训练阶段大家盯着算力,推理阶段真正卡脖子的却是显存…

2026/10/12 5:36:17 阅读更多 →
1240 诸侯安置【洛谷算法习题】

1240 诸侯安置【洛谷算法习题】

P1240 诸侯安置 网页链接 1240 诸侯安置 题目描述 很久以前,有一个强大的帝国,它的国土成正方形状,如图所示。 这个国家有若干诸侯。由于这些诸侯都曾立下赫赫战功,国王准备给他们每人一块封地(正方形中的一格&am…

2026/10/12 5:36:17 阅读更多 →
Recursive Language Models 实战:递归处理超长外部文本

Recursive Language Models 实战:递归处理超长外部文本

把二十万行日志、几百份会议纪要或一整套代码仓库塞进大模型,然后问一句“找出所有相互矛盾的变更”,通常会同时撞上三个问题:输入可能超过上下文窗口;即使能够装下,模型也未必能稳定利用位于中段的信息;一…

2026/10/12 5:35:17 阅读更多 →

日新闻

复古胶片颗粒感噪点合成器:Canvas ImageData 像素高斯杂色注入算法

复古胶片颗粒感噪点合成器:Canvas ImageData 像素高斯杂色注入算法

在数码相机、高清显示屏与现代矢量图形技术高度发达的今天,画面可以做到绝对的锐利、平滑与无瑕。然而,当一张秋日手账插画或拍立得照片过于“平整无瑕”时,往往会散发出一种冰冷生硬的“数码塑料感(Digital Plasticity&#xff0…

2026/10/12 0:00:59 阅读更多 →
活字印刷古籍线装排版:Canvas 竖排文字与栏线自适应算法

活字印刷古籍线装排版:Canvas 竖排文字与栏线自适应算法

在现代网页与移动端设计中,横排(Horizontal Layout)早已经成为了绝对的主流。然而,当我们翻开泛黄的线装古籍、宋版木刻诗集,或是欣赏一张茶道雅集的手写便签时,那种**自上而下纵向书写、自右向左逐列铺展&…

2026/10/12 0:00:59 阅读更多 →
周日晚间的“精神松绑减震器”:无压力情绪倾倒箱与温和轻声陪伴

周日晚间的“精神松绑减震器”:无压力情绪倾倒箱与温和轻声陪伴

每到周日的晚上八点到十点,很多人心里都会悄悄亮起一盏警示灯。 在心理学上,这种现象有一个专门的称谓——“周日夜晚焦虑症(Sunday Scaries)”。明天又是周一,闹钟又要重新在七点响彻卧房;脑海里仿佛有一个…

2026/10/12 0:00:59 阅读更多 →

周新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/12 0:16:30 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/12 0:16:38 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/12 0:16:43 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 10:45:37 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 14:36:53 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 14:36:54 阅读更多 →