小红书 算法一面 七
encoder中的self-attention和decoder中的self-attention有什么区别Transformer 编码器Encoder的**多头自注意力Multi-Head Self-Attention**与解码器Decoder的**掩码多头自注意力Masked Multi-Head Self-Attention**核心差异源于两者的任务目标不同**Encoder 负责“理解输入序列的全局语义”需双向关注所有 tokenDecoder 负责“生成连贯的输出序列”需单向关注已生成的 token防止泄露未来信息**。两者的本质区别集中在**注意力掩码机制**并由此衍生出注意力范围、输入特性、作用目标等一系列差异。## 一、核心定义回顾先明确 Transformer 中两类自注意力的定位1. **Encoder 自注意力**是 Encoder 块的第一个子层输入为 **Encoder 自身的词嵌入位置编码**作用是捕捉输入序列的全局依赖关系。2. **Decoder 自注意力**是 Decoder 块的第一个子层输入为 **Decoder 自身的词嵌入位置编码**作用是捕捉已生成输出序列的上下文依赖关系Decoder 块还有第二个注意力层Encoder-Decoder Attention这是跨注意力而非自注意力需注意区分。## 二、关键区别对比| 对比维度 | **Encoder 多头自注意力** | **Decoder 掩码多头自注意力** ||----------|--------------------------|-------------------------------|| **注意力范围** | **双向Bidirectional**任意 token 可以关注序列中**所有位置**的 token | **单向Unidirectional/Causal**第 $t$ 个 token 只能关注**第 1~t 个** token无法关注 $t1$ 及以后的 token || **掩码类型** | 无掩码或仅 padding mask仅屏蔽 padding 填充的无效 token | **因果掩码Causal Mask padding mask**br1. 因果掩码强制 token 只能看前文防止“未来信息泄露”br2. padding mask屏蔽输出序列的 padding token || **输入特性** | 输入序列是**固定长度的完整序列**训练和推理时均为并行输入 | 训练时输入是完整的目标序列并行计算推理时是**逐token增量生成**从 bos 到 eos || **核心作用** | 建模输入序列的**全局语义关联**例如在翻译任务中理解“我爱中国”中“我”“爱”“中国”的依存关系 | 建模输出序列的**上下文连贯性**例如在翻译任务中生成“ I love China”时生成“love”需依赖前文的“I”生成“China”需依赖“I love” || **适用任务** | 自然语言理解NLU如文本分类、命名实体识别、语义理解 | 自然语言生成NLG如机器翻译、文本摘要、对话生成 || **注意力分数计算** | $Attention(Q,K,V) \text{softmax}\left(\frac{QK^T}{\sqrt{d_k}} M_{\text{pad}}\right)V$br$M_{\text{pad}}$ 仅屏蔽 padding 位置 | $Attention(Q,K,V) \text{softmax}\left(\frac{QK^T}{\sqrt{d_k}} M_{\text{causal}} M_{\text{pad}}\right)V$br$M_{\text{causal}}$ 是下三角掩码上三角元素设为 $-\infty$ |## 三、核心差异的根源因果掩码机制两类自注意力的本质区别是**是否引入因果掩码**我们通过具体原理和实现来理解### 3.1 因果掩码的作用原理在 Decoder 中生成任务要求“**根据前文生成下一个 token**”如果允许 token 关注未来的 token模型就会“作弊”比如生成第 3 个 token 时已经看到了第 5 个 token导致推理时无法正常生成序列。因果掩码是一个 **下三角矩阵**对角线及下方为 0上方为 $-\infty$假设序列长度为 4掩码矩阵 $M_{\text{causal}}$ 如下$$M_{\text{causal}} \begin{bmatrix}0 -\infty -\infty -\infty \\0 0 -\infty -\infty \\0 0 0 -\infty \\0 0 0 0\end{bmatrix}$$将该掩码加到注意力分数矩阵 $QK^T/\sqrt{d_k}$ 上后上三角区域的分数会变成 $-\infty$经过 softmax 后权重为 **0**从而强制 token 只能关注前文。### 3.2 实现层面的差异PyTorch 示例我们通过代码片段直观展示两者的掩码差异pythonimport torchimport torch.nn.functional as F# 模拟 Q, K, V[batch_size, n_heads, seq_len, d_k]batch_size, n_heads, seq_len, d_k 2, 8, 4, 64q k v torch.randn(batch_size, n_heads, seq_len, d_k)# -------------------------- Encoder 自注意力仅 padding mask --------------------------# 假设 padding_mask[batch_size, 1, 1, seq_len]1 表示有效 token0 表示 paddingpadding_mask torch.tensor([[[[1,1,0,0]]], [[[1,1,1,0]]]]) # batch 1 的 seq 3-4 是 paddingbatch 2 的 seq4 是 paddingpadding_mask (1 - padding_mask) * -10000.0 # padding 位置设为 -1e4# 计算注意力分数无因果掩码attn_scores_encoder torch.matmul(q, k.transpose(-2, -1)) / torch.sqrt(torch.tensor(d_k, dtypetorch.float32))attn_scores_encoder padding_mask # 仅加 padding maskattn_weights_encoder F.softmax(attn_scores_encoder, dim-1)# -------------------------- Decoder 自注意力因果掩码 padding mask --------------------------# 1. 生成因果掩码[1, 1, seq_len, seq_len]causal_mask torch.tril(torch.ones(1, 1, seq_len, seq_len))causal_mask (1 - causal_mask) * -10000.0 # 上三角设为 -1e4# 2. 叠加因果掩码和 padding maskattn_scores_decoder torch.matmul(q, k.transpose(-2, -1)) / torch.sqrt(torch.tensor(d_k, dtypetorch.float32))attn_scores_decoder causal_mask padding_mask # 加两种掩码attn_weights_decoder F.softmax(attn_scores_decoder, dim-1)print(Encoder 注意力权重形状:, attn_weights_encoder.shape) # [2,8,4,4]print(Decoder 注意力权重上三角是否为 0:, (attn_weights_decoder[0,0,:,:].triu(diagonal1) 0).all()) # True## 四、补充Decoder 的 Encoder-Decoder Attention需要特别注意Decoder 块包含**两个注意力层**容易混淆1. **掩码自注意力**输入是 Decoder 自身的序列目标序列作用是建模目标序列的内部依赖。2. **Encoder-Decoder Attention**输入的 $Q$ 来自 Decoder 掩码自注意力的输出$K, V$ 来自 Encoder 的输出作用是**关联源序列和目标序列**比如翻译任务中让目标词对齐源词。**Encoder-Decoder Attention 不是自注意力**因为 $Q$ 和 $K,V$ 来自不同的序列而我们讨论的核心是两类**自注意力**的区别。## 五、总结Encoder 自注意力和 Decoder 自注意力的核心区别是**是否引入因果掩码**导致的**注意力范围差异**- Encoder 自注意力是**双向的**为了“理解全局”适配自然语言理解任务- Decoder 自注意力是**单向的**为了“生成连贯序列”适配自然语言生成任务。这种设计完全服务于 Transformer 的“编码-解码”架构目标Encoder 将输入序列编码为语义向量Decoder 基于该向量和已生成序列逐token生成目标序列。DeepSeek R1有看过吗? 介绍一下 最新64页补丁# DeepSeek R1推理大模型的革命性突破与技术解析DeepSeek R1 是幻方量化旗下深度求索DeepSeek于 **2025年1月20日** 发布的**专注推理能力**的大型语言模型性能对标 OpenAI o1 系列在数学、代码、自然语言推理等任务上表现突出。其核心创新在于**纯强化学习训练路径**与**MoE架构优化**并以 MIT 协议完全开源成为开源社区中推理能力最强的模型之一。## 一、核心定位与发布背景DeepSeek R1 诞生于大模型“推理能力竞赛”的关键时期目标是解决传统大模型在**复杂逻辑推理、数学证明、代码生成**等任务上的短板。其发布具有三个里程碑意义1. 首次验证**纯强化学习无监督微调SFT** 可训练出顶级推理能力模型2. 以 MoE 架构实现**671B总参数、37B活跃参数**的高效推理平衡性能与算力成本3. 采用**MIT开源协议**提供从1.5B到70B的全系列蒸馏模型降低推理门槛## 二、核心技术架构与创新### 2.1 模型架构MoEMLA的高效组合DeepSeek R1 基于 DeepSeek-V3 基座采用创新混合架构| 架构参数 | 核心细节 ||----------|----------|| **总参数** | 671BMoE架构活跃参数37B/Token || **层数** | 61层Transformer前3层为**Multi-Head Latent Attention (MLA)** 层其余为标准注意力层 || **专家数量** | 128个专家每Token激活2个专家激活率约1.56% || **上下文窗口** | 128K tokens支持超长文本推理与分析 || **归一化** | 采用 RMSNorm 替代 LayerNorm提升训练效率与稳定性 |**MLA层创新**前3层引入潜在注意力机制将输入映射到低维潜在空间进行注意力计算大幅降低计算复杂度同时保留全局语义信息。### 2.2 训练范式纯强化学习的推理锻造DeepSeek R1 采用**四阶段训练流程**核心是**无SFT的强化学习路径**1. **冷启动Cold Start**用少量高质量CoT思维链数据预训练使模型学会标准答案格式解决R1-Zero的可读性问题2. **RL锻造GRPO算法**使用**GRPOGeneralized Relative Policy Optimization** 替代PPO在多种推理路径中自主选择最优策略强化反思与验证能力3. **数据反哺**模型自生成高质量推理数据减少对人工标注的依赖形成“推理-数据-推理”的闭环4. **人机融合**引入人类偏好奖励模型优化输出的自然性与可读性解决R1-Zero的重复、语言混合问题**关键突破**R1-Zero无冷启动验证了纯RL可实现强大推理能力在AIME 2024竞赛中pass1指标从15.6%提升至71.0%。### 2.3 推理机制反思验证的深度思考模式DeepSeek R1 的核心优势是**模拟人类推理过程**而非直接输出答案- **多路径探索**对同一问题生成多种推理路径通过价值函数选择最优解- **自我验证**对推理结果进行交叉检查发现矛盾时回溯修正- **超长思维链**支持数万字的思维链长度在数学证明、复杂代码生成中展现严谨逻辑- **幻觉抑制**通过强化学习减少无根据断言改写、摘要等场景幻觉率降低45%-50%## 三、两大核心模型版本对比DeepSeek R1 系列包含两个核心版本定位与特性差异显著| 版本 | 训练特点 | 优势 | 不足 | 适用场景 ||------|----------|------|------|----------|| **R1-Zero** | 纯RL训练无SFT无冷启动 | 推理能力强反思验证突出 | 重复输出、可读性差、语言混合 | 研究场景探索纯RL极限 || **R1** | 冷启动RL训练 | 平衡推理能力与可读性幻觉率低 | 训练成本略高 | 生产环境实际应用部署 |## 四、性能表现对标OpenAI o1的推理能力DeepSeek R1 在多类推理任务中表现优异部分指标超越GPT-4o、Claude 3.5### 4.1 数学推理能力- 在AIME美国数学邀请赛中pass1指标达71.0%接近人类金牌水平- MATH数据集上得分89.2%GSM8K得分98.7%远超传统大模型- 复杂数学证明中思维链长度可达23K tokens逻辑严谨性显著提升### 4.2 代码生成能力- HumanEval测试集得分92.3%MBPP得分94.1%支持多语言代码生成与复杂项目开发- 可自主发现代码错误并修复实现“编写-测试-调试”的全流程自动化### 4.3 自然语言推理- 在BBH、MMLU等推理基准上表现优异特别是在需要多步骤推理的任务中- 幻觉率在改写、摘要等场景减少45%-50%输出可靠性大幅提升## 五、开源生态与应用场景### 5.1 开源资源与部署选项DeepSeek R1 提供完整的开源生态降低使用门槛1. **开源模型**R1-Zero、R1及6个蒸馏版本1.5B、2B、7B、8B、14B、70B均采用MIT协议2. **推理工具**支持Ollama、Hugging Face等主流框架可快速部署本地推理3. **API服务**提供低成本API输入4元/百万tokens输出16元/百万tokens缓存命中低至1元/百万tokens### 5.2 典型应用场景1. **数学科研**自动定理证明、复杂公式推导、数学竞赛辅助2. **软件工程**代码生成、自动调试、架构设计、技术文档撰写3. **金融分析**量化策略开发、风险评估、财务报表深度解读4. **法律领域**合同审查、法律条文分析、判例推理5. **教育领域**智能辅导、个性化习题生成、解题思路分析## 六、总结DeepSeek R1 的核心价值在于1. **推理范式革新**证明纯强化学习可训练出顶级推理能力为大模型训练开辟新路径2. **性能与效率平衡**MoE架构使671B模型以37B活跃参数实现高效推理大幅降低算力成本3. **开源普惠**MIT协议全系列蒸馏模型推动推理大模型在全球开发者社区的普及

相关新闻

职场软技能:深度倾听与策略性沉默在技术协作中的实践指南

职场软技能:深度倾听与策略性沉默在技术协作中的实践指南

1. 从“Please Be Quiet”说起:一个被低估的职场软技能 最近在团队里,我观察到一个挺有意思的现象。一个新来的同事,技术底子不错,干活也麻利,但每次开会或者讨论问题,他总是最“积极”的那个。别人话还没说…

2026/8/20 23:23:53 阅读更多 →
20万级SUV全能之选:混动技术、智能安全与空间设计如何满足家庭需求

20万级SUV全能之选:混动技术、智能安全与空间设计如何满足家庭需求

1. 从“够用”到“全能”:80后购车需求的深层演变 聊到20万级别的SUV,市场选择多到让人眼花缭乱。但如果你问一个典型的80后,他到底需要一台什么样的车,答案往往不再是十年前“能开、省油、空间大”那么简单。我们这代人&#xff…

2026/8/19 22:17:38 阅读更多 →
基于ESP32的六足机器人miniHexa:从运动学到步态规划的完整实践

基于ESP32的六足机器人miniHexa:从运动学到步态规划的完整实践

1. 项目概述:为什么选择六足机器人作为机器人学入门平台? 如果你对机器人感兴趣,想从零开始动手搭建一个属于自己的、能走会动的实体,但又觉得轮式小车太简单、人形机器人太复杂,那么六足机器人(Hexapod&am…

2026/8/21 0:07:18 阅读更多 →

最新新闻

JDK 17 升级实战:从核心特性到生产环境部署全解析

JDK 17 升级实战:从核心特性到生产环境部署全解析

在实际 Java 项目升级或新项目选型时,JDK 17 已经成为一个绕不开的长期支持版本。很多开发者知道它重要,但面对从 JDK 8 或 JDK 11 跨越式升级时,往往只关注语法糖,而忽略了那些真正影响代码健壮性、可维护性和运行时性能的底层变…

2026/8/21 3:46:26 阅读更多 →
视频号视频下载工具全解析:原理、选择与安全操作指南

视频号视频下载工具全解析:原理、选择与安全操作指南

1. 先搞清楚这类工具到底能做什么,以及它适合谁如果你经常需要把一些视频号里的内容保存下来,比如自己发布的、朋友分享的,或者一些公开的、有学习价值的片段,那么你肯定遇到过“怎么下载”这个问题。视频号本身不提供直接的下载按…

2026/8/21 3:46:26 阅读更多 →
录播姬工具箱使用教程:3 步救回损坏的B站直播录制文件

录播姬工具箱使用教程:3 步救回损坏的B站直播录制文件

录播姬工具箱使用教程:3 步救回损坏的B站直播录制文件 【免费下载链接】BililiveRecorder 录播姬 | mikufans 生放送录制 项目地址: https://gitcode.com/gh_mirrors/bi/BililiveRecorder 深夜两点,主播的生日回放刚结束,你兴冲冲打开…

2026/8/21 3:46:26 阅读更多 →
基于开源命令行工具构建本地化全格式文件转换引擎

基于开源命令行工具构建本地化全格式文件转换引擎

在实际开发、运维、文档处理和日常办公中,我们经常遇到文件格式转换的需求。无论是将一份PDF合同转为Word进行编辑,将一组PNG图片转为WebP以优化网页加载,还是将一段MP4视频转为GIF用于演示,格式转换都是一个高频且刚需的技术动作…

2026/8/21 3:46:26 阅读更多 →
MathType专业公式编辑器:从安装到精通,提升科研文档效率

MathType专业公式编辑器:从安装到精通,提升科研文档效率

如果你是一名科研工作者、教师,或者需要频繁撰写包含复杂数学公式的文档,那么你一定经历过这样的痛苦:在Word里用自带的公式编辑器一个个符号地点击,排版公式时对齐困难,格式调整繁琐,复制到不同平台后格式…

2026/8/21 3:46:26 阅读更多 →
RAG 与 Agent 私有化部署:企业知识库落地的完整架构

RAG 与 Agent 私有化部署:企业知识库落地的完整架构

摘要企业 AI 原生化转型,90% 的拦路虎不在模型,而在数据与部署:数据质量差、合规要求严、既有系统难集成。本文用一个金融企业的真实落地案例,拆解 RAG/Agent 私有化部署的完整架构——数据管道怎么建、检索链路怎么优化、合规隔离…

2026/8/21 3:45:25 阅读更多 →

日新闻

机场边检旅客定位系统国产化白皮书:算法、硬件、底座平台全程自主

机场边检旅客定位系统国产化白皮书:算法、硬件、底座平台全程自主

前言随着国家数字基础设施信创替代、关键技术自主可控战略持续深化,口岸智慧安防、边检智能管控领域正全面进入国产化、自主化、安全可控升级周期。当前国内机场边检旅客识别与定位体系长期依赖国外商用视觉算法、进口成像硬件、闭源通用计算平台,存在核…

2026/8/21 0:00:42 阅读更多 →
别再把“数字孪生”当空间智能了!镜像视界揭开四维时空的真正面纱

别再把“数字孪生”当空间智能了!镜像视界揭开四维时空的真正面纱

别再把“数字孪生”当空间智能了!镜像视界揭开四维时空的真正面纱当下数字化建设浪潮中,很多项目将三维可视化、视频贴图叠加的数字孪生等同于空间智能。传统数字孪生更多停留在三维场景复刻,擅长把物理世界“画出来、展示出来”,…

2026/8/21 0:00:42 阅读更多 →
105、车载温度范围-40°C到85°C的影像质量一致性——ISP参数温漂补偿与产线标定策略

105、车载温度范围-40°C到85°C的影像质量一致性——ISP参数温漂补偿与产线标定策略

105、车载温度范围-40C到85C的影像质量一致性——ISP参数温漂补偿与产线标定策略 去年冬天在北方某车厂做A样评审,凌晨四点的黑河试验场,零下三十三度。客户拿了一台冷启动的车,中控屏上倒车影像全是雪花噪点,暗部细节直接糊成一片。我第一反应是sensor温度没上来,暗电流…

2026/8/21 0:00:42 阅读更多 →

周新闻

基于阿里云与通义千问(Qwen)构建AI应用:从模型调用到生产部署的完整实践指南

基于阿里云与通义千问(Qwen)构建AI应用:从模型调用到生产部署的完整实践指南

如果你是一名开发者,最近可能已经感受到了AI大模型正在从“玩具”变成“生产力工具”的强烈信号。从代码补全到智能Agent,从本地部署到云端API,我们正处在一个技术栈快速重构的节点。然而,面对层出不穷的模型、框架和工具&#xf…

2026/8/21 3:21:33 阅读更多 →
工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

第四篇:反射——高频能量撞墙之后会发生什么? —— 你以为信号已经过去了,其实它正在回来打你 老Q的现场笔记 第五季,我们正式进入工业神经系统层。这里不再是单个设备的战斗,而是整个工厂“经脉”层面的秩序之战。从这一篇开始,你将第一次看清:看似简单的信号传播,背…

2026/8/21 0:02:09 阅读更多 →
【文章复现】非线性值迭代自适应动态规划(ADP):离散时间非线性系统的策略迭代自适应动态规划算法研究附Matlab代码

【文章复现】非线性值迭代自适应动态规划(ADP):离散时间非线性系统的策略迭代自适应动态规划算法研究附Matlab代码

✅作者简介:热爱科研的Matlab仿真开发者,擅长毕业设计辅导、数学建模、数据处理、建模仿真、程序设计、完整代码获取、论文复现及科研仿真。🍎 往期回顾关注个人主页:Matlab科研工作室👇 关注我领取海量matlab电子书和…

2026/8/19 11:55:16 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/20 6:11:08 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/20 21:46:49 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/21 0:14:22 阅读更多 →