一个KimiK3装下22580个GPT-2,七年缩放真正改变的是记忆与检索
一个KimiK32026大约能塞进22580个GPT-22019。参数从1.24亿跃升到2.8万亿七年时间。表面上只是规模在堆但真正决定模型能不能有效利用这些参数的是它如何存储、更新和检索信息。我起初以为线性注意力只是把O(N²)换成O(N)的简单近似后来顺着源码和论文一路往下看发现每一步都在解决前一步留下的具体瓶颈固定容量的关联记忆一旦写满纯加法更新就会让旧信息互相干扰。没有合适的驱逐和修正机制再大的参数也只是浪费。GPT-2是经典的解码器-only架构。输入先加上token和位置嵌入然后进入12个Transformer块。每个块里注意力先算Q、K、V投影再做softmax(QKᵀ)V。最终隐藏状态经过LM头得到词表logits。自回归生成时每一步其实只需要最后一个位置的logits但如果不做缓存模型会把前面所有token的投影重新算一遍。KV缓存就是为了解决这个冗余把已生成token的key和value向量存下来后续只追加新token的投影。代价也立刻显现——缓存随序列长度线性增长很快变成内存带宽瓶颈。GPT-2参数量约1.24亿词表约5万、12层、12头、嵌入维度768。线性注意力把softmax换成特征映射比如ELU1分别作用在q和k上让QK乘积可以重关联于是整个历史K、V可以折叠进一个固定的D×D状态矩阵。每一步只做两次ND读和两次1D写状态大小不再随N增长。代价是特征映射的表达力弱于指数精度会有损失实际损失大小取决于架构和任务。问题来了。固定大小的状态必须覆盖或合并已有信息。新token的写入是加法旧关联无法被精确隔离。一旦序列长度远超有效容量干扰就不可避免。DeltaNet正是为了解决这个“过载后无法恢复”的问题。Delta规则的核心很直观写入前先问当前key能从缓存里读出什么把旧值从目标value里减掉再把差值按key方向写回去。旧信息被擦除新信息被精确替换。用矩阵语言就是S ← S kᵀ(v - S k)。这相当于在有限白板上用橡皮擦精确改写某一处笔记而不是把新纸一张张叠上去。实现上直接顺序更新是线性时间但训练时需要并行。作者把序列切成大小C的chunk常用64或128匹配tensor-core粒度。块内做带mask的真实注意力score-first块间做状态优先的循环更新。C1退回纯线性CN退回全注意力。FLOPs里有固定的2Ld²状态项和随C增长的2LCd项。C越小纯计算越省但硬件利用率不一定最高。Gated DeltaNet再往前走一步。Delta只能精确替换某个关联无法在上下文切换时整体衰减。Mamba式的统一衰减又太粗暴——所有关联一起被乘上同一个α。Gated Delta把两者合起来α∈[0,1]控制前一状态的衰减强度α1时退回纯Deltaα0时清空记忆。实现上仍用相同的chunk重参数化只是多了数据依赖的标量衰减并维护累积的γ因子来正确处理跨chunk的衰减链。Kimi LinearKDA在Gated DeltaNet基础上引入细粒度通道级衰减每个通道有自己的α而不是一个全局标量。同时采用混合架构——大部分层用KDA提供常数状态的循环记忆周期性插入Multi-head Latent AttentionMLA保留完整的softmax检索能力。MLP被换成MoE容量被精确加在需要的地方。KimiK3的语言骨干基本沿用这个思路23个四层宏循环每循环三层KDA、一层MLA。第一层用稠密FFN其余用latent-space MoE共898个专家2个共享路由选16个。激活从SiLU换成SiTU共享专家在压缩的latent空间计算。此外还有MLA的query LoRA、输出门控以及每12层一次的blockwise Attention ResidualsAttnRes。AttnRes解决的是深度方向的信息流动。普通残差是简单累加hₗ h₁ Σ fᵢ(hᵢ)后期层必须输出越来越大的值才能影响累积状态训练容易不稳定且不同层无法选择性取用早期表示。AttnRes给每一项乘上可学习的权重αᵢ由层专属query与早期状态的key做点积并归一化hₗ α₀·h₁ Σ αᵢ·fᵢ(hᵢ)实际落地时只在每12层的块边界做一次成本可控却能让模型按需检索更早的深度表示。KDA负责序列方向的常数状态记忆MLA负责token上下文的精确检索AttnRes负责深度方向的选择性访问。三者各自解决固定容量记忆必然带来的“必须丢弃部分信息”问题。下面是注意力机制演进的核心权衡对比机制状态大小更新方式主要瓶颈表达力与硬件权衡标准MHA KV CacheO(N)追加内存带宽、二次计算精确但长序列贵线性注意力O(D²)纯加法过载后干扰常数状态表达力近似DeltaNetO(D²)减法修正无法整体衰减精确写回并行需重参数化Gated DeltaNetO(D²)门控Delta通道级控制不足兼顾遗忘与修正KDA (Kimi Linear)O(D²) 周期MLA通道级门控混合实现复杂度细粒度控制 全局检索KimiK3同上 AttnRes深度选择性融合内核需求容量按功能分配我起初觉得“再加一点门控就差不多了”后来看到chunk并行和通道级α的实现细节才意识到真正难的是在保持硬件友好的前提下让固定状态既能精确写又能按需忘。纯规模扩张如果没有对应的驱逐与检索机制只是把干扰也一起放大。固定容量的关联记忆无论是D×D矩阵还是有限专家最终都需要驱逐策略。纯加法会在过载后产生不可逆干扰Delta给出精确擦写门控给出整体衰减通道级和深度残差再把粒度做细。KimiK3把这些机制组合起来让额外参数真正服务于“存什么、怎么改、从哪里取”而不是简单地堆更多相同的层。你在自己的长上下文或推理服务里是否已经遇到过KV缓存成为绝对瓶颈、却又不敢彻底换成线性方案的情况下一次做架构选型时不妨先问一句新加的容量到底解决了哪种具体的信息丢失我是紫微AI在做一个「人格操作系统ZPF」。后面会持续分享AI Agent和系统实验。感兴趣可以关注我们下期见。

相关新闻

CAD 2025在Win11/10系统安装指南:环境检查、安装配置与问题排查

CAD 2025在Win11/10系统安装指南:环境检查、安装配置与问题排查

这类软件安装教程最值得先看的不是下载链接,而是版本适配、系统要求和安装过程中的关键验证点。CAD 2025作为新版专业软件,能否在Win11/10上稳定运行,核心在于安装前的环境检查、安装时的选项配置以及安装后的激活与功能验证。很多人拿到安装…

2026/7/28 20:41:19 阅读更多 →
Unity动态网格编程:解决Mesh.uv数组越界错误与数据同步实践

Unity动态网格编程:解决Mesh.uv数组越界错误与数据同步实践

1. 问题初探:当Mesh.uv赋值时,Unity为何对你Say No?在Unity开发中,尤其是处理3D模型、地形编辑或者程序化网格生成时,Mesh组件是我们打交道最多的对象之一。Mesh.uv属性,这个负责存储模型UV坐标的数组&…

2026/7/28 20:41:19 阅读更多 →
SpringBoot+Vue构建企业级老年人体检管理系统实践

SpringBoot+Vue构建企业级老年人体检管理系统实践

1. 项目概述:企业级BS老年人体检管理系统这套基于SpringBootVueMyBatis架构的老年人体检管理系统,是专为医疗机构设计的全流程体检管理解决方案。我在实际部署中发现,系统通过BS架构实现了体检预约、报告管理、数据统计等核心功能&#xff0c…

2026/7/28 20:40:18 阅读更多 →

最新新闻

物联网设备低功耗优化:NBM7100A与dsPIC30F的协同设计

物联网设备低功耗优化:NBM7100A与dsPIC30F的协同设计

1. 项目背景与核心挑战在物联网终端设备和便携式医疗设备领域,不可充电的初级电池(如锂亚硫酰氯电池、CR2032纽扣电池)因其高能量密度和长储存寿命被广泛应用。但这类电池一旦电量耗尽就必须整体更换,在植入式医疗设备或偏远地区部…

2026/7/28 20:53:23 阅读更多 →
火星循环经济项目:太空农业与酿酒技术创新

火星循环经济项目:太空农业与酿酒技术创新

1. 项目背景与核心价值解析2023年最具突破性的太空经济项目"火星贡酒暨火星集市循环经济火星盾品牌发布会"在深圳成功举办。这个由联合国和谐基金会秘书长亲自站台的跨界项目,标志着人类首次将传统酿酒工艺、循环经济模式和太空科技进行深度融合。作为现场…

2026/7/28 20:53:23 阅读更多 →
程序员健康管理:从工位改造到作息优化的全方案

程序员健康管理:从工位改造到作息优化的全方案

1. 项目概述:研发工程师的健康困境作为在科技行业摸爬滚打十多年的老码农,我见过太多同行在35岁后突然"断电"——有人因为长期伏案工作导致腰椎间盘突出被迫离职,有人因为长期熬夜引发心脏问题住院,还有人因为长期压力过…

2026/7/28 20:53:23 阅读更多 →
USB转蓝牙HID协议桥接:从有线鼠标无线化改造看嵌入式系统设计

USB转蓝牙HID协议桥接:从有线鼠标无线化改造看嵌入式系统设计

1. 从“线”到“波”:一个老物件的无线化重生手边那个用了七八年的有线鼠标,手感早已磨合得恰到好处,微动清脆,滚轮顺滑,外壳的包浆都透着亲切感。但桌面上那根甩来甩去的线缆,却总在提醒你它与这个无线化时…

2026/7/28 20:53:23 阅读更多 →
Java后端面试进阶:从场景驱动到项目实战的60天高效学习路径

Java后端面试进阶:从场景驱动到项目实战的60天高效学习路径

最近和不少准备面试的 Java 后端同学交流,发现一个普遍现象:很多人每天花大量时间刷题、背八股,但总感觉进步缓慢,面试时一遇到场景题就卡壳,或者被问到项目细节就露怯。问题出在哪?是八股文背得不够多&…

2026/7/28 20:53:23 阅读更多 →
Unity UI自动化:PSD设计稿一键转UGUI预制体的高效工作流

Unity UI自动化:PSD设计稿一键转UGUI预制体的高效工作流

如果你是一名 Unity 开发者,或者是一名 UI 设计师,那么下面这个场景你一定不陌生:设计师在 Photoshop 里精心打磨出一个完美的 UI 界面,导出 PSD 文件,然后交给程序员。程序员打开 PSD,开始手动切图、命名、导入 Unity、拖拽 Canvas、摆放 Image、Text、Button,设置锚点…

2026/7/28 20:52:23 阅读更多 →

日新闻

告别臃肿!3步让你的暗影精灵笔记本重获新生

告别臃肿!3步让你的暗影精灵笔记本重获新生

告别臃肿!3步让你的暗影精灵笔记本重获新生 【免费下载链接】OmenSuperHub Control Omen laptop performance, fan speeds, and keyboard lighting, and unlock power limits. 项目地址: https://gitcode.com/gh_mirrors/om/OmenSuperHub 你是否也曾为官方Om…

2026/7/28 0:00:43 阅读更多 →
RAG必踩坑!财报法规检索不准?这款开源工具让答案浮出水面,准确率飙升98.7%!

RAG必踩坑!财报法规检索不准?这款开源工具让答案浮出水面,准确率飙升98.7%!

做 RAG 的人应该都踩过这个致命的坑:把几百页的财报、法规、技术手册扔给向量库,问一个具体问题,搜出来的全是沾边但没用的内容 —— 关键信息要么被硬切块拆碎了,要么藏在几十条结果的最下面。语义相似≠真正相关,这个…

2026/7/28 0:00:43 阅读更多 →
抖音视频文案提取工具全指南:免费2026版、手机App、在线工具一网打尽

抖音视频文案提取工具全指南:免费2026版、手机App、在线工具一网打尽

2026年做短视频运营,从抖音上扒文案早就不是偷偷抄笔记的事了。我刚开始做内容的时候,每天刷半小时抖音,手动把爆款视频的口播敲进备忘录,一条2分钟的视频得花十来分钟,碰到语速快的还要反复回听。后来试了一圈工具&am…

2026/7/28 0:00:43 阅读更多 →

周新闻

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 数据集6000张 完整源码已标注数据集训练好的模型环境配置教程程序运行说明文档,可以直接使用!系统支持图片、视频、摄像头等多种方式检测裂缝,功能强大实用。 1数据集6000张 8各类别

2026/7/28 12:04:22 阅读更多 →
深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

pubg数据集 精选原图1.42万数据 1.49万标签 无任何重复、算法增强或冗余图像! pubg绝地求生目标检测数据集 1分类:e_body,14905个标签,txt格式 共计14244张图,99%为640*640尺寸图像 适合yolo目标检测、AI训练关键词&am…

2026/7/28 8:29:16 阅读更多 →
Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex检测数据集数据集详情检测类别: allies enemy tag图片总量:7247张训练集:5139张验证集:1425张测试集:683张标注状态:全部已标注,即拿即用数据格式:支持YOLO格式及其他格式&#…

2026/7/28 5:03:42 阅读更多 →

月新闻