学习GPU 物理架构与内存层级和KV Cache 与显存增长的一些思考
datawhale社区Datawhale-学用 AI,从此开始llm-algo-leetcode教程地址GitHub - datawhalechina/llm-algo-leetcode: LLM algorithm practice lab with theory, solutions, and test cases.《大模型算法与系统教程》面向大模型入门到进阶的算法实战教程覆盖原理讲解、答案解析、测试用例与 CUDA/Triton 实战。 · GitHub1.GPU 是一座超级工厂把 GPU 想成一座只做一件事的工厂——做矩阵乘法算力TFLOPS 车间里工人的数量和工作速度每秒能做多少次乘加运算显存带宽TB/s 原料传送带的速度每秒能从仓库搬多少数据进车间缓存L2 / shared memory 车间旁边的小料场近但小随时取HBM 显存 远方的巨型仓库容量大但路远精度FP16/BF16/FP8... 秤的精度秤越粗称得越快但可能称不准延迟ns 从下单到拿到原料的时间根据这个框架所有问题都可以归结为一句话大模型的权重和中间结果数据量太大车间算力永远在等传送带带宽喂料——所以 GPU 设计的每一个改动本质上都是在让传送带更快或者减少需要搬运的原料量。2.英伟达GPU逐代拆解每个特性到底是什么意思VoltaV100, 2017——第一次有专门的乘法车间Tensor Core张量核心以前矩阵乘是拿通用算术单元硬算的一条指令算一次乘加Tensor Core 是专门为矩阵乘设计的硬件电路一条指令直接算一个 4×4×4 的小矩阵乘。相当于以前工人一个个搬砖现在是叉车整板搬运。FP16 混合精度配合 Tensor CoreV100 的 FP16 算力125 TFLOPS是 FP3215.7 TFLOPS的约 8 倍。意味着什么深度学习第一次拥有专用硬件训练 ResNet、早期 Transformer 的时间从周缩到天。V100 是 GPT-1/GPT-2 时代的主力卡。AmpereA100, 2020——精度档位大扩充 缓存扩容TF32这是最白嫖的一项——把 FP32 的尾数从 23 位截断到 10 位变成 19 位格式。精度几乎不损失训练 96% 场景无感但算力直接 8 倍。原本为了保险用 FP32 跑的代码改成 TF32 白拿加速。BF16Google 提出的格式。FP16 的问题是指数只有 5 位训练时 loss 一大就容易溢出infBF16 把指数补回 8 位范围和 FP32 一模一样训练时不用担心溢出代价只是尾数糙一点——但训练对此不敏感。从此 BF16 成为大模型训练的默认格式。HBM2e 带宽翻倍HBM 是立体堆叠的显存像高楼用硅通孔把几层 DRAM 叠起来层数越多带宽越高。A100 从 V100 的 0.9 TB/s 提到 2.0 TB/s。L2 缓存 40MBV100 只有 6MB。L2 是车间门口的大料场权重和中间结果如果能在 L2 里被复用就不用每次去远方的 HBM 取——这是缓解带宽压力的最直接手段。40MB 正好能容纳大模型一层的关键中间数据比如大 batch 的激活。MIG多实例 GPU把一块 A100 物理切成最多 7 个相互隔离的小 GPU给不同租户用云服务场景。Sparse Tensor Core稀疏权重里如果有一半是零结构化稀疏2:4 模式硬件直接跳过零不计算白得 2 倍加速。意味着什么GPT-31750 亿参数就是用 A100 集群训练出来的。Ampere 是大模型训练时代的开端。HopperH100, 2022——为 LLM 量身定制FP8比 FP16 再少一半位数。推理时对精度不敏感FP8 让推理吞吐直接翻倍训练也有 FP8 路径代价是要做 loss scaling 等保护。Transformer Engine这是最妙的设计——自动为每一层选择用 FP8 还是 FP16。因为模型不同层的精度敏感度不同有的层用 FP8 会崩有的层用 FP16 纯属浪费Transformer Engine 在前向传播时实时监测数值范围自动切换。相当于给每层配了一个精度管家。Thread Block Cluster多个 SMGPU 里的计算核心组的线程块结成簇可以互相访问对方的 shared memory。这是为长序列注意力准备的——比如处理 128K 长上下文时K/V 矩阵太大放不进一个 SM需要跨 SM 协作FlashAttention 的分布式版本就是靠它实现的。TMATensor Memory Accelerator之前 GPU 搬数据必须经过寄存器相当于所有货物都要先搬进车间再转手TMA 是一个独立的 DMA 引擎允许 HBM 直接异步搬数据到 shared memory完全绕开寄存器。数据搬运和计算可以同时进行双流水线进一步隐藏带宽延迟。HBM3 3.35 TB/s、NVLink 900 GB/sNVLink 是 GPU 与 GPU 之间的高速公路PCIe 只有 64 GB/s 左右多卡训练 GPT 级别模型时卡间通信是另一大瓶颈。意味着什么H100 的 FP8 推理吞吐约为 A100 FP16 的 3~6 倍是 ChatGPT 时代的主力训练/推理卡。BlackwellB200, 2024——把精度压到极限FP4 第二代 Transformer Engine推理进一步降到 4 位精度吞吐再翻倍。B200 的 FP4 标称算力约 9000 TFLOPS。第五代 NVLink 1.8 TB/s双向多卡互连带宽继续翻倍支撑万卡级集群训练。HBM3e 8 TB/s、单卡 192GB带宽比 H100 又翻一倍多。意味着什么单卡能装下 1-2TB 量级的 MoE 模型配合超大容量推理成本大幅下降。这就是生成式 AI 爆发背后的硬件基础。性能指标怎么读TFLOPSTera Floating-point Operations Per Second每秒万亿次浮点运算——看任何算力指标必须先看它是在什么精度下测的FP4 FP8 FP16 FP32数字大不代表全面。TB/s每秒搬运万亿字节——传送带速度大模型场景下它比算力更关键。关键比值算力 ÷ 带宽 该硬件能喂饱的算术强度上限。大模型算术强度低所以带宽几乎是硬约束。3.HBM完整谱系代号世代代表 GPU带宽量级HBM第一代V1000.9 TB/sHBM2第二代V100升级版等~1 TB/sHBM2e第三代e extendedA1001.5~2.0 TB/sHBM3第四代H1003.35 TB/sHBM3e第五代e extendedB2008 TB/s所以说A100 提升了 HBM2e 的带宽和说HBM 带宽可达 1.5 TB/s指的是同一根传送带——只是前一句强调了 A100 用的是第三代型号HBM2e后一句是泛称。既然 A100 板上装的就是 HBM2e 颗粒那么HBM 带宽实际就等于HBM2e 带宽。4.完整数据通路一次典型计算HBM芯片外大仓库│ ← ① 搬运带宽瓶颈1.5~8 TB/s▼L2芯片级中转站40~50MB所有 SM 共享 ← 数据必经之路│ ← ② 搬运更快~5.5~12 TB/s▼SM 内部┌─────────────────────────────────────┐│ L1 / Shared Memory小料场~164KB/SM ││ │ ← ③ 搬运最快19~33 TB/s ││ ▼ ││ 寄存器工人桌面每个线程独占 ││ │ ← ④ 读取几乎零成本 ││ ▼ ││ 计算单元CUDA Core / Tensor Core │└─────────────────────────────────────┘5.为什么不全用最快的存储SRAM因为物理上不可能、成本上不划算。这是一个容量-速度-成本三角不可能三角存储类型速度密度每 GB 成本寄存器/SRAM极快ns 级低6 个晶体管存 1 位极贵L2 SRAM快中贵HBM DRAM慢百 ns高1 个晶体管电容存 1 位相对便宜如果把 HBM 80GB 全部用 SRAM 造物理上GPU 芯片面积要 1000 倍增长A100 整颗 die 才 826mm²全 SRAM 化要 1 平米以上的硅片一片晶圆根本切不出来成本上SRAM 每 GB 成本是 DRAM 的 50~100 倍一块全 SRAM 卡要几百万美金电力上晶体管数量爆炸功耗也爆炸所以必须分层只有当前要用的那一小撮数据放最贵的 SRAM每 SM 寄存器 ~256KB、SMEM ~164KB、L2 40MB总共加起来几十 MB绝大部分历史数据放便宜的 HBM几十~上百 GB这是个工程妥协。6.真正减少数据搬迁的是FlashAttention不是 PagedAttentionFlashAttentionPagedAttention解决什么算 Attention 时少搬数据KV cache怎么存、怎么访问核心思路算子在 SMEM 里算完再写回 HBM按页分块 块表映射收益减少 HBM 往返次数提升显存利用率、支持长序列共同点都是 vLLM 用的核心优化两者不冲突、互补vLLM 框架里先 PagedAttention 存 KV管得稳再用 FlashAttention 算搬得少。

相关新闻

PolyWorks变量:测量精度控制的核心机制

PolyWorks变量:测量精度控制的核心机制

1. 为什么PolyWorks脚本里“变量”不是可有可无的装饰,而是控制精度的扳手PolyWorks不是Excel,也不是PowerPoint——它是一套精密测量数据处理的工业级平台,背后跑的是百万级点云、千级特征、毫秒级坐标变换。你用鼠标点选一个圆柱体&#xf…

2026/8/23 8:20:26 阅读更多 →
浏览器下载提速实战:多线程下载器集成与网络优化方案

浏览器下载提速实战:多线程下载器集成与网络优化方案

这次我们来看一个解决浏览器下载速度慢问题的实用方案。如果你经常遇到浏览器下载文件时速度不稳定、达不到带宽上限,或者对多线程下载、断点续传有需求,那么这个基于开源下载工具和浏览器集成的思路值得一试。核心不是介绍某个单一的软件,而…

2026/8/23 8:19:22 阅读更多 →
校园小红薯项目 — 注解总结

校园小红薯项目 — 注解总结

项目:campus-xiaohongshu(Spring Boot 后端) 整理日期:2026-08-19 说明:本文按用途分类,汇总项目中出现的全部注解及其作用,并标注实际出现位置。一、启动类 / 全局功能开关 这类注解放在启动类…

2026/8/24 11:20:04 阅读更多 →

最新新闻

STM32移植FreeRTOS实战指南:从裸机到多任务系统开发

STM32移植FreeRTOS实战指南:从裸机到多任务系统开发

1. 项目概述:为什么要在STM32上跑FreeRTOS? 如果你玩过一阵子STM32,从点灯、串口打印到驱动各种外设,可能已经感受到了裸机编程的“天花板”。当你的项目需要同时处理按键扫描、屏幕刷新、数据采集和网络通信时,那一大…

2026/8/24 16:00:07 阅读更多 →
国标监控平台从0到1:wvp-GB28181-pro 设备接入、无插件播放与级联共享完整指南

国标监控平台从0到1:wvp-GB28181-pro 设备接入、无插件播放与级联共享完整指南

国标监控平台从0到1:wvp-GB28181-pro 设备接入、无插件播放与级联共享完整指南 【免费下载链接】wvp-GB28181-pro 基于GB28181-2016、部标808、部标1078标准实现的开箱即用的网络视频平台。自带管理页面,支持NAT穿透,支持海康、大华、宇视等品…

2026/8/24 16:00:07 阅读更多 →
DSP/单片机性能优化:将关键函数拷贝到RAM运行的原理与实践

DSP/单片机性能优化:将关键函数拷贝到RAM运行的原理与实践

1. 项目概述:为什么要把DSP函数拷贝到RAM中运行?如果你正在开发DSP(数字信号处理器)程序,并且对代码的执行速度有极致要求,那么“将函数拷贝到RAM中运行”这个操作,绝对是你绕不开的优化手段。这…

2026/8/24 16:00:07 阅读更多 →
免费微信聊天记录导出完整指南:把全部对话备份到自己的电脑

免费微信聊天记录导出完整指南:把全部对话备份到自己的电脑

免费微信聊天记录导出完整指南:把全部对话备份到自己的电脑 【免费下载链接】WeChatMsg 提取微信聊天记录,将其导出成HTML、Word、CSV文档永久保存,对聊天记录进行分析生成年度聊天报告 项目地址: https://gitcode.com/GitHub_Trending/we/…

2026/8/24 16:00:07 阅读更多 →
【非标自动化】2、认识元器件(比例阀)

【非标自动化】2、认识元器件(比例阀)

比例阀比例阀是一类能够根据输入电信号,连续地调节气体压力、流量或流动方向的电控阀。普通电磁阀通常只有两种状态:断电:关闭或处于初始位置 通电:完全打开或切换到另一位置比例阀则可以处于许多中间状态:输入信号较小…

2026/8/24 16:00:07 阅读更多 →
从大纲到定稿,一台AI就够了?深度拆解毕夏AI官网的全流程学术写作逻辑

从大纲到定稿,一台AI就够了?深度拆解毕夏AI官网的全流程学术写作逻辑

——当论文写作不再是“散装工序”,而是一条完整的智能流水线 毕夏AI官网:www.bixiaai.com 微信公众号搜一搜:毕夏AI官网 写论文这件事,最让人崩溃的从来不是“写不出来”,而是流程太碎、工具太杂、环节太多。 选题…

2026/8/24 15:59:07 阅读更多 →

日新闻

前端内容安全与依赖审计实践

前端内容安全与依赖审计实践

前端内容安全与依赖审计实践 前端安全依赖分层防护。没有任何单一配置能替代输出编码、权限校验和依赖更新。 把不可信内容当作数据 默认使用框架的转义能力;确需渲染 HTML 时,先在服务端或可信的客户端库中进行白名单过滤。避免把用户输入直接赋给 inne…

2026/8/24 1:08:15 阅读更多 →
Windows登录密码存储机制全解析:从哈希算法到安全加固实战

Windows登录密码存储机制全解析:从哈希算法到安全加固实战

1. 项目概述:Windows登录密码的“黑匣子”每次你按下CtrlAltDel,输入密码,然后看到那个熟悉的桌面,这背后发生了一系列复杂而精密的操作。作为一名长期与Windows系统打交道的从业者,我经常被问到:“我的密码…

2026/8/24 1:08:15 阅读更多 →
AI面试系统安全挑战与解决方案

AI面试系统安全挑战与解决方案

1. 项目概述:AI面试系统的安全挑战去年参与某跨国企业AI面试系统部署时,遇到一个典型案例:候选人在视频面试中无意提到竞争对手产品名称,系统竟自动将该信息关联到企业知识库并生成竞品分析报告。这个看似"智能"的功能&…

2026/8/24 1:08:15 阅读更多 →

周新闻

[光学原理与应用-521]:对光的错误理解与纠偏

[光学原理与应用-521]:对光的错误理解与纠偏

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

2026/8/24 0:06:02 阅读更多 →
SIP通话转接原理与REFER方法实战解析

SIP通话转接原理与REFER方法实战解析

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

2026/8/24 0:20:20 阅读更多 →
Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

2026/8/24 0:14:11 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/23 18:47:06 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/23 12:10:44 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/24 11:20:22 阅读更多 →