AI 芯片 ISA
AI 芯片又称 AI 加速器、NPU、TPU 等的指令集架构Instruction Set Architecture, ISA与传统通用 CPU如 x86、ARM或 GPU 的指令集存在本质区别。传统 CPU 针对复杂的标量分支逻辑设计GPU 针对大规模并发的矢量/并行计算设计而 AI 芯片的 ISA 则专门围绕大吞吐量矩阵运算、低精度算术INT8/FP16/BF16/FP8以及高带宽数据搬运进行深度定制。1. AI 芯片 ISA 的核心分类与设计范式根据指令执行与控制流的复杂程度AI 芯片的指令集主要分为以下几种主流范式① VLIWVery Long Instruction Word超长指令字代表架构Google TPU (v1~v4/v5)、寒武纪 Bang ISA、Habana Gaudi。核心思想将控制逻辑从硬件转移到编译器。一条极其庞大的指令如 128~512 位同时包含多个子操作指令如1 个矩阵计算 1 个向量计算 2 个数据搬运 1 个标量分支。优势消除了复杂的硬件指令译码器与乱序执行逻辑芯片面积和功耗极低计算密度极高。劣势对编译器要求苛刻。若编译器无法填满超长指令的所有槽位硬件就会产生 NOP空指令造成算力浪费。② DSA / CISC 风格的域专用指令集Domain-Specific ISA代表架构Google TPU 脉动阵列指令、华为 Ascend升腾DaVinci 架构。核心思想针对 Deep Learning 中的常见算子如MatMul、Conv2D、Softmax、LayerNorm直接设计粗粒度宏指令Macro-instructions。典型指令示例LOAD_WEIGHT从 HBM/DRAM 搬运权重到片上 Buffer。MATRIX_MUL触发硬件脉动阵列Systolic Array完成一个128×128128 \times 128128×128的矩阵乘法。VECTOR_ACT对输出矩阵应用 GELU/ReLU 激活函数。优势指令密度极高代码体积小大幅降低译码开销和指令发射频次。③ SIMD / SIMT 风格的扩展指令集代表架构NVIDIA CUDA PTX伪汇编/中语言、AMD CDNA (ROCm/GCN ISA)。核心思想继承 GPU 的单指令多线程SIMT模型但在传统矢量/标量指令集的基础上加入了专用的张量指令Tensor Core Instructions。典型代表PTXmma.sync.aligned.m16n8k16.row.col一条指令指挥一个 Warp32 个线程协同完成一个16×8×1616 \times 8 \times 1616×8×16的半精度矩阵乘累加。④ 开源扩展RISC-V Vector AI Extensions代表架构Esperanto (ET-SoC-1)、Tenstorrent (Wormhole/Blackhole)、平头哥玄铁。核心思想基于基础 RISC-V 标量指令集结合RVVRISC-V Vector Extension并扩充自定义的Matrix/Tensor Custom Instructions。优势开源自由无专利限制非常适合特定领域定制如端侧/边缘 AI 芯片。2. AI 芯片指令集与传统 CPU/GPU 的区别维度通用 CPU ISA (如 x86/ARM)通用 GPU ISA (如 NVIDIA SMM/SOT)AI 芯片 ISA (如 TPU/Ascend/Tenstorrent)操作数粒度标量 / 短向量(32/64 bit, SIMD 256/512 bit)矢量 / Warp 级矩阵张量 / 二维矩阵 / 块Tile控制流支持极强复杂分支预测、乱序执行中等Warp Divergence 串行化极弱或无依赖主机 CPU 调度专注于数据流内存访问机制硬件自动管理 Cache 隐式加载显式 Shared Memory 全局 L2 Cache显式 DMA 搬运与 SPMScratchpad Memory指令解码与发射极其复杂超标量、动态调度较复杂Warp Scheduler 轮询极简VLIW 静态调度或硬件队列推导3. AI 芯片 ISA 的关键硬件指令模块一套完整的 AI 芯片指令集通常划分为以下 4 个功能模块┌────────────────────────┐ │ AI Accelerator │ └───────────┬────────────┘ │ ┌────────────────────┬───────────────┴───────────────┬────────────────────┐ ▼ ▼ ▼ ▼ [ Compute - Matrix ] [ Compute - Vector ] [ Data Movement ] [ Control Sync ] • MatMul (GEMM) • Element-wise • DMA Load/Store • Event Wait/Notify • Conv2D • Reduction (Sum/Max) • Tensor Transpose • Barrier Sync • Systolic Push • Activation (GELU/Softmax)• Cross-Core Interconnect矩阵计算指令Matrix Compute直接驱动片上的 2D 脉动阵列或 Tensor Engine支持低精度输入如FP8/INT8/BF16与高精度累加如FP32。矢量/标量计算指令Vector/Scalar Compute用于处理无法归并为大矩阵的非线性算子如Softmax、LayerNorm、RoPE位置编码、Element-wise Add。数据搬运指令Data Movement / DMA由于 AI 芯片普遍采用SPMScratchpad Memory如 SRAM而非传统 Cache数据在 HBM/DRAM 和片上 Buffer 之间的流动必须由指令显式控制如异步 DMA 通信、Tensor 步长重排/Padding 挂载。同步与控制指令Synchronization Control负责计算单元与 DMA 搬运单元之间的Double Buffering双缓冲/乒乓机制同步如设置信号量Semaphore Wait/Post或流水线 Barrier。4. 软件栈与 AI 指令集的关系为什么程序员很少直接写 AI 汇编与 CPU/GPU 类似AI 芯片的 ISA 也是硬件与软件的界面。但在实际大模型开发中工程师很少手写 AI 芯片的汇编代码[ AI 框架 ] PyTorch / TensorFlow / JAX │ ▼ (Graph Level IR) [ AI 编译器前端 ] TorchDynamo / StableHLO / ONNX / MLIR │ ▼ (Kernel/Loop Level IR) [ AI 编译器后端 ] Triton / TVM / Halide / NVCC (PTX) / CISA / LLVM │ ▼ (Hardware ISA) [ AI 芯片硬件 ] NVIDIA Tensor Core / Google TPU VLIW / Ascend DaVinci ISA编译器的重度依赖AI 模型的算子形态变化极快。通常由MLIR、Triton、TVM或OpenXLA等 AI 编译器生成对应的 AI 芯片指令。硬件隐秘性除了 CUDA PTX 和开源 RISC-V 厂商外大部分商用 NPU/TPU 厂商的底层底层 ISA 并不对外公开属于 Non-public ISA开发者仅能通过厂商提供的C/C 风格算子库如 cuDNN、CANN、Ascend C或 AI 编译器接口进行交互。5. 总结与未来趋势随着大语言模型LLM与 Transformer 架构成为主导AI 芯片指令集正在朝着以下方向演进FlashAttention / PagedAttention 硬件级支持指令集开始显式支持融合 Attention 算子、Tile 级的 KV Cache 寻址与流水线。FP8 / FP4 稀疏化指令引入对 4-bit 浮点数以及 2:4 结构化稀疏矩阵计算的硬件指令支持。存算一体CIM指令直接在 Memory Array 内部触发计算进一步消除数据搬运的指令开销。

相关新闻

FFmpeg视频编辑核心能力与实战技巧详解

FFmpeg视频编辑核心能力与实战技巧详解

1. FFmpeg视频编辑核心能力解析FFmpeg作为开源音视频处理工具链中的瑞士军刀,其命令行工具在视频编辑领域有着不可替代的地位。不同于专业非线性编辑软件的图形界面操作,FFmpeg通过命令行参数实现高效精准的媒体处理,特别适合自动化处理、批量…

2026/8/4 6:15:30 阅读更多 →
UE4性能优化:深入解析GUObjectAllocator与GC策略解决间歇性卡顿

UE4性能优化:深入解析GUObjectAllocator与GC策略解决间歇性卡顿

1. 项目概述:从一次卡顿排查说起最近在为一个UE4 4.26版本的项目做性能优化,团队反馈在长时间运行后,尤其是在打开大型关卡或频繁切换场景时,会出现明显的间歇性卡顿,帧时间图上能看到周期性的“毛刺”。这种卡顿不像G…

2026/8/4 6:14:30 阅读更多 →
RadixAttention

RadixAttention

在 SGLang 中,RadixAttention 是其实现零开销(Zero-overhead)全局 KV Cache 复用的核心机制。 传统 Prefix Caching 往往需要手动指定静态 Prefix,或者仅支持简单的线性匹配;而 RadixAttention 将运行过程中产生的所有…

2026/8/4 6:14:30 阅读更多 →

最新新闻

Python爬虫实战:Requests+BeautifulSoup+正则批量提取视频选集信息

Python爬虫实战:Requests+BeautifulSoup+正则批量提取视频选集信息

1. 项目概述:从视频网站精准“收割”选集信息最近在整理一些在线课程或者追剧的时候,有没有遇到过这样的烦恼?一个几十集甚至上百集的系列视频,你想把每一集的名字都整理出来,做成一个目录或者导入到自己的笔记软件里&…

2026/8/4 7:10:54 阅读更多 →
C++预处理器指令详解与应用实践

C++预处理器指令详解与应用实践

1. 预处理器指令的本质与作用在C开发中,预处理器指令是编译过程中最先被处理的特殊指令。它们以#开头,在编译器真正开始编译源代码之前,由预处理器执行文本级别的操作。不同于普通的C语句,预处理器指令不遵循C语法规则&#xff0c…

2026/8/4 7:10:54 阅读更多 →
LS-DYNA霍普金森压杆动态劈裂仿真技术详解

LS-DYNA霍普金森压杆动态劈裂仿真技术详解

1. 项目概述:霍普金森压杆动态劈裂仿真全解析在材料动态力学性能研究领域,霍普金森压杆(Split Hopkinson Pressure Bar, SHPB)实验技术一直是获取高应变率下材料力学响应的黄金标准。而LS-DYNA作为显式动力学分析的行业标杆工具,其k文件建模方…

2026/8/4 7:10:54 阅读更多 →
为什么手机上录的视频在电脑上播是“躺着的“?聊聊移动端视频优化

为什么手机上录的视频在电脑上播是“躺着的“?聊聊移动端视频优化

为什么手机上录的视频在电脑上播是"躺着的"?聊聊移动端视频优化 你肯定遇到过:手机竖着录的视频,发到电脑上打开——画面旋转了 90,人脸横着、字幕竖着。更诡异的是,有些 App 里能正常播放,有些就…

2026/8/4 7:10:54 阅读更多 →
柔性板流固耦合减阻技术及MATLAB实现

柔性板流固耦合减阻技术及MATLAB实现

1. 柔性板重构减阻技术概述在流体力学工程实践中,柔性板结构的减阻优化一直是个极具挑战性的课题。传统刚性结构由于无法自适应流场变化,往往需要复杂的主动控制机构来实现减阻效果。而柔性材料特有的变形特性,使其能够通过被动形变实现流场重…

2026/8/4 7:10:53 阅读更多 →
CST与Matlab联合仿真在超表面设计中的实践

CST与Matlab联合仿真在超表面设计中的实践

1. 项目概述:CST与Matlab联合仿真在超表面设计中的应用超表面(Metasurface)作为人工设计的二维亚波长结构阵列,正在彻底改变传统光学器件的设计范式。这种由金属或介质微结构组成的平面结构,能够实现对电磁波相位、振幅…

2026/8/4 7:09:53 阅读更多 →

日新闻

AI Agent白手起家26: 使用标准事件驱动大模型实践

AI Agent白手起家26: 使用标准事件驱动大模型实践

纲要 练习目标:掌握大模型标准事件的调用回顾 LangChain 中的核心标准事件 invokestreambatchastream_eventswith_structured_output 环境准备实战代码:多种事件调用对比 同步调用与流式输出批量处理异步事件流监听结构化输出 运行说明与预期结果总结与扩…

2026/8/4 0:00:40 阅读更多 →
dealsea是什么?跨境卖家必知的美国deal站入门指南

dealsea是什么?跨境卖家必知的美国deal站入门指南

说实话,第一次听说美国这个老牌折扣网站的跨境卖家,十个有八个会问同一个问题:这个平台到底是干嘛的?我见过一个做家居出口的朋友,他在亚马逊上月销二十万美金,却从来没用过它。我给他看了首页——一屏一屏…

2026/8/4 0:01:40 阅读更多 →
清华大学重磅EST:植物自导电闪蒸焦耳热600°C/2600°C两步法!稀土超积累植物秒级转化为CeO₂-石墨烯电催化剂!

清华大学重磅EST:植物自导电闪蒸焦耳热600°C/2600°C两步法!稀土超积累植物秒级转化为CeO₂-石墨烯电催化剂!

通讯作者:邓兵、刘建国通讯单位:清华大学DOI:https://doi.org/10.1021/acs.est.6c00603研究背景稀土元素(REEs)是清洁能源技术与电子器件不可或缺的核心原料,然而传统提取方式依赖能耗高、排放大的采矿与强…

2026/8/4 0:01:40 阅读更多 →

周新闻

最大流算法详解:从水管网络到Ford-Fulkerson与Dinic实战

最大流算法详解:从水管网络到Ford-Fulkerson与Dinic实战

1. 从水管网络到最大流:一个核心问题的诞生想象一下,你是一个城市供水系统的总工程师。你的城市有多个水源(水库),需要通过一个复杂的地下管道网络,将水输送到各个居民区。每条管道都有其最大通水能力&…

2026/8/3 4:58:13 阅读更多 →
基于Springboot的企业门户网站(源码+LW+调试文档+讲解)

基于Springboot的企业门户网站(源码+LW+调试文档+讲解)

温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台…

2026/8/3 1:53:31 阅读更多 →
MATLAB xcorr函数详解:从互相关原理到四大实战应用

MATLAB xcorr函数详解:从互相关原理到四大实战应用

1. 从一次信号“找茬”说起:为什么我们需要互相关几年前,我在处理一组声学传感器数据时遇到了一个棘手的问题。我有两个麦克风记录了一段相同的音频信号,理论上它们接收到的声音波形应该非常相似,只是由于麦克风位置不同&#xff…

2026/8/4 5:26:40 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/3 13:07:03 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/3 5:19:38 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/3 8:27:36 阅读更多 →