CPU、GPU、NPU工作原理和区别
大家读完觉得有帮助记得关注和点赞1. 核心术语CPU, GPU, NPU核心观点 在芯片总面积一定的情况下晶体管资源在控制逻辑单元和计算单元之间的分配决定了芯片的特性和用途。1.1 CPU - 复杂逻辑的控制大师面积分配 大部分芯片面积用于控制逻辑如分支预测、乱序执行、多级高速缓存。计算单元ALU/FPU占比相对较小。能力 逻辑控制能力极强擅长处理复杂、串行、多变的任务。单线程性能高但并行算力相对较弱。角色 系统的大脑和指挥官负责运行操作系统、应用程序的整体调度和复杂决策。1.2 GPU - 大规模并行的计算巨兽面积分配 绝大部分芯片面积用于构建海量的、相对简单的计算核心Streaming Processors / CUDA Cores。控制逻辑和缓存被大量核心共享相对简化。能力 并行计算能力极强逻辑控制能力弱。适合处理高度并行、计算模式统一的任务如图形渲染、科学计算、矩阵运算。角色 协处理器在CPU的指挥下负责完成计算密集型的“重活”。1.3 NPU / TPU - 专精定制的效率专家设计哲学 属于专用集成电路范畴的AI加速器。硬件电路直接针对神经网络的核心运算如张量运算、卷积、矩阵乘加、激活函数进行固化优化。能力 在其特定任务上相比通用处理器CPU/GPU具有压倒性的能效比和速度优势例如一个时钟周期内可完成数万至数十万次乘加运算。应用场景 手机、物联网设备、边缘计算等对功耗和实时性要求极高的场景。TPU Google的张量处理单元是NPU的一个著名实现。其设计目标与NPU高度一致。TPU vs. GPU 的经典比喻 [11]GPU 像一个博士生他能够快速解决各种复杂的数学问题通用并行计算能力强。TPU 像一个专门计算两位数字乘法的计算器它做这个特定任务的速度远超博士生且功耗极低但你无法用它来写论文。Google TPU芯片布局直观展示了其专用性黄色计算单元 占据了绝对主导的面积即庞大的矩阵乘加计算阵列。蓝色数据单元/ 绿色I/O单元 服务于计算单元的数据搬运。红色控制单元 面积最小逻辑极其简化负责调度固定的计算流程。1.4 小结融合与演进GPU 在保持通用并行计算的同时不断引入针对AI的专用硬件单元如NVIDIA的Tensor Cores专门加速矩阵运算。NPU 在保证极致能效的同时也开始增强其编程灵活性和对更多计算类型的支持。趋势 GPU与NPU呈现出 “双向奔赴” 的融合趋势旨在实现通用性与高效能之间的最佳平衡。2. DaVinci 架构统一架构覆盖全场景2.1 场景与需求分析不同AI应用场景对算力和内存的需求差异巨大设备端Device 功耗敏感算力需求通常小于10 TFLOPS内存要求小如手机、摄像头。边缘端Edge 中等算力与内存需求如边缘服务器、智能网关。云端Cloud 追求极致算力需求可达数百甚至数千TFLOPS需要大内存支持大规模模型训练和推理。华为的解决方案是采用统一的DaVinci架构通过 scalable 的设计以同一套核心架构覆盖从极低功耗到极高算力的所有场景。2.2 Ascend NPU 核心设计DaVinci架构的创新在于引入了 3D Cube 引擎作为矩阵计算的专用硬件。传统计算 标量Scalar、矢量Vector运算。AI核心 3D Cube 实现了大规模矩阵Tensor的并行计算极大提升了计算密度和效率。效果 在单位芯片面积或单位功耗下其AI计算性能相比传统的CPU和GPU架构实现了数量级的提升。3. 路线一NPU集成于手机SoCKirin系列现代手机是一个片上系统将CPU、GPU、NPU、ISP、基带等多种处理器集成于一颗芯片。3.1 Kirin 970 (2017) - 首秀搭载机型 Mate 10系列。意义 全球首款内置独立NPU的手机AI芯片。性能 在AI任务如图片识别上速度比CPU快25~50倍。3.2 Kirin 990 5G (2019) - 集成与进化搭载机型 Mate 30系列。NPU 集成达芬奇架构的NPU大核微核实现不同场景下的能效最优。SoC拓扑 典型的多核异构架构NPU与CPU、GPU、ISP等协同工作。关键参数工艺 台积电7nm EUVCPU 2xA76 2.86GHz 2xA76 2.36GHz 4xA55 1.95GHzGPU Mali-G76 MP16NPU 1个大核 1个微核3.3 Kirin 9000 5G (2020) - 巅峰搭载机型 Mate 40系列。工艺 台积电5nm代表了当时最先进的制程。NPU 采用2个大核 1个微核的设计AI算力再创新高。3.4 Kirin 9000s (2023) - 回归与突破搭载机型 Mate 60系列。意义 在美国制裁背景下的“王者低调回归”。工艺 据分析采用中芯国际N2等效7nm工艺。性能定位 虽在制程上略逊于Kirin 9000但实现了从0到1的突破具备强大的综合性能和AI能力。4. 路线二独立AI加速卡Ascend系列面向数据中心和企业市场提供独立的AI训练和推理卡。4.1 产品形态Atlas系列包括Atlas 200/300/500/800/900等是集成了Ascend NPU的加速卡、服务器或一体机。4.2 Ascend 310 (2019) - 推理主力定位 高效AI推理。架构 达芬奇架构 D-mini 核心。算力 FP16 INT8 算力分别达到8 TFLOPS和16 TOPS。对标 性能与能效对标NVIDIA T4 推理卡。4.3 Ascend 910 (2019) - 训练定位 高端AI模型训练。架构 达芬奇架构 Max 核心。算力 FP16算力高达256 TFLOPSINT8算力512 TOPS。工艺 台积电7nm EUV。对标 直接挑战Google TPU v3 和NVIDIA V100。集群能力 数千颗Ascend 910可通过高速互联构建AI计算集群如鹏城实验室的“鹏城云脑”提供E级百亿亿次AI算力。4.4 Ascend 910B (2023) - 持续迭代定位 Ascend 910的升级版是目前中国AI算力市场的关键产品。改进 在制程、架构、互联带宽等方面均有优化综合性能进一步提升以应对NVIDIA H800/A800等最新GPU的竞争。总结通过统一的达芬奇架构成功地将其NPU技术横向扩展应用于从极致能效的手机端到极致算力的云端的全场景。纵向深耕在手机芯片Kirin和AI加速卡Ascend两条产品线上持续迭代构建了完整的自主AI算力体系。

相关新闻

react-moralis源码深潜:_useResolveCall一个Hook如何统一所有异步请求的状态管理

react-moralis源码深潜:_useResolveCall一个Hook如何统一所有异步请求的状态管理

react-moralis源码深潜:_useResolveCall一个Hook如何统一所有异步请求的状态管理 【免费下载链接】react-moralis Hooks and components to use Moralis in a React app 项目地址: https://gitcode.com/gh_mirrors/re/react-moralis react-moralis 是一个专为…

2026/8/26 20:22:51 阅读更多 →
微信4.0防撤回失效?3步恢复微信防撤回补丁指南

微信4.0防撤回失效?3步恢复微信防撤回补丁指南

微信4.0防撤回失效?3步恢复微信防撤回补丁指南 【免费下载链接】RevokeMsgPatcher :trollface: A hex editor for WeChat/QQ/TIM - PC版微信/QQ/TIM防撤回补丁(我已经看到了,撤回也没用了) 项目地址: https://gitcode.com/GitHu…

2026/8/26 20:22:51 阅读更多 →
老款Mac免费升级路径:用OpenCore Legacy Patcher让旧机器跑上最新macOS

老款Mac免费升级路径:用OpenCore Legacy Patcher让旧机器跑上最新macOS

老款Mac免费升级路径:用OpenCore Legacy Patcher让旧机器跑上最新macOS 【免费下载链接】OpenCore-Legacy-Patcher Experience macOS just like before 项目地址: https://gitcode.com/GitHub_Trending/op/OpenCore-Legacy-Patcher 苹果已停止给大量老款Mac推…

2026/8/26 20:22:51 阅读更多 →

最新新闻

软件测试面试突破:核心挑战与实战策略

软件测试面试突破:核心挑战与实战策略

1. 软件测试面试的核心挑战与应对策略在当前的IT就业环境中,软件测试岗位的竞争日趋激烈。根据我过去五年参与技术面试和辅导求职者的经验,一个中级测试工程师岗位平均会收到80-120份简历。面对如此激烈的竞争,仅仅掌握基础测试知识已经远远不…

2026/8/26 20:54:11 阅读更多 →
人形机器人百米冲刺9.39秒背后:运动控制、软件架构与芯片算力解析

人形机器人百米冲刺9.39秒背后:运动控制、软件架构与芯片算力解析

最近有一条消息在科技圈刷屏:“北京人形机器人百米9.39秒超越博尔特”。很多人第一反应是“单位看错了吧”,因为9.39秒跑完100米,平均速度超过38km/h,比博尔特9.58秒的世界纪录还要快。如果这个成绩属实,它将意味着人形…

2026/8/26 20:54:11 阅读更多 →
Pinecone Nexus GA 登顶 τ-Knowledge 基准:同一款模型只换检索层,47.4% 反超 frontier

Pinecone Nexus GA 登顶 τ-Knowledge 基准:同一款模型只换检索层,47.4% 反超 frontier

Pinecone Nexus GA 登顶 τ-Knowledge 基准:同一款模型只换检索层,47.4% 反超 frontier 8 月 23 日 Pinecone 正式宣布知识引擎 Nexus 进入 GA(General Availability)。同一天,在 Sierra AI 发布的 τ-Knowledge 企业知…

2026/8/26 20:54:11 阅读更多 →
蓝桥杯国赛C语言模块化编程实战指南

蓝桥杯国赛C语言模块化编程实战指南

1. 这不是一份“答案集”,而是一套可复用的国赛级解题操作系统蓝桥杯第十四届国赛试题,光看标题,很多人第一反应是“刷题资料”“考前押题”“学长笔记”。但如果你真把这套材料当普通题解来用,大概率会在实战中栽跟头——不是因为…

2026/8/26 20:54:10 阅读更多 →
量子启发算法与时空图神经网络在物流排班优化中的创新应用

量子启发算法与时空图神经网络在物流排班优化中的创新应用

1. 赛题核心:从“物流网络”到“量子计算”的解题思路跃迁 每年四月的MathorCup高校数学建模挑战赛,都是国内数学建模圈子里的一场硬仗。今年的C题,题目叫“物流网络分拣中心货量预测及人员排班”,听起来是不是特别“经典”&#…

2026/8/26 20:54:09 阅读更多 →
起重机远程控制系统:架构设计、一键切换与PLC互锁实践

起重机远程控制系统:架构设计、一键切换与PLC互锁实践

在大型造船厂或重型钢结构车间,单靠操作工在起重机驾驶室或手持遥控器完成吊装,已经很难满足生产节拍和集中安全管控的要求。江智起重机远程控制系统瞄准的正是这个场景:多台桥式、门座式或半门式起重机,由地面中控室集中远程控制…

2026/8/26 20:53:07 阅读更多 →

日新闻

Python random 模块常用函数详解:从入门到实战

Python random 模块常用函数详解:从入门到实战

目录 1. 引言2. 准备工作3. 基础随机函数4. 序列相关函数5. 随机种子与复现6. 实战案例7. 注意事项8. 常见问题与排查9. 总结 1. 引言 摘要: 本文系统介绍 Python 标准库 random 模块中最常用的随机数生成函数。内容涵盖基础随机函数(random()、unifor…

2026/8/26 0:00:40 阅读更多 →
《Microsoft Sql server 2008 Internals》读书笔记--第三章Databases and Database Files(2)

《Microsoft Sql server 2008 Internals》读书笔记--第三章Databases and Database Files(2)

《Microsoft Sql server 2008 Internals》索引目录: 《Microsoft Sql server 2008 Internals》读书笔记--目录索引 在上篇文章中,主要介绍了创建数据库的基本语法和FileGroup的初步知识。需要注意的是: 关于FileGroup 如果你的系统是用Raid设备直接存…

2026/8/26 1:18:18 阅读更多 →
政务AI智能体怎么建?三种模式、三步路径与四个误区

政务AI智能体怎么建?三种模式、三步路径与四个误区

政务AI智能体已经从概念试点阶段,转入了政务服务的常态化落地应用;在实际使用过程中,它能自主理解办事需求、辅助完成填报申报、开展材料预审,并联动多个系统协同作业,真正嵌入到政务办理的全流程当中。但在落地推进过…

2026/8/26 1:18:18 阅读更多 →

周新闻

[光学原理与应用-521]:对光的错误理解与纠偏

[光学原理与应用-521]:对光的错误理解与纠偏

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

2026/8/26 14:45:33 阅读更多 →
SIP通话转接原理与REFER方法实战解析

SIP通话转接原理与REFER方法实战解析

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

2026/8/26 17:46:43 阅读更多 →
Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

2026/8/26 14:46:37 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/26 3:50:20 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/26 17:46:39 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/26 1:24:05 阅读更多 →