ROCm HIP:amd::Context 源码剖析,以及 device context 与 host context 的区别
本文基于 AMD ROCm 开源栈rocm-systems/projects/clr的源码剖析 ROCclr 运行时中核心对象amd::Context的设计与职责并结合 HIP 运行时hipamd说明两种典型上下文——per-deviceprimarycontext与host context——的差异。适合想深入理解 ROCm/HIP 内存管理与设备抽象的读者。目录1、背景ROCclr 在 ROCm 栈中的位置2、amd::Context是什么3、核心职责逐条拆解3.1 设备集合管理与引用计数3.2 主机内存分配 hostAlloc / hostFree3.3 SVM 分配 svmAlloc / svmFree3.4 互操作与属性4、device context vs host context4.1 device context单设备的 primary context4.2 host context跨全部设备的全局上下文4.3 对照表5、调用链6、总结1、背景ROCclr 在 ROCm 栈中的位置ROCm 的用户态运行时大致分层如下HIP API (hipamd) - 用户直接调用的 hipMalloc / hipLaunchKernel 等 | ROCclr (rocclr) - Common Language Runtime设备抽象、内存对象、命令队列 | ROCr / HSA runtime - 硬件抽象层直接和 KFD/驱动打交道 | amdgpu / KFD (内核态)amd::Context属于ROCclr 层是连接“上层 API 语义”和“下层设备资源”的关键枢纽对象。无论是 OpenCL 的cl_context还是 HIP 的设备上下文最终都落到这个类上。2、amd::Context是什么打开头文件rocclr/platform/context.hpp类定义的第一行就点明了它的身份classContext:publicRuntimeObject{std::vectorDevice*devices_;// ...};RuntimeObject继承自ReferenceCountedObject和ICDDispatchedObject这意味着Context是引用计数对象通过retain()/release()管理生命周期而非裸delete是可被 OpenCL ICD 分发的对象可以在cl_context和内部对象之间安全转换。一句话概括它的本质Context就是“一组Device*的聚合”同时是这组设备之上一切内存分配与资源生命周期的“归属域ownership domain”。值得强调的是Context类本身并不区分“host”还是“device”。所谓 host context / device context 的差异完全取决于构造它时传入了哪些设备。这是理解本文后半部分的关键。3、核心职责逐条拆解下面结合实现文件rocclr/platform/context.cpp逐条分析。3.1 设备集合管理与引用计数构造函数遍历传入的设备列表对每个设备retain()并在此过程中筛选出两类“特殊设备”Context::Context(conststd::vectorDevice*devices,constInfoinfo):devices_(devices),info_(info),properties_(NULL),glenv_(NULL),customHostAllocDevice_(NULL){for(constautodevice:devices){device-retain();// 1) 第一个具备“自定义 host 分配器”的设备if(customHostAllocDevice_NULLdevice-customHostAllocator()){customHostAllocDevice_device;}// 2) 所有支持 SVM 的设备if(device-svmSupport()){svmAllocDevice_.push_back(device);}}// 多设备场景下把“细粒度系统不支持”的设备排到最前优先在它上面分配if(svmAllocDevice_.size()1){uint isFirstDeviceFGSEnabledsvmAllocDevice_.front()-isFineGrainedSystem(true);for(autodev:svmAllocDevice_){if(isFirstDeviceFGSEnabled!dev-isFineGrainedSystem(true)){std::swap(svmAllocDevice_.front(),dev);break;}}}}析构函数则做对称的清理解绑 D3D/GL interop、通知设备ContextDestroy()、逐个release()设备。Context因此成为设备生命周期的持有者。3.2 主机内存分配 hostAlloc / hostFreeContext提供统一的主机内存分配入口。它优先使用设备提供的“自定义 host 分配器”通常是 pinned / page-locked 内存DMA 更快否则退回普通对齐分配void*Context::hostAlloc(size_t size,size_t alignment,boolatomics)const{if(customHostAllocDevice_!NULL){returncustomHostAllocDevice_-hostAlloc(size,alignment,atomics?Device::MemorySegment::kAtomics:Device::MemorySegment::kNoAtomics);}returnAlignedMemory::allocate(size,alignment);}voidContext::hostFree(void*ptr)const{if(customHostAllocDevice_!NULL){customHostAllocDevice_-hostFree(ptr);return;}AlignedMemory::deallocate(ptr);}3.3 SVM 分配 svmAlloc / svmFreeSVMShared Virtual Memory共享虚拟内存是让 CPU 和多个 GPU 使用同一虚拟地址访问同一块内存的机制。Context的svmAlloc会在所有支持 SVM 的设备上把同一地址映射一遍void*Context::svmAlloc(size_t size,size_t alignment,cl_svm_mem_flags flags,constamd::Device*curDev,void*svmPtr){unsignedintnumSVMDevsvmAllocDevice_.size();if(numSVMDev1){returnnullptr;}void*svmPtrAllocedsvmPtr;amd::ScopedLocklock(ctxLock_);// 优先在“当前设备”上分配if(curDev!nullptr){if(!(flagsCL_MEM_SVM_ATOMICS)||(curDev-info().svmCapabilities_CL_DEVICE_SVM_ATOMICS)){svmPtrAllocedcurDev-svmAlloc(*this,size,alignment,flags,svmPtrAlloced);if(svmPtrAllocednullptr)returnnullptr;}}// 再在其余支持 SVM 的设备上映射同一地址for(constautodev:svmAllocDevice_){if(devcurDev)continue;if((flagsCL_MEM_SVM_ATOMICS)!(dev-info().svmCapabilities_CL_DEVICE_SVM_ATOMICS)){continue;// 该设备不支持平台原子跳过}svmPtrAlloceddev-svmAlloc(*this,size,alignment,flags,svmPtrAlloced);if(svmPtrAllocednullptr)returnnullptr;}returnsvmPtrAlloced;}svmFree中还有一处值得注意的多 GPU 竞态防护先原子地从全局映射表移除该内存对象再逐设备释放 GPU 虚拟地址最后才真正release()避免并发分配复用同一 VA 时被错误释放voidContext::svmFree(void*ptr)const{amd::ScopedLocklock(ctxLock_);amd::Memory*svmMemamd::MemObjMap::FindAndRemoveMemObj(ptr);if(svmMem!nullptr!svmAllocDevice_.empty()){svmAllocDevice_.front()-SetSvmAttributes(ptr,svmMem-getSize(),amd::MemoryAdvice::ResetAttributes);}for(constautodev:svmAllocDevice_){dev-svmFree(ptr);}if(svmMem!nullptr){svmMem-release();}}3.4 互操作与属性除了内存分配Context还保存了Info info_D3D10/D3D11/GL 等 interop 标志与句柄cl_context_properties* properties_原始属性GLFunctions* glenv_OpenGL 上下文Monitor ctxLock_对上下文串行化访问的锁Windows 平台上的 D3D10/D3D11 扩展缓存。4、device context vs host context明确了Context的本质后来看代码库里两种典型的实例。它们复用同一个amd::Context类差别仅在于构造时传入的设备列表。4.1 device context单设备的 primary context在每个 ROCm 设备初始化时rocclr/device/rocm/rocdevice.cpp会为该设备单独创建一个 Context源码注释直接写着 “dummy context”amd::Context::Info info{0};std::vectoramd::Device*devices{this};// 注意只有 this 一个设备// Create a dummy contextcontext_newamd::Context(devices,info);这个 Context 存放在amd::Device::context_中通过amd::Device::context()暴露。到了 HIP 层hip::Device直接复用它而不是新建// hipamd/src/hip_context.cpp init()for(size_t i0;idevice_count;i){amd::Device*constamd_devicedevices[i];amd_device-SetActiveWait(true);// 复用 amd::Device 里已有的“永生”上下文auto*devicenewDevice(amd_device-context(),static_castunsignedint(i));// ...}hip::Device通过asContext()返回这个单设备上下文它就相当于 CUDA 里每个设备的primary context// hipamd/src/hip_internal.hppclassDevice:publicamd::ReferenceCountedObject{amd::Context*asContext()const{returncontext_;}// ...amd::Context*context_;//! ROCclr context单设备};由于它的devices_里只有 1 个设备所有基于它的 buffer、内核、命令队列、内存分配都绑定到这一个 GPU。4.2 host context跨全部设备的全局上下文在 HIP 初始化的末尾hip_context.cpp又创建了一个覆盖全部 GPU的全局上下文host_context// hipamd/src/hip_context.cppamd::Context*host_contextnullptr;// 全局变量voidinit(bool*status){// ... 枚举全部 GPU 到 devices ...// Create and initialize host contexthost_contextnewamd::Context(devices,amd::Context::Info());// 传入全部设备if(!host_context||CL_SUCCESS!host_context-create(nullptr)){// ...}amd::RuntimeTearDown::RegisterObject(host_context);}它的用途是处理不绑定到具体设备的分配最典型的是纯 SVM / 系统内存可访问的分配。getNullStream()对此有专门判断——当传入的 ctx 是host_context时选哪个设备的 null stream 都无所谓hip::Stream*getNullStream(amd::Contextctx,boolwait){for(constautoit:g_devices){if(it-asContext()ctx){// 命中某个 device contextreturnit-NullStream(wait);}}// 纯 SVM / 系统内存访问用哪个设备默认流都行if(hip::host_contextctx){returngetNullStream(wait);// 回退到当前设备}returnnullptr;}因为它的devices_含全部 GPUsvmAlloc()会在每个设备上都映射同一地址从而实现跨设备统一寻址。补充ROCclr 内部还有一个类似性质的glb_ctx_见rocdevice.cpp同样覆盖全部设备专供 P2P staging 等驱动内部分配使用属于更底层的“全设备上下文”。4.3 对照表维度device contextprimaryhost context创建位置rocclr/device/rocm/rocdevice.cppcontext_ new amd::Context(...)hipamd/src/hip_context.cpphost_context new amd::Context(...)devices_内容单个设备this全部 GPU归属层ROCclramd::Device拥有HIP 全局单例典型用途该设备上的 buffer / 内核 / 队列per-device 分配跨设备 SVM / 系统内存、与设备无关的分配SVM 行为只在 1 个设备上映射在所有设备上映射同一 VAHIP 暴露方式hip::Device::asContext()全局hip::host_context语义类比CUDA 的 device primary context一个“与具体设备无关”的兜底上下文5、调用链HIP 层 (hipamd)ROCclr 层拥有asContext 复用devices_ 1 个 GPUdevices_ 全部 GPUamd::Devicedevice contextamd::Context(devices{this})单设备glb_ctx_amd::Context(全部设备)驱动内部 P2Phip::Devicehost_contextamd::Context(全部设备)全局单例per-device 分配绑定单个 GPUSVM / 系统内存跨设备统一寻址6、总结amd::Context是 ROCclr 中引用计数的“设备集合 分配归属域”统一承载 host 内存分配、SVM 分配、interop 属性与资源生命周期。它本身不区分host / device差异完全来自构造时传入的设备列表范围。device context只含单个 GPU是每个设备的 primary contextHIP 通过hip::Device::asContext()复用per-device 的 buffer、内核、分配都落在这一个设备上。host context覆盖全部 GPU是 HIP 的全局单例专门服务跨设备 SVM / 与具体设备无关的主机侧分配。二者共用同一套svmAlloc逻辑但因设备列表不同一个只映射单卡地址一个在所有卡上映射同一 VA从而支撑起 ROCm 的统一虚拟内存模型。理解这两类 Context 的分工是读懂 HIP 内存管理hipMalloc/hipMallocManaged/ SVM与多 GPU 寻址的基础。

相关新闻

MSP430BT5190外设深度解析:从寄存器到低功耗系统设计实战

MSP430BT5190外设深度解析:从寄存器到低功耗系统设计实战

1. 项目概述:为什么我们需要深入理解MCU外设?在嵌入式开发这条路上摸爬滚打了十几年,我见过太多项目卡在“知其然,不知其所以然”的瓶颈上。很多工程师,尤其是刚入行的朋友,拿到一块像MSP430BT5190这样的微…

2026/9/19 3:32:29 阅读更多 →
从芯片到系统:ADS8353/7853评估板实战指南与高精度ADC设计要点

从芯片到系统:ADS8353/7853评估板实战指南与高精度ADC设计要点

1. 项目概述:从芯片到系统,如何用好一块ADC评估板在嵌入式系统、精密测量或者工业控制领域,但凡涉及到将现实世界的物理量(比如温度、压力、振动)转换成数字信号进行处理,模数转换器(ADC&#x…

2026/9/18 15:07:59 阅读更多 →
如何用qmcdump一键解密QQ音乐加密音频:终极免费工具完整指南

如何用qmcdump一键解密QQ音乐加密音频:终极免费工具完整指南

如何用qmcdump一键解密QQ音乐加密音频:终极免费工具完整指南 【免费下载链接】qmcdump 一个简单的QQ音乐解码(qmcflac/qmc0/qmc3 转 flac/mp3),仅为个人学习参考用。 项目地址: https://gitcode.com/gh_mirrors/qm/qmcdump …

2026/9/19 2:42:46 阅读更多 →

最新新闻

OpenHands 实战:TaoToken 跑通 SWE-bench Verified 全流程

OpenHands 实战:TaoToken 跑通 SWE-bench Verified 全流程

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/19 16:55:36 阅读更多 →
用 OpenDesign 复刻 Airtable 设计系统:从视觉规范到语义化 Design Token 的完整落地指南

用 OpenDesign 复刻 Airtable 设计系统:从视觉规范到语义化 Design Token 的完整落地指南

用 OpenDesign 复刻 Airtable 设计系统:从视觉规范到语义化 Design Token 的完整落地指南 【免费下载链接】open-design 🎨 Best DeepSeek Harness Design Plugin. The open-source Claude Design alternative. 🖥️ Local-first desktop app…

2026/9/19 16:55:36 阅读更多 →
Cline 报 401?TaoToken 这样核对模型 ID 和 Base URL

Cline 报 401?TaoToken 这样核对模型 ID 和 Base URL

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/19 16:55:36 阅读更多 →
Caffe EuclideanLoss 层完全指南:平方和(L2)回归损失层的原理、配置与实战

Caffe EuclideanLoss 层完全指南:平方和(L2)回归损失层的原理、配置与实战

Caffe EuclideanLoss 层完全指南:平方和(L2)回归损失层的原理、配置与实战 【免费下载链接】caffe Caffe: a fast open framework for deep learning. 项目地址: https://gitcode.com/gh_mirrors/ca/caffe 本文以 Caffe 官方教程 docs…

2026/9/19 16:55:36 阅读更多 →
QuickRecorder:macOS 录屏快速上手指南

QuickRecorder:macOS 录屏快速上手指南

QuickRecorder:macOS 录屏快速上手指南 【免费下载链接】QuickRecorder A lightweight screen recorder based on ScreenCapture Kit for macOS / 基于 ScreenCapture Kit 的轻量化多功能 macOS 录屏工具 项目地址: https://gitcode.com/GitHub_Trending/qu/Quick…

2026/9/19 16:55:36 阅读更多 →
Roc 语言 Try.map_both 实战:从 REPL 快照测试看懂 Ok/Err 双分支映射语义

Roc 语言 Try.map_both 实战:从 REPL 快照测试看懂 Ok/Err 双分支映射语义

Roc 语言 Try.map_both 实战:从 REPL 快照测试看懂 Ok/Err 双分支映射语义 【免费下载链接】roc A fast, friendly, functional language. 项目地址: https://gitcode.com/GitHub_Trending/ro/roc 本篇技术指南以 Roc 仓库中的 REPL 快照测试 test/snapshots…

2026/9/19 16:54:36 阅读更多 →

日新闻

BP神经网络时序预测:滑窗长度与多窗口平均策略

BP神经网络时序预测:滑窗长度与多窗口平均策略

简介:面向机器学习、深度学习与数据建模学习者的一份完整研究文献,聚焦BP神经网络在农业产量预测中的应用。文档以1980—2018年全国棉花产量为样本,系统讲解数据归一化处理、激活函数原理、多层神经网络结构搭建及训练流程,展示敏…

2026/9/19 0:00:30 阅读更多 →
Transformer训练实时监控实战:基于MindSpore的损失曲线可视化方案

Transformer训练实时监控实战:基于MindSpore的损失曲线可视化方案

上个月调一个Deformable DETR模型,在单卡上要跑将近两天。第二天早上我下意识打开终端翻日志,发现loss从凌晨两点就开始往上爬,一路从0.8涨到1.35,整整六个小时没人发现。那六个小时的训练不仅白跑,还霸占着卡——等于…

2026/9/19 0:00:30 阅读更多 →
OpenCloud 中的 Go 类型安全转换库 spf13/cast:从零值回退到泛型 API 的完整实战指南

OpenCloud 中的 Go 类型安全转换库 spf13/cast:从零值回退到泛型 API 的完整实战指南

OpenCloud 中的 Go 类型安全转换库 spf13/cast:从零值回退到泛型 API 的完整实战指南 【免费下载链接】opencloud 🌤️ OpenCloud is the open source platform for file management, sharing and collaboration. Simple and sovereign. 项目地址: htt…

2026/9/19 0:00:30 阅读更多 →

周新闻

AI SDK Harness 依赖更新指南:掌握 harness 包 SDK 依赖的升级、桥接同步与一致性校验

AI SDK Harness 依赖更新指南:掌握 harness 包 SDK 依赖的升级、桥接同步与一致性校验

AI SDK Harness 依赖更新指南:掌握 harness 包 SDK 依赖的升级、桥接同步与一致性校验 【免费下载链接】ai The AI Toolkit for TypeScript. From the creators of Next.js, the AI SDK is a free open-source library for building AI-powered applications and ag…

2026/9/19 3:59:36 阅读更多 →
Refine v5 Ant Design NumberField 组件实战:基于 Intl 的本地化数字格式化

Refine v5 Ant Design NumberField 组件实战:基于 Intl 的本地化数字格式化

Refine v5 Ant Design NumberField 组件实战:基于 Intl 的本地化数字格式化 【免费下载链接】refine A React Framework for building internal tools, admin panels, dashboards & B2B apps with unmatched flexibility. 项目地址: https://gitcode.com/GitH…

2026/9/19 3:53:08 阅读更多 →
Flutter应用改名全指南:从Android到iOS的配置与工具实践

Flutter应用改名全指南:从Android到iOS的配置与工具实践

刚接一个外包项目时,甲方要求把工程里临时用的应用名改成正式产品名。我本来觉得“改名”这种小事,打开配置文件改一行不就完了?结果真动手才发现,Flutter项目里“应用名称”根本不是一处配置,而是一整套散落在 Androi…

2026/9/19 4:02:43 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/16 22:31:27 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/15 21:39:18 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/16 22:32:59 阅读更多 →