【NVIDIA cuFile技术解析】开源GPU直连存储与Storage-Next如何重构AI数据路径
文章目录NVIDIA cuFile技术解析开源GPU直连存储与Storage-Next如何重构AI数据路径一、引言二、传统数据路径为什么跟不上GPU2.1 两条路径2.2 AI工作负载为何特别需要它三、cuFile开源了什么3.1 API与底层栈3.2 微秒级不是固定SLA四、Vera CPU数据服务不能只靠直通五、Storage-Next与SCADA5.1 40多家厂商共同定义GPU驱动存储5.2 SCADA只拉应用需要的数据六、工程落地与横向对比6.1 采用cuFile前先做四类基准6.2 与其他I/O路线对比七、总结NVIDIA cuFile技术解析开源GPU直连存储与Storage-Next如何重构AI数据路径一、引言亲爱的朋友们创作不容易若对您有帮助的话请点赞收藏加关注哦您的关注是我持续创作的动力谢谢大家有问题请私信或联系邮箱jasonai.fngmail.comAI 系统讨论性能时常盯着 GPU 算力和显存带宽但训练、检索和 Agent 推理都要不断把数据从存储送到 GPU。传统路径通常由 CPU 发起 I/O把数据读入主机内存再复制到 GPU当成千上万个 GPU 线程同时请求小块数据CPU 搬运、内存复制、压缩、加密和校验会成为新的瓶颈。2026 年 8 月 4 日NVIDIA 在 Future of Memory and StorageFMS大会宣布开源 cuFile API 及其下层垂直存储软件栈。cuFile 是 GPUDirect Storage 的组成部分让 GPU 能直接发起对存储的读写并将访问延迟压到微秒级。NVIDIA 同时联合 40 多家存储和闪存厂商推出 Storage-Next 计划试图把 GPU 驱动存储从单一厂商优化扩展为开放、互操作的行业规范。这次开源的目标不是简单“再快一点读文件”而是让存储从被动容量层变成 AI 计算数据路径的一部分。二、传统数据路径为什么跟不上GPU2.1 两条路径传统I/O Storage → NIC/NVMe → CPU内核/驱动 → 主机内存 → CPU发起复制 → GPU显存 GPUDirect Storage / cuFile Storage → NIC/NVMe ───────────────→ GPU显存 受控DMA与存储软件栈减少中间复制能降低 CPU 占用和主机内存带宽压力也缩短尾延迟。但“直连”不是物理上完全绕过 CPU控制面、权限配置、文件系统、错误处理和安全策略仍有 CPU 与内核参与优化的是数据面的大块搬运路径。2.2 AI工作负载为何特别需要它场景I/O特征传统瓶颈大模型训练大规模分片、检查点和数据集流入CPU拷贝占用、GPU等待数据向量检索/RAG大量并发随机读取小I/O与尾延迟放大长上下文推理KV/上下文层级溢出到外部存储内存容量不足、换入延迟多Agent系统数千并发工具和数据请求CPU编排、压缩与加密拥塞科学计算GPU直接处理大型文件块主机内存形成中转瓶颈当 GPU 可以自己发出数千个并发存储操作存储系统就需要像并行加速器的上游组件一样设计而不是只优化单个 CPU 线程顺序读写。三、cuFile开源了什么3.1 API与底层栈cuFile 为应用提供 GPU Buffer 与文件之间的读写接口属于 NVIDIA GPUDirect Storage。开源 API 及其下层软件栈意味着存储厂商和开发者可以查看、贡献并适配实现而不只在封闭二进制接口外做插件。// 概念示例具体参数与错误处理以官方API为准CUfileHandle_t handle;void*gpu_buffer;cudaMalloc(gpu_buffer,bytes);cuFileHandleRegister(handle,handle_desc);cuFileBufRegister(gpu_buffer,bytes,0);ssize_tncuFileRead(handle,gpu_buffer,bytes,file_offset,0);cuFileBufDeregister(gpu_buffer);cuFileHandleDeregister(handle);cudaFree(gpu_buffer);应用仍需注册文件句柄与 GPU 缓冲区检查对齐、返回值和兼容路径。硬件或文件系统不支持直通时生产程序必须有回退和可观测性避免性能悄悄退化却无人发现。3.2 微秒级不是固定SLANVIDIA 表示 cuFile 利用大量 GPU 线程、高带宽显存等方法使存储访问达到微秒级。这个表述描述技术路径与典型能力不代表任意网络存储、任意文件大小或拥塞状态都能保证同一延迟。介质、拓扑、文件系统、队列深度、I/O 大小和加密都会影响结果。四、Vera CPU数据服务不能只靠直通GPU 直读存储之前或之后数据仍可能需要压缩、解压、加密、校验和重构。NVIDIA 博客披露Vera CPU 在两阶段压缩与加密流水线中吞吐最高达到 x86 CPU 的 3.21 倍。该数字来自 NVIDIA 展示的特定基准应按“最高、特定流水线”理解不应外推到所有 CPU 工作负载。GPU请求 │ ▼ 存储数据 ─► 压缩/解压 ─► 加密/解密 ─► 校验/重构 ─► GPU显存 Vera CPU / BlueField / 存储处理器协同cuFile 缩短数据搬运Vera/BlueField 处理数据服务Spectrum-X 承担网络SCADA 管理规模化加速数据访问。NVIDIA 的策略是全路径协同而非让某一个 API 独自解决所有存储瓶颈。五、Storage-Next与SCADA5.1 40多家厂商共同定义GPU驱动存储Storage-Next 汇集存储厂商、控制器供应商、散热与冷却、编排方和标准组织目标是让 GPU 驱动存储行为形成互操作、开放标准。NVIDIA 博客列举 DDN、KIOXIA、Micron 等参与者整体超过 40 家。参与方需要共同解决的问题存储/闪存厂商并发队列、介质延迟、故障语义控制器厂商DMA、隔离、数据服务卸载网络厂商大规模东西向流量与拥塞控制编排平台资源发现、拓扑感知和QoS安全/标准组织权限、审计、接口与互操作规范5.2 SCADA只拉应用需要的数据NVIDIA 提出的 SCADAScaled, Accelerated Data Access框架让大规模并行 GPU 从存储中只读取应用所需数据直接进入高速显存。它把控制面与高速用户路径分离特权组件在初始化时配置受保护访问应用的数据面保持高吞吐但不因此获得任意读写其他进程内存的能力。这点很重要。直通若缺少隔离会把性能特性变成安全漏洞。开放 API 的成熟度最终取决于权限、地址验证、租户隔离、审计和撤销是否与速度一样可靠。六、工程落地与横向对比6.1 采用cuFile前先做四类基准测试至少记录吞吐顺序/随机、不同块大小、队列深度延迟P50/P95/P99不只看平均值资源GPU利用率、CPU占用、主机内存带宽可靠性回退路径、短读写、设备错误、重试与数据校验对照组Apread → pinned host memory → cudaMemcpyAsync 实验组BcuFileRead → GPU buffer 保持文件、块大小、队列深度、缓存状态和校验方式一致 同时比较端到端任务时间而不只比较裸I/O带宽。6.2 与其他I/O路线对比路线优势适用场景局限POSIX I/O主机拷贝兼容性最好、调试成熟通用应用与中小吞吐CPU和内存中转开销mmap/页缓存编程简单、复用系统缓存CPU访问和混合工作负载GPU仍需迁移行为受页缓存影响io_uring异步拷贝高效CPU异步I/O需要广泛Linux兼容数据仍经主机路径cuFile/GPUDirect StorageGPU直达、降低CPU搬运、并发高AI训练、检索、科学计算对硬件、驱动、文件系统和拓扑有要求cuFile 不会让所有工作负载都更快。小文件元数据密集、预处理严重依赖 CPU、数据能完全缓存于内存或 GPU 计算本身已是瓶颈时传统路径可能更简单。七、总结维度核心结论开源内容NVIDIA开源cuFile API及底层存储软件栈扩展GPUDirect Storage互操作性数据路径GPU可直接向存储读写减少CPU和主机内存的数据搬运性能口径官方称访问可达微秒级Vera CPU特定两阶段流水线最高为x86的3.21倍行业协作Storage-Next联合40多家厂商推动GPU驱动存储的开放标准安全边界直通数据面仍需特权控制面、隔离、审计和可靠回退不能绕过权限cuFile 开源意味着 GPU 直连存储从 NVIDIA 的性能特性向行业公共接口迈进。随着训练数据、Agent 上下文和检索索引远超显存容量未来 AI 系统的性能上限会越来越取决于整条数据路径存储能否及时、并行且安全地把正确数据送到 GPU而不只是 GPU 每秒能做多少次矩阵乘法。参考资料As AI Increases Demands on Memory, Storage Steps Up — NVIDIA BlogNVIDIA GPUDirect Storage文档NVIDIA cuFile API Reference

相关新闻

FTTO全光园区网络部署实战:从PON技术原理到工程落地避坑指南

FTTO全光园区网络部署实战:从PON技术原理到工程落地避坑指南

1. 项目概述:从“光纤到户”到“光纤到工位”如果你在负责企业、园区或者大型楼宇的网络建设或改造,最近一定频繁听到“FTTO”这个词。它不再是电信运营商宣传册上那个遥远的“光纤到户”概念,而是正在成为解决企业内部网络瓶颈、支撑数字化转…

2026/8/8 15:02:18 阅读更多 →
VMware虚拟机磁盘压缩实战:释放vmdk文件占用的宿主机空间

VMware虚拟机磁盘压缩实战:释放vmdk文件占用的宿主机空间

1. 虚拟机磁盘膨胀的“隐形杀手”与压缩的必要性如果你在Windows上用VMware Workstation或Player跑虚拟机,时间一长,可能会发现一个令人头疼的现象:宿主机上那个虚拟机磁盘文件(通常是.vmdk格式)的体积,像吹…

2026/8/8 13:05:42 阅读更多 →
数据库主键与外键:从核心概念到实战权衡

数据库主键与外键:从核心概念到实战权衡

1. 从一次数据混乱说起:为什么我们需要主键和外键?如果你刚接触数据库,可能会觉得“主键”和“外键”是两个抽象的概念,甚至有点多余。我刚开始做项目时也这么想,直到有一次,我接手了一个小型的用户订单系统…

2026/8/8 13:08:07 阅读更多 →

最新新闻

tweetback与Eleventy整合开发:静态站点生成实战

tweetback与Eleventy整合开发:静态站点生成实战

tweetback与Eleventy整合开发:静态站点生成实战 【免费下载链接】tweetback Take ownership of your Twitter data and get your tweets back 项目地址: https://gitcode.com/gh_mirrors/tw/tweetback tweetback是一个帮助用户掌控自己Twitter数据的开源项目…

2026/8/8 15:57:21 阅读更多 →
RAG 系统设计拆招:同样一道题,为什么有人拿 offer

RAG 系统设计拆招:同样一道题,为什么有人拿 offer

进阶拆招第一卷。6 道大厂 RAG 真题方向,每题先摆三种最常见的错误答法,逐层拆破绽,再给优化回答。数据均为示意性,重点看思路。 怎么读:每题给三种典型答法——① 概念混淆(方向就错)、② 似是…

2026/8/8 15:57:21 阅读更多 →
工业4-20mA信号有源与无源的本质区别、快速区分与正确接线指南

工业4-20mA信号有源与无源的本质区别、快速区分与正确接线指南

1. 项目概述:从一次现场调试的困惑说起 上个月,我带着新来的工程师小张去一个老旧的化工车间做仪表改造前的摸底。现场有一排老式的压力变送器,我们需要把它们输出的4-20mA信号接到新的PLC上。小张拿着万用表,熟练地找到信号线&am…

2026/8/8 15:57:21 阅读更多 →
大模型输出格式约束:从Prompt工程到函数调用的实战指南

大模型输出格式约束:从Prompt工程到函数调用的实战指南

1. 从“天马行空”到“循规蹈矩”:为什么我们需要约束大模型的输出?如果你用过ChatGPT、Claude或者国内的文心一言、通义千问这类大语言模型,一定有过这样的体验:你问它“帮我写一首关于春天的诗”,它可能会给你一首七…

2026/8/8 15:57:21 阅读更多 →
STM32程序跳转与IAP升级:从原理到实战的嵌入式开发指南

STM32程序跳转与IAP升级:从原理到实战的嵌入式开发指南

1. 项目概述:为什么我们需要程序跳转? 在嵌入式开发,尤其是基于STM32这类资源受限的单片机项目中,“程序跳转”这个听起来有点底层的操作,其实离我们并不遥远。你可能正在开发一个需要固件在线升级(IAP&…

2026/8/8 15:57:21 阅读更多 →
Beremiz开源软PLC:工业自动化的模块化革命

Beremiz开源软PLC:工业自动化的模块化革命

Beremiz开源软PLC:工业自动化的模块化革命 【免费下载链接】beremiz Beremiz is Free Software for machine automation. 项目地址: https://gitcode.com/gh_mirrors/be/beremiz 引言:传统PLC的桎梏与开源解决方案 在工业自动化领域,…

2026/8/8 15:56:20 阅读更多 →

日新闻

AI多智能体时代来临,读懂MCP与A2A架构,抢占企业数字化新风口

AI多智能体时代来临,读懂MCP与A2A架构,抢占企业数字化新风口

当下AI应用飞速普及,无数企业下场搭建智能体系统,可落地阶段难题接踵而至:上下文无限堆积频繁爆栈、AI工具调用准确率低下、Token成本居高不下、企业数据权限混乱暗藏安全隐患……很多团队卡在架构搭建环节,空有前沿技术概念&…

2026/8/8 0:00:07 阅读更多 →
PHP二维码生成终极指南:用chillerlan/php-qrcode打造专业级二维码

PHP二维码生成终极指南:用chillerlan/php-qrcode打造专业级二维码

PHP二维码生成终极指南:用chillerlan/php-qrcode打造专业级二维码 【免费下载链接】php-qrcode A PHP QR Code generator and reader with a user-friendly API. 项目地址: https://gitcode.com/gh_mirrors/ph/php-qrcode 在当今数字时代,二维码已…

2026/8/8 0:00:08 阅读更多 →
UniApp微信小程序隐私保护组件开发:从原理到实战

UniApp微信小程序隐私保护组件开发:从原理到实战

1. 项目缘起:为什么我们需要一个隐私保护通用组件?最近在维护一个基于uniapp开发的微信小程序矩阵时,我遇到了一个非常棘手的问题。随着平台对用户隐私保护的要求越来越严格,几乎每一个新版本发布,或者在某些特定机型&…

2026/8/8 0:00:08 阅读更多 →

周新闻

最大流算法详解:从水管网络到Ford-Fulkerson与Dinic实战

最大流算法详解:从水管网络到Ford-Fulkerson与Dinic实战

1. 从水管网络到最大流:一个核心问题的诞生想象一下,你是一个城市供水系统的总工程师。你的城市有多个水源(水库),需要通过一个复杂的地下管道网络,将水输送到各个居民区。每条管道都有其最大通水能力&…

2026/8/6 22:02:27 阅读更多 →
基于Springboot的企业门户网站(源码+LW+调试文档+讲解)

基于Springboot的企业门户网站(源码+LW+调试文档+讲解)

温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台…

2026/8/8 8:58:26 阅读更多 →
MATLAB xcorr函数详解:从互相关原理到四大实战应用

MATLAB xcorr函数详解:从互相关原理到四大实战应用

1. 从一次信号“找茬”说起:为什么我们需要互相关几年前,我在处理一组声学传感器数据时遇到了一个棘手的问题。我有两个麦克风记录了一段相同的音频信号,理论上它们接收到的声音波形应该非常相似,只是由于麦克风位置不同&#xff…

2026/8/7 23:24:08 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/7 17:02:37 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/7 23:54:54 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/7 17:02:36 阅读更多 →