Flex:ai是什么?一文看懂开源XPU虚拟化与AI训推智能调度的终极解析
Flex:ai是什么一文看懂开源XPU虚拟化与AI训推智能调度的终极解析【免费下载链接】flexaiFlex:ai是一个面向AI容器场景的开源项目其核心能力包含两大部分分别是XPU虚拟化和多级智能调度。其中XPU虚拟化分为本地XPU虚拟化和跨节点拉远虚拟化本地XPU虚拟化支持将1台服务器上的XPU算力卡虚拟化分割出多个虚拟算力单元实现单张算力卡在多个容器的共享。跨节点拉远虚拟化支持通过RDMA或TCP网络访问远端节点上的算力卡。多级智能调度支持对切分出的虚拟卡进行Binpack等资源级调度以及对AI训推任务进行分时调度等能力。项目地址: https://gitcode.com/ModelEngine/flexaiFlex:ai是一个面向AI容器场景的开源项目由上海交通大学、西安交通大学、厦门大学、华为等联合发起。它的两大核心能力是XPU虚拟化和多级智能调度前者能把一张物理算力卡GPU/NPU虚拟切分成多个虚拟算力单元让单张算力卡被多个容器共享后者能对切分出的虚拟卡做 Binpack 等资源级调度并对 AI 训推任务进行分时调度从而大幅提升 AI 集群的算力利用率。为什么需要Flex:aiAI集群的算力浪费难题 在实际生产环境中AI 业务集群通常是大小模型混部的场景一方面运行 DeepSeek、Qwen 系列等大模型往往独占整卡甚至多卡另一方面还有大量小参数量模型CV 模型、Embedding 模型等它们根本吃不满一张整卡。结果就是昂贵且稀缺的 GPU/NPU 资源大量闲置浪费。同时AI 工作负载千差万别如何在有限算力上高效调度大并发任务一直是业界的难题。Flex:ai 正是为此而生——项目文档中明确说明了这一动机可参见 README.md 的“动机”一节。 一句话总结让一张卡掰成多份用让多份算力被聪明地分。核心能力一XPU虚拟化本地切分 跨节点拉远XPU 是 GPU/NPU 等异构算力卡的统称。Flex:ai 的虚拟化分为两种模式1️⃣ 本地XPU虚拟化单卡多容器共享把 1 台服务器上的算力卡虚拟化分割出多个虚拟算力单元实现单张算力卡在多个容器的共享GPU 侧一张 GPU 可切分为 1~20 个 vGPU支持指定算力切分百分比5 的倍数与显存大小由 GPU-device-plugin 设备插件和 CUDA 劫持客户端完成资源管控详细说明见 GPU-Virtual-Service/README.md。NPU 侧在昇腾原生架构与 CANN 基础上深度定制支持将单张物理 NPU 虚拟化为多个不同规格的 vNPU 实例按 1:1、2:8 等比例动态切分实现硬件级资源隔离详见 Ascend-Virtual-Service/README.md。下图展示了跨节点拉远虚拟化中“租算端与算力端”的协同设计数据经共享内存解耦后再由 CUDA Wrapper 下发到远端 GPU 执行2️⃣ 跨节点拉远虚拟化GPU算力池化通过RDMA 或 TCP 网络访问远端节点上的算力卡让没有 GPU 的节点也能租到算力。该能力位于 gpu-remoting 模块通过LD_PRELOAD劫持 CUDA Runtime / Driver API以及 cuBLAS、cuDNN、NCCL 等库调用透明地把请求转发到远端执行内置调度器scheduler支持多种策略可通过 config.json 配置轮询、空闲显存、利用率等调度方法配套 Python 存储组件storage处理训练数据集的加载与共享内存传输。下面是拉远虚拟化存储模块的代码结构总览图客户端与服务端通过 ZeroMQ 通信数据集经预处理后写入共享内存核心能力二多级智能调度在虚拟化切分的基础上Flex:ai 提供两级调度能力把剩余算力压榨到极致 资源级调度Binpack 装箱调度对切分出的虚拟卡进行 Binpack 等资源级调度。GPU 场景基于 Volcano 调度器扩展调度组件vc-scheduler、vc-controller-manager、vc-webhook-manager可通过 volcano-development.yaml 一键部署到 K8s 集群。⏱ 任务级调度分时复用与优先级时间片轮转复用突破物理切分的数量限制多个 AI 任务在同一张物理卡上毫秒级时间片轮转低负载推理任务以排队抢占方式共享算力算力保障与优先级多级调度策略支持为核心业务设置高优先级关键任务优先获得算力响应降低长尾延迟。昇腾侧的调度行为由 flexnpud.conf 配置例如quota参数定义每轮调度循环允许下发算子的最大次数aicore_alloc定义每个进程在分时调度中的算力权重。快速上手体验算力切分效果 GPU虚拟化部署步骤前置安装 Helm、NVIDIA 驱动与 nvidia-container-toolkit导入调度组件镜像执行kubectl apply -f volcano-development.yaml拉起调度层打包并安装 helm chart拉起client-updateCUDA 劫持与gpu-device-plugin设备插件在业务 Pod 中申请虚拟卡资源三个参数即可参数说明huawei.com/vgpu-number申请的 vGPU 卡数huawei.com/vgpu-cores算力切分百分比0-1005的倍数huawei.com/vgpu-memory.1Gi显存占用Gi通过watch nvidia-smi或容器内gpu-monitor工具即可观察到 GPU 利用率在设定的切分百分比附近波动验证切分生效。Ascend NPU体验步骤基于华为官方vllm-ascend镜像启动容器进入 hypervisor 目录依次执行./clear.sh→./flexnpud→./register.sh启动守护进程并注册用户进程进入 aclserver 目录分别运行./server.sh与./server_2.sh启动两个推理进程通过vllm bench的吞吐结果即可观察到算力切分效果。项目结构一览 目录说明Ascend-Virtual-Service/昇腾 NPU 虚拟化hypervisor 守护进程、acl 服务端/客户端GPU-Virtual-Service/xpu-pool-service/本地 GPU 虚拟化设备插件、CUDA 劫持、xpu-exporter 监控GPU-Virtual-Service/gpu-remoting/跨节点拉远虚拟化API 劫持、调度器、存储组件GPU-Virtual-Service/yaml/Volcano 调度器部署清单总结Flex:ai 以XPU虚拟化 多级智能调度两大核心能力直击 AI 集群大小模型混部导致算力浪费的痛点本地切分让一张卡多容器共享跨节点拉远让算力像池子一样按需流动Binpack 与分时调度让每一份算力都被充分利用。无论你是 GPU 还是昇腾 NPU 用户都能在这个开源项目中找到贴合自身场景的算力共享方案。【免费下载链接】flexaiFlex:ai是一个面向AI容器场景的开源项目其核心能力包含两大部分分别是XPU虚拟化和多级智能调度。其中XPU虚拟化分为本地XPU虚拟化和跨节点拉远虚拟化本地XPU虚拟化支持将1台服务器上的XPU算力卡虚拟化分割出多个虚拟算力单元实现单张算力卡在多个容器的共享。跨节点拉远虚拟化支持通过RDMA或TCP网络访问远端节点上的算力卡。多级智能调度支持对切分出的虚拟卡进行Binpack等资源级调度以及对AI训推任务进行分时调度等能力。项目地址: https://gitcode.com/ModelEngine/flexai创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

从0到1理解零信任:边界为何失灵、身份如何接管防线(纵深防御落地指南)

从0到1理解零信任:边界为何失灵、身份如何接管防线(纵深防御落地指南)

从0到1理解零信任:边界为何失灵、身份如何接管防线(纵深防御落地指南) 【免费下载链接】Security-101 8 Lessons, Kick-start Your Cybersecurity Learning. 项目地址: https://gitcode.com/GitHub_Trending/se/Security-101 还在靠&q…

2026/9/25 6:07:49 阅读更多 →
x86汇编实战指南:高频指令、寻址方式与栈帧调试

x86汇编实战指南:高频指令、寻址方式与栈帧调试

1. 为什么还要啃x86汇编这块硬骨头很多人第一次接触汇编,脑子里冒出来的画面大概是黑底白字、满屏寄存器名、看一眼就想关掉。尤其是现在高级语言和框架已经把底层包得严严实实,写业务代码根本碰不到eax、ebp这些东西。但只要你做过逆向分析、性能调优、…

2026/9/25 6:06:48 阅读更多 →
ax 调度与 Agentic Orchestrator:用 CLI 编排 codex、claude 智能体

ax 调度与 Agentic Orchestrator:用 CLI 编排 codex、claude 智能体

1. 从"ax"这个标题说起:一个被低估的编排入口第一次看到"ax"这个标题,很多人会一头雾水——两个字母,没有上下文,没有正文,没有关键词。但如果你把热搜词摊开来看,线索其实非常清晰&am…

2026/9/25 6:06:48 阅读更多 →

最新新闻

The Concise TypeScript Book 精讲:TypeScript 三斜线指令(Triple-Slash Directives)完整指南

The Concise TypeScript Book 精讲:TypeScript 三斜线指令(Triple-Slash Directives)完整指南

文档教程 【免费下载链接】typescript-book The Concise TypeScript Book: A Concise Guide to Effective Development in TypeScript. Free and Open Source. 项目地址: https://gitcode.com/gh_mirrors/typ/typescript-book 点击查看 免费下载 三斜线指令&#x…

2026/9/25 7:16:42 阅读更多 →
Atlas 300V 24G推理加速卡部署YOLO全流程实战:从环境搭建到性能优化

Atlas 300V 24G推理加速卡部署YOLO全流程实战:从环境搭建到性能优化

最近好几个朋友问我一件事:Atlas 300V 24G到底算不算运算加速卡,能不能拿来部署YOLO?问的人多了,我觉得值得专门写一篇来说清楚。这个困惑我也经历过——Atlas家族的产品线实在太杂了,300I、300V、500、800、310、310P…

2026/9/25 7:16:42 阅读更多 →
VoltAgent 接入 Z.AI Coding Plan:模型路由配置、环境变量与源码级解析

VoltAgent 接入 Z.AI Coding Plan:模型路由配置、环境变量与源码级解析

人工智能AI AgentAgent 框架后端多智能体RAG工具调用Agent 记忆 【免费下载链接】voltagent AI Agent Engineering Platform built on an Open Source TypeScript AI Agent Framework 项目地址: https://gitcode.com/gh_mirrors/vo/voltagent 点击查看 免费下载 Z.…

2026/9/25 7:16:42 阅读更多 →
pylibcudf RegexFlags 深入指南:cuDF 字符串正则标志枚举的用法、组合与底层实现

pylibcudf RegexFlags 深入指南:cuDF 字符串正则标志枚举的用法、组合与底层实现

数据分析数据工程机器学习 【免费下载链接】cudf cuDF - GPU DataFrame Library 项目地址: https://gitcode.com/gh_mirrors/cu/cudf 点击查看 免费下载 导读 RegexFlags 是 pylibcudf 字符串子系统中用于控制正则表达式解析行为的标志枚举,是 pylibc…

2026/9/25 7:16:41 阅读更多 →
OpenShell Kubernetes 计算驱动深入解析:Sandbox 生命周期、命名空间模式与驱动配置实战

OpenShell Kubernetes 计算驱动深入解析:Sandbox 生命周期、命名空间模式与驱动配置实战

【免费下载链接】OpenShell OpenShell is the safe, private runtime for autonomous AI agents. 项目地址: https://gitcode.com/gh_mirrors/op/OpenShell 点击查看 免费下载 OpenShell 的 Kubernetes 计算驱动(openshell-driver-kubernetes&#xff0…

2026/9/25 7:16:41 阅读更多 →
VisiData Loader 开发指南:从 open_<filetype> 到 Saver 的完整实战教程

VisiData Loader 开发指南:从 open_<filetype> 到 Saver 的完整实战教程

数据分析CLI数据可视化 【免费下载链接】visidata A terminal spreadsheet multitool for discovering and arranging data 项目地址: https://gitcode.com/gh_mirrors/vi/visidata 点击查看 免费下载 本指南以 VisiData 官方 API 文档(docs/api/loader…

2026/9/25 7:15:41 阅读更多 →

日新闻

AI元人文:从工具使用到思维重构的深度探索

AI元人文:从工具使用到思维重构的深度探索

最近半年我一直在琢磨一件事:AI元人文到底是什么?说白了,就是“用元视角重新审视人与AI的关系”,也在“探索AI如何反向逼着我们发现自己的思考边界”。标题里的“元探索”,在我看就是一层套一层的追问——当你用AI解决…

2026/9/25 0:00:41 阅读更多 →
Python+CNN车牌识别实战:从数据预处理到模型训练与部署

Python+CNN车牌识别实战:从数据预处理到模型训练与部署

简介:基于Python与卷积神经网络的车牌识别项目,面向计算机视觉初学者及智能交通开发者,目标是帮助用户掌握从数据预处理、模型构建到实际部署的完整流程。压缩包共25个文件,包含jpg/png图像样本、py训练脚本、md说明文档、dat数据…

2026/9/25 0:00:41 阅读更多 →
Vim基础操作全攻略:保存退出、模式切换与高频命令实战

Vim基础操作全攻略:保存退出、模式切换与高频命令实战

1. 项目概述1.1 核心需求解析今天聊聊Vim。写这个题目的原因是:几乎每个后端开发者、运维人员、数据工程师某天都会遇到一个场景——深夜加班,服务器登录界面只有黑底白字,编辑器只有vi/vim,你必须在五分钟内完成一次配置修改并保…

2026/9/25 0:00:41 阅读更多 →

周新闻

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

直接铺开项目本身吧。这几个月我一直在折腾一件事:用Flutter给OpenHarmony做一款游戏集合类的App,说白了就是把若干小游戏塞进一个壳里,用统一入口分发。这个方向本身不算新鲜,真正让我花了不少心思的,是首页那堆游戏卡…

2026/9/24 14:34:13 阅读更多 →
Word表格编号全攻略:从列表编号到题注交叉引用

Word表格编号全攻略:从列表编号到题注交叉引用

写Word文档,最让人头疼的往往是那些“看起来不起眼”的小问题。比如表格编号这事:今天在表后面多加了两个空白行,明天给客户交稿前发现整个章节的编号全部错位,光是挨个改序号就能耗掉大半个下午。我前阵子帮人整理一份上百页的技…

2026/9/24 9:10:42 阅读更多 →
从第一个站到第二个站:独立开发者的静态网站选型与落地实践

从第一个站到第二个站:独立开发者的静态网站选型与落地实践

1. 项目概述1.1 核心需求解析做独立开发者这几年,说实话,第一个网站上线的那天晚上我兴奋得没睡着。但等它跑了半年,流量惨淡、功能臃肿、代码自己都懒得看第二遍之后,我才慢慢琢磨明白一个道理:第一个网站是练手&…

2026/9/24 14:33:56 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/24 12:50:34 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/24 14:33:48 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/24 12:49:17 阅读更多 →