Python GPU 任务调度:CUDA 显存管理和多进程隔离
Python GPU 任务调度CUDA 显存管理和多进程隔离一、模型加载失败——CUDA out of memory的锅多个 AI 服务部署在同一台 GPU 机器上各自用各自的 Python 进程。看似井水不犯河水结果第一个服务加载了 7B 模型占 14GB 显存第二个服务加载 1.5B 模型占 3GB第三个服务一加载就报CUDA out of memory。明明 GPU 有 24GB 显存只是两个服务用了 17GB为什么第三个加载 3GB 就报 OOM答案是 CUDA 的内存碎片化。PyTorch 的显存分配不是先申请一大块按需分发而是用多少申请多少。两个进程虽然总占用只有 17GB但内存碎片加上 PyTorch 缓存机制导致剩余空间不足以连续分配 3GB。二、CUDA 显存管理架构flowchart TB subgraph GPU[GPU 显存24GB HBM] direction TB Frag1[进程 A: 模型参数\n10GB 连续] Cache1[进程 A: PyTorch 缓存\n4GB 预留] Frag2[进程 B: 模型参数\n3GB 连续] Cache2[进程 B: PyTorch 缓存\n1GB 预留] Free1[碎片空间\n2GB已碎片化] Free2[可用空间\n4GB] end subgraph Manager[显存管理器] MCP[多进程隔离 (CUDA MPS)] MCP -- Limit1[进程 A 显存限制: 14GB] MCP -- Limit2[进程 B 显存限制: 5GB] CacheClean[内存清理策略] CacheClean -- Empty[torch.cuda.empty_cache()] CacheClean -- IPC[CUDA IPC 共享] end subgraph Schedule[任务调度] Q[任务队列] -- Alloc[显存检查] Alloc --|够用| Run[执行任务] Alloc --|不够| Wait[等待 清理] Wait -- GC[触发 Python GC\n 清理 CUDA 缓存] GC -- Alloc end三、生产级显存管理代码显存管理器import torch import gc import time import threading from typing import Optional, Callable, Dict from dataclasses import dataclass, field from collections import deque import logging logger logging.getLogger(__name__) dataclass class GPUMemoryBudget: GPU 显存预算——每个进程/任务的显存限额 device: int 0 total_memory_mb: int 0 # 为该任务预留的显存MB peak_memory_mb: int 0 # 历史峰值 current_allocated_mb: int 0 # 当前分配 class GPUMemoryManager: GPU 显存管理器——负责任务级别的显存隔离和调度 def __init__(self, device_id: int 0, reserved_memory_mb: int 1024): device_id: GPU 设备编号 reserved_memory_mb: 为系统和 CUDA 上下文预留的显存 self.device_id device_id self.reserved_mb reserved_memory_mb # 检查 GPU 是否可用 if not torch.cuda.is_available(): raise RuntimeError(CUDA 不可用请检查驱动和 PyTorch 版本) self.total_memory_mb torch.cuda.get_device_properties( device_id ).total_memory // (1024 * 1024) self.available_mb self.total_memory_mb - reserved_memory_mb # 任务显存预算表 self._budgets: Dict[str, GPUMemoryBudget] {} self._lock threading.Lock() logger.info( fGPU {device_id}: 总显存 {self.total_memory_mb}MB, f可用 {self.available_mb}MB (预留 {reserved_memory_mb}MB) ) def register_task( self, task_id: str, memory_budget_mb: int, ) - GPUMemoryBudget: 注册一个任务并分配显存预算 如果剩余显存不足抛出异常 with self._lock: # 检查总预算是否超标 allocated_sum sum( b.total_memory_mb for b in self._budgets.values() ) if allocated_sum memory_budget_mb self.available_mb: raise MemoryError( f任务 {task_id} 需要 {memory_budget_mb}MB f但仅剩 {self.available_mb - allocated_sum}MB ) budget GPUMemoryBudget( deviceself.device_id, total_memory_mbmemory_budget_mb, ) self._budgets[task_id] budget logger.info(f任务 {task_id}: 已分配 {memory_budget_mb}MB 预算) return budget def release_task(self, task_id: str): 释放任务的显存预算并清理 CUDA 缓存 with self._lock: if task_id in self._budgets: del self._budgets[task_id] # 触发 Python GC 和 CUDA 缓存清理 gc.collect() torch.cuda.empty_cache() logger.info(f任务 {task_id}: 已释放显存预算) def get_current_usage(self) - Dict[str, int]: 获取当前显存使用情况 allocated torch.cuda.memory_allocated(self.device_id) // (1024 * 1024) cached torch.cuda.memory_reserved(self.device_id) // (1024 * 1024) free self.total_memory_mb - allocated - cached return { total_mb: self.total_memory_mb, allocated_mb: allocated, cached_mb: cached, free_mb: max(0, free), } def safe_execute( self, task_id: str, func: Callable, *args, max_retries: int 3, **kwargs, ): 在显存安全的环境中执行函数 如果 OOM自动清理缓存并重试 for attempt in range(max_retries): try: return func(*args, **kwargs) except torch.cuda.OutOfMemoryError as e: logger.warning( f任务 {task_id} OOM第 {attempt1}/{max_retries} 次尝试 ) # 清理策略先清 Python GC再清 CUDA 缓存 gc.collect() torch.cuda.empty_cache() # 检查显存状态 usage self.get_current_usage() logger.warning(f当前显存: {usage}) if attempt max_retries - 1: raise RuntimeError( f任务 {task_id} 重试 {max_retries} 次后仍然 OOM ) from e # 递增等待给其他释放显存的机会 time.sleep(2 ** attempt)多进程 GPU 隔离方案import multiprocessing as mp from contextlib import contextmanager class GPUProcessPool: GPU 多进程池——每个进程独立管理自己的显存 def __init__(self, gpu_id: int, num_workers: int 2): self.gpu_id gpu_id self.num_workers num_workers self._pool: Optional[mp.Pool] None # 每个 worker 的显存限额 total_mem torch.cuda.get_device_properties(gpu_id).total_memory self.worker_memory_limit ( total_mem // num_workers * 80 // 100 # 每个 worker 用 80% 份额 ) staticmethod def _worker_init(gpu_id: int, memory_limit: int, worker_id: int): 每个 worker 进程的初始化函数 ——在 fork 之后、执行任务之前调用 import os os.environ[CUDA_VISIBLE_DEVICES] str(gpu_id) # 设置 PyTorch 显存限制 torch.cuda.set_per_process_memory_fraction( memory_limit / torch.cuda.get_device_properties(gpu_id).total_memory ) # 设置 PyTorch 显存分配策略 # expandable_segmentsTrue 允许内存段动态扩展减少碎片 os.environ[PYTORCH_CUDA_ALLOC_CONF] expandable_segments:True logger.info(fWorker {worker_id} 初始化完成, 显存限制: {memory_limit} 字节) def start(self): 启动多进程池 self._pool mp.Pool( processesself.num_workers, initializerself._worker_init, initargs(self.gpu_id, self.worker_memory_limit, 0), ) def submit(self, func, *args, **kwargs): 提交任务到进程池 if self._pool is None: raise RuntimeError(请先调用 start()) return self._pool.apply_async(func, args, kwargs)模型加载时的显存优化def load_model_with_memory_budget( model_path: str, budget_mb: int, device: str cuda:0, ) - torch.nn.Module: 在显存预算限制下加载模型 ——如果超出预算自动尝试量化 # 初步估算FP16 模型大约每 1B 参数占用 2GB # 如果预算不够尝试 INT8/INT4 量化 file_size_mb __import__(os).path.getsize(model_path) // (1024 * 1024) if file_size_mb budget_mb * 1.5: # 模型文件超过预算的 1.5 倍必须量化 logger.info(f模型大小 {file_size_mb}MB 超过预算 {budget_mb}MB使用 INT4 量化) from transformers import BitsAndBytesConfig quant_config BitsAndBytesConfig( load_in_4bitTrue, bnb_4bit_compute_dtypetorch.float16, bnb_4bit_use_double_quantTrue, ) model load_model(model_path, device_mapauto, quantization_configquant_config) else: # 预算充足直接加载 torch.cuda.set_per_process_memory_fraction( budget_mb / torch.cuda.get_device_properties(0).total_memory * (1024 * 1024) ) model load_model(model_path) model model.to(device) return model四、边界分析与 Trade-offs多进程 vs MPSMulti-Process Service多进程简单易用隔离性强但有进程间通信开销CUDA MPS共享 GPU 上下文减少碎片但单进程崩溃可能影响其他进程建议推理服务用 MPS训练任务用多进程隔离显存碎片化PyTorch 的expandable_segments可以缓解碎片问题但有轻微性能开销。对于需要频繁分配释放显存的场景如动态 batch size建议开启。任务优先级简单 FIFO 调度可能不够。建议参考 Kubernetes 的 QoS 模型Guaranteed / Burstable / BestEffort设计优先级调度。GPU 共享的经济性一张 A10080GB按 5 个进程平分每个 16GB。如果某个进程实际只用 8GB剩余的 8GB 浪费了。可以使用 MIGMulti-Instance GPU或 MPS 提高利用率。五、总结Python GPU 任务调度的核心挑战是显存碎片化和多进程隔离显存预算制每个任务注册时声明显存需求管理器全局调度多进程隔离每个进程独立管理显存避免相互影响OOM 自愈捕获 OOM → 清理缓存 → 递减重试量化降级模型超过显存预算时自动尝试量化加载一个实用的显存监控命令nvidia-smi --query-gpumemory.used,memory.free --formatcsv -l 1持续观察显存波动。

相关新闻

Function Calling 回退策略:工具不可用时的优雅降级方案

Function Calling 回退策略:工具不可用时的优雅降级方案

Function Calling 回退策略:工具不可用时的优雅降级方案 一、查询订单的工具突然挂了,Agent 应该怎么办? 生产环境中,Agent 调用的工具函数不可能 100% 可用。第三方 API、内部服务、数据库访问,任何一个环节都可能因为…

2026/7/27 3:45:07 阅读更多 →
【数据集】上市公司绿色管理创新能力(2008-2025年)

【数据集】上市公司绿色管理创新能力(2008-2025年)

绿色管理创新能力是指企业通过制度、流程、组织结构等方面的创新来推动绿色发展的能力 通常的构建方法是依据企业是否实施或披露五类绿色管理实践,对每项进行0—1赋值后加总,形成企业—年度指标,它衡量的是企业绿色管理创新的实施程度或管理…

2026/7/27 4:33:10 阅读更多 →
终极米哈游扫码登录器:一键登录四大热门游戏

终极米哈游扫码登录器:一键登录四大热门游戏

终极米哈游扫码登录器:一键登录四大热门游戏 【免费下载链接】MHY_Scanner MHY扫码登录器,支持从直播流抢码。 项目地址: https://gitcode.com/gh_mirrors/mh/MHY_Scanner 还在为繁琐的游戏登录流程烦恼吗?MHY扫码登录器为你带来革命性…

2026/7/28 5:05:16 阅读更多 →

最新新闻

基于经验模态分解 时序分析 核主成分分析 长短期记忆网络 多维时间序列预测 LSTM多维时间序列预测模型 LSTM和 MD-LSTM进行对比

基于经验模态分解 时序分析 核主成分分析 长短期记忆网络 多维时间序列预测 LSTM多维时间序列预测模型 LSTM和 MD-LSTM进行对比

EMD-KPCA-LSTM 基于经验模态分解和核主成分分析的长短期记忆网络多维时间序列预测MATLAB代码(含LSTM、EMD-LSTM、EMD-KPCA-LSTM三个模型的对比) matlab 参考文档:基于EMD-PCA-LSTM的光伏功率预测模型 研究内容:本案例使用数据集是…

2026/7/28 17:59:04 阅读更多 →
[Linux 驱动] -- platform_device 与 paltform_driver 的匹配(i2c_client 与 i2c_driver)

[Linux 驱动] -- platform_device 与 paltform_driver 的匹配(i2c_client 与 i2c_driver)

自己总结platform_device与platform_driver的匹配分为如下三种情况:基于设备树风格的匹配:platform_driver.device_driver.of_device_id->compatible 和 设备树中的compatible属性进行比较;匹配 id 表(id_table),即…

2026/7/28 17:59:04 阅读更多 →
nmap的使用

nmap的使用

Nmap(全称Network Mapper)是一款功能强大、界面简洁清晰的连接端口扫描软件。能够轻松扫描确定哪些服务运行在哪些连接端,并且推断计算机运行哪个操作系统,从而帮助用户管理网络以及评估网络系统安全!Nmap运行需要用到一个驱动程序WinPcap&am…

2026/7/28 17:59:04 阅读更多 →
经典CNN和GAN论文代码总结(未完待续... ...)

经典CNN和GAN论文代码总结(未完待续... ...)

经典CNN 经典GAN GAN Paper: https://arxiv.org/abs/1906.01529Code: https://github.com/sheqi/GAN_Review CGAN Paper: https://arxiv.org/abs/1411.1784Code: <> CycleGAN Paper: https://arxiv.org/abs/1703.10593v6Code: <> CoGAN Paper: https://arxiv.org…

2026/7/28 17:59:03 阅读更多 →
【自然语言处理】

【自然语言处理】

python做自然语言处理&#xff0c;持续更新。 import jieba # 分词库 seg_list jieba.cut("北京野生动物园轿车遭黑熊围堵") print ("Default Mode:", .join(seg_list))Default Mode: 北京 野生 动物园 轿车 遭 黑熊 围堵附作者相关研究&#xff1a; ***…

2026/7/28 17:59:03 阅读更多 →
LeetCode-Python-273. 整数转换英文表示

LeetCode-Python-273. 整数转换英文表示

将非负整数转换为其对应的英文表示。可以保证给定输入小于 231 - 1 。示例 1:输入: 123 输出: "One Hundred Twenty Three" 示例 2:输入: 12345 输出: "Twelve Thousand Three Hundred Forty Five" 示例 3:输入: 1234567 输出: "One Million Two Hund…

2026/7/28 17:58:03 阅读更多 →

日新闻

告别臃肿!3步让你的暗影精灵笔记本重获新生

告别臃肿!3步让你的暗影精灵笔记本重获新生

告别臃肿&#xff01;3步让你的暗影精灵笔记本重获新生 【免费下载链接】OmenSuperHub Control Omen laptop performance, fan speeds, and keyboard lighting, and unlock power limits. 项目地址: https://gitcode.com/gh_mirrors/om/OmenSuperHub 你是否也曾为官方Om…

2026/7/28 0:00:43 阅读更多 →
RAG必踩坑!财报法规检索不准?这款开源工具让答案浮出水面,准确率飙升98.7%!

RAG必踩坑!财报法规检索不准?这款开源工具让答案浮出水面,准确率飙升98.7%!

做 RAG 的人应该都踩过这个致命的坑&#xff1a;把几百页的财报、法规、技术手册扔给向量库&#xff0c;问一个具体问题&#xff0c;搜出来的全是沾边但没用的内容 —— 关键信息要么被硬切块拆碎了&#xff0c;要么藏在几十条结果的最下面。语义相似≠真正相关&#xff0c;这个…

2026/7/28 0:00:43 阅读更多 →
抖音视频文案提取工具全指南:免费2026版、手机App、在线工具一网打尽

抖音视频文案提取工具全指南:免费2026版、手机App、在线工具一网打尽

2026年做短视频运营&#xff0c;从抖音上扒文案早就不是偷偷抄笔记的事了。我刚开始做内容的时候&#xff0c;每天刷半小时抖音&#xff0c;手动把爆款视频的口播敲进备忘录&#xff0c;一条2分钟的视频得花十来分钟&#xff0c;碰到语速快的还要反复回听。后来试了一圈工具&am…

2026/7/28 0:00:43 阅读更多 →

周新闻

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 数据集6000张 完整源码已标注数据集训练好的模型环境配置教程程序运行说明文档&#xff0c;可以直接使用&#xff01;系统支持图片、视频、摄像头等多种方式检测裂缝&#xff0c;功能强大实用。 1数据集6000张 8各类别

2026/7/28 12:04:22 阅读更多 →
深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

pubg数据集 精选原图1.42万数据 1.49万标签 无任何重复、算法增强或冗余图像&#xff01; pubg绝地求生目标检测数据集 1分类&#xff1a;e_body&#xff0c;14905个标签&#xff0c;txt格式 共计14244张图&#xff0c;99%为640*640尺寸图像 适合yolo目标检测、AI训练关键词&am…

2026/7/28 8:29:16 阅读更多 →
Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex检测数据集数据集详情检测类别&#xff1a; allies enemy tag图片总量&#xff1a;7247张训练集&#xff1a;5139张验证集&#xff1a;1425张测试集&#xff1a;683张标注状态&#xff1a;全部已标注&#xff0c;即拿即用数据格式&#xff1a;支持YOLO格式及其他格式&#…

2026/7/28 5:03:42 阅读更多 →

月新闻