vllm 缓存对模型启动时间的影响
你的观察基本符合 vLLM 的实际启动流程。几个缓存影响的阶段不同所以影响启动时间差异很大。先区分一下缓存主要内容影响阶段对 vLLM 启动时间影响/tmp/torchinductor_root/PyTorch Inductor 编译缓存模型运行时图优化、kernel fusion通常较小~/.triton/cache/Triton kernel 编译缓存Triton 自定义 kernel 编译通常较小~/.cache/vllm/vLLM 自身缓存含部分编译产物vLLM backend 初始化中等flashinfer/FlashInfer kernel autotune / JIT 编译缓存attention、MoE、量化 kernel非常大为什么 FlashInfer 缓存影响最大你的模型unsloth/Qwen3.6-27B-NVFP4启动参数--moe-backend flashinfer_b12x这类模型启动时会大量依赖 FlashInfer。启动流程大概vLLM serve | |-- load model weights | |-- initialize attention backend | |-- initialize MoE backend | |-- FlashInfer kernel selection | |-- 查找已有 kernel cache | |-- 没有: 编译 CUDA kernel autotune 保存 cache | |-- engine ready第一次启动没有 flashinfer cache | v nvcc / nvrtc 编译大量 kernel | v 几十秒甚至几分钟第二次读取 ~/.cache/vllm/flashinfer | v 直接加载 | v 快速启动为什么 Triton cache 不明显因为现在 vLLM 的核心路径不一定大量依赖 Triton。例如以前vLLM | |-- Triton attention |-- Triton fused kernel现在很多情况vLLM | |-- FlashAttention | |-- FlashInfer | |-- CUTLASS | |-- CUDA kernel尤其 BlackwellRTX5090 SM120 NVFP4大量走FlashInfer CUTLASS Tensor Core kernel不是 Triton。所以~/.triton/cache可能只有少量 kernel。/tmp/torchinductor_root为什么影响小PyTorch Inductor主要影响torch.compilegraph captureoperator fusion例如torch.compile(model) | v Inductor | v 生成优化后的 kernel但是 vLLM 推理不是传统PyTorch eager torch.compile更多是CUDA Graph custom kernel FlashInfer所以 Inductor 贡献有限。你可以验证第一次启动rm -rf ~/.cache/vllm/flashinfer time vllm serve ...观察Compiling ... Generating kernels... Autotuning...第二次time vllm serve ...通常会明显减少。你的环境建议持久化你之前设置export HF_HOME/hyperai/input/input0/hub export VLLM_CACHE_ROOT/local_nvme/vllm_cache export FLASHINFER_CACHE_DIR/local_nvme/flashinfer_cache export TORCHINDUCTOR_CACHE_DIR/local_nvme/torch_cache export TRITON_CACHE_DIR/local_nvme/triton_cache其中最关键第一优先级FLASHINFER_CACHE_DIR一定要持久化。第二优先级VLLM_CACHE_ROOT保存 vLLM 相关编译结果。第三TRITON_CACHE_DIR TORCHINDUCTOR_CACHE_DIR保存也没坏处但收益明显低。对你的 RTX5090 NVFP4 环境还有一个特殊点Blackwell 的 NVFP4 kernel 比传统 FP16 kernel 更依赖CUTLASS FlashInfer architecture specific compilation例如sm_120 sm_121这些 kernel 不是通用二进制。所以同一个 cacheRTX5090(sm120)换到B200(sm100)通常不能复用。甚至RTX5090 A机器 RTX5090 B机器如果 CUDA / driver / flashinfer 版本不同也可能重新编译。所以你的实验结果可以总结为启动耗时主要 模型权重加载 FlashInfer kernel 编译/autotune 不是 PyTorch Inductor Triton cache对于你现在这个Qwen3.6-27B-NVFP4 RTX5090 vLLM FlashInfer MoE backend场景flashinfer cache是最值得持久化的。

相关新闻

深入解析MibSPI RXRAM寄存器:状态标志与错误处理实战

深入解析MibSPI RXRAM寄存器:状态标志与错误处理实战

1. 项目概述与核心价值在嵌入式开发的日常里,SPI(Serial Peripheral Interface)通信就像我们和外围芯片“对话”的嘴巴和耳朵。但当你需要同时和多个设备高速、不间断地“聊天”时,传统的单缓冲SPI就显得力不从心了,频…

2026/7/23 13:47:40 阅读更多 →
大模型评测基准(Benchmark)技术全解析:从原理到实践部署

大模型评测基准(Benchmark)技术全解析:从原理到实践部署

在实际大模型选型、调优和部署过程中,我们经常会看到各种评测榜单和分数:某个模型在 MMLU 上得了 85 分,另一个在 HumanEval 上表现更好。但这些分数到底是怎么测出来的?为什么同一个模型在不同榜单上排名可能天差地别&#xff1f…

2026/7/22 13:06:36 阅读更多 →
仿真UR机械臂Gazebo和RViz联合调试

仿真UR机械臂Gazebo和RViz联合调试

首先启动Gazebo仿真roslaunch ur_gazebo ur5_bringup.launch其次打开一个新终端,运行 MoveIt 规划执行roslaunch ur5_moveit_config moveit_planning_execution.launch sim:true可以看见显示You can start planning now!即可最终打开RVizroslaunch ur5_moveit_confi…

2026/7/23 16:00:35 阅读更多 →

最新新闻

MSPM0 RTC模块深度解析:从基础配置到精准校准与低功耗实战

MSPM0 RTC模块深度解析:从基础配置到精准校准与低功耗实战

1. 项目概述:为什么RTC是嵌入式系统的“心跳” 在嵌入式系统里,实时时钟(RTC)模块的角色,就像我们生活中的手表。它不负责让系统“跑”起来(那是主时钟和CPU的活儿),而是确保系统在任…

2026/7/24 1:39:56 阅读更多 →
深入解析MSPM0复位机制:从原理到实战,构建稳定嵌入式系统

深入解析MSPM0复位机制:从原理到实战,构建稳定嵌入式系统

1. 项目概述:为什么需要深入理解复位机制?在嵌入式开发中,尤其是基于MSPM0这类32位微控制器的项目里,复位机制常常被开发者视为一个“黑盒”——知道它存在,出了问题就按一下复位键,但对其内部的分级、触发…

2026/7/24 1:39:56 阅读更多 →
YOLOv8车辆检测系统开发全流程指南

YOLOv8车辆检测系统开发全流程指南

1. 项目概述:基于YOLOv8的车辆识别检测系统这个项目实现了一个完整的车辆识别检测系统,核心采用了YOLOv8这一当前最先进的目标检测算法。系统包含从数据准备、模型训练到应用部署的全流程解决方案,特别适合需要快速实现车辆检测功能的开发者。…

2026/7/24 1:39:56 阅读更多 →
基于YOLOv8的落水检测与救援系统开发实践

基于YOLOv8的落水检测与救援系统开发实践

1. 项目概述:基于YOLOv8的落水检测与救援系统这个项目实现了一套完整的落水人员与救援设备检测系统,从数据标注到模型训练再到Web展示的全流程解决方案。核心采用YOLOv8目标检测算法,配合经过专业标注的数据集,能够准确识别水面上…

2026/7/24 1:39:56 阅读更多 →
锂电极片胶辊运行产生极片划痕、压痕的故障溯源区分

锂电极片胶辊运行产生极片划痕、压痕的故障溯源区分

新能源锂电产业发展背景:极片外观缺陷制约量产良率提升 随着动力电池、储能电池行业产线向高速化、高精度化迭代,涂布、辊压、分切全流程均依靠锂电极片胶辊完成极片输送、压合、展平工序。极片表面出现划痕、周期性压痕是行业高频不良问题,该…

2026/7/24 1:39:56 阅读更多 →
MSPM0 RTC模块实战:低功耗嵌入式系统精准时钟配置与校准

MSPM0 RTC模块实战:低功耗嵌入式系统精准时钟配置与校准

1. 项目概述:为什么嵌入式系统需要一个“永不掉线”的时钟?在嵌入式系统开发中,尤其是那些需要长时间独立运行、对功耗极其敏感的设备,比如智能水表、共享单车锁、环境监测传感器或者可穿戴手环,一个核心需求是&#x…

2026/7/24 1:38:56 阅读更多 →

日新闻

用Highcharts 创建可拖拽三维散点立方体3D图表

用Highcharts 创建可拖拽三维散点立方体3D图表

该案例基于Highcharts scatter3d 三维散点图实现空间立方体散点可视化,核心特色:三维 X/Y/Z 三轴空间,所有散点分布在 0~10 立方体空间内;散点使用径向渐变实现立体 3D 圆球质感;支持鼠标 / 触屏拖拽画布,…

2026/7/24 0:00:29 阅读更多 →
AppCertDlls:进程创建路径上的 DLL 入口

AppCertDlls:进程创建路径上的 DLL 入口

AppCertDlls:进程创建路径上的 DLL 入口 AppCertDlls 位于 HKLM\System\CurrentControlSet\Control\Session Manager\AppCertDlls。本文的程序功能是只读列出这个键在 64 位和 32 位注册表视图中的全部值,并显示每条值的来源、名称、类型和可安全显示的数…

2026/7/24 0:00:29 阅读更多 →
我的编程之路:第一篇博客

我的编程之路:第一篇博客

大家好,我是一名编程初学者,同时这也是我编程学习之路上的第一篇博客。在这里,我想要向大家介绍我的一些想法和规划。a.自我介绍我是一个刚刚接触编程的新手,目前在学习c语言,我对编程世界充满了强烈的好奇。当然&…

2026/7/24 0:00:29 阅读更多 →

周新闻

Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/22 8:58:19 阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/24 1:23:39 阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/23 17:49:47 阅读更多 →

月新闻