Qwen3.5-Plus 1M 上下文 vllm OOM?让 Codex 走 TaoToken 对照 --max-num-seqs
单条 1M 输入也 OOM从 vllm 报错日志反推 Qwen3.5-Plus 参数错位Qwen3.5-Plus 在 vllm 上部署 1M 上下文时最让人头疼的不是跑得慢而是明明只发了一条请求进程却被系统 kill 掉或者 API 直接超时。这类问题往往不是显存真的不够而是--max-model-len、--max-num-batched-tokens、--max-num-seqs与--enable-prefix-caching四个参数没有对齐再加上系统 OOM killer 在背后补刀。本文走排障路线把start_api.sh、nvidia-smi显存现象和 vllm 报错日志整理好交给 Codex 对照参数逐项排查。这一步需要先在 https://taotoken.net/?utm_sourcetaotoken_aicg_blog_end 创建 Key再把 Codex 的 Base URL 填成 https://taotoken.net/api。TaoToken 在这里只提供 Key 和 Base URL不替代 vllm 推理、不部署 Qwen3.5-Plus、不读写模型权重。一、原问题与场景单条 1M 输入为什么也会 OOM先把现象描述清楚否则 Codex 拿到的信息不足以定位。典型的三类表现第一类是启动就崩。start_api.sh执行后vllm 在加载权重阶段就报torch.cuda.OutOfMemoryError日志里能看到Tried to allocate XX GiB但此时还没有任何请求进来。这通常意味着--gpu-memory-utilization加上 KV cache 预分配已经超过了 A100 80G 的实际可用显存。第二类是单条请求触发 OOM。服务能起来但一发 1M 上下文的请求vllm 日志出现EngineCore崩溃或CUDA out of memorynvidia-smi显示显存瞬间打满。根因多半是--max-num-batched-tokens被设成了 1048576vllm 会按这个上限去预留激活显存单条请求就把预算吃光。第三类是进程被 kill但显存没满。nvidia-smi看显存还有余量可推理进程突然消失dmesg里能看到Out of memory: Killed process。这是系统 OOM killer 介入和显存无关是主机内存vm.overcommit_memory、max_map_count配置没跟上。把这三类现象对应的日志片段、start_api.sh全文、nvidia-smi截图一起贴给 Codex它才能判断到底是显存预算问题、参数错位问题还是内核参数问题。二、TaoToken 前置给 Codex 一个能读长日志的入口排障场景下Codex 需要读的东西很多几百行的 vllm 启动日志、start_api.sh、nvidia-smi输出、dmesg片段。这些内容拼起来很容易超过普通对话窗口所以先把 Codex 接到 TaoToken 上。操作顺序打开 https://taotoken.net/?utm_sourcetaotoken_aicg_blog_endutm_mediumcsdnutm_campaignrewriteutm_content 注册并创建一个 API Key。在控制台确认 Key 状态正常记下它。把 Codex 的 Base URL 指向 https://taotoken.net/api 模型 ID 按控制台里可用的填。需要强调边界TaoToken 只负责把请求转发到模型它不碰你的 vllm 进程不读你的模型权重也不改你的start_api.sh。所有参数修改、脚本重跑、显存观察都在你自己的服务器上完成。Codex 的角色是读日志 给建议执行权在你手里。如果你还没建 Key直接去 API Keys 页面https://taotoken.net/console/api-keys?utm_sourcetaotoken_aicg_blog_endutm_mediumcsdnutm_campaignrewriteutm_content 。接入细节看文档https://taotoken.net/doc?utm_sourcetaotoken_aicg_blog_endutm_mediumcsdnutm_campaignrewriteutm_content 。三、可复制配置Codex 侧与 vllm 侧各改什么这一节分两块Codex 怎么配start_api.sh怎么改。Codex 侧以 config.toml 为例model 你的模型ID model_provider taotoken [model_providers.taotoken] name TaoToken base_url https://taotoken.net/api env_key TAOTOKEN_API_KEY环境变量里设置TAOTOKEN_API_KEYYOUR_API_KEY。配好后先发一条短消息确认连通再开始贴长日志。vllm 侧start_api.sh里四个参数必须对齐。原文坑 10 给出的组合是--max-model-len 1048576 \ --max-num-batched-tokens 1048576 \ --max-num-seqs 1 \ --enable-prefix-caching \ --gpu-memory-utilization 0.9这里最容易出问题的是--max-num-batched-tokens。它和--max-model-len都设成 1048576意味着 vllm 允许单批次塞进 1M token激活显存按这个量级预留。A100 80G 在 BF16 下光 KV cache 加激活就很难扛住。排障时可以先把它降下来比如设成--max-num-batched-tokens 8192让 vllm 分块处理再观察是否还 OOM。--max-num-seqs 1是长上下文场景的合理值避免并发把显存摊薄。--enable-prefix-caching对多轮对话有用但单条 1M 请求首次推理时它不省显存别指望它救 OOM。把改前改后的start_api.sh都贴给 Codex让它对比参数差异比只贴报错更有效。四、验证请求与成功结果重跑单条 1M 推理看什么改完参数后重跑一次单条 1M 上下文推理观察三个指标第一vllm 启动日志里GPU blocks和KV cache的预分配数字。如果--max-num-batched-tokens降下来后这个数字明显变小说明激活显存预算松了。第二nvidia-smi在推理过程中的峰值显存。A100 80G 上1M 上下文单条推理的稳定占用应该在 75G 以内原文坑 10 的验证标准。如果还是瞬间打满说明参数没对齐或模型精度选错了。第三dmesg里是否还有Killed process。如果显存没满但进程还是被杀就要回到系统层检查vm.overcommit_memory是否设为 1、vm.max_map_count是否够大、swap 是否关闭。原文坑 12 给了一组内核参数swapoff -a sed -i /swap/s/^/#/ /etc/fstab echo vm.overcommit_memory1 /etc/sysctl.conf echo vm.max_map_count2621440 /etc/sysctl.conf sysctl -p另外可以给推理进程设oom_score_adj降低被 OOM killer 选中的概率echo -1000 /proc/[PID]/oom_score_adj验证成功的标志单条 1M 输入跑完进程存活API 返回正常nvidia-smi峰值不超 75Gdmesg无 kill 记录。把这次成功的日志和之前的失败日志一起贴给 Codex让它确认参数组合是否稳定。五、本篇常见错排查错误一只改--max-model-len不动--max-num-batched-tokens。前者是模型能接受的最大长度后者是单批次 token 预算。两个都设 1048576等于告诉 vllm我一次要处理 1M token激活显存直接爆。排障时优先降--max-num-batched-tokens。错误二--gpu-memory-utilization设太高。0.9 在 A100 80G 上意味着 vllm 可以占用 72G留给系统和 CUDA context 的空间很少。如果同时跑其他进程容易触发系统 OOM。可以试 0.85 或 0.8。错误三忽略--enforce-eager。原文start_api.sh里带了--enforce-eager它会关闭 CUDA graph降低显存峰值但牺牲一点吞吐。长上下文排障阶段建议保留稳定后再考虑去掉。错误四把系统 OOM 当成显存 OOM。两者日志不同显存 OOM 是torch.cuda.OutOfMemoryError系统 OOM 是dmesg里的Killed process。搞混了会往错误方向调参。错误五Codex 贴日志时截断。vllm 的报错往往在日志中段只贴最后几行会丢掉关键信息。把完整启动日志和报错前后的上下文一起给 Codex。如果排查中需要确认模型侧行为可以用模型对话页面直接发一条短请求对比https://taotoken.net/model-chat?utm_sourcetaotoken_aicg_blog_endutm_mediumcsdnutm_campaignrewriteutm_content 。接入相关问题看文档https://taotoken.net/doc?utm_sourcetaotoken_aicg_blog_endutm_mediumcsdnutm_campaignrewriteutm_content 。六、语义一致 CTA这条排障路线的核心是把start_api.sh、nvidia-smi现象、vllm 报错日志整理清楚交给 Codex 对照参数排查改完重跑单条 1M 推理验证。TaoToken 在其中只做两件事——提供 Key 和 Base URL让 Codex 能读下这些长日志。如果你还在建 Key 阶段去 API Keys 页面https://taotoken.net/console/api-keys?utm_sourcetaotoken_aicg_blog_endutm_mediumcsdnutm_campaignrewriteutm_content 。接入配置和 Base URL 填法看文档https://taotoken.net/doc?utm_sourcetaotoken_aicg_blog_endutm_mediumcsdnutm_campaignrewriteutm_content 。如果你后续要把这类长上下文排障做成常态化流程可以考虑 Coding Planhttps://taotoken.net/coding-plan?utm_sourcetaotoken_aicg_blog_endutm_mediumcsdnutm_campaignrewriteutm_content 。再提醒一次边界TaoToken 不替代 vllm 推理、不部署 Qwen3.5-Plus、不读写模型权重。参数怎么改、脚本怎么跑、显存怎么观察都在你的服务器上完成。Codex 给建议你来做决定。

相关新闻

蜂鸟式轻量设计:从colibri字体到网页性能优化

蜂鸟式轻量设计:从colibri字体到网页性能优化

1. colibri 到底是个什么项目我第一次看到"colibri"这个词,脑子里蹦出来的是蜂鸟。西班牙语里 colibr 就是蜂鸟的意思,法语里也这么叫。后来翻了一圈资料,发现叫这个名字的东西真不少——有开源字体、有轻量级浏览器、有音频插件&a…

2026/9/20 7:34:19 阅读更多 →
FT232R驱动安装全攻略:USB转UART串口调试与常见问题排查

FT232R驱动安装全攻略:USB转UART串口调试与常见问题排查

做嵌入式或者电子开发的朋友,十有八九都跟FT232R打过照面。这颗FTDI出品的USB转UART桥接芯片,几乎成了各种开发板、调试器、设备固件升级工具的标配——电脑上插个USB口,串口终端里立刻多出一个COM口,底层干活的其实就是它。我最早…

2026/9/20 7:33:19 阅读更多 →
蜂鸟工具集Colibri实测:轻量便携的Windows效率工具箱

蜂鸟工具集Colibri实测:轻量便携的Windows效率工具箱

如果你经常逛小众软件分享群,或者喜欢折腾 Windows 效率工具,最近应该没少看到“colibri”这个名字。它确实是个有点特别的项目——一个以蜂鸟命名的轻量级 Windows 工具集,把日常高频操作(截图、取色、文件搜索、快速启动、二维码…

2026/9/20 7:33:19 阅读更多 →

最新新闻

智能体安全实战指南:从提示注入到防御体系搭建与红队测试

智能体安全实战指南:从提示注入到防御体系搭建与红队测试

智能体安全最近是真的热,从圈内技术分享到安全社区议题,几乎每周都有新文章讨论。我自己的感受是,过去一年里,大模型智能体已经从“能聊天的Demo”快速进化成真正在干活的生产系统——写代码、操作数据库、调用API、审批流程、管理…

2026/9/20 8:10:36 阅读更多 →
GoCAD三维地质建模实战:从数据准备到体积计算的完整流程

GoCAD三维地质建模实战:从数据准备到体积计算的完整流程

本来答应大家写GoCAD操作记录的续篇,拖了一阵子,主要是一直在忙一个矿区的地质建模项目,赶着交成果图。陆陆续续把项目里用到的核心操作重新捋了一遍,包括安装适配、数据整理、曲面构建、体积计算这些真实流程。趁热记下来&#x…

2026/9/20 8:10:36 阅读更多 →
Virtuoso 6.1下宏力PDK实战解析:结构、SKILL与工艺角

Virtuoso 6.1下宏力PDK实战解析:结构、SKILL与工艺角

简介:围绕宏力半导体采用Cadence Virtuoso 6.1 PDK开发系统的行业案例,整理成一份面向半导体设计与工艺工程师的专业技术资料。内容重点阐述PDK自动化系统(PAS)和PDK测试系统(STEP)的架构与作用&#xff0c…

2026/9/20 8:10:36 阅读更多 →
Kimi K2.7 Code 上了 LiveCodeBench:用 TaoToken 一把 Key 跑同题集合

Kimi K2.7 Code 上了 LiveCodeBench:用 TaoToken 一把 Key 跑同题集合

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/20 8:10:36 阅读更多 →
InvenTree开源库存管理系统:免费自建的条码盘点与BOM管理,快速部署指南

InvenTree开源库存管理系统:免费自建的条码盘点与BOM管理,快速部署指南

InvenTree开源库存管理系统:免费自建的条码盘点与BOM管理,快速部署指南 【免费下载链接】InvenTree Open Source Inventory Management System 项目地址: https://gitcode.com/GitHub_Trending/in/InvenTree 月底盘库,货架上堆着的料和…

2026/9/20 8:10:36 阅读更多 →
chezmoi 模板函数 `completion`:在 dotfiles 中动态生成 Shell 补全脚本

chezmoi 模板函数 `completion`:在 dotfiles 中动态生成 Shell 补全脚本

开发工具CLI配置管理 【免费下载链接】chezmoi Manage your dotfiles across multiple diverse machines, securely. 项目地址: https://gitcode.com/gh_mirrors/ch/chezmoi 点击查看 免费下载 导读 chezmoi 提供了名为 completion 的模板函数,它能在模…

2026/9/20 8:09:35 阅读更多 →

日新闻

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

直接铺开项目本身吧。这几个月我一直在折腾一件事:用Flutter给OpenHarmony做一款游戏集合类的App,说白了就是把若干小游戏塞进一个壳里,用统一入口分发。这个方向本身不算新鲜,真正让我花了不少心思的,是首页那堆游戏卡…

2026/9/20 0:00:46 阅读更多 →
Word表格编号全攻略:从列表编号到题注交叉引用

Word表格编号全攻略:从列表编号到题注交叉引用

写Word文档,最让人头疼的往往是那些“看起来不起眼”的小问题。比如表格编号这事:今天在表后面多加了两个空白行,明天给客户交稿前发现整个章节的编号全部错位,光是挨个改序号就能耗掉大半个下午。我前阵子帮人整理一份上百页的技…

2026/9/20 0:00:46 阅读更多 →
从第一个站到第二个站:独立开发者的静态网站选型与落地实践

从第一个站到第二个站:独立开发者的静态网站选型与落地实践

1. 项目概述1.1 核心需求解析做独立开发者这几年,说实话,第一个网站上线的那天晚上我兴奋得没睡着。但等它跑了半年,流量惨淡、功能臃肿、代码自己都懒得看第二遍之后,我才慢慢琢磨明白一个道理:第一个网站是练手&…

2026/9/20 0:00:46 阅读更多 →

周新闻

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

直接铺开项目本身吧。这几个月我一直在折腾一件事:用Flutter给OpenHarmony做一款游戏集合类的App,说白了就是把若干小游戏塞进一个壳里,用统一入口分发。这个方向本身不算新鲜,真正让我花了不少心思的,是首页那堆游戏卡…

2026/9/20 0:00:46 阅读更多 →
Word表格编号全攻略:从列表编号到题注交叉引用

Word表格编号全攻略:从列表编号到题注交叉引用

写Word文档,最让人头疼的往往是那些“看起来不起眼”的小问题。比如表格编号这事:今天在表后面多加了两个空白行,明天给客户交稿前发现整个章节的编号全部错位,光是挨个改序号就能耗掉大半个下午。我前阵子帮人整理一份上百页的技…

2026/9/20 0:00:46 阅读更多 →
从第一个站到第二个站:独立开发者的静态网站选型与落地实践

从第一个站到第二个站:独立开发者的静态网站选型与落地实践

1. 项目概述1.1 核心需求解析做独立开发者这几年,说实话,第一个网站上线的那天晚上我兴奋得没睡着。但等它跑了半年,流量惨淡、功能臃肿、代码自己都懒得看第二遍之后,我才慢慢琢磨明白一个道理:第一个网站是练手&…

2026/9/20 0:00:46 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/19 23:01:36 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/19 17:50:38 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/19 23:35:34 阅读更多 →