Qwen3.6-27B 量化版来了
这次英伟达也下场了放出了nvidia/Qwen3.6-27B-NVFP4乍一看很香官方 ModelOpt 量化Apache 2.0vLLM 直接 serve模型卡写着磁盘和 GPU 显存需求大约降低2.5x但我翻完模型卡和社区 discussion 后感觉有必要详细介绍一下先说结论显存收益是真实的官方说把 transformer block 里的 linear operators 权重和激活量化到 NVFP4参数位宽从 16 bit 降到 4 bit磁盘和 GPU 显存需求大约降 2.5x精度基本稳住了官方评测里 NVFP4 和 FP8 很接近MMLU Pro 甚至 86.3 vs 86.1小赢 0.2性能有分歧有测试 NVFP4 在 RTX PRO 6000 Blackwell 上 decode 可以跑到 200 t/s 左右FP8 约 112 t/s但也有更完整对测里FP8 在 decode-bound 场景反而快 8-12%坑也很具体B200 / DGX Spark / RTX PRO 6000 Blackwell 上都有人遇到 Marlin 警告、modelopt_mixed、以及重复!/dtoken 的问题生产建议很朴素显存紧张、长上下文、想跑 27B 的同学可以试 NVFP4追求稳定吞吐的同学务必拿 FP8 在同一套 vLLM / FlashInfer / MTP 配置下 A/B这个模型到底是什么项目信息基座Alibaba Qwen3.6-27B参数量27B架构Hybrid AttentionGated DeltaNet Gated Attention上下文262KQwen 原版还写了可扩展到 1,010,000 tokens量化工具nvidia-modelopt v0.45.0量化目标transformer blocks 内 linear operators 的权重与激活推理引擎vLLM官方测试硬件NVIDIA GB300硬件兼容Hopper / BlackwellLicenseApache 2.0Qwen3.6-27B 自身的亮点也很明确主打 Agentic Coding、仓库级推理、Thinking Preservation以及更长的上下文对本地部署玩家来说最关键的其实就两个词27B 262K27B 代表它还在个人工作站和单卡专业卡的想象范围里262K 代表它适合 Agent、RAG、长文档、代码仓库这类吃上下文的任务英伟达这次做 NVFP4理论上的吸引力很直接把 27B 再压一压让它更容易塞进显存同时尽量保住 Qwen3.6 的能力官方精度表没明显变傻官方模型卡给了 NVFP4 和 FP8 的 accuracy benchmark我把关键数字搬出来BenchmarkFP8NVFP4差值MMLU Pro86.186.30.2GPQA Diamond86.085.5-0.5HLE21.721.80.1τ²-Bench Telecom95.295.40.2MMMU Pro74.674.3-0.3SciCode44.844.5-0.3AIME 202593.192.7-0.4AA-LCR68.868.3-0.5IFBench65.165.50.4一句话精度层面基本可以放心差值大多在 0.5 以内考虑到 benchmark 本身的波动这个结果挺漂亮社区的质量测试也支持这个判断7 个 prompt 的质量检查包括诗歌、投诉邮件、HTML todo、HTML Snake、逻辑题转 JSON、merge_intervals、59KB 文档转 JSON结果很接近逻辑题两边都是5/5 correctmerge_intervals两边都过6/6 edge cases都能处理 ValueError也都没有 mutation59KB 文档转 JSON 两边都能产出 valid JSON严重程度都判成highHTML todo 和 Snake 都是 valid single-file关键 API 存在Thinking mode 下NVFP4 在一个 trivial Python 任务里 16K token budget 都没把函数收完FP8 能正确完成所以我的判断是正常非思考模式下NVFP4 没有明显质量塌陷但做确定性代码任务时Thinking mode 要谨慎官方部署方式NVIDIA 模型卡给的 vLLM 命令很简短vllm serve nvidia/Qwen3.6-27B-NVFP4 \ --port 8000 \ --quantization modelopt \ --max-model-len 262144 \ --reasoning-parser qwen3如果你要上工具调用、MTP、前缀缓存、chunked prefill有 DGX Spark 用户贴过一组更详细的命令vllm serve ~/models/hf/Qwen3.6-27B-NVFP4 \ --trust-remote-code \ --served-model-name qwen36-27b \ --gpu-memory-utilization 0.45 \ --dtype bfloat16 \ --max-num-seqs 4 \ --max-model-len 131072 \ --reasoning-parser qwen3 \ --enable-auto-tool-choice \ --tool-call-parser qwen3_coder \ --speculative-config {method:mtp,num_speculative_tokens:3} \ --max-num-batched-tokens 16384 \ --enable-chunked-prefill \ --async-scheduling \ --enable-prefix-caching \ --quantization modelopt社区实测一NVFP4 看起来真能打测试条件RTX PRO 6000 Blackwell 96GB开启MTP speculative decoding先看 NVFP4Qwen3.6-27B-NVFP4 在 RTX PRO 6000 Blackwell 上的社区实测再看 FP8Qwen3.6-27B-FP8 在 RTX PRO 6000 Blackwell 上的社区实测把图里的关键数字拎出来场景NVFP4 decode t/sFP8 decode t/s观察pp256 / tg32 / d0204112NVFP4 明显高pp256 / tg256 / d0201111NVFP4 明显高pp4096 / tg32 / d0117112接近pp4096 / tg256 / d0159112NVFP4 高pp16384 / tg32 / d0205119NVFP4 高pp16384 / tg256 / d0200111NVFP4 高pp256 / tg32 / d4k161113NVFP4 高pp4096 / tg32 / d4k203117NVFP4 高pp16384 / tg32 / d4k204112NVFP4 高pp256 / tg32 / d8k205113NVFP4 高pp4096 / tg32 / d8k204117NVFP4 高pp16384 / tg32 / d8k204113NVFP4 高NVFP4 decode 都在200 t/s左右FP8 大多在111-119 t/s区间但别只看 decodeprefill 上 FP8 反而更强比如 pp4096 / tg32 / d0FP8 是9,785 t/sNVFP4 是6,782 t/sTTFT 也有类似现象pp16384 / tg32 / d0FP8 是1,605 msNVFP4 是2,595 ms某些 decode 场景里NVFP4 的确能跑出很漂亮的数字但长 prompt 和 prefill 场景下FP8 依然有反杀空间社区实测二另一组完整对测里FP8 反而更快有网友把 NVFP4 和 FP8 放到两张 RTX PRO 6000 Blackwell 96GB 上并行跑配置大概是项目NVFP4FP8模型nvidia/Qwen3.6-27B-NVFP4Qwen/Qwen3.6-27B-FP8GPU1× RTX PRO 6000 Blackwell 96GB1× RTX PRO 6000 Blackwell 96GBvLLM0.24.00.23.1rc1.devSpec decodingMTP, 3 tokensMTP, 3 tokensKV cachefp8_e4m3fp8_e4m3max len262K262Kgpu util0.920.92max seqs128128它的吞吐结论和 前面实测的截图相反场景NVFP4FP8结论single small decode77.1 tok/s84.7 tok/sFP8 10%warm TTFT0.09 s0.09 s持平big prompt decode98.7 tok/s111.0 tok/sFP8 12%big prompt prefill~5,700 tok/s / 3.9 s~7,000 tok/s / 3.2 sFP8 更强16 并发 aggregate891.7 tok/s963.3 tok/sFP8 8%16 并发 per-request67.4 tok/s68.5 tok/s接近4 并发 big aggregate358.9 tok/s342.5 tok/sNVFP4 5%4 并发 big per-request100.4 tok/s103.7 tok/s接近这里我觉得最关键的是这句话FP8 在 decode-bound 场景里稳定快 8-12%NVFP4 只在大 prompt 并发这种 prefill-bound 场景里小幅领先再看 per-prompt latency也挺扎心PromptNVFP4FP8捷克语 2000 词故事49.3 s / 74.4 tok/s36.8 s / 87.3 tok/sHTML todo16.3 s / 104 tok/s15.9 s / 116 tok/sHTML Snake17.6 s / 124 tok/s15.8 s / 141 tok/s逻辑题转 JSON2.75 s / 104 tok/s2.6 s / 129 tok/sPythonmerge_intervals1.78 s / 122 tok/s1.87 s / 129 tok/s捷克语投诉邮件11.0 s / 60.5 tok/s6.0 s / 110 tok/s59KB 转 JSON20.0 s / 103 tok/s25.2 s / 103 tok/s这组测试有点局限了两边 vLLM build 不同attention / MoE backend 也有差异但它依然给了一个很重要的提醒NVFP4 的速度优势没有形成统一规律尤其别把显存下降自动等价成吞吐上涨重复 token这坑有点吓人这个 bug 典型现象是模型能正常加载但极简 prompt 也会输出一串d d d d d或者满屏!Qwen3.6-27B-NVFP4 社区反馈的重复感叹号问题有用户反馈 vLLM release0.24.0正常nightly 有问题从vllm/vllm-openai:nightly换到vllm/vllm-openai:v0.24.0-cu129-ubuntu2404后缓解但也有人说vllm0.24.0和 nightly 都遇到过更细的反馈是0.24.0里 flashinfer0.6.12会让 AutoTuner 出现三百多次[AutoTuner]: Tuning fp8_gemm: 100%nightly 升到0.6.13后 AutoTuner 异常缓解但 CoT 中输出!!!的问题还在最后对于正在迷茫择业、想转行提升或是刚入门的程序员、编程小白来说有一个问题几乎人人都在问未来10年什么领域的职业发展潜力最大答案只有一个人工智能尤其是大模型方向当下人工智能行业正处于爆发式增长期其中大模型相关岗位更是供不应求薪资待遇直接拉满——字节跳动作为AI领域的头部玩家给硕士毕业的优质AI人才含大模型相关方向开出的月基础工资高达5万—6万元即便是非“人才计划”的普通应聘者月基础工资也能稳定在4万元左右。再看阿里、腾讯两大互联网大厂非“人才计划”的AI相关岗位应聘者月基础工资也约有3万元远超其他行业同资历岗位的薪资水平对于程序员、小白来说无疑是绝佳的转型和提升赛道。如果你还不知道从何开始我自己整理一套全网最全最细的大模型零基础教程我也是一路自学走过来的很清楚小白前期学习的痛楚你要是没有方向还没有好的资源根本学不到东西下面是我整理的大模型学习资源希望能帮到你。扫码免费领取全部内容最后1、大模型学习路线2、从0到进阶大模型学习视频教程从入门到进阶这里都有跟着老师学习事半功倍。3、 入门必看大模型学习书籍文档.pdf书面上的技术书籍确实太多了这些是我精选出来的还有很多不在图里4、AI大模型最新行业报告2026最新行业报告针对不同行业的现状、趋势、问题、机会等进行系统地调研和评估以了解哪些行业更适合引入大模型的技术和应用以及在哪些方面可以发挥大模型的优势。5、面试试题/经验【大厂 AI 岗位面经分享107 道】【AI 大模型面试真题102 道】【LLMs 面试真题97 道】6、大模型项目实战配套源码适用人群四阶段学习规划共90天可落地执行第一阶段10天初阶应用该阶段让大家对大模型 AI有一个最前沿的认识对大模型 AI 的理解超过 95% 的人可以在相关讨论时发表高级、不跟风、又接地气的见解别人只会和 AI 聊天而你能调教 AI并能用代码将大模型和业务衔接。大模型 AI 能干什么大模型是怎样获得「智能」的用好 AI 的核心心法大模型应用业务架构大模型应用技术架构代码示例向 GPT-3.5 灌入新知识提示工程的意义和核心思想Prompt 典型构成指令调优方法论思维链和思维树Prompt 攻击和防范…第二阶段30天高阶应用该阶段我们正式进入大模型 AI 进阶实战学习学会构造私有知识库扩展 AI 的能力。快速开发一个完整的基于 agent 对话机器人。掌握功能最强的大模型开发框架抓住最新的技术进展适合 Python 和 JavaScript 程序员。为什么要做 RAG搭建一个简单的 ChatPDF检索的基础概念什么是向量表示Embeddings向量数据库与向量检索基于向量检索的 RAG搭建 RAG 系统的扩展知识混合检索与 RAG-Fusion 简介向量模型本地部署…第三阶段30天模型训练恭喜你如果学到这里你基本可以找到一份大模型 AI相关的工作自己也能训练 GPT 了通过微调训练自己的垂直大模型能独立训练开源多模态大模型掌握更多技术方案。到此为止大概2个月的时间。你已经成为了一名“AI小子”。那么你还想往下探索吗为什么要做 RAG什么是模型什么是模型训练求解器 损失函数简介小实验2手写一个简单的神经网络并训练它什么是训练/预训练/微调/轻量化微调Transformer结构简介轻量化微调实验数据集的构建…第四阶段20天商业闭环对全球大模型从性能、吞吐量、成本等方面有一定的认知可以在云端和本地等多种环境下部署大模型找到适合自己的项目/创业方向做一名被 AI 武装的产品经理。硬件选型带你了解全球大模型使用国产大模型服务搭建 OpenAI 代理热身基于阿里云 PAI 部署 Stable Diffusion在本地计算机运行大模型大模型的私有化部署基于 vLLM 部署大模型案例如何优雅地在阿里云私有部署开源大模型部署一套开源 LLM 项目内容安全互联网信息服务算法备案…扫码免费领取全部内容3、这些资料真的有用吗这份资料由我和鲁为民博士(北京清华大学学士和美国加州理工学院博士)共同整理现任上海殷泊信息科技CEO其创立的MoPaaS云平台获Forrester全球’强劲表现者’认证服务航天科工、国家电网等1000企业以第一作者在IEEE Transactions发表论文50篇获NASA JPL火星探测系统强化学习专利等35项中美专利。本套AI大模型课程由清华大学-加州理工双料博士、吴文俊人工智能奖得主鲁为民教授领衔研发。资料内容涵盖了从入门到进阶的各类视频教程和实战项目无论你是小白还是有些技术基础的技术人员这份资料都绝对能帮助你提升薪资待遇转行大模型岗位。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

相关新闻

DisCEdge: Distributed Context Management for Large Language Models at the Edge

DisCEdge: Distributed Context Management for Large Language Models at the Edge

DisCEdge 论文总结与核心部分翻译 一、主要内容总结 本文聚焦于大语言模型(LLM)在边缘节点部署时的上下文管理挑战,提出了分布式上下文管理系统 DisCEdge,核心内容如下: 问题背景:LLM 具有无状态特性,在地理分布式边缘节点部署时,用户上下文(会话历史、偏好等)的一…

2026/8/13 22:26:08 阅读更多 →
2026年神经酸能提升记忆力吗?7款脑营养产品数据实测排行

2026年神经酸能提升记忆力吗?7款脑营养产品数据实测排行

​一、“神经酸对记忆力到底有多大帮助?——一个让我翻了一周文献的问题”“孩子背课文比同学多花一倍时间,我查了说神经酸能改善记忆力,但到底能改善多少?有没有具体的数据或者文献支撑?我不想听“有好处”这种模糊的…

2026/8/13 22:26:08 阅读更多 →
Android非Root环境下跨应用私有数据访问:Content Provider与备份解析实战

Android非Root环境下跨应用私有数据访问:Content Provider与备份解析实战

1. 项目概述&#xff1a;一个看似不可能的任务在Android开发或者逆向分析的过程中&#xff0c;我们常常会遇到一个令人头疼的瓶颈&#xff1a;如何访问其他应用存储在/data/data/<package_name>目录下的私有数据&#xff1f;这个目录是Android沙盒安全模型的核心&#xf…

2026/8/13 22:26:08 阅读更多 →

最新新闻

跨境电商运营怎么做?新手入门全流程指南

跨境电商运营怎么做?新手入门全流程指南

有个新手朋友刚拿到亚马逊账号的时候&#xff0c;兴奋地跟我说他准备一周之内上架五款产品。我问他选品调研做了吗&#xff0c;他说"1688上看了几款卖得不错的&#xff0c;直接拿货就行"。我说你先别急&#xff0c;把五款产品放一放&#xff0c;先花三天时间做调研。…

2026/8/13 23:21:48 阅读更多 →
寻找专业合川网站建设公司?这些坑你必须避开,否则预算白扔还耽误生意

寻找专业合川网站建设公司?这些坑你必须避开,否则预算白扔还耽误生意

在重庆的大西北,有一个充满魅力和历史底蕴的地方,那就是合川。这里三江汇流,风景如画,更有一群敢想敢干、务实肯干的老板们。在这个互联网深度渗透每个行业的今天,很多合川的企业家都在问我同一个问题:“我想做个网站,到底该找谁?是不是找家便宜的随便弄弄就行?”说实…

2026/8/13 23:21:48 阅读更多 →
从零基础到月薪过万:普通人如何通过网站建设与运营就业逆袭

从零基础到月薪过万:普通人如何通过网站建设与运营就业逆袭

说实话,每次看到后台收到那些私信,问我“现在入行晚不晚”、“零基础能不能干”的时候,我心里总是五味杂陈。大家焦虑,因为大环境在变,互联网的风口好像一夜之间就转了方向。但如果你把目光放长远一点,把“网站建设与运营就业”这六个字嚼碎了看,你会发现,这不仅仅是一…

2026/8/13 23:21:48 阅读更多 →
跨境电商运营和国内电商运营有什么区别?核心差异深度对比

跨境电商运营和国内电商运营有什么区别?核心差异深度对比

有个朋友在国内淘宝做了五年&#xff0c;做到过年销三千万。去年转来做跨境&#xff0c;来的时候信心满满——"我连淘宝这么卷的平台都能做起来&#xff0c;做跨境还不是降维打击&#xff1f;"结果第一个月就被现实教育了。他选了一款在国内卖爆的厨房小工具&#xf…

2026/8/13 23:21:48 阅读更多 →
AI工程实践指南:从小米校招看AI人才需求与实战技能构建

AI工程实践指南:从小米校招看AI人才需求与实战技能构建

最近几年&#xff0c;无论是技术社区还是招聘市场&#xff0c;AI 相关的讨论热度都居高不下。作为技术从业者&#xff0c;我们不仅关注技术本身的发展&#xff0c;也关心行业趋势如何影响我们的职业路径。近期&#xff0c;小米启动了面向 2027 届毕业生的全球校园招聘&#xff…

2026/8/13 23:21:48 阅读更多 →
KES数据库技能包覆盖Oracle兼容、多源数据库迁移

KES数据库技能包覆盖Oracle兼容、多源数据库迁移

近日&#xff0c;**电科金仓在Gitee社区发布了一套KES技能包——一套面向AI编程助手的金仓数据库专业技能包。**首批共上线31个技能&#xff0c;把金仓数据库&#xff08;KES&#xff09;相关的产品知识、操作方法和实践经验&#xff0c;整理成智能体能够识别和调用的专业技能。…

2026/8/13 23:20:48 阅读更多 →

日新闻

Visual Studio新建项目解决方案为空:系统性排查与修复指南

Visual Studio新建项目解决方案为空:系统性排查与修复指南

1. 问题现象与本质剖析如果你是一位.NET开发者&#xff0c;或者正准备踏入这个领域&#xff0c;那么Visual Studio&#xff08;后面简称VS&#xff09;绝对是你绕不开的伙伴。但有时候&#xff0c;这个伙伴会跟你开一个不大不小的玩笑&#xff1a;你满怀期待地点击“创建新项目…

2026/8/13 0:00:09 阅读更多 →
长春建设厅网站:普通人买房办事必看的真实指南与避坑攻略

长春建设厅网站:普通人买房办事必看的真实指南与避坑攻略

说实话,每次提起“长春建设厅网站”这几个字,我心里都挺有感触的。不是因为它有多高大上,也不是因为那里藏着什么不可告人的秘密,恰恰相反,是因为它太“接地气”了,或者说,它是咱们普通人想要在这个城市好好生活、安稳买房时,必须得翻过的一座“数据山”。很多新朋友第…

2026/8/13 0:00:09 阅读更多 →
Windows家庭版远程桌面多用户破解完整指南:RDPWrap终极解决方案

Windows家庭版远程桌面多用户破解完整指南:RDPWrap终极解决方案

Windows家庭版远程桌面多用户破解完整指南&#xff1a;RDPWrap终极解决方案 【免费下载链接】rdpwrap.ini RDPWrap.ini for RDP Wrapper Library by StasM 项目地址: https://gitcode.com/GitHub_Trending/rd/rdpwrap.ini 你是否曾为Windows家庭版无法支持多用户远程桌面…

2026/8/13 0:00:09 阅读更多 →

周新闻

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁

5分钟告别提取码焦虑&#xff1a;baidupankey如何智能破解百度网盘资源锁 【免费下载链接】baidupankey 在线查询网盘提取码&#xff08;维护中 rm repo&#xff09; 项目地址: https://gitcode.com/gh_mirrors/ba/baidupankey 你是否曾经在深夜寻找一份重要资料&#x…

2026/8/13 2:38:34 阅读更多 →
如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片&#xff1a;Python开源工具完整指南 【免费下载链接】chinese_license_plate_generator 中国车牌生成器 项目地址: https://gitcode.com/gh_mirrors/ch/chinese_license_plate_generator 中国车牌生成器是一个基于Python的开源项目&#xff0c…

2026/8/13 10:41:52 阅读更多 →
收藏!小白程序员轻松入门大模型,从Harness工程开始实践

收藏!小白程序员轻松入门大模型,从Harness工程开始实践

文章强调学习大模型不应只关注模型本身&#xff0c;而应重视模型外的系统搭建&#xff0c;即Harness。提出AgentModelHarness的实用公式&#xff0c;详细介绍Harness的四个层次&#xff1a;持久化层、执行层、控制层和观察与验证层。文章还探讨了上下文工程、工具设计、AGENTS.…

2026/8/13 10:41:51 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速&#xff1a;macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/13 10:41:50 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南&#xff1a;3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗&#xff1f;ncmdump解密工具帮你轻松解决这个困…

2026/8/13 10:41:49 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片&#xff1a;为英语学习 App 打造桌面级学习助手适用平台&#xff1a;HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0&#xff08;API 26 Beta&#xff09;新增了 AgentCard 智能体卡片能力&#xff0c;这是继 HMAF&#xff08;鸿蒙智能体框架&#x…

2026/8/13 10:41:49 阅读更多 →