深度 | 模型为芯片而生:DeepSeek V4 与昇腾 950 的共谋改变了什么
模型为芯片而生DeepSeek V4 与昇腾 950 的共谋改变了什么核心观点DeepSeek V4 不是适配了昇腾而是为昇腾协同设计——当开源世界最有分量的模型把架构写成昇腾原生国产算力第一次摸到了生态定义权。这是一篇深度研究不是新闻简报。基于 30 个来源的交叉验证覆盖技术架构、竞争格局、市场影响三个维度。证据等级[A] 官方/一手 [B] 2可靠来源 [C] 单一来源 [D] 个人判断一、被误读的八芯适配4 月 24 日 DeepSeek 发布 V41.6 万亿总参数、490 亿激活的 MoE1M 上下文开源权重。主流叙事把它包装成国产算力里程碑——八家国产芯片厂商 Day 0 全量适配。但这份叙事漏了最重要的细节。SemiAnalysis 在 6 月 17 日发布昇腾 950DT 的指令级拆解结论直接推翻适配这个词V4 的推理路径在发布之前就是照着昇腾的硬件写出来的。稀疏矩阵乘、专家路由的 Expert Gather 指令、FP4/FP8 混合精度——这些 V4 架构里最核心的设计恰好都是昇腾 NPU 最擅长、而通用 GPU 并不天生优化的东西。[A]黄仁勋在 4 月 15 日播客里说DeepSeek 若率先在华为芯片上跑通对美国是糟糕的结果。他没说完的下半句才是重点——他怕的不是跑通而是 CUDA 失去默认优化特权。[B]二、技术纵深V4 架构里写着昇腾的名字V4 相对 V3 做了四个激进改动每一个都偏离 GPU 惯例设计V4 的取舍对昇腾的意味注意力抛弃 MLA改 CSAHCA 混合压缩注意力稀疏索引与全局压缩贴合 NPU 稀疏访存多 Token 预测原生 MTP同时预测 t1…t3让 decode 从访存密集转向算力密集精度FP4 专家 FP8 非专家950PR 是国产唯一原生 FP4 芯片残差mHC 流形约束超连接减少中间激活省显存带宽1M 上下文下V4-Pro 每 token 的 FLOPs 只有 V3.2 的 27%KV 缓存只有 10%。[B] 在 1M 上下文场景里KV 缓存是从显存里挤出来的10% 意味着同样的卡能塞下十倍长的上下文也意味着昇腾相对小的片上内存不再是致命伤。昇腾 950DT 最关键的三个数字144GB 片上 HiZQ 2.0 内存、4TB/s 带宽、2TB/s 片间互联。[A] 144GB 对 MoE 推理是决定性的——1.6T 总参数、49B 激活的 V4-Pro所有专家权重放上单卡后推理只需搬运激活参数。这是全部专家常驻与专家换入换出的本质区别。Atlas 950 SuperPoD 在 WAIC 2026 真机首秀1024 卡、1 EFLOPS FP8、256TB 统一编址、3μs RTT最大可扩到 8192 卡。256TB 统一编址意味着 1.6T 参数的权重与 KV 可全部驻留在同一逻辑内存空间应用层不需要做跨机调度。华为公布的数字V4-Pro 在 950DT 上单卡 decode 约 4700 TPS、TPOT 约 20ms。对比 H20FP4 算力 2.87 倍。需要诚实标注这是厂商口径、8K 输入的离线指标。真正的独立验证来自另一个方向。SemiAnalysis 的追踪显示V4 发布当天只有 CUDA 和 CANN 两套栈能跑完整推理AMD ROCm 只有 1-2 tok/sNVIDIA 自己的 TensorRT-LLM 还踩了一个静默内存损坏的 bug修了几周。[A] V4 发布当天能完整跑起来的推理栈只有两套——CUDA和昇腾 CANN。上图V4 的四个激进设计与昇腾 950 硬件能力的对应关系。三、竞争格局八家赛马与英伟达的侧门八家国产芯片 Day 0 适配是被扁平化的表述。严格拆解Day 04 月 24 日只有昇腾和寒武纪Day 14 月 25 日海光、摩尔线程、沐曦、昆仑芯、平头哥、天数智芯六家通过智源 FlagOS 补齐 Flash 版适配壁仞单独完成了 Pro 版适配。[B] 唯一在 Day 0 拿出完整、可验证推理性能的国产栈只有昇腾。智源 FlagOS 做了三件事FlagGems 全算子替换Triton 写不依赖 cuDNN/cuBLAS、统一张量并行策略、FP4FP8→BF16 精度转换。这套抽象层让写一次、跑八家成为可能但代价是性能上限被锁在通用算子层——这就是为什么六家 Day 1 适配都没拿出可审计的性能数字。厂商芯片V4 适配公开性能华为昇腾 950DT/950PRDay 0协同设计4700 TPS 单卡 decode寒武纪思元 590/690Day 0代码开源无公开 V4 数据摩尔线程夸娥 S5000Day 1V4-Flash 吞吐 65.7%沐曦曦云 C500/C600Day 1无公开 V4 数据海光深算 DCU3Day 1无 V4 数据昆仑芯/平头哥/天数P800/真武/天核Day 1仅验证NVIDIAH20/H200CUDA Day 0中国份额已跌至约 8%对比表八家中只有华为拿出了可审计的 V4 性能数字。英伟达在中国三条路全受阻。H20 是被阉割的降级产品算力密度只有 H100 的约 40%被中国云厂商用脚投票H200 获准出口但到 2026 年 Q1 实际营收是零——北京以战略陷阱为由按住了审批。[B] 于是英伟达打出第四张牌把独立的 Vera CPU 卖给中国。Vera CPU 不是降级产品而是一台完整的 88 核 Armv9.2 服务器 CPU1.2TB/s 内存带宽定价远高于2 万美元。[B] 精妙之处在于出口管制管的是 GPU不管 CPU——这是监管后门。中国头部云厂商已计划采购 300 台双路 Vera 服务器做测试。但这条路同样悬AMD Venice 256 核声称单机柜吞吐是 Vera 的 3.3 倍美国也可能把管制扩展到 CPU。[D]上图2026 年国产算力与英伟达中国路线的关键节点。四、市场与生态估值、产能与定义权DeepSeek 的融资曲线三个月内被改写4 月锚定 100 亿美元估值5 月 28 日第一轮交割、投后约 520 亿美元、大基金首次投资一家大模型公司7 月第二轮投前估值已到 710 亿美元A 股 IPO 已列入 2027 年科创板日程。[B] 最有象征意义的不是金额而是大基金——这个历史上只投中芯、长鑫等硬件的国家队第一次把钱放进了一家软件公司。7 月 31 日彭博报道DeepSeek 计划在内蒙古乌兰察布建设 1GW 级智算中心投资约 350 亿美元采用自建租赁混合模式。但最关键的芯片方案至今未被证实——彭博原文说尚不清楚用谁的芯片中国部分自媒体声称全部国产而 8 月 8 日中国日报的说法更保守双方都未承诺建设。[C] 1GW 国产方案目前是叙事不是事实。产能账很朴素中芯 N2 年产能约 260 万颗2026 年需求约 420 万颗缺口 40%华为独占 43% 产能。[B] 昇腾 950 2026 年计划出货约 75 万颗路透字节跳动一家就锁走了一半HBM 是更硬的瓶颈——国产 HBM3 要等长鑫 2028 年才可能规模化。梁文锋在 7 月内部会上说的那句华为的问题是产能不是技术是对全局最精准的概括。[C]7 月 31 日国产算力板块史诗级大反攻科创芯片 ETF 涨 7.9%寒武纪 20cm 涨停、市值一度站上 5000 亿。[B] 政策底座更厚国家规划五年 2 万亿建全国算力网、2028 年国产芯片占比不低于 80%日本 8 月 1 日起对先进封装设备实施全面出口许可反向加速国产封装替代。上图国产算力的供需结构——需求被开源模型点燃供给被产能与 HBM 卡住。五、三个层次的博弈第一层是推理先行。国产芯片今天真正攻下的是推理市场——昇腾 950DT 的 decode 已摸到 H100 的 85-90%成本只有约四分之一。[B] 但训练仍是英伟达的天下V4 技术报告刻意不披露预训练硬件行业共识是H800 训练 昇腾推理/续训练的混合结构弃 CUDA叙事被夸大了。[C] 需要看到的是6 月 5 日昇腾 910C 集群已完成 V4-Pro 1.6T 全参数后训练MFU 34.22%这堵墙正在被一点点凿穿。[A]第二层是生态反向渗透。V4 的开源让昇腾从国产替代选项变成全球开发者默认选项之一。技术报告同期发布的 TileLang 是一套旨在逃离 CUDA 的 GPU 算子语言——DeepSeek 不只在芯片层面做国产化还在工具链层面给整个行业留了退路。第三层是定义权。当开源世界最有影响力的模型把架构做成昇腾原生开发者生态会围绕 CANN 生长正如二十年前围绕 CUDA 生长。我判断未来一年国产算力最大的变量不是芯片性能而是模型-芯片协同设计的深度——谁能让模型为自家芯片而生谁就掌握了生态的定义权。[D]六、我的判断我原以为国产算力跑万亿模型是工程成就现在看是范式转折。V4 与昇腾的协同设计第一次让芯片定义模型变成了现实——这在 AI 芯片史上只有 CUDA 时代做到过。最需要保持清醒的三点。第一性能数字基本是厂商口径4700 TPS 是离线最优值真实在线负载要等 950DT 8 月上线华为云后才有独立验证。第二国产训练闭环仍未完全跑通预训练依旧是英伟达主导910C 的 34% MFU 后训练是进步但离端到端国产还有距离。第三乌兰察布 1GW 的芯片方案悬而未决它可能是国产算力最大的增量订单也可能只是一篇彭博报道。我判断方向是确定的模型为芯片而设计的循环一旦转起来就不会倒转。MiniMax H3 在 8 月 3 日复制了同样的 Day 0 模式说明这不是 DeepSeek 的孤例而是中国开源生态的默认打法。下一个观察窗口是 9 月——昇腾 950 超节点批量商用时V4 的推理价格会降多少那是国产算力真正交卷的时刻。参考来源部分SemiAnalysis InferenceX — DeepSeek V4 Day 0→43 Performance华为 — Atlas 950 SuperPoD 发布DeepSeek-V4 技术报告arXiv:2606.19348路透 — 中国科技巨头抢购昇腾 950彭博 — DeepSeek 乌兰察布 1GW 数据中心芯东西 — 8 大国产 AI 芯片适配 DeepSeek-V4人民日报 — DeepSeek 跑在国产芯片上意味着什么财新 — 大基金领投 DeepSeekAI 辅助深度研究人工视角解读。每日更新。

相关新闻

FAQPage Schema 机制分析与 AI 引用率实证研究:5 段问答结构化如何撬动 27.8% 的引用增量

FAQPage Schema 机制分析与 AI 引用率实证研究:5 段问答结构化如何撬动 27.8% 的引用增量

文章目录问题背景:AI 搜索引擎引用机制与传统 SEO 的结构性矛盾机制拆解:AI 引擎的语义索引与信息块摘录原理技术实现:FAQPage Schema 的 JSON-LD 编码与验证实证数据:5 段 FAQ 结构化对引用率的量化影响平台分发差异与内容适配策…

2026/8/11 0:45:22 阅读更多 →
【Bug已解决】fix underlying issue with `test_from_save_pretrained_dtype_inference` is that the `model.to(

【Bug已解决】fix underlying issue with `test_from_save_pretrained_dtype_inference` is that the `model.to(

【Bug已解决】fix underlying issue with test_from_save_pretrained_dtype_inference is that the model.to(dtype) cast at 解决方案 一、现象长什么样 diffusers 有个测试 test_from_save_pretrained_dtype_inference,本意是验证:「从一个以某 dtype …

2026/8/11 0:44:22 阅读更多 →
深度 | FDE军备竞赛:95%的AI试点没赚到钱,巨头砸$90亿送工程师上门

深度 | FDE军备竞赛:95%的AI试点没赚到钱,巨头砸$90亿送工程师上门

# 深度 | FDE军备竞赛:95%的AI试点没赚到钱,巨头砸$90亿送工程师上门 核心观点:模型不再是瓶颈,部署才是——微软、AWS、OpenAI、Anthropic 八周内砸下近百亿美元组建 FDE 军团,抢的是企业 AI 的「最后一公里」。 证据…

2026/8/11 0:44:22 阅读更多 →

最新新闻

从3.3V到姿态角:一个比特的嵌入式通信四层跃迁之旅

从3.3V到姿态角:一个比特的嵌入式通信四层跃迁之旅

第一层:物理层——铜导线上的“交通法规” 核心职责:定义通信的物理介质、电气特性和时序参数。它是所有上层协议能够运行的物质基础。 它回答的核心问题: 高电平是几伏?低电平是几伏? 时钟频率最高能跑多快&#x…

2026/8/11 1:28:41 阅读更多 →
【Bug已解决】FLUX kohya LoRA conversion crashes on `final_layer` (KeyError on missing adaLN_modulation_1;

【Bug已解决】FLUX kohya LoRA conversion crashes on `final_layer` (KeyError on missing adaLN_modulation_1;

【Bug已解决】FLUX kohya LoRA conversion crashes on final_layer (KeyError on missing adaLN_modulation_1; Incompatible keys on final_layer alphas) 解决方案 一、现象长什么样 把 Kohya 格式的 FLUX LoRA 转成 diffusers 格式时,只要 LoRA 覆盖了 FLUX 的 f…

2026/8/11 1:28:41 阅读更多 →
化工AI网:构建产业智能中枢,驱动化工行业数字化转型

化工AI网:构建产业智能中枢,驱动化工行业数字化转型

1. 项目概述:化工AI网是什么,以及它解决了什么痛点最近“化工AI网”这个项目标题在圈子里讨论得挺多,乍一看可能觉得又是一个蹭AI热点的概念平台。但作为一个在化工行业和信息化领域摸爬滚打了十几年的老兵,我看到的远不止一个简单…

2026/8/11 1:28:41 阅读更多 →
分布式系统日志管理架构设计与性能优化实战

分布式系统日志管理架构设计与性能优化实战

1. 日志管理在核心配置体系中的战略地位日志系统就像企业的神经系统,每时每刻都在记录着系统的运行状态。我在金融行业做架构师时,曾遇到过因日志管理缺失导致的重大生产事故——某次支付系统异常时,运维团队花了6小时才定位到根本原因&#…

2026/8/11 1:28:41 阅读更多 →
0xFF 的幽灵:为什么你的嵌入式开发里,全是这些十六进制“天书”

0xFF 的幽灵:为什么你的嵌入式开发里,全是这些十六进制“天书”

在用寄存器、SPI、I2C这些底层接口读取数据时,返回的结果确实几乎全是 0xFF、0x12 这类格式。这背后是二进制本质、十六进制速记、行业通用习惯三重原因共同作用的结果。 1. 根本原因:计算机只看二进制,但二进制对人太长了 芯片内部全是 0 和…

2026/8/11 1:28:41 阅读更多 →
【Bug已解决】Can‘t use `load_lora_weights()` on `Ideogram4ModularPipeline` 解决方案

【Bug已解决】Can‘t use `load_lora_weights()` on `Ideogram4ModularPipeline` 解决方案

【Bug已解决】Cant use load_lora_weights() on Ideogram4ModularPipeline 解决方案 一、现象长什么样 Ideogram4ModularPipeline 是 diffusers 的「模块化」pipeline(把 transformer、文本编码器、VAE 等拆成可独立替换的组件模块)。用户想给它加 LoR…

2026/8/11 1:27:40 阅读更多 →

日新闻

如何用Video2X实现专业级视频画质提升:AI视频增强完整指南

如何用Video2X实现专业级视频画质提升:AI视频增强完整指南

如何用Video2X实现专业级视频画质提升:AI视频增强完整指南 【免费下载链接】video2x A machine learning-based video super resolution and frame interpolation framework. Est. Hack the Valley II, 2018. 项目地址: https://gitcode.com/GitHub_Trending/vi/v…

2026/8/11 0:00:02 阅读更多 →
前后端分离项目中控制台与接口工具数据差异排查指南

前后端分离项目中控制台与接口工具数据差异排查指南

1. 问题现象解析:控制台与Apifox的数据差异 最近在调试一个前后端分离项目时,遇到了一个典型问题:后端服务在本地开发环境控制台能正常输出查询数据,但通过Apifox测试时却返回空结果。这种"控制台有数据,接口工具…

2026/8/11 0:00:03 阅读更多 →
AI编程实战:从Claude Code踩坑到游戏开发入门

AI编程实战:从Claude Code踩坑到游戏开发入门

1. 从“AI能帮我做游戏”到“AI让我重新学编程”最近身边不少朋友,尤其是一些非技术背景、但对游戏开发有浓厚兴趣的朋友,都在问我同一个问题:“听说现在用Claude Code这种AI编程工具,小白也能做游戏了,是真的吗&#…

2026/8/11 0:00:03 阅读更多 →

周新闻

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁 【免费下载链接】baidupankey 在线查询网盘提取码(维护中 rm repo) 项目地址: https://gitcode.com/gh_mirrors/ba/baidupankey 你是否曾经在深夜寻找一份重要资料&#x…

2026/8/11 1:08:05 阅读更多 →
如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南 【免费下载链接】chinese_license_plate_generator 中国车牌生成器 项目地址: https://gitcode.com/gh_mirrors/ch/chinese_license_plate_generator 中国车牌生成器是一个基于Python的开源项目&#xff0c…

2026/8/11 1:08:05 阅读更多 →
收藏!小白程序员轻松入门大模型,从Harness工程开始实践

收藏!小白程序员轻松入门大模型,从Harness工程开始实践

文章强调学习大模型不应只关注模型本身,而应重视模型外的系统搭建,即Harness。提出AgentModelHarness的实用公式,详细介绍Harness的四个层次:持久化层、执行层、控制层和观察与验证层。文章还探讨了上下文工程、工具设计、AGENTS.…

2026/8/11 1:08:05 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/10 17:07:33 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/11 1:08:06 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/10 17:07:33 阅读更多 →