大模型在写代码,DeepSeek 把“国产算力软件栈”从能跑到吃满
2026 年 10 月AI 圈最热闹的新闻不是“又发了一个新模型”而是模型层已经卷到头战争打到了算子、编译器和芯片驱动那一层。DeepSeek 把一整套原本跑在英伟达上的底层组件搬到了华为昇腾TileLang、DeepGEMM、DeepEP、FlashMLA、TileKernels……其中 TileLang 的思路很关键用接近 Python 的写法描述算子编译器再把同一份逻辑落到 NVIDIA / 昇腾 / AMD 后端。这件事的意义比“模型多 100 亿参数”大得多。一、CUDA 的真正护城河不是芯片是软件栈很多人以为英伟达强在卡。不对。英伟达最硬的资产是二十年积累的算子库开发者习惯调优经验框架层PyTorch / TensorFlow / vLLM / Triton默认先认 CUDA出了问题Stack Overflow 上有人答国产芯片过去不是算不动而是硬件出来了软件像毛坯房。工程师得手写 Ascend C换芯片再重来一遍。所以“国产算力”的瓶颈从来不是晶体管是生态摩擦力。二、TileLang 在解决什么把“写算子”变成“描述意图”传统深度学习算子开发// 伪代码手写 GPU kernel __global__ void matmul(float* A, float* B, float* C, int N) { int row blockIdx.y * blockDim.y threadIdx.y; int col blockIdx.x * blockDim.x threadIdx.x; float sum 0.0f; for (int k 0; k N; k) sum A[row*Nk] * B[k*Ncol]; C[row*Ncol] sum; }能跑但要管 shared memory要管 bank conflict要管 pipeline / prefetch换架构几乎重写TileLang 的思路是另一层抽象# 伪代码TileLang 风格 tile_kernel def gemm(A: Tile[M, K], B: Tile[K, N]) - Tile[M, N]: C zeros(M, N) for k in range(K.tiles): C A[:, k] B[k, :] return C然后TileLang 编译器 ├── NVIDIA 后端 → CUDA / PTX ├── 昇腾 后端 → Ascend C / CANN └── AMD 后端 → ROCm / HIP开发者不用再背“某家硬件的私房 API”。模型组写模型系统组写 tile编译器管落地。三、为什么 DeepSeek 做这件事有杀伤力因为 DeepSeek 不是“做个开源玩具”而是真拿 TileLang 训过 V4 系列真在昇腾 950 上做 128 卡超节点优化真把 MoE 通信、稀疏注意力、矩阵乘、数据选择全拆开重做一遍公开数据里有一些很“硬”的数字BF16 稠密矩阵乘达到标称硬件上限的 99.8%FP8 约 99.5%DeepSeek V4.1 的稀疏注意力在 prefill 阶段约 410 TFLOPS是理论值的 95%但别被微基准骗了单算子 99% ≠ 端到端训练 99%。通信、调度、显存碎片、重算策略、容错恢复才是千卡集群的命门。这也是为什么外部开发者还要在自己负载上复测——公告是厂家的生产是自己的。四、OpenAI 进 EDA大模型开始“画芯片”另一条线更安静但更长远OpenAI 和 Synopsys 搞 GPT-Synopsys让模型操作 EDA 工具、写 RTL、做布局布线、帮时序收敛。这意味着什么过去芯片工程师的护城河懂时序懂 PPAPower / Performance / Area懂工具链黑魔法懂“哪条约束别信”未来会变成人定架构和约束Agent 跑 EDA 流水线人做终审。EDA 脚本、约束文件、时序报告、布局规则本质都是半结构化文本 工具调用正好是 LLM 的舒适区。不是说芯片工程师消失而是“会带 Agent 的工程师”吃掉“不会带 Agent 的工程师”。五、2026 年 AI 工程的真实分层大模型新闻里大家看的是GPT-6 / Gemini 4 Argon / Claude Opus 5.5100 万 token 输出Agent 自动写项目但工程界真正在拼的是四层① 应用层Agent / RAG / 工作流 ② 框架层PyTorch / vLLM / ONNX / llama.cpp ③ 系统层调度、通信、显存、算子、编译器 ④ 硬件层GPU / NPU / 昇腾 / RISC-V / HBM / 电源 / 散热越往下越不性感越难抄。2026 年之后真正有壁垒的公司不是“接了 10 个模型 API”而是有自己的算子语言有自己的编译后端能在国产芯片上把利用率跑过 90%能把 Agent 的 token 成本压到竞争对手 1/3六、开发者该学什么别学什么该学编译器基础Triton / TileLang / MLIR / TVM算子性能模型FLOPS、带宽、occupancy、memory bound分布式训练MoE、TP/PP/EP、通信原语端侧推理量化、KV cache、RISC-V Vector、NPU 调度EDA 基础RTL、时序约束、PPA别只学天天换 Prompt 模板把 Agent 串 20 个工具当架构以为“调通 demo”等于“能上线”把模型发布稿当技术结论七、一句话总结2026 年最被低估的趋势不是“模型更强”而是AI 正在从应用软件长进编译器、EDA、驱动、芯片和电厂里。以后不会再有“纯 AI 公司”和“纯硬件公司”。只剩一种公司能把模型、算子、芯片、电和钱拧成一条流水线的公司。八、延伸阅读螺旋生成论系列开放获取著作如果从更底层的代数结构——比如公理$$I^2 -N $$$出发去重新看数系、生成结构、素数分布、信息结构与智能系统的底层规律可以参考张智明所著《螺旋生成论》Spiral Generation Theory系列开放获取著作。该系列已发布 70 余部专著与预印本托管于 CERN 旗下 Zenodo采用开放获取协议。螺旋生成论全集索引https://doi.org/10.5281/zenodo.21211001著作体系总汇编https://doi.org/10.5281/zenodo.21199593作者 ORCIDhttps://orcid.org/0009-0003-7777-7694数学与数论《螺旋数原理公理系统与各向异性复数理论》 https://doi.org/10.5281/zenodo.20602099《螺旋生成元一个跨学科统一数学框架的探索》 https://doi.org/10.5281/zenodo.21555082《从几何构造到黎曼猜想》 https://doi.org/10.5281/zenodo.20995372AI 与系统《生成式 AI 与提示词工程》 https://doi.org/10.5281/zenodo.20839550《螺旋元逻辑从 i²-1 到万物理论的统一框架假说》 https://doi.org/10.5281/zenodo.21806751总纲与科普《旋生万物从奇点到宇宙的统一生成论》 https://doi.org/10.5281/zenodo.20408189《螺线宗谱发现宇宙的源代码》 https://doi.org/10.5281/zenodo.20659854上述著作为统一数学框架假说适合作为交叉视角阅读材料系统架构与芯片工程仍以可复现基准、端到端吞吐和硬件实测为准。开放获取汇总​全集索引 https://doi.org/10.5281/zenodo.21211001 总汇编 https://doi.org/10.5281/zenodo.21199593 ORCID https://orcid.org/0009-0003-7777-7694

相关新闻

M 系列 Mac 跑靶场:架构不兼容时先确认三件事

M 系列 Mac 跑靶场:架构不兼容时先确认三件事

授权与合规声明 本文全部操作对象均为自建隔离靶场(本机容器或隔离虚拟机),涉及安全测试的环节必须以取得合法授权为前提。未经授权的渗透测试违反《中华人民共和国网络安全法》与《刑法》相关条款,须承担相应法律责任。本文只讲环…

2026/10/3 19:16:00 阅读更多 →
建筑造价转大模型:定额分地区版本,价格不能跨区外推

建筑造价转大模型:定额分地区版本,价格不能跨区外推

版权与内容来源声明 本文为原创整理。文中涉及官方文档、开源仓库、论文与公开报道的内容,均在附表 A 中标注来源;引用官方原文保持原样,不作改写。文中命令、版本号与界面截图以本文成文时的实测/核验结果为准,标注「待验证」的部…

2026/10/3 19:16:00 阅读更多 →
大模型擅长0到1,后续改进效率低

大模型擅长0到1,后续改进效率低

用大模型写代码,完善图像和渲染的时候发现 细节太多的时候,LLM就顾不过来了,表现得类似“降智”了; 尤其是有些是视觉上在人看来非常简单和显而易见的修改或更新,但LLM死活就是抓不住重点,反复绕圈子。

2026/10/3 19:16:00 阅读更多 →

最新新闻

【实战】STM32 ADC采集数据乱跳?从参考源选型到软件滤波的工程调优笔记(附HAL库完整代码)

【实战】STM32 ADC采集数据乱跳?从参考源选型到软件滤波的工程调优笔记(附HAL库完整代码)

先说结论:ADC数据乱跳,八成问题出在硬件。参考源温漂大、模拟地没布好、电源纹波超标,这些靠软件根本救不回来。我们在一个智慧供暖项目上,STM32内置12位ADC采集温度,原始数据跳了2%~3%,换外部REF3030参考源…

2026/10/3 19:56:39 阅读更多 →
组蛋白乳酸化与免疫:代谢信号如何通过表观修饰重塑免疫细胞功能?

组蛋白乳酸化与免疫:代谢信号如何通过表观修饰重塑免疫细胞功能?

组蛋白乳酸化作为连接细胞代谢状态与基因转录的新型表观遗传修饰,由肿瘤或炎症微环境中积累的乳酸驱动。最新研究发现,组蛋白乳酸化通过调控巨噬细胞表型转换、促进免疫抑制分子表达及影响自噬过程,在肿瘤免疫逃逸和炎症消退中发挥双向调节作…

2026/10/3 19:56:39 阅读更多 →
口碑过硬的GEO同城优化供应商,一起来看看

口碑过硬的GEO同城优化供应商,一起来看看

我们是口碑过硬的 GEO 同城优化供应商,深耕生成式引擎同城获客领域,长期服务海南各类实体企业,凭借稳定的优化效果与贴心的落地服务,收获众多合作客户的认可。在服务过程中,我们发现很多实体商家尝试线上引流&#xff…

2026/10/3 19:56:39 阅读更多 →
PCB改动实时呈现在KiCad界面上:KiCAD MCP Server的IPC实时同步后端深度解析

PCB改动实时呈现在KiCad界面上:KiCAD MCP Server的IPC实时同步后端深度解析

PCB改动实时呈现在KiCad界面上:KiCAD MCP Server的IPC实时同步后端深度解析 【免费下载链接】KiCAD-MCP-Server KiCAD MCP is a Model Context Protocol (MCP) implementation that enables Large Language Models (LLMs) like Claude to directly interact with Ki…

2026/10/3 19:56:39 阅读更多 →
OpenRig rig context 上下文库完整教程:把团队知识与系统世界变成可寻址地址

OpenRig rig context 上下文库完整教程:把团队知识与系统世界变成可寻址地址

OpenRig rig context 上下文库完整教程:把团队知识与系统世界变成可寻址地址 【免费下载链接】openrig Build your own network of agents from Claude Code, Codex and Pi: persistent teams with roles, shared context and owned work. 项目地址: https://gitc…

2026/10/3 19:56:39 阅读更多 →
大模型API聚合分发平台怎么运作:四层架构拆解与七步部署实战

大模型API聚合分发平台怎么运作:四层架构拆解与七步部署实战

2026年AI大模型行业爆发式增长,智能体、数字员工、内容生成赛道全面起量,多模型混用成了刚需。但国内开发与创业的痛点同样突出:海外模型无法直连,网络不稳、延迟高、频繁限流,注册与国际支付门槛高;多平台…

2026/10/3 19:55:38 阅读更多 →

日新闻

把回忆蒸馏成 AI 的浪漫实验:为什么你需要前任.skill 完整指南

把回忆蒸馏成 AI 的浪漫实验:为什么你需要前任.skill 完整指南

把回忆蒸馏成 AI 的浪漫实验:为什么你需要前任.skill 完整指南 【免费下载链接】ex-skill 前任 skill 项目地址: https://gitcode.com/gh_mirrors/exsk/ex-skill 前任.skill 是一个运行在 Claude Code 上的开源 Skill:导入微信、iMessage、短信、…

2026/10/3 0:00:27 阅读更多 →
45个经典Linux面试题:从命令到网络排障的完整考点解析

45个经典Linux面试题:从命令到网络排障的完整考点解析

刚开始带应届生的时候,我最头疼的就是他们拿着一摞Linux面试题背得滚瓜烂熟,一上机全露馅。后来自己从被面的人变成面别人的人,才慢慢摸清楚:Linux面试题考的根本不是答案本身,而是你面对一个不确定的系统问题时&#…

2026/10/3 0:01:28 阅读更多 →
SAP生产预留实战指南:MB21/MB23/MB25协同与MRP集成

SAP生产预留实战指南:MB21/MB23/MB25协同与MRP集成

简介:本资源是一份面向SAP ABAP开发人员、生产计划专员及ERP实施顾问的实操型操作指南,聚焦SAP生产预留核心业务场景,系统解决物料预留创建、查询、校验与批量处理等高频问题。文档以结构化方式覆盖预留背景原理、OMC2编码规则、工厂级参数配…

2026/10/3 0:01:28 阅读更多 →

周新闻

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解 【免费下载链接】spirula-studio Cross-vendor 3D Gaussian Splatting trainer - video to splat to mesh, Vulkan or CUDA. 项目地址: https://gitcode.com/GitHub_Trending/sp/spirula-studio Sp…

2026/10/3 9:14:33 阅读更多 →
SEO怎么推广速查手册新手避坑实战指南

SEO怎么推广速查手册新手避坑实战指南

SEO怎么推广速查手册新手避坑实战指南 模板网站太丑不够用?别急着加滤镜,那是治标不治本。很多老板盯着后台流量掉得眼红,却还在纠结首页Banner的圆角是不是3像素。这就像穿着西装去挖土,姿势不对,努力白费。我整理这份 速查手册…

2026/10/3 9:47:50 阅读更多 →
FireRed-OpenStoryline少样本仿写深度解析:AI Agent如何复刻你的独特文案风格与节奏

FireRed-OpenStoryline少样本仿写深度解析:AI Agent如何复刻你的独特文案风格与节奏

FireRed-OpenStoryline少样本仿写深度解析:AI Agent如何复刻你的独特文案风格与节奏 【免费下载链接】FireRed-OpenStoryline FireRed-OpenStoryline is an AI video editing agent that transforms manual editing into intention-driven directing through natural language …

2026/10/3 9:42:31 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/2 10:36:31 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/3 9:42:35 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/3 9:42:36 阅读更多 →