智源研究院提出 Triton-TLE 分层语言扩展,并通过 FlagTree 编译优化实现百倍级自动调优加速
8 月 1 日Meet AI Compiler 技术沙龙第 9 期在北京举办。本期活动聚焦 AI 编译技术的最新进展多位来自产业界和科研机构的专家围绕编程语言、算子开发、编译优化与推理执行展开分享呈现 AI 编译器从上层语言表达到硬件执行的协同演进。其中BAAI AI 编译器研究员郭晖与肖航以「FlagTreeTriton-TLE 语言扩展、Tile IR 后端与编译优化实践」为题介绍了 FlagTree 团队围绕 Triton 开展的一系列探索。BAAI - AI 编译器研究员 - 郭晖老师BAAI - AI 编译器研究员 - 肖航老师面对日益复杂的硬件架构和更加不规则的模型算子团队提出 Triton Language ExtensionTLE尝试在高级 DSL 与底层硬件控制之间建立一条渐进式通道同时在 FlagTree 编译器上围绕 TileIR 后端、自动调优、数据布局、指令调度等方面开展编译优化。这套工作的核心目标是在保留 Triton 易用性和社区生态的同时让开发者可以根据实际需要逐步深入硬件细节以相对统一的开发体系覆盖快速算子优化、架构感知调优和原生代码级优化。两位老师与到场观众深度交流HyperAI 在不违原意的前提下对分享内容进行了整理汇总。关注微信公众号「HyperAI超神经」后台回复关键字「0801 AI 编译器」即可获取确认授权的讲师演讲 PPT。在 Triton 之上重新平衡抽象与性能近年来AI 编译器面临一个越来越突出的矛盾硬件架构和模型算子不断复杂化但开发者仍希望使用较高层的 DSL获得接近专家手写 Kernel 的性能。抽象过高编译器未必能获得足够的信息完成深度优化抽象过低开发者又会重新回到 CUDA 或厂商私有语言的复杂开发模式中。Triton 的成功在于将 GPU 算子开发从 Thread 级提升至 Tile 级。用户使用 Python DSL 描述数据块之间的计算关系线程映射、寄存器分配、数据布局、流水线和同步等工作主要交给编译器处理。这种方式降低了高性能算子的开发门槛也形成了庞大的社区生态。但随着新一代 GPU、领域专用架构和国产 AI 芯片不断发展Triton 原有抽象也开始遇到边界。一方面如果编译器后端尚未支持新硬件的存储结构、通信机制或计算单元前端开发者很难自行利用这些能力另一方面越来越多的关键算子需要精确控制存储层级、并行粒度、CTA 间协作以及通信与计算的重叠原有 Triton 代码有时难以完整表达这些意图。Gluon、TLX、TileLang 等新语言和 DSL 的出现也反映了同一趋势AI 算子开发已经不只是编写单个 Kernel还需要表达数据布局、并行层次、流水线、通信拓扑和硬件特性。TLE 并不试图替代 Triton而是在其语法和生态之上进行分层扩展。它由 TLE-Lite、TLE-Struct 和 TLE-Raw 三个层次组成分别对应轻量级语义提示、架构感知控制和原生代码级优化。TLE-Lite 面向算法工程师和快速调优场景。开发者不必直接关心底层硬件而是向编译器补充更明确的结构信息例如某个 Tensor 需要按照子 Tile 访问某项计算运行在分布式 Mesh 上或者一个 CTA 内部采用 Producer-Consumer Pipeline。以子 Tile 操作为例开发者可以从较大的 Tensor 中直接取出一个逻辑子块完成激活、归一化或统计计算后再写回而不必手动计算偏移、构造 Mask 和处理边界。由于编译器能够识别这是一次规则的 Tile 访问便可以围绕数据布局、向量化、Bank Conflict 和寄存器复用进一步优化。这种方式尤其适合稀疏 Attention、局部归一化、分块统计和路由类算子。在分布式场景中TLE 使用 Device Mesh 描述节点、GPU、Block Cluster 和 Block 等不同层级将其组织为统一的多维拓扑。开发者面向 Mesh 维度编写程序编译器和 Runtime 再将逻辑拓扑映射到真实硬件和通信机制。由此Ring 通信、Barrier 同步和分片访问不再只是代码中散落的 Rank 和通信组而成为可分析的结构化语义。一旦通信关系被显式表达编译器便有机会开展拓扑感知调度、通信计算重叠、Barrier 合并和死锁检查。TLE-Lite 还通过 Pipeline 原语将 CTA 内部协作抽象为 Producer-Consumer 模型。开发者主要描述数据由谁生产、由谁消费底层 Barrier、缓冲区复用和同步机制则交给编译器处理。这并不是屏蔽底层能力而是将其转化为可分析、可验证和可优化的程序结构。从轻量语义到原生透传覆盖不同优化深度如果说 TLE-Lite 主要解决跨平台语义表达那么 TLE-Struct 更关注架构感知和精细调优。不同 GPU、DSA 和 AI 加速器在存储层次、执行单元、同步机制和片上网络上存在明显差异。TLE-Struct 因此向开发者暴露层次化的并行和存储结构允许其显式定义数据布局、计算映射和内存层级但不必直接绑定某一家厂商的私有接口。例如同一块本地 Buffer 在 GPU 后端可以映射至 Shared Memory在 DSA 后端则可以映射至 Scratchpad 或片上 SRAM。用户表达的是结构化的内存意图编译器负责将其转换为适合目标硬件的地址空间和访存指令。MoE 中的 Expert Counting 是一个典型场景。该算子本质上是统计 Token 被路由至不同 Expert 的数量容易受到共享内存布局、并发更新、Bank Conflict 和跨 Block 汇总等因素影响。借助 TLE-Struct开发者可以显式组织计数器布局将不同 Expert 或 Token 映射至本地存储的不同区域编译器获得这些结构信息后再生成合适的访问和同步方式。TLE-Raw 则面向性能优化专家为厂商原生代码保留接口。部分性能路径必须直接使用 CUDA、汇编或专用 Intrinsic。如果强行将其重新封装进高层 DSL反而可能限制性能或增加迁移成本。TLE-Raw 允许开发者在 Triton/TLE 体系中内联原生代码或直接接入厂商编译管线。以 All-Gather GEMM 为例该算子同时涉及通信、矩阵计算、Buffer 和同步管理。开发者可以复用底层通信能力同时继续使用结构化的 Tensor 和 Tile 表达计算最后由统一编译管线将不同部分组织为可调用算子。这种分层设计使算法工程师、算子开发者和性能专家能够在同一套体系内选择不同的优化深度而不必一开始就进入最底层编程。性能测试也表明TLE 的抽象开销整体可控。在 Radix Select 测试中TLE 复刻了 TensorRT-LLM 的算法在多组 Shape 下达到其约 85%—97% 的性能。对于需要跨平台维护和快速迭代的团队而言以更统一的代码获得接近专家实现的性能具备较高工程价值。在 128K 上下文的 SparseMLA 场景中TLE 通过 Pipeline 原语表达不同执行角色之间的协作性能达到 FlashMLA 基线的约 90%。团队还在单节点 8 张 NVIDIA H100 上测试了 All-Gather并进一步探索 GEMM 与 All-Gather 融合。其重点不是简单替代通信库而是将通信纳入算子级表达和编译优化范围使数据传输、局部计算、同步和后续消费可以共同形成流水。对于推理系统而言这类通信计算融合往往比孤立提升某个 GEMM 的峰值性能更有意义因为用户最终感知的是端到端等待时间。Flagtree 编译优化实践除 TLE 语言扩展外FlagTree 团队还开展了两方面工作一是接入 CUDA Tile IR 后端二是面向真实模型工作负载实施多项 Triton 编译优化。CUDA Tile IR 的核心理念是让程序表达 Tile而不是提前固化底层线程映射。其输入由 Tile Program 和三维 Tile Grid 组成Dialect 内部则通过 Tile Compute、View 和 Token-Ordered OperationTKO共同表达计算、数据视图和必要依赖。其中TensorView 描述全局指针、Shape 和 StridePartitionView 在此基础上增加分块映射能力Token 用于约束相关 TKO 之间的依赖关系Memory Model 则单独规定内存语义与作用域。FlagTree 并未整体替换 Triton NVIDIA 原生后端而是在原有体系中增加 TileIR 路径并通过 TLE 原语覆盖 TileIR的 View 和 Token 接口。满足条件的 Kernel 可以进入 TileIR 后端暂不支持的 Kernel则回退至 Native CUDA两条路径可以在编译器中共存。自动调优方面团队提出 FlagOSTune以解决 Triton Autotune 在真实模型中的覆盖与成本矛盾。实际模型推理中同一种算子可能对应大量不同 Shape。团队统计发现六个模型、四类推理场景中包含 1994 个唯一 MM Shape远高于日常 Benchmark 的覆盖范围。如果直接扩展候选配置理论搜索规模又会迅速增长至数百万组。FlagOSTune 通过扩展搜索空间提高性能通过「模型预测少量实测」的方式压缩搜索成本。系统先使用 XGBoost 对候选配置排序只将最有潜力的少量配置送入真实编译和 GPU 测试再结合遗传算法继续搜索。在 NVIDIA, 摩尔线程和沐曦多款算力上提升了多个算子的性能加速 1.217.35x在 NVIDIA H20 MM 算子的多个 shape 实验中搜索空间配置从 62 万余个压缩至 4070 个调优效率加速 120 倍性能几乎无损。在数据布局方面团队重点优化了数据布局转换的性能开销。Triton 中的 convert_layout 通常涉及跨线程数据重排需要写入 Shared Memory、同步后再读回并不是零成本操作。对于小算子或访存密集型算子少量布局转换就可能成为性能瓶颈。FlagTree 对 Remove Layout Conversions 机制进行增强通过代价模型、反向传播和局部联合求解等技术减少不必要的数据布局转换。在 100 多个算子的测试中净转换消除率约为 68%—79%性能提升最高 71%。另一项优化是指令重排。循环展开只是复制循环体并不会自动把多次 Load 提前发射。开启编译器重排后相互独立的 Load 可以提前执行再穿插后续计算从而利用硬件流水线隐藏访存延迟。在三类典型算子中这项优化平均带来约 1.19—1.61 倍加速峰值提升达到 2 倍。团队还针对 DeepSeek-V4-Flash 的真实 Shape 优化 Fused Marlin MoE 算子的性能通过 Fragment 合并减少数据加载时间。结合算法层面的优化与 vLLM CUDA 相比FlagGems 在测试的 53 个 Shape 上均取得加速按shape出现频次加权计算平均提升约 1.208 倍。在 NVIDIA H20 的 DeepSeek-V4-Flash 端到端测试中TP4 时首 Token 时延降低 20.22%总吞吐提升 12.63%TP8 时首 Token 时延降低 12.87%总吞吐提升 7.65%。未来工作展望下一阶段FlagTree 将重点推进 NUMA 编程模型和 MegaKernel Compiler。面向多节点、多 GPU以及 GPU 内部的 Cluster 和本地 SRAM数据访问会呈现明显的远近差异。TLE 希望显式描述 Tensor 如何沿 Mesh 切分以及如何在不同分布方式之间转换使编译器能够判断计算应靠近哪些数据哪些通信可以被合并或与计算重叠。MegaKernel Compiler 则尝试将优化范围从单个 Kernel 扩展至一段模型执行过程。编译器将识别可以协同优化的计算拆解为具体任务再统一决定任务如何分配、并行和流水最终生成一个或少数几个 MegaKernel。TLE 在其中承担前端语义与硬件结构之间的桥梁。Tile、Mesh、Pipeline、Memory Layout 和原生能力接口使编译器看到的不再只是一串独立算子而是一张可以调度、放置、同步和融合的任务图。从 TLE-Lite 的轻量语义提示到 TLE-Struct 的架构感知控制再到 TLE-Raw 的原生能力透传结合各种编译优化技术FlagTree 正尝试在 Triton 易用性、跨平台迁移和极致性能之间建立一套更具弹性的分层体系并让新硬件能力更快转化为模型和算子的实际性能。

相关新闻

Claude Fable 5生物安全防护系统更新:误报率大幅降低,提升AI模型安全与效率

Claude Fable 5生物安全防护系统更新:误报率大幅降低,提升AI模型安全与效率

这次我们来看 Anthropic 最新更新的 Claude Fable 5 生物安全防护系统。对于开发者、研究者和企业用户来说,AI 模型的安全性和可靠性是决定其能否投入实际应用的关键。Fable 5 的更新重点不在于引入新功能,而在于大幅优化了其核心安全分类器的性能&#…

2026/8/9 5:05:18 阅读更多 →
三大降AI工具对比:嘎嘎降AI、率零与去AIGC实战评测

三大降AI工具对比:嘎嘎降AI、率零与去AIGC实战评测

1. 项目概述最近在内容创作圈子里,"降AI"突然成了高频词。作为一名常年混迹于文案、设计、编程等多个领域的内容生产者,我深刻感受到AI生成内容泛滥带来的困扰。平台审核越来越严格,用户对"AI味"内容的抵触情绪也越来越明…

2026/8/9 5:05:17 阅读更多 →
2026年信息系统项目管理师考试备考全攻略

2026年信息系统项目管理师考试备考全攻略

1. 2026年信息系统项目管理师考试全景解析作为国内IT领域最具含金量的高级职称认证之一,信息系统项目管理师(俗称"高项")考试每年吸引数万从业者参与。结合近年考纲演变趋势和行业技术发展动向,2026年考试预计将在以下维…

2026/8/9 5:05:17 阅读更多 →

最新新闻

C语言项目实战:控制台扫雷游戏开发与核心算法解析

C语言项目实战:控制台扫雷游戏开发与核心算法解析

很多同学在初学C语言时,常常感觉语法枯燥,学完指针、数组后不知道能做什么。其实,通过一个完整的项目实战,是巩固知识、提升编程思维的最佳途径。扫雷游戏就是一个经典的选择,它几乎涵盖了C语言初级阶段的所有核心知识…

2026/8/9 6:04:44 阅读更多 →
AI编程工具可观测性实战:用AgentsView构建本地会话分析与成本监控仪表盘

AI编程工具可观测性实战:用AgentsView构建本地会话分析与成本监控仪表盘

1. 项目概述:为什么我们需要一个AI编程工具的“仪表盘”?最近几个月,我几乎把所有主流的AI编程工具都试了个遍。从Cursor、GitHub Copilot到Windsurf、Bolt.new,再到各种集成了大模型能力的IDE插件。工具多了,问题也跟…

2026/8/9 6:04:44 阅读更多 →
游戏赛季化与阵营系统后端架构实战:数据驱动玩法焕新

游戏赛季化与阵营系统后端架构实战:数据驱动玩法焕新

最近在整理明日方舟的赛季化更新内容时,发现“卫戍协议”这个玩法模式即将迎来重大调整,很多玩家都在讨论“乌萨斯阵营”加入的可能性。这背后其实涉及到游戏运营中一个非常经典的技术与设计话题:如何通过数据驱动的方式,对已有的…

2026/8/9 6:04:44 阅读更多 →
基于RAG与Agent技术构建垂直领域专业内容生成系统

基于RAG与Agent技术构建垂直领域专业内容生成系统

1. 这篇文章真正要解决的问题“影视门外汉尬黑超人”,这个标题乍一看像是个娱乐话题,但它精准地戳中了一个在技术圈、尤其是AI内容生成领域日益凸显的痛点:如何让一个通用大模型(“超人”)去理解和执行一个高度垂直、专…

2026/8/9 6:04:44 阅读更多 →
JVM类加载机制解析与性能优化实践

JVM类加载机制解析与性能优化实践

1. JVM类加载机制深度解析作为Java开发者最常接触却又最容易忽视的核心机制,类加载过程直接影响着应用的启动性能、内存占用和运行时稳定性。最近在排查一个"找不到或无法加载主类"的生产问题时,我重新梳理了JVM类加载的完整流程,发…

2026/8/9 6:04:44 阅读更多 →
赫兹威客框架部署指南:从环境准备到性能调优

赫兹威客框架部署指南:从环境准备到性能调优

1. 赫兹威客框架模板概述赫兹威客(HertzWitkey)是一款基于现代Web技术栈的企业级前后端分离框架模板,特别适合快速构建中后台管理系统。这个框架整合了Spring Boot、Vue.js等主流技术,提供了从用户权限管理到数据可视化的完整解决…

2026/8/9 6:03:44 阅读更多 →

日新闻

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁 【免费下载链接】baidupankey 在线查询网盘提取码(维护中 rm repo) 项目地址: https://gitcode.com/gh_mirrors/ba/baidupankey 你是否曾经在深夜寻找一份重要资料&#x…

2026/8/9 0:01:47 阅读更多 →
如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南 【免费下载链接】chinese_license_plate_generator 中国车牌生成器 项目地址: https://gitcode.com/gh_mirrors/ch/chinese_license_plate_generator 中国车牌生成器是一个基于Python的开源项目&#xff0c…

2026/8/9 0:01:47 阅读更多 →
收藏!小白程序员轻松入门大模型,从Harness工程开始实践

收藏!小白程序员轻松入门大模型,从Harness工程开始实践

文章强调学习大模型不应只关注模型本身,而应重视模型外的系统搭建,即Harness。提出AgentModelHarness的实用公式,详细介绍Harness的四个层次:持久化层、执行层、控制层和观察与验证层。文章还探讨了上下文工程、工具设计、AGENTS.…

2026/8/9 0:03:48 阅读更多 →

周新闻

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁 【免费下载链接】baidupankey 在线查询网盘提取码(维护中 rm repo) 项目地址: https://gitcode.com/gh_mirrors/ba/baidupankey 你是否曾经在深夜寻找一份重要资料&#x…

2026/8/9 0:01:47 阅读更多 →
如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南 【免费下载链接】chinese_license_plate_generator 中国车牌生成器 项目地址: https://gitcode.com/gh_mirrors/ch/chinese_license_plate_generator 中国车牌生成器是一个基于Python的开源项目&#xff0c…

2026/8/9 0:01:47 阅读更多 →
收藏!小白程序员轻松入门大模型,从Harness工程开始实践

收藏!小白程序员轻松入门大模型,从Harness工程开始实践

文章强调学习大模型不应只关注模型本身,而应重视模型外的系统搭建,即Harness。提出AgentModelHarness的实用公式,详细介绍Harness的四个层次:持久化层、执行层、控制层和观察与验证层。文章还探讨了上下文工程、工具设计、AGENTS.…

2026/8/9 0:03:48 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/8 17:02:44 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/9 0:45:04 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/8 17:02:44 阅读更多 →