超厉害!用 Codex 自动研究,GPU Mode qr_v2 内核加速 232 倍
简介近期GPU Mode 与 Core Automation 合作举办自动研究竞赛问题为实现批量方阵紧凑豪斯霍尔德 QR 分解。183 名参赛者中作者获第 12 名实现比基线快 232 倍加速。文章将分享方法、知识及瓶颈。读博客无需了解相关数学知识作者会重点介绍方法。可点击[问题链接和排行榜](https://www.gpumode.com/leaderboard/774?tabrankings)查看完整竞赛页面此次竞赛是 GPU Mode [研究时代的线性代数内核](https://www.gpumode.com/news/linear-algebra-kernels-age-of-research)系列活动一部分。问题介绍拿到一批形状为 batch x n x n 的方阵 FP32 CUDA 矩阵 A要返回与 torch.geqrf(A) 相同的紧凑豪斯霍尔德 QR 表示包括上三角为 R、下三角存储豪斯霍尔德向量的 H 矩阵以及存储反射系数的 tau 向量。检查器会用 torch.linalg.householder_product(H, tau) 重建 Q提取 R triu(H)并验证等式A≈QR,Q⊤Q≈I,Q⊤A≈R。排行榜按不同形状和条件下几何平均运行时间排名重要矩阵大小有批量方阵如 512 x 512 等。内部允许用低比特的 FP16、FP8 或 NVFP4但返回因子要满足 FP32 风格 QR 检查。给出 3 x 3 小例子Q 为正交矩阵R 为上三角矩阵。竞赛要求输出紧凑豪斯霍尔德形式方便检查器重建 Q 并读取 R。对于 3×3 例子第一个反射器能将第一列 (12, 6, -4) 映射到 (-14, 0, 0)-14 成 R11原理在数学部分介绍。为何该问题适合自动研究GPU Mode 为参赛者提供 popcorn CLI 与智能体交互智能体可用其测试、基准测试并提交到排行榜检查器提供形状反馈和几何平均时间。这为编写循环提供理想环境智能体渴望紧密反馈循环以优化。GPU Mode 竞赛提供迭代内核方式可直接提交或由赞助商提供积分支持。此次竞赛组织者基本允许无限次提交合理安排间隔即可。曾出现工作区耗尽 Modal 积分情况因大家频繁提交。14 天里作者提交超 1500 次。积累足够知识以提出更好的问题作者了解 GPU 内核优化基础知识一年但未在该领域专业工作在排行榜参赛者中处于劣势前一位参赛者是 NVIDIA 首席工程师。不过作者掌握基础知识且读了关于 GatedDeltaNet 的文章对 GPU 内核通用术语较熟悉。对领域了解越深越能向大语言模型提好问题将未知变已知。无相关领域知识也可参与竞赛虽难进前 10 名但靠测试框架/智能体循环可显著加速。竞赛开始作者学习 QR 分解概念和方法有格拉姆 - 施密特方法和豪斯霍尔德反射法竞赛要求用豪斯霍尔德反射法。作者与 Claude 交流、看 YouTube 视频建立理解明确用分块豪斯霍尔德算法结合尾随 WY 更新GPT - 5.5 也有相关见解。矩阵分解在大语言模型训练优化器变体中常见如 Shampoo 风格优化器及 Muon 方法。可选QR 分解的数学原理豪斯霍尔德反射豪斯霍尔德 QR 分解有顺序依赖进行通用矩阵乘法困难用分块豪斯霍尔德方法更适合矩阵乘法。回顾问题约定输入是一批形状为 batch x n x n 的方阵 FP32 矩阵 A输出是 torch.geqrf 返回的紧凑 (H, tau) 格式H 上三角为 R对角线以下存豪斯霍尔德向量tau 每列存一个标量检查器从 (H, tau) 重建 Q 并验证 A ≈ QR。以浴室镜子为例说明反射原理豪斯霍尔德反射是找到垂直分量并减去两次。豪斯霍尔德向量是反射面紧凑存储垂直分量是 x 在 v 上投影代入公式可得相关计算。tau 是 2 / v⊤vv 确定反射面tau 缩放更新量。二维豪斯霍尔德反射有相关规则和特点在高维空间可使对角线以下元素变零。QR 分解目标是将矩阵 A 转上三角矩阵 R豪斯霍尔德反射面可一次性转换列以 3×3 例子说明找到反射面和目标向量的方法。计算 tau 后可得反射器公式对每列重复操作可将 A 变为上三角矩阵 R反射操作使 Q 为正交矩阵这是检查器验证正交性来源。处理完列后geqrf 复用对角线以下空间存 v_j 尾部R 在对角线上及以上tau 单独存储检查器用 H 和 tau 重建 Q。借助分块豪斯霍尔德算法减少串行工作量豪斯霍尔德 QR 分解逐列将矩阵 A 对角线以下元素置零反射器构建有数据依赖是串行过程矩阵 - 向量运算在慢速向量通道运行张量核心闲置。分块算法是经典解决方案选宽度为 b 的窄面板完成串行工作因面板列少计算成本低。将面板 b 个反射器压缩为秩为 b 的更新WY 表示通过三次矩阵乘法应用到尾随块串行工作限制在面板内其余转化为 GEMM 运算。具体给出 WY 表示和尾随块更新步骤。逐列串行工作在窄面板内进行成本低b 个反射器压缩后一次性应用到尾随块面板移动重复过程。面板是瓶颈但列少右侧尾随块是 GEMM 运算随面板移动缩小。想深入理解数学原理可与 Claude 探讨或查看[Mike 的文章](https://ml-mike.com/writing/qr_v2/)他获第 5 名并分享学习经验。其他挑战一是内部可靠使用低精度尤其是病态输入二是应对不同形状n 32, 176, 352, 512, 1024, 2048, 4096和批量大小变化。大矩阵批量少难利用张量核心n 32 小矩阵需打包到一次内核启动。充分利用 Codex作者用 ChatGPT Pro 和 Claude Pro 参赛用 Modal 进行性能分析Modal 每月免费提供 30 美元积分。选 Codex 原因订阅更高版本直觉认为 OpenAI 模型在 Triton 方面表现好/compaction 在 Codex 中效果好。对问题有基本了解后让 Codex 做基本设置添加相关文件并维护日志。日志可记录想法有效性达 3000 微秒性能瓶颈后更重视日志。Codex 优点是按明确指令执行给出详细提示和目标可工作数小时。最初手动提示 Codex 在 Triton 中实现针对 n 512 和 n 1024 形状的优化。可用 /goal 引导模型循环到目标设定合理数值目标和具体标准效果好。作者每 2 - 3 小时提供输入引导模型有时让其夜间无人监督运行最初督促模型多使用 Triton 等。使用 /goal 时可用 /btw 或 /side 不中断循环提问作者会咨询 Claude 并反馈想法。基线 torch.geqrf 路径运行时间约 419 毫秒为 n 512 形状实现分块豪斯霍尔德算法后一天内将运行时间缩到 5000 微秒。232 倍加速是基线时间与最终 1,805 微秒结果对比得出谱系图显示从 108,803 微秒到 1,805 微秒提升。达 3000 微秒瓶颈后优化困难作者让 Codex 进行性能分析。展示 QR v2 * B200 全表几何平均数据及内核进展突破情况。列出 QR 内核结构演变表格包括结构变化、作用、类型和几何平均时间。在性能分析找瓶颈需反复尝试启动开销和面板开销是主要瓶颈精力花在减少面板开销和使 WY 更新适合 GEMM 运算上。作者反复问自己一系列问题如开销解决方法、信息获取、性能分析看法等还提到归约融合等优化尝试。引入思路多样性以跳出局部最优性能从 3000 微秒提升到 1800 微秒时模型易陷入局部最优表现为手动调参尝试小变体。几年前智能体常因不够智能等陷入循环当时用不同采样方法等解决。现在模型挑战是产生新想法和有“研究品味”作者写了相关文章。作者采用多种策略帮助模型跳出局部最优如保留 3 - 5 个候选方案、人工干预、鼓励冒险、用强大顾问模型、指示使用子智能体、用 NCU 和 Modal 分析、清理工作等还考虑过多智能体群策略但未尝试。认为强大顾问策略将成自动研究标准策略Claude Code 提供 /advisor 命令。实现提示展示最终目录结构和 AGENTS.md 最终内容包括提交规范和束搜索规范等相关指令。

相关新闻

SAP学习笔记 - ABAP开发01 - BDC概述,LSMW 实例 - MM02批量修改物料说明

SAP学习笔记 - ABAP开发01 - BDC概述,LSMW 实例 - MM02批量修改物料说明

下面这篇文章也讲了LSMW SAP学习笔记 - FICO03 - FB00,FB01(F-02),FB02,FB03,FS00,OBR1,OBR2,复制总账会计科目-FS15/CG3Y/CG3Z/FS16,OBY2,LSMW-CSDN博客 咱们本章用MM0…

2026/8/17 3:00:03 阅读更多 →
深入解析Python字节码缓存:从pyc文件机制到开发部署实战

深入解析Python字节码缓存:从pyc文件机制到开发部署实战

1. 从一次“诡异”的编译错误说起那天下午,我正忙着调试一个部署在服务器上的Python服务。本地跑得好好的,一上服务器就报了个ImportError,说某个模块找不到。我第一反应是依赖没装全,但pip list一看,该有的都在。更奇…

2026/8/18 3:58:11 阅读更多 →
OLED屏幕技术原理与STM32驱动实战:从7T1C电路到SSD1306应用

OLED屏幕技术原理与STM32驱动实战:从7T1C电路到SSD1306应用

大家好,我是CSDN的一名技术博主。今天我们不聊代码,来深入聊聊一个在嵌入式开发、消费电子乃至高端显示领域都绕不开的核心器件——OLED屏幕。很多朋友在选择屏幕时,都会听到“OLED色彩好、对比度高、省电”,但知其然更要知其所以…

2026/8/17 2:59:03 阅读更多 →

最新新闻

技术写作知识体系:从主题索引到版本更新

技术写作知识体系:从主题索引到版本更新

技术写作知识体系:从主题索引到版本更新 问题与适用范围 微服务网关在流量高峰期遭遇无缓冲 Channel 死锁,线程池瞬间挂起。 本文以 技术写作方法论与知识体系构建 为例,讨论并发与异常输入下的处理方式。下文的架构图和代码用于解释设计取舍…

2026/8/18 6:56:17 阅读更多 →
无U盘安装CentOS 7:Windows硬盘直装与双系统引导全攻略

无U盘安装CentOS 7:Windows硬盘直装与双系统引导全攻略

1. 项目概述与核心思路最近在折腾一台老旧的Windows笔记本,想把它改造成一个轻量级的Linux服务器来跑点小服务。手头没有多余的U盘,又不想破坏现有的Windows系统,这听起来像是个不可能的任务,对吧?其实不然。通过直接在…

2026/8/18 6:56:17 阅读更多 →
计算机毕业设计之基于python的网咖管理系统的设计与实现

计算机毕业设计之基于python的网咖管理系统的设计与实现

随着信息技术的飞速发展,网咖行业对高效、智能的管理系统需求日益增长。本文设计并实现了一套基于Python语言、Django框架、Vue前端框架以及MySQL数据库的网咖管理系统。该系统旨在解决传统网咖管理中存在的效率低下、信息不透明等问题,通过用户、管理员…

2026/8/18 6:56:17 阅读更多 →
本地AI抠图神器See-through WebUI安装与优化全攻略

本地AI抠图神器See-through WebUI安装与优化全攻略

上周帮一个做电商的朋友处理商品图,他有一批白底产品图,想快速把产品主体抠出来换个背景。试了几个在线工具,要么效果粗糙边缘锯齿,要么收费高昂批量处理麻烦。折腾到半夜,我突然想起之前隐约听过一个叫“See-through”…

2026/8/18 6:56:17 阅读更多 →
智能体控制论:构建能调度其他AI的元智能体架构

智能体控制论:构建能调度其他AI的元智能体架构

1. 项目概述:当智能体开始“使用”智能体最近在AI圈子里,一个听起来有点“套娃”的概念正在被频繁讨论:智能体对智能体的使用。这不再是简单的多智能体协作,而是指向一个更深层的架构——一个智能体系统能够像人类使用工具一样&am…

2026/8/18 6:56:17 阅读更多 →
智能体决策可重构性实践:基于锚点实现跨SDK决策追溯

智能体决策可重构性实践:基于锚点实现跨SDK决策追溯

1. 项目缘起:从“黑盒”到“白盒”的决策追溯困境在智能体(Agent)开发领域,尤其是当我们深度集成来自不同供应商的SDK来构建复杂决策系统时,一个长期困扰开发者和算法工程师的痛点日益凸显:我们常常无法清晰…

2026/8/18 6:55:17 阅读更多 →

日新闻

告别逐帧截图:用 extract-video-ppt 快速提取视频中的 PPT 并一键导出 PDF

告别逐帧截图:用 extract-video-ppt 快速提取视频中的 PPT 并一键导出 PDF

告别逐帧截图:用 extract-video-ppt 快速提取视频中的 PPT 并一键导出 PDF 【免费下载链接】extract-video-ppt extract the ppt in the video 项目地址: https://gitcode.com/gh_mirrors/ex/extract-video-ppt 如果你还停留在"看网课 不停暂停 截图 …

2026/8/18 0:00:57 阅读更多 →
思源宋体TTF一站式上手:7个字重免费商用,从下载到上线的完整走查

思源宋体TTF一站式上手:7个字重免费商用,从下载到上线的完整走查

思源宋体TTF一站式上手:7个字重免费商用,从下载到上线的完整走查 【免费下载链接】source-han-serif-ttf Source Han Serif TTF 项目地址: https://gitcode.com/gh_mirrors/so/source-han-serif-ttf 你是不是也经历过这种时刻:设计稿里…

2026/8/18 0:00:58 阅读更多 →
华硕笔记本控制权回收指南:GHelper 如何用一个 10MB 文件替代 Armoury Crate

华硕笔记本控制权回收指南:GHelper 如何用一个 10MB 文件替代 Armoury Crate

华硕笔记本控制权回收指南:GHelper 如何用一个 10MB 文件替代 Armoury Crate 【免费下载链接】g-helper Lightweight Armoury Crate alternative for Asus laptops with nearly the same functionality. Works with ROG Zephyrus, Flow, TUF, Strix, Scar, ProArt, …

2026/8/18 0:00:59 阅读更多 →

周新闻

基于阿里云与通义千问(Qwen)构建AI应用:从模型调用到生产部署的完整实践指南

基于阿里云与通义千问(Qwen)构建AI应用:从模型调用到生产部署的完整实践指南

如果你是一名开发者,最近可能已经感受到了AI大模型正在从“玩具”变成“生产力工具”的强烈信号。从代码补全到智能Agent,从本地部署到云端API,我们正处在一个技术栈快速重构的节点。然而,面对层出不穷的模型、框架和工具&#xf…

2026/8/17 2:58:27 阅读更多 →
工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

第四篇:反射——高频能量撞墙之后会发生什么? —— 你以为信号已经过去了,其实它正在回来打你 老Q的现场笔记 第五季,我们正式进入工业神经系统层。这里不再是单个设备的战斗,而是整个工厂“经脉”层面的秩序之战。从这一篇开始,你将第一次看清:看似简单的信号传播,背…

2026/8/17 2:58:30 阅读更多 →
【文章复现】非线性值迭代自适应动态规划(ADP):离散时间非线性系统的策略迭代自适应动态规划算法研究附Matlab代码

【文章复现】非线性值迭代自适应动态规划(ADP):离散时间非线性系统的策略迭代自适应动态规划算法研究附Matlab代码

✅作者简介:热爱科研的Matlab仿真开发者,擅长毕业设计辅导、数学建模、数据处理、建模仿真、程序设计、完整代码获取、论文复现及科研仿真。🍎 往期回顾关注个人主页:Matlab科研工作室👇 关注我领取海量matlab电子书和…

2026/8/17 2:58:32 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/17 18:54:37 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/17 18:55:16 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/17 18:55:55 阅读更多 →