autoresearch-mlx基准结果全解读:从2.667到1.294的val_bpb优化路径与硬件差异分析
【免费下载链接】autoresearch-mlxApple Silicon (MLX) port of Karpathys autoresearch — autonomous AI research loops on Mac, no PyTorch required.项目地址https://gitcode.com/gh_mirrors/au/autoresearch-mlx点击查看免费下载autoresearch-mlx是 Karpathy 提出的 autoresearchLLM 自主科研循环的 Apple Silicon / MLX 移植版无需 PyTorch 与 CUDA直接在 Mac 上用固定 5 分钟训练预算自动迭代train.py唯一目标是把val_bpb每字节比特数越低越好降到最低。本文完整解读其公开基准从 2.667 的基线一路压到 1.294并对比不同 Mac 硬件上的结果差异。一、项目是什么LLM 自己当研究员 autoresearch-mlx 的规则极简协议全文见 program.md元素说明唯一可改文件train.py —— 模型、优化器、训练循环随便改唯一指标val_bpb由 prepare.py 中只读的evaluate_bpb计算固定预算每次实验训练 5 分钟TIME_BUDGET 300见 prepare.py全程约 6–7 分钟决策规则跑完看val_bpb变低就keep变高就git reset回退然后无限循环一句话概括时间锁死硬件说了算——比的是谁能在 5 分钟里塞进更多有效优化步。二、公开优化路径2.667 → 1.808 的四次关键改动 results.tsv 记录了同一台 Mac 上从默认基线出发、逐条保留的本地行走路径Commitval_bpb内存(GB)状态改动383abb42.66700026.9keep基线AdamW默认配置c67ad2a2.69536926.9discard降低 weight decay 到 0.1失败回退909dd592.58890426.9keep总 batch 减半至2^164161af32.53372826.9keep矩阵学习率提到 0.045efc7aa1.80790220.7keep深度从 8 层砍到 4 层几个值得新手注意的细节中间有失败c67ad2a降 weight decay 反而变差被标记discard回退——这正是keep-or-revert机制的价值坏改动不会污染分支。降 batch 更多步数batch 减半后同样的 5 分钟里优化器多走了一倍多的步val_bpb 掉 0.078。最狠的一刀是砍深度8 层 → 4 层直接让 val_bpb 从 2.534 崩到 1.808-0.726内存还从 26.9GB 降到 20.7GB。这些最终值就固化在 train.py 的超参数区DEPTH 4、TOTAL_BATCH_SIZE 2**16、MATRIX_LR 0.04。 核心规律在固定墙钟时间下更小、训得快的模型能赢过更大的模型因为它能塞进更多优化步。这就是 Apple Silicon 移植反复验证出的模式。三、长程竞赛三台 Mac 的最优解与硬件差异 ️短跑只是热身。把循环挂整夜后README.md 中 Longer Apple Silicon runs 一节不同硬件跑出了明显不同的冠军配方机器当前最佳 val_bpb起点反复获胜的改动组合M4 Max #11.2945261.596971纯 AdamW、低矩阵 LR、3× MLP、去掉 logit cap、适中 weight decayM4 Max #21.3305091.807902更精简 batch、长退火anneal、SiLU、低正则、无 logit capMac Mini长跑1.3533291.922472Muon 优化器、更锐利的注意力、更小 MLP、更低标量 LR三个结论没有全局最优配方。两台同代 M4 Max 的最优组合都不相同——一台靠纯 AdamW 低矩阵 LR 3× MLP另一台靠长退火 SiLU 低正则。Mac Mini 找出了不同的路。小硬件上的最强改动偏向更激进的步数效率Muon、小 MLP、低标量 LR而不是简单复现 Max 机的配方。迁移性差正是价值所在。Mac Mini 的发现移植到 Max 基线上并不完全成立——这类硬件特化行为恰恰是自动循环擅长挖出来的东西。换硬件跑请先在自己机器上重建基线别直接套用别人的数字program.md 明确要求Do NOT use baseline numbers from other platforms。四、为什么一次运行的数字要打折看 单跑一次的 val_bpb 是有噪声的同一份train.py重跑结果会漂移约±0.03GPU 归约非确定性。而循环只保留比当前最优低的运行记录曲线其实是乐观的运行最小值——诚实复评时会回涨。所以项目提供了 rigor.py一个统计门槛替代看一眼差值就拍板多种子评分每个改动跑 3 个可配 5 个seed 取均值而非单次快照Bootstrap 置信检验只有当新配置确实更好的概率 P(better) ≥ 0.95 才keep快速淘汰第一个 seed 就明显劣于当前最优立刻丢弃不浪费后续 seed永不重复按train.py的哈希记账rigor_ledger.jsonl相同配置不重评uv run rigor.py run halve the batch size # 3 seed 评分 uv run rigor.py best # 查看当前最优 uv run rigor.py log # 全部已评分配置它只决策不改train.py、不碰 git、不动评测函数。对新手很友好——把循环交给严谨模式曲线才经得起复评。五、自己动手最快上手方法 ⚡前置Apple Silicon Mac Python 3.10 uvmlx、numpy、pyarrow、rustbpe、tiktoken。# 1. 安装依赖 uv sync # 2. 一次性准备数据 分词器存到 ~/.cache/autoresearch/ uv run prepare.py # 3. 跑一个 5 分钟实验得到你自己的基线 uv run train.py跑完会看到类似输出格式定义见 train.pyval_bpb: 2.534000 training_seconds: 312.4 peak_vram_mb: 27528.9 num_steps: 46 num_params_M: 50.3给新手的三条提醒只和你同一台机器的基线比别和本文数字或 NVIDIA 结果对比每次实验约 7 分钟睡觉前挂上醒来约 70 个实验按 8–9 个/小时估记结果用制表符分隔的 TSV描述里不要带逗号见 program.md 的 Logging results 一节。六、关键文件导航 文件角色README.md项目总览与全部公开基准数字program.md自主实验协议AI Agent 的操作手册train.py模型/优化器/训练循环唯一允许改的文件prepare.py数据、分词器、只读的evaluate_bpb评测勿改results.tsv实验历史账本rigor.py多种子 Bootstrap 的 keep/discard 统计门槛pyproject.toml依赖声明结语 autoresearch-mlx 用一组漂亮的数字说明了三件事5 分钟预算下小而快能打败大而慢2.667 → 1.808、不同 Mac 硬件会收敛到不同的最优配方1.294 / 1.331 / 1.353、单次运行的数字必须用统计门槛过滤噪声rigor.py。如果你想在自己机器上验证这套流程从uv run prepare.py开始半小时后就能拥有属于你的基线数字。赞分享【免费下载链接】autoresearch-mlxApple Silicon (MLX) port of Karpathys autoresearch — autonomous AI research loops on Mac, no PyTorch required.项目地址https://gitcode.com/gh_mirrors/au/autoresearch-mlx点击查看免费下载相关推荐Autoresearch EvalsClaude Autoresearch 迭代结果分析协议全解析Autoresearch EvalsClaude Autoresearch 迭代结果分析协议全解析 Autoresearch 项目Claude AutoreAI 技能人工智能AI 评测开发工具microeco包与LEfSe分析结果差异解析及优化方案microeco包与LEfSe分析结果差异解析及优化方案 背景介绍 microeco是一个强大的R语言微生物组分析工具包它整合了多种微生物组数据分析方法其中科研生物信息学数据分析autoresearch-mlx的rigor.py用Bootstrap置信检验告别val_bpb噪声的终极方案autoresearch mlx的rigor.py用Bootstrap置信检验告别val_bpb噪声的终极方案 autoresearch mlx 是 Karp创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

Android系统架构本质:动态契约体系与分层调试实战

Android系统架构本质:动态契约体系与分层调试实战

1. 为什么“系统架构”不是一张PPT里的分层图,而是Android开发者的底层操作系统观很多人第一次看到“Android系统架构”这个词,下意识会去翻官方文档里那张经典的四层图:Linux内核层、硬件抽象层(HAL)、运行时与框架层…

2026/10/11 23:08:51 阅读更多 →
Kepware反向当OPC DA Client:老系统接入新架构的完整配置指南

Kepware反向当OPC DA Client:老系统接入新架构的完整配置指南

简介:这份 Kepware 使用教程聚焦 OPC DA Client 功能,面向物联网开发者与工业通信集成人员,讲解如何利用 Kepware 建立与各类 IoT 设备的连接并完成数据交换配置。资源共 1 个 PDF 文件,约 614KB,内容精炼、结构紧凑&a…

2026/10/11 23:07:51 阅读更多 →
Navicat for MySQL绿色版免安装部署与连接备份避坑指南

Navicat for MySQL绿色版免安装部署与连接备份避坑指南

简介:Navicat for MySQL 8.2.12 绿色版是一套面向 MySQL 数据库管理员、开发者与分析师的免安装图形化管理工具,通过解压即可直接运行,省去繁琐安装步骤,适合在临时环境、多台机器或运维现场快速部署使用。包内共收录 19 个文件&a…

2026/10/11 23:07:50 阅读更多 →

最新新闻

【深度学习新浪潮】Meta Muse 智能体:它是什么?有哪些特点?为什么突然火了?

【深度学习新浪潮】Meta Muse 智能体:它是什么?有哪些特点?为什么突然火了?

1. 引言 近期,Meta Muse 智能体在 AI 领域引发广泛关注,开发者、创作者与科技从业者纷纷展开讨论。许多初次接触者不禁疑惑:这是 Meta 推出的又一款大模型?抑或仅是蹭热度的 AI 玩具? 事实并非如此。Meta Muse 是 Meta 在 AI 智能体方向的一次战略性布局,它并非简单的对…

2026/10/12 2:24:22 阅读更多 →
Spring-boot-3 -注解 yaml配置 -日志

Spring-boot-3 -注解 yaml配置 -日志

4、核心技能1. 常用注解SpringBoot 摒弃 XML 配置方式,改为全注解驱动1. 组件注册Configuration 自定义配置类、SpringBootConfiguration 用来标注SpringBoot主启动类的Bean 可以在自定义配置类面创建对象交给ioc容器,组件在容器中的名字为方法名、Scope…

2026/10/12 2:24:22 阅读更多 →
Neuroimage: 动态功能连接方法的重测信度比较

Neuroimage: 动态功能连接方法的重测信度比较

本篇文献发表在Neuroimage杂志。所发布内容旨在与大家分享学术新知,促进交流学习版权归原作者或原出处所有,感谢各位学者的辛勤付出与研究成果。1.引言大脑的功能组织具有丰富的时空结构,可以使用功能连接指标进行探测。功能连接被定义为两个…

2026/10/12 2:24:22 阅读更多 →
page_alloc __rmqueue

page_alloc __rmqueue

__rmqueue() 是伙伴系统分配路径的核心调度器。它在持有 zone->lock 的前提下,按照碎片化风险从低到高的顺序,依次尝试不同的分配策略,直到成功或彻底失败。核心作用与策略链它的本质是一个多级降级策略链:先尝试最“干净”的方…

2026/10/12 2:24:22 阅读更多 →
游戏引擎中物理步进与动画采样的同步机制解析

游戏引擎中物理步进与动画采样的同步机制解析

1. 这不是教科书,是我在三个项目里拆过七次引擎后写下的物理与动画系统手记“游戏引擎架构深度解析(三):物理与动画系统”——看到这个标题,你大概率正卡在某个角色落地时穿模、布料抖动像癫痫发作、或者刚加完一个新关…

2026/10/12 2:24:22 阅读更多 →
产业与汇率全景分析深入分析多表格形成一篇文章

产业与汇率全景分析深入分析多表格形成一篇文章

产业与汇率全景深度分析:汇率是外生变量,产业是底层根基引言汇率从来不是孤立的数字,它是一国产业竞争力、贸易结构、资本流动、宏观政策、全球供需格局共同定价的结果;反过来,汇率波动又会重塑产业成本、订单、利润、…

2026/10/12 2:23:21 阅读更多 →

日新闻

复古胶片颗粒感噪点合成器:Canvas ImageData 像素高斯杂色注入算法

复古胶片颗粒感噪点合成器:Canvas ImageData 像素高斯杂色注入算法

在数码相机、高清显示屏与现代矢量图形技术高度发达的今天,画面可以做到绝对的锐利、平滑与无瑕。然而,当一张秋日手账插画或拍立得照片过于“平整无瑕”时,往往会散发出一种冰冷生硬的“数码塑料感(Digital Plasticity&#xff0…

2026/10/12 0:00:59 阅读更多 →
活字印刷古籍线装排版:Canvas 竖排文字与栏线自适应算法

活字印刷古籍线装排版:Canvas 竖排文字与栏线自适应算法

在现代网页与移动端设计中,横排(Horizontal Layout)早已经成为了绝对的主流。然而,当我们翻开泛黄的线装古籍、宋版木刻诗集,或是欣赏一张茶道雅集的手写便签时,那种**自上而下纵向书写、自右向左逐列铺展&…

2026/10/12 0:00:59 阅读更多 →
周日晚间的“精神松绑减震器”:无压力情绪倾倒箱与温和轻声陪伴

周日晚间的“精神松绑减震器”:无压力情绪倾倒箱与温和轻声陪伴

每到周日的晚上八点到十点,很多人心里都会悄悄亮起一盏警示灯。 在心理学上,这种现象有一个专门的称谓——“周日夜晚焦虑症(Sunday Scaries)”。明天又是周一,闹钟又要重新在七点响彻卧房;脑海里仿佛有一个…

2026/10/12 0:00:59 阅读更多 →

周新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/12 0:16:30 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/12 0:16:38 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/12 0:16:43 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 10:45:37 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 14:36:53 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 14:36:54 阅读更多 →