nanoGPT 手把手教程:3分钟跑通第一个GPT模型,复现GPT-2与微调全流程
nanoGPT 手把手教程3分钟跑通第一个GPT模型复现GPT-2与微调全流程【免费下载链接】nanoGPTThe simplest, fastest repository for training/finetuning medium-sized GPTs.项目地址: https://gitcode.com/GitHub_Trending/na/nanoGPTnanoGPT 是目前最精简的 GPT 训练与微调仓库之一核心只有约 600 行代码。本文带你走通环境搭建、训练字符级模型、文本生成、复现 GPT-2、微调和调优排错的全部环节零基础也能逐条命令跑通。它解决了什么问题这一章帮你先判断一件事你手上要做的 GPT 实验是不是适合用 nanoGPT 来做。代码量小到能读完训练入口 是约 300 行的标准训练循环模型定义 约 300 行实现完整 GPT 结构没有多余的抽象层出问题一眼能定位。复现 GPT-2 有真实基准训练入口 可以在单节点 8×A100 40GB 上于约 4 天内复现 GPT-2124M 参数验证损失降到约 2.85与官方模型微调后的水平相当。硬件门槛压得很低单卡、普通笔记本甚至纯 CPU 的 MacBook 都能跑字符级训练官方给出了各档硬件的现成参数组合。全链路工具齐备从 数据准备脚本、训练入口、采样脚本 到 性能基准一条流水线不用换仓库。对比项minGPTnanoGPT定位教学导向的 GPT 实现性能优先的训练/微调仓库代码风格讲解性强、结构较松精简紧凑、贴近真实训练适用场景理解原理快速跑真模型、微调、复现实验从零跑通第一个模型这一章帮你把依赖装齐、数据备好并让第一条训练命令顺利出结果。两条命令完成环境准备先装依赖一共七个包pip install torch numpy transformers datasets tiktoken wandb tqdm装完后python -c import torch不报错就说明 PyTorch 就绪transformers用来加载 GPT-2 权重tiktoken是 OpenAI 的 BPE 分词器wandb是可选的日志工具。再拿到代码仓库为只读直接克隆即可使用git clone https://gitcode.com/GitHub_Trending/na/nanoGPT cd nanoGPT把莎士比亚语料转成整数序列训练前先运行 字符级数据准备脚本它会下载约 1MB 的莎士比亚文本并把文本编码成整数流python data/shakespeare_char/prepare.py跑完后在data/shakespeare_char/目录下出现train.bin和val.bin两个文件即为成功。一条命令启动训练看损失确认收敛配置文件 config/train_shakespeare_char.py 已经调好直接启动python train.py config/train_shakespeare_char.py这个配置训练的是一个 6 层、6 个注意力头、384 维嵌入的小 GPTblock_size为 256模型一次最多参考前 256 个字符batch_size为 64每次迭代消耗的样本数learning_rate为 1e-3max_iters为 5000总训练步数。在一张 A100 上约 3 分钟跑完终端会持续打印 loss验证损失最低可稳定到1.4697左右——看到 val 值在 1.5 附近徘徊就说明模型收敛了。让模型开口说话这一章帮你从刚训好的模型里生成第一段文本并搞懂每种硬件下该怎么启动。三种硬件如何选启动命令训练命令随硬件变化采样命令则统一。先对照你的设备选训练方式# GPU直接用默认配置 python train.py config/train_shakespeare_char.py有 GPU 就照上面跑CPU 用户需要同时关掉torch.compile加--compileFalse并缩小模型和上下文python train.py config/train_shakespeare_char.py --devicecpu --compileFalse \ --block_size64 --batch_size12 --n_layer4 --n_head4 --n_embd128 \ --max_iters2000 --lr_decay_iters2000 --dropout0.0device指定运行设备n_layer / n_head / n_embd分别控制层数、注意力头数和嵌入维度CPU 上约 3 分钟也能跑完验证损失约 1.88样本质量略差但流程完整。Apple Silicon 的 MacBook 用--devicemps调用芯片内 GPU可获得约 2-3 倍加速python train.py config/train_shakespeare_char.py --devicemps采样命令和关键参数怎么调训练结束后 checkpoint 写在out-shakespeare-char目录把 采样脚本 指过去即可python sample.py --out_dirout-shakespeare-charout_dir指定读取哪个输出目录。每次运行生成的文本都不一样字符级模型的典型输出大致是这种有格式、有角色名、句法略显荒诞的样子BALTHAZAR: I am not so much in the way to you But that I would be gone, and if you must Then speak no more of this, for I am As ready as the day is long.想控制生成行为常用这几个参数参数作用--start指定生成起始文本提示词--num_samples生成几段样本--max_new_tokens每段最多生成多少 token--temperature采样随机程度0 为完全确定性输出如果不想自己训练也可以直接对 OpenAI 官方预训练模型做推理把--init_fromgpt2-xl换成gpt2、gpt2-medium、gpt2-large可选不同规格python sample.py --init_fromgpt2-xl \ --startThe moon rose above the castle \ --num_samples3 --max_new_tokens100从玩具到生产GPT-2 复现与微调这一章帮你在多卡环境复现 GPT-2124M并学会用官方 checkpoint 做低成本微调。准备 OpenWebText 语料GPT-2 复现使用 OpenWebTextOpenAI WebText 的开源重建版先运行 数据准备脚本 下载并用 GPT-2 的 BPE 分词器编码python data/openwebtext/prepare.py完成后同样得到train.bin和val.bin里面是 uint16 编码的 token 序列。一行命令启动 8 卡分布式训练有 8×A100 40GB 节点的话用 DDP 启动即可torchrun --standalone --nproc_per_node8 train.py config/train_gpt2.py整轮训练约 4 天验证损失降到约2.85。注意一个基准细节官方 GPT-2 直接在这个数据集上评估损失约 3.11微调后才到 2.85所以 2.85 才是合理的对比线——你的模型到了这个数字就可以说复现成功。微调时哪些参数要改微调不从头训而是加载预训练权重继续训小数据集微调配置 里三个参数最关键init_from初始化的预训练模型示例用gpt2-xl显存不够可换更小的gpt2、gpt2-mediumlearning_rate微调用 3e-5 这种小学习率避免冲掉预训练知识max_iters小数据集 20 步左右即可约 9 个 epoch 的量级数据准备用词元级脚本比字符级快几秒完成然后启动python data/shakespeare/prepare.pypython train.py config/finetune_shakespeare.py微调在单卡上几分钟就能结束最佳 checkpoint 落在配置里的out_dir默认out-shakespeare。用它采样python sample.py --out_dirout-shakespeare同样每次输出不同微调后的文本语感明显更接近真莎士比亚JULIET: And therefore, since the world is so unkind, I will be bold and tell thee what I think: If thou art one that would be true to me, Then prove it now, and let us part no more.调优技巧与常见问题这一章帮你在遇到慢、卡、崩的时候快速止血。三个提速手段默认已开启 torch.compile训练入口 使用 PyTorch 2.0 编译官方数据是单步时间从约 250ms 降到 135ms无需额外操作。混合精度加--dtypebfloat16用 bfloat16 计算可明显降低显存占用并提速。梯度累积用--gradient_accumulation_steps在单卡上模拟更大 batch显存不够但想要大 batch 时优先试它。迭代时间存疑时跑 性能基准脚本它只保留训练循环核心来对比机器与配置差异。高频问题速查症状处理显存不足OOM调小--batch_size或--block_size微调时换更小的init_from损失波动、不收敛降低learning_rate加大warmup_iterstorch.compile 相关报错如 Windows加--compileFalse变慢但能跑CPU 上训练太慢缩小--block_size、--n_layer、--max_iters想确认是不是机器问题用 bench.py 对比单步耗时跑通之后还能做什么到这里你已经完成了从字符级训练到 GPT-2 复现、微调的完整闭环下一步的探索成本都很低因为可读的代码就摆在那里。改 模型定义尝试 RoPE、ALiBi 等其他位置编码照着 数据准备脚本 写一个自己的语料预处理训领域模型用 bench.py 做配置对比找到你的机器上的最优规模翻一遍 配置目录理解每档模型对应的参数组合另需留意作者已发布后继项目 nanochat仓库 README 标注 nanoGPT 偏历史性质长期规划建议同时关注两者的状态。选一台你手边的机器先把train_shakespeare_char那条命令跑起来——3 分钟后你就有自己的 GPT 了。【免费下载链接】nanoGPTThe simplest, fastest repository for training/finetuning medium-sized GPTs.项目地址: https://gitcode.com/GitHub_Trending/na/nanoGPT创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

高斯过程如何帮你少走90%的弯路:贝叶斯优化BO与EI采集函数在GEMM参数空间中的实现原理

高斯过程如何帮你少走90%的弯路:贝叶斯优化BO与EI采集函数在GEMM参数空间中的实现原理

高斯过程如何帮你少走90%的弯路:贝叶斯优化BO与EI采集函数在GEMM参数空间中的实现原理 【免费下载链接】Simulation-of-Microscopic-Typical-Matrix-Computation-Patterns 项目地址: https://gitcode.com/SEU-TLab/Simulation-of-Microscopic-Typical-Matrix-Com…

2026/9/25 5:37:29 阅读更多 →
OpenChamber Project Context 源码解读:Notes、Todos 与 Plans 的服务端存储架构

OpenChamber Project Context 源码解读:Notes、Todos 与 Plans 的服务端存储架构

AI Agent人工智能代码智能体交互助手 【免费下载链接】openchamber Agentic Development Environment based on OpenCode AI agent 项目地址: https://gitcode.com/gh_mirrors/op/openchamber 点击查看 免费下载 本文以 OpenChamber 仓库中 packages/web/server/li…

2026/9/25 5:37:29 阅读更多 →
阅读笔记:《云计算关键领域安全指南v5》

阅读笔记:《云计算关键领域安全指南v5》

云计算是一种运营模型和一组技术,用于通过对计算、网络、存储等资源的抽象来管理共享资源池。云计算能够实现通过网络访问可扩展且具有弹性的可共享的物理或虚拟资源池,并可按需进行自助式资源调配和管理。云可以由几乎任何计算资源组成,从处…

2026/9/25 5:36:29 阅读更多 →

最新新闻

OFDM频谱感知实战:10节点协作+循环平稳检测+历史谱图可视化

OFDM频谱感知实战:10节点协作+循环平稳检测+历史谱图可视化

简介:本资源是一套面向通信工程专业高年级本科生及无线认知网络研究者的OFDM信号协作频谱感知MATLAB仿真方案,聚焦于解决单节点在阴影与深度衰落场景下检测不可靠的问题,通过融合多节点感知结果提升频谱判断准确性。压缩包共6个文件&#xff…

2026/9/25 9:41:42 阅读更多 →
2026年AI大模型应用盘点:从通用对话到Coding Agent的15家主流工具实测

2026年AI大模型应用盘点:从通用对话到Coding Agent的15家主流工具实测

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/25 9:41:42 阅读更多 →
计算机网络简答题与论述题核心考点梳理:从TCP/IP到子网划分

计算机网络简答题与论述题核心考点梳理:从TCP/IP到子网划分

简介:计算机网络课程的简答题与论述题常考内容,集中整理进一份Word文档,面向高校学生、考研备考生及求职面试者备考使用。文档系统梳理了电路交换、分组交换与报文交换的优缺点,分组传输中传输、传播、排队等延迟的影响因素&#…

2026/9/25 9:41:42 阅读更多 →
从TMN框架到E300实战:传输网管入门核心知识梳理

从TMN框架到E300实战:传输网管入门核心知识梳理

简介:《中兴传输网管入门知识》是一份面向通信行业新手与传输网管初学者的入门教程,系统梳理电信管理网(TMN)核心概念及其在SDH传输网络中的落地方式。内容从TMN的引入背景、三大结构(功能结构、信息结构、物理结构&am…

2026/9/25 9:41:42 阅读更多 →
Atlas 300V 24G部署YOLO全流程:昇腾推理卡环境搭建与优化

Atlas 300V 24G部署YOLO全流程:昇腾推理卡环境搭建与优化

1. Atlas 300V 24G到底是一张什么卡如果你也是被"atlas部署yolo"这个词带进来的,那你大概率跟我一样,手头或公司机房里躺着一张Atlas 300V 24G,想赶紧把YOLO跑起来,结果一查资料各种术语铺过来,头都大了。先…

2026/9/25 9:41:42 阅读更多 →
Linux服务器SSH连接与GPU开发环境实操指南

Linux服务器SSH连接与GPU开发环境实操指南

1. 项目概述:这不是“连服务器”,而是重建你和算力之间的信任链 “手把手教你如何连上实验室的服务器”——这句话在研究生新生群里刷屏的频率,几乎和开学季的快递单号一样高。但真正点开教程的人,十有八九卡在第二步&#xff1a…

2026/9/25 9:40:41 阅读更多 →

日新闻

AI元人文:从工具使用到思维重构的深度探索

AI元人文:从工具使用到思维重构的深度探索

最近半年我一直在琢磨一件事:AI元人文到底是什么?说白了,就是“用元视角重新审视人与AI的关系”,也在“探索AI如何反向逼着我们发现自己的思考边界”。标题里的“元探索”,在我看就是一层套一层的追问——当你用AI解决…

2026/9/25 0:00:41 阅读更多 →
Python+CNN车牌识别实战:从数据预处理到模型训练与部署

Python+CNN车牌识别实战:从数据预处理到模型训练与部署

简介:基于Python与卷积神经网络的车牌识别项目,面向计算机视觉初学者及智能交通开发者,目标是帮助用户掌握从数据预处理、模型构建到实际部署的完整流程。压缩包共25个文件,包含jpg/png图像样本、py训练脚本、md说明文档、dat数据…

2026/9/25 0:00:41 阅读更多 →
Vim基础操作全攻略:保存退出、模式切换与高频命令实战

Vim基础操作全攻略:保存退出、模式切换与高频命令实战

1. 项目概述1.1 核心需求解析今天聊聊Vim。写这个题目的原因是:几乎每个后端开发者、运维人员、数据工程师某天都会遇到一个场景——深夜加班,服务器登录界面只有黑底白字,编辑器只有vi/vim,你必须在五分钟内完成一次配置修改并保…

2026/9/25 0:00:41 阅读更多 →

周新闻

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

直接铺开项目本身吧。这几个月我一直在折腾一件事:用Flutter给OpenHarmony做一款游戏集合类的App,说白了就是把若干小游戏塞进一个壳里,用统一入口分发。这个方向本身不算新鲜,真正让我花了不少心思的,是首页那堆游戏卡…

2026/9/24 14:34:13 阅读更多 →
Word表格编号全攻略:从列表编号到题注交叉引用

Word表格编号全攻略:从列表编号到题注交叉引用

写Word文档,最让人头疼的往往是那些“看起来不起眼”的小问题。比如表格编号这事:今天在表后面多加了两个空白行,明天给客户交稿前发现整个章节的编号全部错位,光是挨个改序号就能耗掉大半个下午。我前阵子帮人整理一份上百页的技…

2026/9/24 9:10:42 阅读更多 →
从第一个站到第二个站:独立开发者的静态网站选型与落地实践

从第一个站到第二个站:独立开发者的静态网站选型与落地实践

1. 项目概述1.1 核心需求解析做独立开发者这几年,说实话,第一个网站上线的那天晚上我兴奋得没睡着。但等它跑了半年,流量惨淡、功能臃肿、代码自己都懒得看第二遍之后,我才慢慢琢磨明白一个道理:第一个网站是练手&…

2026/9/24 14:33:56 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/24 12:50:34 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/24 14:33:48 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/24 12:49:17 阅读更多 →