经过多次尝试,在kaggle 双T4训练Qwen2.5-0.5B的正确打开方式是:
经过多次尝试,在kaggle 双T4训练Qwen2.5-0.5B的正确打开方式是:!torchrun --nproc_per_node2 \ -m swift.cli.sft \ --model ./qwen2.5-0.5b-instruct \ --dataset /kaggle/working/duan/tools/ai_copilot/sft_dataset.jsonl \ --max_length 4096 \ --num_train_epochs 3 \ --per_device_train_batch_size 4 \ --learning_rate 5e-5 \ --output_dir ./output_v2 \ --logging_steps 5 \ --save_steps 500 \ --eval_steps 500 \ --split_dataset_ratio 0.1 \ --bf16 true详细过程在kaggle上的最佳实践先安装库!pip install ms-swift[llm] -U -q !pip install torchao -U -q下载模型因为ms-swift自己下载模型太慢,用transformers下载from transformers import AutoModelForCausalLM, AutoTokenizer model_name Qwen/Qwen2.5-0.5B-Instruct save_dir ./qwen2.5-0.5b-instruct tokenizer AutoTokenizer.from_pretrained(model_name, trust_remote_codeTrue) tokenizer.save_pretrained(save_dir) model AutoModelForCausalLM.from_pretrained(model_name, trust_remote_codeTrue) model.save_pretrained(save_dir) print(f下载完成保存在 {save_dir})上传训练数据集我就偷懒了,直接下载段言项目的代码,里面自带数据集!git clone https://gitcode.com/skywalk163/duan/怎么偷懒呢? 直接让程序帮我们找到数据集的位置import os for root, dirs, files in os.walk(/kaggle): for f in files: if f sft_dataset.jsonl: print(os.path.join(root, f))这段代码会自动输出数据集的路径:/kaggle/working/duan/tools/ai_copilot/sft_dataset.jsonl开始训练一般我们都是用swift sft 开训,但是在kaggle上双T4卡训练会报错,所以要用torchrun启动:!torchrun --nproc_per_node2 \ -m swift.cli.sft \ --model ./qwen2.5-0.5b-instruct \ --dataset /kaggle/working/duan/tools/ai_copilot/sft_dataset.jsonl \ --max_length 4096 \ --num_train_epochs 3 \ --per_device_train_batch_size 4 \ --learning_rate 5e-5 \ --output_dir ./output_v2 \ --logging_steps 5 \ --save_steps 500 \ --eval_steps 500 \ --split_dataset_ratio 0.1 \ --bf16 true现在max_length 设为4096, train_batch_size 设为4也能正常训练,不爆显存 .以前用段言自带的训练脚本,max_length 设为2048, train_batch_size 设为1 才能不爆显存!训练完毕:Train: 100%|██████████████████████████████████| 201/201 [14:5800:00, 2.82s/it] {eval_loss: 0.2401, eval_runtime: 8.635, eval_samples_per_second: 13.55, eval_steps_per_second: 6.833, eval_token_acc: 0.9391, epoch: 3, global_step/max_steps: 201/201, elapsed_time: 15m 7s, remaining_time: 0s, memory(GiB): 13.83, train_speed(s/it): 4.514} Val: 100%|██████████████████████████████████████| 59/59 [00:0800:00, 7.01it/s] /usr/local/lib/python3.12/dist-packages/torch/distributed/c10d_logger.py:83: UserWarning: barrier(): using the device under current context. You can specify device_id in init_process_group to mute this warning. return func(*args, **kwargs) [INFO:swift] Saving model checkpoint to /kaggle/working/output_v2/v2-20260801-011216/checkpoint-201 {train_runtime: 908.2, train_samples_per_second: 3.495, train_steps_per_second: 0.221, train_loss: 0.3376, epoch: 3, global_step/max_steps: 201/201, elapsed_time: 15m 8s, remaining_time: 0s, memory(GiB): 13.83, train_speed(s/it): 4.518} Train: 100%|██████████████████████████████████| 201/201 [15:0800:00, 4.52s/it] [INFO:swift] last_model_checkpoint: /kaggle/working/output_v2/v2-20260801-011216/checkpoint-201 [INFO:swift] best_model_checkpoint: /kaggle/working/output_v2/v2-20260801-011216/checkpoint-201 [INFO:swift] images_dir: /kaggle/working/output_v2/v2-20260801-011216/images [INFO:swift] End time of running main: 2026-08-01 01:27:46.525213 [rank0]:[W801 01:27:47.297239747 ProcessGroupNCCL.cpp:1553] Warning: WARNING: destroy_process_group() was not called before program exit, which can leak resources. For more info, please see https://pytorch.org/docs/stable/distributed.html#shutdown (function operator())最优模型确认框架这里使用的是swift将checkpoint-201即最后一个epoch保存的检查点标记为最佳模型。再用6个epoch试试!有了当前提升准确率的感觉.训练完成:Val: 100%|██████████████████████████████████████| 59/59 [00:0800:00, 7.01it/s] /usr/local/lib/python3.12/dist-packages/torch/distributed/c10d_logger.py:83: UserWarning: barrier(): using the device under current context. You can specify device_id in init_process_group to mute this warning. return func(*args, **kwargs) [INFO:swift] Saving model checkpoint to /kaggle/working/output_v2/v3-20260801-013448/checkpoint-402 {train_runtime: 1786, train_samples_per_second: 3.554, train_steps_per_second: 0.225, train_loss: 0.2082, epoch: 6, global_step/max_steps: 402/402, elapsed_time: 29m 46s, remaining_time: 0s, memory(GiB): 13.83, train_speed(s/it): 4.443} Train: 100%|██████████████████████████████████| 402/402 [29:4600:00, 4.44s/it] [INFO:swift] last_model_checkpoint: /kaggle/working/output_v2/v3-20260801-013448/checkpoint-402 [INFO:swift] best_model_checkpoint: /kaggle/working/output_v2/v3-20260801-013448/checkpoint-402 [INFO:swift] images_dir: /kaggle/working/output_v2/v3-20260801-013448/images [INFO:swift] End time of running main: 2026-08-01 02:04:54.818971 [rank0]:[W801 02:04:55.541631968 ProcessGroupNCCL.cpp:1553] Warning: WARNING: destroy_process_group() was not called before program exit, which can leak resources. For more info, please see Redirecting… (function operator())最后测试下来,500步的效果最好!torchrun --nproc_per_node2 \ -m swift.cli.sft \ --model ./qwen2.5-0.5b-instruct \ --dataset /kaggle/working/duan/tools/ai_copilot/sft_dataset.jsonl \ --max_length 4096 \ --num_train_epochs 12 \ --per_device_train_batch_size 4 \ --learning_rate 5e-5 \ --output_dir ./output_v2 \ --logging_steps 5 \ --save_steps 500 \ --eval_steps 500 \ --split_dataset_ratio 0.1 \ --bf16 trueTrain: 100%|██████████████████████████████████| 804/804 [47:1000:00, 2.91s/it] {eval_loss: 0.2208, eval_runtime: 8.648, eval_samples_per_second: 13.53, eval_steps_per_second: 6.822, eval_token_acc: 0.952, epoch: 12, global_step/max_steps: 804/804, elapsed_time: 47m 19s, remaining_time: 0s, memory(GiB): 14.06, train_speed(s/it): 3.531} Val: 100%|██████████████████████████████████████| 59/59 [00:0800:00, 6.98it/s] /usr/local/lib/python3.12/dist-packages/torch/distributed/c10d_logger.py:83: UserWarning: barrier(): using the device under current context. You can specify device_id in init_process_group to mute this warning. return func(*args, **kwargs) [INFO:swift] Saving model checkpoint to /kaggle/working/output_v2/v7-20260801-042924/checkpoint-804 {train_runtime: 2840, train_samples_per_second: 4.47, train_steps_per_second: 0.283, train_loss: 0.1082, epoch: 12, global_step/max_steps: 804/804, elapsed_time: 47m 20s, remaining_time: 0s, memory(GiB): 14.06, train_speed(s/it): 3.532} Train: 100%|██████████████████████████████████| 804/804 [47:2000:00, 3.53s/it] [INFO:swift] last_model_checkpoint: /kaggle/working/output_v2/v7-20260801-042924/checkpoint-804 [INFO:swift] best_model_checkpoint: /kaggle/working/output_v2/v7-20260801-042924/checkpoint-500 [INFO:swift] images_dir: /kaggle/working/output_v2/v7-20260801-042924/images [INFO:swift] End time of running main: 2026-08-01 05:17:05.974298 [rank0]:[W801 05:17:07.697822352 ProcessGroupNCCL.cpp:1553] Warning: WARNING: destroy_process_group() was not called before program exit, which can leak resources. For more info, please see https://pytorch.org/docs/stable/distributed.html#shutdown (function operator())如果爆显存,就把batch_size减小即可.合并模型!swift merge-lora --adapters /kaggle/working/output_v2/v7-20260801-042924/checkpoint-500转为gguf这步我在kaggle上需要先编译安装llama.cpp,需要较长时间,且经常有报错.所以转gguf我都是在本地让Trae帮我转的.测试效果全部完成v7: 18/18 PASS (100%)比 v3 的 17/18 有明显提升。v3 vs v7 对比#测试用例v3v7v7 改进点1基础函数OKOK补全了参数b2多参数默认值OKOK加了段落参数更完整3嵌套条件OKOK加了段落前缀4for-elseOKOKfindtarget更准确5双重循环OKOKlen(mat)替代N变量名正确6列表推导OKOK用遍历...之...若语法7字典推导OKOK接近正确语法8类定义OKOK稳定9try-except-finallyOKOK去掉了设 path 为 空10类继承superOKOK多了属性 breed11lambdafiltermapOKOK用筛选遍历...之...若12match-caseOKOK-13海象运算符OKOK(设 n 为 len(data))正确14propertyOKOK特性 段落 area名称正确15复合赋值OKOK稳定16冒泡排序OKOK段落 bubble_sort完整17with语句FAILOK从失败变通过18装饰器OKOK结构更合理模型信息项目v3v7模型名duan-translator-v3duan-translator-v7训练轮数402500GGUF 大小948MB948MB通过率17/18 (94.4%)18/18 (100%)平均速度26.6 tok/s26.1 tok/sv7 核心改进列表推导从显式循环升级为[x 遍历 x 之 20至0如果 x 取余 2 等于 0]语法海象运算符正确输出(设 n 为 len(data))形式with 语句从直接失败变为可通过lambda 高阶函数开始使用筛选/映射关键字更少的冗余设 xxx 为 空声明先到这里吧,暂时训练告一段落,该想想这个东西怎么用了.

相关新闻

毕业有这一个就够了✨告别一堆垃圾论文工具!

毕业有这一个就够了✨告别一堆垃圾论文工具!

真的不想再让学弟学妹瞎折腾了😭 写论文以来,下载过一堆工具,手机电脑全塞满。 写、改、查、画、翻译、答辩,每个环节换一个软件,操作繁琐、广告多、收费坑,关键是很多工具功能残缺、定稿翻车率超高&…

2026/8/5 6:20:26 阅读更多 →
曾爱玲入职B站任AI视频生成业务负责人,B站AI业务能否借势起飞?

曾爱玲入职B站任AI视频生成业务负责人,B站AI业务能否借势起飞?

36氪独家获悉,曾爱玲入职B站担任AI视频生成业务负责人,向CEO陈睿汇报。此前B站AI投入聚焦多方向,此次新负责人加入,或为其AI业务带来新变化。曾爱玲履历亮眼曾爱玲毕业于香港中文大学,曾是卡内基梅隆大学访问学者。她曾…

2026/8/5 6:13:45 阅读更多 →
muduo网络库(八):EventLoop 事件循环

muduo网络库(八):EventLoop 事件循环

muduo网络库(八):EventLoop 事件循环muduo网络库(八):EventLoop 事件循环概述EventLoop 的内部结构loop 主循环跨线程唤醒机制为什么需要 wakeup跨线程投递流程doPendingFunctors 的巧妙设计One Loop Per T…

2026/8/5 6:14:32 阅读更多 →

最新新闻

ShaderGraph反正切节点全解析:从数学原理到实战应用

ShaderGraph反正切节点全解析:从数学原理到实战应用

1. 项目概述:为什么ShaderGraph的反正切节点值得深挖? 在Unity ShaderGraph的众多数学节点里, 反正切节点(Arctangent Node) 和它的兄弟 Arctangent2 节点,可能是最容易被新手开发者忽略,但…

2026/8/6 6:57:06 阅读更多 →
Godot引擎中基于Gerstner波与GPU着色器的实时海洋模拟实现

Godot引擎中基于Gerstner波与GPU着色器的实时海洋模拟实现

1. 项目概述:从像素到波涛的挑战在游戏和交互式体验中,一片能让人信服的海洋,其价值远超一个漂亮的静态背景。它关乎沉浸感,关乎氛围,甚至关乎玩法本身。然而,实时模拟海洋的动态表面,尤其是那种…

2026/8/6 6:57:06 阅读更多 →
视频合成7大核心技能:从剪辑基础到专业调色全流程解析

视频合成7大核心技能:从剪辑基础到专业调色全流程解析

1. 项目概述:视频合成技能全景解析最近在整理项目素材和制作个人作品集时,我深刻感受到,无论是做产品演示、内容创作还是活动回顾,把多个视频片段流畅地合成一个完整作品,已经成了一项绕不开的基础能力。这不仅仅是简单…

2026/8/6 6:57:06 阅读更多 →
5分钟用BehaviorDesigner为Unity游戏AI搭建巡逻与战斗行为树

5分钟用BehaviorDesigner为Unity游戏AI搭建巡逻与战斗行为树

1. 项目概述:为什么选择BehaviorDesigner?如果你正在开发一款带有NPC敌人的游戏,无论是RPG、FPS还是塔防,一个最基础的需求就是让敌人“动起来”,比如在固定路线上巡逻,发现玩家后追击并攻击。这个需求听起…

2026/8/6 6:57:06 阅读更多 →
基于CLI与AgentSkill构建工业级AI影视解说自动化链路

基于CLI与AgentSkill构建工业级AI影视解说自动化链路

1. 项目概述:从手动剪辑到AI自动化流水线做影视解说内容的朋友,尤其是个人创作者或者小型工作室,最头疼的事情是什么?我干了十几年,从最早的论坛图文解说,到后来的视频剪辑,再到现在的全平台分发…

2026/8/6 6:57:06 阅读更多 →
I.MX6ULL SPI驱动:软件片选与硬件片选原理、配置与实战

I.MX6ULL SPI驱动:软件片选与硬件片选原理、配置与实战

1. 项目概述:深入理解SPI片选机制在嵌入式开发中,SPI(Serial Peripheral Interface)总线因其简单、高速、全双工的特性,成为连接Flash、传感器、显示屏等外设的首选。然而,很多开发者,尤其是刚接…

2026/8/6 6:56:06 阅读更多 →

日新闻

深入解析LimboAI C++内核:架构设计与性能优化实战

深入解析LimboAI C++内核:架构设计与性能优化实战

1. 项目概述:为什么我们需要深入LimboAI的C内核?如果你是一名使用Godot引擎的游戏开发者,尤其是对AI行为逻辑有较高要求的项目,那么LimboAI这个名字你大概率不会陌生。它作为Godot 4生态中一个备受瞩目的行为树与状态机插件&#…

2026/8/6 0:00:06 阅读更多 →
Unity 2D游戏敌人AI系统:基于PlayMaker状态机与2D Toolkit的实战开发

Unity 2D游戏敌人AI系统:基于PlayMaker状态机与2D Toolkit的实战开发

1. 项目概述与核心思路大家好,我是老张,一个在游戏开发一线摸爬滚打了十多年的老码农。今天咱们接着聊《空洞骑士》风格2D动作游戏的Demo制作。上一期我们搭好了基础框架,处理了角色移动和碰撞,这一期,我们要让游戏世界…

2026/8/6 0:00:06 阅读更多 →
被动防火门市场前景发展趋势

被动防火门市场前景发展趋势

被动防火门依靠材质结构、密闭构造阻隔烟火蔓延,无需电控启动,是建筑被动消防系统核心构件,行业依托新规管控、城市更新、工业安全升级迎来稳定扩容,整体朝着合规化、专项化、低碳化、智能化方向发展。现阶段 GB12955‑2024 新版国…

2026/8/6 0:00:06 阅读更多 →

周新闻

最大流算法详解:从水管网络到Ford-Fulkerson与Dinic实战

最大流算法详解:从水管网络到Ford-Fulkerson与Dinic实战

1. 从水管网络到最大流:一个核心问题的诞生想象一下,你是一个城市供水系统的总工程师。你的城市有多个水源(水库),需要通过一个复杂的地下管道网络,将水输送到各个居民区。每条管道都有其最大通水能力&…

2026/8/5 15:00:43 阅读更多 →
基于Springboot的企业门户网站(源码+LW+调试文档+讲解)

基于Springboot的企业门户网站(源码+LW+调试文档+讲解)

温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台…

2026/8/5 13:13:56 阅读更多 →
MATLAB xcorr函数详解:从互相关原理到四大实战应用

MATLAB xcorr函数详解:从互相关原理到四大实战应用

1. 从一次信号“找茬”说起:为什么我们需要互相关几年前,我在处理一组声学传感器数据时遇到了一个棘手的问题。我有两个麦克风记录了一段相同的音频信号,理论上它们接收到的声音波形应该非常相似,只是由于麦克风位置不同&#xff…

2026/8/5 10:20:36 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/5 23:28:39 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/5 21:00:14 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/5 23:46:51 阅读更多 →