大模型指令微调与LoRA实战:从数据构建到效果验收
简介一份介绍大模型指令微调概述的PPT课件面向自然语言处理与深度学习方向的学生、算法工程师及对大模型技术感兴趣的读者帮助系统理解大模型微调的基本概念与实现路径。资源以NLP四范式为主线梳理从传统机器学习到预训练Prompt的发展脉络并重点讲解指令微调的原理、好处、一般流程及指令数据集构建的两种方法同时引用相关研究文献便于延伸学习。资源包共1个pptx文件大小2.65MB结构紧凑适合直接用于学习或内部分享目前已有4243人学习下载。PPT中不仅给出大语言模型构建的预训练、有监督微调、奖励建模、强化学习四个阶段还具体说明了如何通过模板将文本-标签对转换为指令数据、如何借助LLM自动生成指令数据等实操方法可帮助初学者快速建立从NLP范式到指令微调的整体认知也为进一步研究大模型对齐技术打下基础。1. 指令微调不是重训模型为什么“听话”比“聪明”更值钱很多人第一次接触“大模型指令微调”时会有一个错觉微调就是让模型再学一批新知识把模型“变聪明”。但在实际项目里指令微调解决的是另一件事——让模型听懂指令、按格式输出、学会特定场景的说话方式。一个已经预训练好的大模型知识储备已经很充分但它不一定“听话”你问它问题它可能长篇大论、绕开重点、甚至自己编格式。指令微调做的事情就是拿一批“指令 期望回复”的数据把模型的行为习惯掰过来。这篇文章要讲的就是从数据构建、训练参数到评估验收的完整链路最后也会聊到怎么把这套内容整理成一份能直接拿去讲的技术分享 PPT。无论你是有算力资源打算自己做微调还是只想先跑通一个最小实验都可以照着后面的步骤来。2. 指令微调的核心机制SFT 的边界、LoRA 的适用面与数据决定的“上限”2.1 指令微调与大模型预训练、RLHF 的关系它解决哪一环要理解指令微调先得看它在整个大模型技术栈里的位置。预训练阶段模型在海量文本上做自回归学习目标是预测下一个 token这个阶段赋予模型语言能力和基础知识指令微调阶段通常被称作 SFTSupervised Fine-Tuning拿人工标注好的“指令-回复”对做有监督训练目标是让模型学会“用户问什么就按指令格式答什么”再往后还有 RLHF 或 DPO用人类偏好进一步对齐价值观和风格。实际项目里最常见的做法是“预训练 → SFT → 偏好对齐”三段式。SFT 解决的是“能力”和“行为”问题偏好对齐解决的是“偏好”问题。如果你的场景只是内部工具助手、垂直领域问答、结构化输出跑完 SFT 基本就能上线只有对回答的倾向性有严格要求时才需要叠加偏好对齐阶段。所以指令微调是性价比最高的一个环节数据构建成本远低于预训练训练时间也短得多。2.2 全参微调还是 LoRA取决于算力、数据量与场景做指令微调第一个要做的选择是全参微调Full Fine-Tuning还是参数高效微调PEFT而 LoRA 是 PEFT 里最主流的方法。全参微调把模型所有参数都更新效果上限最高但对显存和数据量的要求也高一个 7B 模型用全参 SFT单卡 80G 都可能捉襟见肘而且容易过拟合。LoRA 的思路是冻结基座模型只训练注入的低秩矩阵新增参数量通常只有基座模型的 0.5% 到 2%显存占用大幅下降训练速度也快得多。我一般的选型逻辑是看两个变量数据量和部署约束。如果手里的高质量指令数据在一两万条以内LoRA 几乎是首选如果数据量到了几十万条、且你的基座模型确实严重不适配目标领域才考虑全参微调。LoRA 的另一个好处是训练产物是“插件文件”基座模型文件不动。部署时可以动态加载多个 LoRA 适配器一个基座服务多个业务场景这个优势在生产环境里非常实用。2.3 为什么 LoRA 要冻结基座、只调低秩矩阵LoRA 的核心思想来自一个观察模型微调过程中权重更新的“内在维度”很低不需要在完整权重矩阵上做更新只需学习一个低秩分解。具体操作上对每个被选中的线性层冻结原来的 W额外引入两个小矩阵 A 和 B前向计算时把 BA 的乘积加到 W 的输出上。训练时只更新 A 和 B推理时再把 BA 合并回 W。这个设计的实际收益有三层第一显存占用和优化器状态大幅减少普通消费级显卡也能跑微调第二模型原有的预训练知识不会被大幅破坏训练稳定性比全参微调好很多第三多个 LoRA 适配器可插拔切换实验成本极低。实践中唯一要注意的是 target_modules 的选取——不是所有线性层都要加 LoRA。对大多数 7B 模型q_proj、k_proj、v_proj、o_proj 这四件套是默认选项如果做数学推理类任务建议加上门控网络相关模块否则模型学不住推理模式。对比维度全参微调LoRA 微调参数量更新比例100%约 0.5%-2%显存需求7B 模型约 60G约 16G-24G训练速度慢快 3-10 倍适配器可插拔支持支持适用数据量十万级以上千条到几万条模型通用知识保持一般较好表格里的显存数字不是绝对标准因为序列长度、batch size、是否开启梯度检查点都会影响实际占用。但它能反映一个趋势LoRA 把指令微调从“只有大团队才做得起”拉到了“单卡即可跑”的量级这也是它成为技术分享 PPT 里必讲章节的原因。3. 可复现的指令数据构建格式、数量与清洗脚本3.1 指令数据的最小格式从 Alpaca 到对话模板不管用什么框架做指令微调数据格式都绕不开 Alpaca 风格的“指令-输入-输出”三元组结构。最简形式是一个 JSON 对象包含 instruction指令、input上下文输入可为空、output期望输出。部分框架还要求加一个 system 字段用于描述角色设定。数据最终会被拼进对话模板变成模型实际看到的 token 序列。{ instruction: 将下面的句子翻译成英文, input: 今天天气真好我们出门散步吧。, output: The weather is nice today, lets go out for a walk. }{ instruction: 你是一名运维专家请根据日志判断故障原因, input: [ERROR] 10.0.0.2: connect timeout after 3000ms, output: 故障原因可能是目标主机未启动或防火墙拦截建议先检查目标端口连通性。 }第一条是最简单的“指令-输入-输出”映射第二条多了一个 system 角色设定让模型以特定专家身份回答。这个 system 字段在训练时会被拼到模板最前面模型会把它当作隐含约束来学习。如果你的业务场景有固定的角色设定务必在每一条数据中都带上 system 字段而不是只在某几条里加否则模型会学到“有时有角色、有时没角色”的混乱行为。3.2 基础数据量估算与筛选标准指令微调需要多少条数据这个问题没有绝对答案但有一个经验区间可以参考。如果任务是通用助手风格三千到一万条高质量数据就能看到明显的行为改变如果是垂直领域问答比如客服、运维、法律咨询建议准备一万条以上纯格式转换类任务比如从自由文本抽取结构化 JSON三千条以内就足够因为任务本身简单关键在格式一致性。真正决定效果的不是数量而是质量分布。一条数据里如果 output 占了十几个错误动作模型学到的就是错误的格式习惯。筛选数据时有几条硬标准第一output 必须是该任务场景下的“标准答案”不能有随意发挥第二指令和 output 之间必须有明确对应关系指令含糊但 output 精准的数据不要留第三重复度过高的数据会让训练集收敛特别快但泛化差建议按语义去重第四数据里必须覆盖“拒绝回答”的场景比如超出知识范围的问题模型需要学会说“不知道”而不是硬编。3.3 用脚本快速统计与清洗指令数据拿到一批原始数据后不要急着喂给模型先用脚本做一次体检。这个脚本会输出数据总量、指令长度分布、输出长度中位数、输入为空的比例等基础指标用来判断数据集是否畸形。比如输出长度全部超过 1000 字而任务只是短问答显然数据质量有问题。import json def inspect_dataset(path): with open(path, r, encodingutf-8) as f: data json.load(f) total len(data) empty_input 0 outputs [] instructions [] for item in data: if not item.get(input, ).strip(): empty_input 1 outputs.append(len(item[output])) instructions.append(len(item[instruction])) print(f总样本数: {total}) print(f无输入上下文样本数: {empty_input}占比 {empty_input / total:.1%}) print(f指令长度中位数: {sorted(instructions)[total // 2]}) print(f输出长度中位数: {sorted(outputs)[total // 2]}) print(f输出长度超过 800 字样本数: {sum(1 for x in outputs if x 800)}) if __name__ __main__: inspect_dataset(train_data.json)逻辑说明脚本读取 JSON 数组统计空输入样本、指令和输出的字长分布。输出长度中位数如果远高于任务应有的长度大概率是标注人员写成了“小作文”训练后模型会变得啰嗦。参数说明文件路径按实际位置替换即可如果是 JSONL 格式把 json.load 改成逐行读取。体检之后再做一轮去重和规则清洗就可以进入模板拼装环节了。拼装模板的代码同样值得放在脚本里统一处理不要把模板拼进 JSON 文本里存着那样重复占存储还容易改错。训练前用模板函数动态拼接后续切换基座模型只需换模板函数数据文件不用动。4. 把指令微调跑起来LoRA 训练脚本与参数调优4.1 最小可运行训练脚本LoRA 微调环境准备好之后训练脚本是整个链路的核心。这里给一份基于 PyTorch transformers peft 的最小可运行示例目标是把一个开源模型用 LoRA 在单卡上跑通指令微调。脚本刻意简化了验证逻辑把注意力集中在训练主流程上。from transformers import ( AutoTokenizer, AutoModelForCausalLM, TrainingArguments, DataCollatorForSeq2Seq, Trainer ) from peft import LoraConfig, get_peft_model, TaskType from datasets import load_dataset # 1. 加载基座模型和 tokenizer model_name /path/to/base_model tokenizer AutoTokenizer.from_pretrained(model_name) tokenizer.pad_token tokenizer.eos_token # 部分模型没有 pad_token # 2. 配置 LoRA lora_config LoraConfig( r16, # 低秩矩阵的秩越大表达力越强显存占用越高 lora_alpha32, # LoRA 缩放系数通常为 r 的 2 倍 target_modules[q_proj, k_proj, v_proj, o_proj], lora_dropout0.05, biasnone, task_typeTaskType.CAUSAL_LM ) model AutoModelForCausalLM.from_pretrained(model_name) model get_peft_model(model, lora_config) # 3. 数据加载与预处理 def format_chat(example): # 按模型对应的对话模板拼接此处以常见 chat 格式为例 text fs### 指令:\n{example[instruction]}\n\n### 输入:\n{example[input]}\n\n### 输出:\n{example[output]}/s return {text: text} def preprocess(example): enc tokenizer(example[text], truncationTrue, max_length1024) enc[labels] enc[input_ids].copy() return enc dataset load_dataset(json, data_filestrain_data.json, splittrain) dataset dataset.map(format_chat).map(preprocess).select_columns([input_ids, attention_mask, labels]) # 4. 配置训练参数并启动 training_args TrainingArguments( output_dir./lora_out, per_device_train_batch_size4, gradient_accumulation_steps8, learning_rate2e-4, warmup_ratio0.03, num_train_epochs3, logging_steps10, save_steps200, fp16True, # 不支持 fp16 的显卡改用 bf16 remove_unused_columnsFalse, ) trainer Trainer( modelmodel, argstraining_args, train_datasetdataset, data_collatorDataCollatorForSeq2Seq(tokenizer, paddingTrue), ) trainer.train() model.save_pretrained(./lora_adapter) tokenizer.save_pretrained(./lora_adapter)逻辑说明脚本先加载基座模型的 tokenizer 和权重然后用 peft 的 get_peft_model 把 LoRA 适配器套到模型上接着加载 JSON 数据按对话模板拼接成完整文本再 tokenizer 编码成 input_ids。labels 直接复制 input_ids表示每个位置都要预测下一个 token这是因果语言模型的标准做法。参数说明r 和 lora_alpha 是 LoRA 里最核心的两个超参。r 决定低秩矩阵的表达维度一般取 8 到 32lora_alpha 是缩放系数经验上设为 r 的两倍训练会更稳定。target_modules 列表需要对照模型实际的层命名修改不同模型的线性层名称不一样如果不确定可以用 model.named_modules() 打印后核对。fp16 开启后会加快训练速度训练结果需要留意是否有 loss 震荡。4.2 关键超参的含义与推荐区间超参设置是微调里最容易被玄学影响的部分但实际是有规律可循的。表格里摘出最关键的几个参数并给出一组经过多轮实验验证的推荐区间。说明一下这些数字对 7B-13B 模型有效更大的模型可能需要相应调低学习率。超参推荐区间调参方向常见误解learning_rate1e-5 到 3e-4数据少则偏小LoRA 可偏大全参微调经验直接套用lora_r8 到 32任务复杂取大简单取小r 越大不一定越好过大会过拟合lora_alphar 的 1 倍到 4 倍默认取 2 倍效果稳定单独调 alpha 不如先调 lrmax_seq_len512 到 2048按任务输出长度定设太长会浪费显存batch_size4 到 16显存不够就开梯度累积单卡 batch 越大收敛越稳num_train_epochs2 到 5看 loss 和验证效果超过 5 轮大概率过拟合学习率是调参优先级最高的一个。LoRA 微调的学习率一般比全参微调大一两个数量级但不能直接套用预训练阶段的 5e-5。我在实际项目里经常遇到有人把学习率设为 1e-4 后模型输出全是乱码降到 2e-4 左右反而稳定。这里的关键是观察训练 loss 曲线如果前 100 步 loss 快速下降后突然飙升大概率是学习率过大如果 loss 在 0.7 附近缓慢爬行则要适当加大学习率或增大 lora_r。4.3 训练过程的观察点loss 只是起点看输出才是关键训练开始后很多人盯着 loss 数值在那焦虑其实 loss 只反映模型对训练数据的拟合程度不直接代表推理质量。一个实践中非常有效的做法是每保存一次 checkpoint 就手动加载并跑两条验证指令看输出文本是否合理。到第三个 epoch 时如果模型输出开始变得机械重复、缺乏多样性基本可以断定已经开始过拟合这时可以提前终止训练而不是等它跑完。另一个容易被忽略的观察点是梯度的振荡情况。开启 fp16 后如果 loss 在每 10 步内出现超过 0.1 的波动优先检查是不是学习率过高其次检查数据里有没有 padding 不一致导致的部分样本长度异常。用 DataCollatorForSeq2Seq 统一 padding 后这类问题会明显减少。训练日志里还要关注 grad_norm 的变化正常情况下应该在 1 到 5 之间徘徊突然飙升到 20 以上说明某条数据极端异常需要把它找出来删掉否则后续训练会被带偏。5. 指令微调避坑记录五个高频翻车现场5.1 现象一loss 降了生成质量反而变差这是新手最容易困惑的问题。模型在训练集上 loss 一路走低但推理时输出要么答非所问要么重复套话。我去排查这类问题的时候第一个怀疑的就是数据质量——大概率是数据集里存在大量“指令与输出不对应”的样本。比如 output 里混进了几个跑题的回答模型在拟合这些错误映射时整体行为被带偏。解决手段是把训练 loss 下降曲线调出来看如果模型在训练集上都出现了大段重复就先检查数据里有没有大量以“好的”开头的空泛回复。把这些样本抽出来后验证集效果往往立刻改善。5.2 现象二出结果了但模型只会说一种话训练完毕模型对训练集里的指令回答得像模像样换一种提问方式就完全失灵。这个现象叫“指令过拟合”——模型记住了具体指令的措辞没学会指令背后的任务模式。我在一个模拟项目X里踩过这个坑训练数据里所有指令都是“请帮我写一封请假邮件”模型学会后改成“帮我草拟一封英文邮件”就直接懵了。解决办法是刻意在数据里对同一任务写多种指令表达至少 8 到 10 种不同措辞让模型学到“任务是任务措辞可变”的真规律。5.3 现象三中文输出丢字、标点缺失这个坑和 tokenizer 直接相关。很多开源模型的词表对中文字符是按单字拆分的如果训练时把 max_seq_len 设得偏小长输出的后半段被截断模型永远学不到完整的句尾标点。另一个原因是对话模板里少一个空格或换行导致分词错位标点符号被黏到上一个 token 上。排查时先打印 tokenizer 编码后的 input_ids看看句尾到 eos_token 之间有没有异常再检查模板函数里每段之间是否按官方模板要求补了换行。这类问题技术含量不高但特别影响最终效果观感。5.4 现象四LoRA 没有真正生效有几次训练跑完了loss 也降了但基座模型和微调后的模型输出几乎完全一致。检查后发现是 target_modules 设错了LoRA 加在了模型没有作用到的层上比如模型里根本没有名为 q_proj 的层。不同模型家族对这些核心模块命名不同有的叫 qkv_proj有的叫 attention.wq。正确做法是先用脚本打印所有线性层名再对照匹配确保 LoRA 真正作用在注意力机制和全连接层上。我在实际项目里也见过加了 LoRA 但没调用 get_peft_model 的这种低级错误通常靠检查模型可训练参数数量就能很快定位。5.5 现象五验证集效果好上线后一塌糊涂训练时抽了一些验证集跑分很满意一进生产环境就崩。问题往往出在数据分布错位训练数据刻意把每个指令的目标输出写得比较完整但线上用户的真实输入是口语化且简短的问题。为了规避这个坑我习惯在训练集里掺杂大概 10% 的“简写指令”和“不完整输入”让模型提前见过低信息量的提问方式。另一个生产环境的隐性问题是对话历史长度超长训练时 max_seq_len 只有 1024上线时用户粘贴了大段上下文模型直接截断。这个要在数据构建阶段就把 max_seq_len 往上线场景靠而不是训练完再妥协。6. 验证效果与进阶路线评测集、DPO 与汇报页的组织逻辑指令微调做完怎么判断“可以上线了”我的做法是准备三份评测集第一份是训练数据里留出的同分布验证集衡量基本拟合能力第二份是换个措辞改写后的等价指令集衡量泛化能力第三份是从线上日志抽出的真实用户问题衡量场景匹配度。评分方式不搞复杂直接人工打分按“完全正确、部分正确、不相关、乱答”四档打标。重点关注“乱答”比例如果能压到 5% 以内就具备上线条件高于 15% 就要回头找数据或训练参数的问题。进阶方向上LoRA SFT 只是第一步。如果模型存在明显的偏好偏差比如医疗问答总是推荐过度治疗下一步可以在这个 LoRA 基础上继续做 DPO。值得注意的是DPO 仍可复用同一个适配器文件只需要准备偏好对数据chosen 和 rejected训练目标变成让模型学习“哪个答案更符合人类偏好”。我通常会建议先检查 SFT 阶段是否已经把基础行为学对了再考虑 DPO——SFT 质量差直接上 DPO 就是沙地起高楼。如果你要把整个探索过程整理成一份技术分享 PPT章节结构建议按“为什么做指令微调 → 数据怎么构造 → LoRA 原理与训练配置 → 效果对比与坑点”四个部分展开。每一页放一个关键表格或 loss 曲线截图比堆文字有效得多。我自己的习惯是每一页只回答三个问题中的一个这是什么、我遇到了什么、我是怎么解决的。这样无论是给团队内部同步还是对外分享听众都能抓住主线。指令微调做到后期越来越体会到它是一门“数据工程”大于“模型工程”的活儿。模型架构和训练框架都是现成的真正拉开差距的是你对业务的理解和数据质量的把关。我在这条路上翻过不少车从数据脏乱导致模型学歪到 LoRA 参数没生效白跑一轮实验每次都靠回归到“先检查数据、再检查参数”来止血。希望这篇文章能帮你把该踩的坑提前绕开用好指令微调这把钥匙。本文还有配套的精品资源点击获取

相关新闻

PowerPoint VBA抽奖系统:纯宏驱动的离线滚动抽人方案

PowerPoint VBA抽奖系统:纯宏驱动的离线滚动抽人方案

简介:这是一份专为活动主持人、教师及企业培训师设计的PPT内嵌式抽奖工具,解决现场互动环节中手动抽签效率低、缺乏悬念感的问题。资源为单个51KB的PPT文件,内含完整VBA宏代码,支持在PowerPoint演示文稿中直接运行名单随机抽取功能…

2026/10/11 10:19:08 阅读更多 →
华为云云容器引擎 CCE:用户驱动体验升级(听劝版)

华为云云容器引擎 CCE:用户驱动体验升级(听劝版)

最好的产品,诞生于用户的每一次点击与反馈。华为云云容器引擎 CCE 近期围绕大家反馈的远程登录、日志体验等方向进行了专项优化,欢迎体验:https://www.huaweicloud.com/product/cce.html 诚邀您对云容器引擎 CCE 使用满意度进行评价&#xff…

2026/10/11 10:19:08 阅读更多 →
SpringBoot+Vue构建本科生交流培养管理平台:设计与实践

SpringBoot+Vue构建本科生交流培养管理平台:设计与实践

1. 项目背景与需求拆解1.1 本科生培养管理中的真实痛点带过本科生的老师都有体会,光靠课堂和邮件做培养管理,简直就是一场灾难。学生交上来的周报散落在微信聊天记录里,导师评语写在纸质本上,到了期末想统计这个学期指导了多少次、…

2026/10/11 10:18:07 阅读更多 →

最新新闻

酒店管理系统毕设:房态流转、数据库设计与Spring Boot实战

酒店管理系统毕设:房态流转、数据库设计与Spring Boot实战

简介:这是一套面向Java毕业设计场景的酒店管理系统完整资料包,涵盖毕业设计论文、答辩PPT、源代码、数据库及讲解视频,主要帮助计算机类专业学生解决系统开发、毕业论文撰写和答辩准备等环节的实际问题。压缩包共13个文件,包含3个…

2026/10/11 13:04:46 阅读更多 →
用Python从零开发轻量停车管理系统:入场计费与GUI实战

用Python从零开发轻量停车管理系统:入场计费与GUI实战

上个月帮一个朋友收拾小区停车场的烂摊子,他们的登记方式还停留在一本纸质记录本加一个计算器的阶段:进场时手写车牌和入场时间,出场时翻遍整本本子找记录、算费用。高峰期出口堵成一团,保安一边对着单据皱眉,一边跟车…

2026/10/11 13:04:46 阅读更多 →
免root下的五层执行隔离:OpenClaw on Android 安全架构完全解读(SELinux、应用沙箱与版本锁定)

免root下的五层执行隔离:OpenClaw on Android 安全架构完全解读(SELinux、应用沙箱与版本锁定)

移动开发AI 应用CLI开发工具 【免费下载链接】openclaw-android Run OpenClaw on Android with a single command — no proot, no Linux 项目地址: https://gitcode.com/gh_mirrors/op/openclaw-android 点击查看 免费下载 OpenClaw on Android 让你免 root 在安卓…

2026/10/11 13:04:46 阅读更多 →
TSN网络离线规划器OpenPlanner:从约束建模到GCL下发

TSN网络离线规划器OpenPlanner:从约束建模到GCL下发

简介:OpenPlanner是一个开源TSN规划器,面向工业物联网、自动驾驶、远程医疗等低时延高可靠场景的工程师与研究者,核心价值在于通过调度算法为时间敏感网络提供确定性传输规划。资源包共217个文件,以91个Python脚本与87个JSON配置为…

2026/10/11 13:04:46 阅读更多 →
NMODBUS 实战:C# 实现 Modbus TCP 主站与从站模拟

NMODBUS 实战:C# 实现 Modbus TCP 主站与从站模拟

简介:NMODBUS.zip 是一套面向 C# 开发者的 MODBUS TCP/IP 通信库资源,适合刚接触工业自动化协议、需要快速与 PLC 建立数据交互的新手与中级开发者。它封装了 ModbusTcpMaster 等核心类,提供读写保持寄存器、线圈以及数据转换、异常处理等常用…

2026/10/11 13:04:46 阅读更多 →
为什么iwe拒绝规定笔记结构?揭秘文本图管理工具的3条设计原则

为什么iwe拒绝规定笔记结构?揭秘文本图管理工具的3条设计原则

人工智能Agent 记忆MCP 服务CLI知识管理开发工具 【免费下载链接】iwe Markdown knowledge graph — LSP for your editor, CLI MCP memory for your AI agents 项目地址: https://gitcode.com/gh_mirrors/iw/iwe 点击查看 免费下载 🤔 用过不少笔记工…

2026/10/11 13:03:46 阅读更多 →

日新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/11 0:00:27 阅读更多 →

周新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/11 0:00:27 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 10:45:37 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/9 21:32:20 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/10 10:38:42 阅读更多 →