课堂实录NLP落地指南:从数据清洗到教学行为模式挖掘
简介《DeepSeek教学反思支持方案基于NLP文本分析的课堂实录自动标注与教学行为模式挖掘》全文535页、共56个章节是面向教研人员、教育技术研究者与一线教师的技术参考手册适合需要借助NLP工具开展课堂观察与教学反思的读者。资源系统讲解DeepSeek-NLP在课堂实录清洗、分词定制、词性标注、命名实体识别、教学行为边界界定、数据增强与标注体系设计等环节的落地方法配有Kappa一致性校验、模型适配改造等实践策略目录支持快速跳转与书签大纲浏览便于按章节检索与精读。资源包共1个PDF文件大小15.28MB已有117人学习下载。读者既能借助完整章节结构梳理全流程技术路线也可直接参考其中的标注规范与调优经验服务于后续教学行为挖掘与反思改进实践。1. DeepSeek教学反思支持方案535页到底能解决什么问题教师写教学反思靠课后回忆教研员评价课堂靠观感印象这两件事长期停留在定性层面。这份资源是一套基于 DeepSeek-NLP 文本分析的课堂实录自动标注与教学行为模式挖掘方案不是论文也不是纯代码库而是把「数据采集清洗 → 分词与标注 → 模型微调 → 行为模式挖掘 → 反思报告生成」整条链路拆成 56 章 535 页的落地文档。它解决的是教学反思数字化里最具体的三个问题多源课堂实录文本怎么标准化、教学行为怎么定义边界并自动标注、行为模式怎么量化成可执行的教研结论。适合正在做教育 NLP 落地、需要标注体系设计参考或者想用大模型给教研提供数据支撑的工程师和教研团队。2. 课堂实录数据预处理清洗、归一化与定制化分词的完整链路先立一个观点课堂实录不是「正常的文本」而是口语化、碎片化、带大量噪声的非结构化文本。把音频转写结果直接扔进通用 NLP 流程后面每一步都会翻车。文档第 3 到第 7 章花了大篇幅处理这件事核心链路是采集校验 → 清洗 → 归一化 → 定制分词 → 停用词过滤每一步都有明确的验收标准。2.1 多源课堂实录的噪声特征与清洗策略课堂实录的噪声来源主要有三类语音转写带来的语气词和重复「嗯」「然后然后」、手写笔记 OCR 产生的错字与断句错误、教研平台导出时的格式混乱空格、换行不统一。文档的清洗策略不是「一刀切把东西都删掉」而是分类处理。语气词直接正则过滤重复词缩并格式类问题统一规范化。import re # 课堂实录常见口语噪声语气词、重复字词、多余空白 noise_patterns [ (r嗯|呃|啊, ), # 语气填充词 (r(\S)\1{2,}, r\1), # 连续重复字词保留一个 (r然后然后|就是就是, 然后), (r\s{2,}, ), # 空白符归一 ] def clean_transcript(text: str) - str: for pattern, repl in noise_patterns: text re.sub(pattern, repl, text) return text.strip()这个规则有两个值得注意的点。第一是顺序重复词缩并必须放在语气词过滤之后否则「啊啊啊」先缩成「啊」再被语气词规则清掉顺序反了会漏。第二是重复阈值{2,}不是死的英语课实录里「OK OK」这种教师口头禅不能缩需要按学科配置白名单。文档里把这类清洗策略设计成了可配置规则包不同学科加载不同配置而不是写死在代码里。清洗落到工程上还有一个常被忽略的环节清洗前后的对比抽检。文档第 4 章明确要求每次清洗后随机抽 5% 的文本人工比对确认「过度清洗」——比如把教师的提问句砍成了祈使句——才允许进入下一环。这一步看着琐碎实际是防止清洗规则越调越激进的关键闸门。注意清洗只做「噪声过滤」不做「语义改写」避免把教师的提问句改没了。2.2 音频转写与手写实录的归一化处理清洗做完紧接着要解决异构性问题。同样一份课堂实录音频转写平台输出的是「Speaker 0 / Speaker 1」带时间戳的分行文本手写笔记 OCR 出来是没标点的流水账段落教研平台导出又是另一种格式。多路数据进同一套 pipeline必须先归一。文档第 5 章给出的归一化标准可以浓缩成一张表归一化项音频转写文本现状手写实录现状统一标准说话人标记Speaker 0 / Speaker 1无标记 / 「师」「生」混杂统一为 T: 教师 / S: 学生标点符号无标点或半角标点全角/半角混用统一全角句读句末必须有标点分段规则按语音停顿断行按自然段按教学环节分段重复内容转写重复句无保留一次说话人标记的归一化是后面所有分析的地基代码层面就是一次映射替换def normalize_speaker(text: str) - str: # 把各类说话人标记统一成 T: / S:方便后续行为序列分析 mapping {教师: T, 老师: T, Speaker 0: T, 学生: S, Speaker 1: S} for raw, target in mapping.items(): text re.sub(rf{raw}\s*[:], f{target}:, text) return text这里的坑在于「老师」不一定指教师本人。课堂实录里「老师说……」可能是学生在转述也可能是旁白。文档的做法是只对行首的说话人标记做归一化正文里出现的「老师」不动留给后面的 NER 去判断。归一化阶段过度处理会把信息提前丢掉这是文档反复强调的边界。归一化做完整批数据的一致性校验也得跟上。文档第 5.5 章的做法是抽检归一化后的文本重点核对说话人标记比例是否合理——正常课堂教师话语量占比在 60% 到 70%如果一批实录里 S 标记明显多于 T大概率是映射规则出了问题。这一条规则虽然简单但在批量处理几百份实录时能提前拦截格式问题。2.3 定制化分词与教学停用词表分词是课堂实录处理里最能体现「通用 NLP 直接迁移会翻车」的环节。通用分词器遇到「提问行为」「小组讨论」「师生互动」这类教学术语经常切成「提问/行为」「小组/讨论」语义完整性和后面的实体识别全被打乱。文档第 6 章的核心做法是给 DeepSeek-NLP 分词模块注入教学领域自定义词典用词典权重控制最长匹配优先级。from deepseek_nlp import Tokenizer # 教学领域词典数字代表匹配优先级越大越优先 custom_dict { 提问行为: 10, 小组讨论: 10, 师生互动: 10, 新授环节: 8, 巩固练习: 8, } tokenizer Tokenizer(user_dictcustom_dict) tokens tokenizer.cut(教师在提问行为后进入小组讨论环节)注入词典的逻辑说明通用词典对领域术语没概念cut会把「提问行为」拦腰切断导致后续词性标注和 NER 拿不到完整语义单元。权重值的含义是最长匹配时的优先级领域术语权重必须高于通用词否则长词会被通用短词抢占。这个词典不是一次性建完文档第 8 章专门讲了动态更新机制新教案、新学科术语出现时要能增量补充而不是全量重训。停用词表的构建方向跟很多人的直觉相反。通用 NLP 里停用词表是「删得越多越好」但课堂实录场景下「请」「回答」「思考」这类词在通用停用词表里可能被过滤掉它们在课堂实录里恰恰是教学行为的关键信号——「请」是教师指令行为的标志词「回答」是学生应答行为的上下文。文档第 7 章把停用词表拆成两级通用停用词层加教学保留词层过滤优先级是「保留词 停用词」先判断是否命中保留词再决定是否过滤。这套两级结构是教学场景语义保留的核心策略。分词和停用词处理完验收标准是「教学术语不被切碎、行为信号词不被删掉」。文档给的验收方式很朴素拿 10 份已标注实录跑一遍 pipeline检查分词后的术语完整率和停用词过滤后的行为词保留率。这两项指标不过关不进下一环节。3. 教学行为标注体系实体边界、维度拆解与样本均衡手段数据预处理完真正决定整个方案上限的是标注体系。课堂实录自动标注不是简单的文本分类而是要把「谁在什么时候做了什么、属于哪个教学环节」拆成结构化数据这一步的粒度设计直接决定后面模式挖掘能挖出什么。3.1 教师行为、学生行为、互动行为的边界界定文档第 12 章把教学行为实体分成三大类教师行为、学生行为、互动行为。分类本身不难难在边界。「学生回答后教师追问」到底算教师行为还是互动行为文档定的判定原则是看是否形成「有来有往」的对话对——单一动作归行为类完整问答对归互动类。边界规则可以整理成这样实体类型定义边界典型示例排除项教师行为教师单方面发出的动作「教师讲解作者生平」自问自答后无学生回应学生行为学生单方面发出的动作「学生朗读课文第二段」学生在教师追问驱动下的回应互动行为至少一个完整问答对师问→生答→师反馈教师连续讲授 5 分钟以上边界模糊时按优先级裁决互动行为 教师行为 学生行为。理由是互动行为携带的教学信息量最高宁可把它标成互动也不拆成两个孤立行为。文档还把三类行为的细粒度子类做了编码「教师提问-课堂管理」和「教师提问-理解检测」是两个不同的标注结果这种粒度差异在后面的认知层次分析里非常关键。标注结果的质量校验同样不能省。文档第 12.6 章的做法是每完成 500 条标注随机抽 50 条由第二个标注员独立复核重点看不一致集中在哪类实体。如果错误集中在互动行为的判定上说明规则手册的例子还不够需要补典型样例。3.2 四个标注维度的拆解与编码设计行为实体回答的是「谁做了什么」要支持教学反思还得知道「做得怎么样」。文档第 17 章建立了四个平行标注维度认知层次、互动类型、语言风格、教学环节。每个行为实体都要挂上这四组标签组合起来形成结构化编码。维度可取值标注示例认知层次记忆/理解/应用/分析/评价/创造「谁能背一下乘法口诀」→记忆互动类型师生问答/生生讨论/小组展示/独立练习「四人小组讨论一下」→生生讨论语言风格指令性/鼓励性/讲解性/提问性「你的思路很清晰很棒」→鼓励性教学环节导入/新授/巩固/小结/作业布置课堂前 3 分钟内容 → 导入编码设计的核心是保证可计算性。文档给了一套「行为_对象_维度_取值」的结构化编码比如T-P-C-记忆表示「教师提问认知层次为记忆」S-A-I-师生问答表示「学生应答互动类型为师生问答」。这套编码直接对接后面的关联规则挖掘和序列模式挖掘算法层不需要再解析自然语言标签省掉一整个中间转换环节。多维度标注必然产生冲突文档的处理机制是「先维度独立标注再融合裁决」。比如一个标注员把某句标成「教师提问-理解层次」另一个标成「教师提问-应用层次」这类冲突不靠模型解决而是靠标注规则手册里的判定示例兜底示例之外的情况进入人工复核接口。这个闭环设计在工程上很实用不是追求所有冲突自动消解。3.3 同义词替换与句级重组解决样本不均衡课堂实录的样本分布极度不均衡新授环节的「教师讲解」可能占全部样本的 60% 以上而导入环节的「学生回答」可能不到 5%。模型在这种分布上训练对高频类别过拟合是必然的。文档的思路不是简单粗暴做数据增强而是先量化不均衡度、设定增强目标再按类别针对性增强。同义词替换是文档重点讲的第一类方法教学领域词表驱动import random # 教学领域同义词表精简示例 synonym_map { 讲解: [讲授, 阐述, 说明], 提问: [发问, 询问, 追问], 讨论: [交流, 探讨, 研讨], } def synonym_augment(text: str, p: float 0.3) - str: words text.split() new_words [] for w in words: if w in synonym_map and random.random() p: new_words.append(random.choice(synonym_map[w])) else: new_words.append(w) return .join(new_words)参数p是每个词的替换概率文档建议控制在 0.2 到 0.3过高会让语义失真。替换后必须抽检「提问」换成「追问」在时序语义上其实已经变了同一份增强数据喂进模型会把边界样本搞得更模糊。第二类方法是句级重组只做长句拆短句不做语序调整目的是给模型提供更多短句样本同时保持语义完整。这两种方法配合降采样把占比过高的「教师讲解」压下来整体类别分布才能拉平。增强之外还有一个降成本的思路是弱监督标注。文档第 20 章的做法是用小规模人工标注数据训练一个 seed 模型让它先跑一遍粗标人工只复核低置信度样本而不是从零标起。实测下来标注成本能降一半以上代价是规则设计初期投入高适合标注预算有限的团队。4. 模型训练与微调适配损失函数定制、优化器协同与过拟合抑制标注数据就位后进入模型训练环节。文档第 22 到第 35 章覆盖了从环境搭建、损失函数、优化器到微调策略的完整流程方案没有照搬通用 NLP 训练范式而是针对教学行为分类的三个特性做了适配类别不均衡、边界模糊、层级关联。4.1 教学行为分类的损失函数定制思路通用分类任务通常一个交叉熵损失就够教学行为分类不行。「讲解」类样本占大头「提问」「评价」类样本稀缺交叉熵会把高频类学得越来越好、低频类越来越差。文档第 24 章给出的解法是混合损失设计基础交叉熵保底再叠两个定制项层级感知损失和模糊感知损失。层级感知损失针对的是认知层次这类有序类别。记忆、理解、应用、分析这些层次之间有远近关系模型把「理解」错分成「应用」和错分成「创造」错的严重程度不一样。普通交叉熵不关心这种距离层级感知损失会把相邻层级的错分惩罚降低、跨级错分惩罚升高让模型学到层级结构。模糊感知损失针对的是标注边界模糊的样本比如某个句子在「提问」和「追问」之间标注员都拿不准这类样本的 loss 权重被自动调低避免模型被边界样本带偏。两个定制项和基础 CE 的权重配比文档给的参考值是 0.7 / 0.15 / 0.15实际项目里先用默认值跑 baseline再按验证集 F1 调整。损失函数这块很容易过度设计文档的提醒是「先跑通再调优」。第一版直接上混合损失翻车了根本分不清是哪个组件出了问题。我的习惯是先只用 CE 跑一轮拿到基线再逐个加定制项每加一个看一次 F1 变化虽然慢一点但每一步都心里有数。4.2 AdamW 与 Batch Size、学习率的协同调整优化器和学习率策略文档给的标准答案是 AdamW warmup 余弦退火。课堂教学文本有个实际约束句子长度差异极大一个指令短句可能只有 6 个字一段学生陈述可能有 200 字。固定 batch size 意味着 padding 浪费严重显存被没有信息的 pad token 占掉大半。文档的建议是「按长度分桶」把长度相近的样本分到同一个 batch而不是随机打乱。from torch.optim import AdamW from transformers import get_cosine_schedule_with_warmup # 教学文本任务建议小数据量用小 lrwarmup 占 10% optimizer AdamW(model.parameters(), lr2e-5, weight_decay0.01) scheduler get_cosine_schedule_with_warmup( optimizer, num_warmup_stepsint(total_steps * 0.1), num_training_stepstotal_steps, )参数选择的逻辑weight_decay0.01是 AdamW 的通用推荐值教学文本数据量通常不大不需要把正则加得太狠lr2e-5比通用任务的 5e-5 保守一个量级因为微调数据只有几百到几千条时大学习率很容易把预训练权重冲坏。warmup 的作用是先让优化器适应数据分布再进入正常学习阶段10% 的占比对小数据集够用。多卡训练时文档建议用梯度累积替代加大 batch而不是直接调大 batch size这样既保住模型效果又避开显存上限。Batch Size 这块有点玄学但大方向是明确的单卡 16 到 32 起步文本长度差异大的数据集优先分桶而不是增 batch。4.3 LoRA 微调与增量/全量微调的选择文档第 30、32 章把微调策略对比得很清楚三条路线对应不同资源条件微调方式可训练参数占比数据量要求适用场景LoRA0.1%–1%千级样本单卡、快速迭代、显存有限增量微调仅新增分类头百级样本标注冷启动、类别体系已定全量微调100%万级样本算力充足、数据覆盖全面LoRA 是文档推荐的首选路线rank 值建议 8 到 16代码层面就是peft配置里改r和lora_alpha两个参数。增量微调适合标注数据极少的冷启动阶段冻结 base 模型权重只训练新增的教学行为分类头几百条标注数据就能跑起来缺点是模型对教学语义的理解没有真正深入。全量微调只在标注数据达到万级、且覆盖多学科多学段时才建议尝试否则大概率把预训练学到的东西冲掉。这里容易被忽略的是微调数据集的筛选文档第 31 章专门讲了「高价值课堂实录样本」的定义覆盖多个教学环节、包含多轮师生问答、标注置信度高。筛选比调参更能涨点把低价值的重复样本剔除用高质量样本微调效果往往好过在全部数据上训练。文档里给的实验对比是同样 2000 条数据筛选后的训练集比随机训练集在低频类别上 F1 高出 5 到 8 个百分点。5. 课堂实录 NLP 落地避坑五个高频问题排查记录文档第 19、35、54 等章节分散记录了大量异常处理经验这里把课堂实录 NLP 落地时最容易踩的五个坑集中整理成排查记录每条都是「现象 → 原因 → 解决」的完整链路。5.1 NER 把「老师」识别成普通名词现象NER 模型跑完课堂实录里大量「老师」被标成普通名词而不是教学角色实体后续「教师行为」提取直接缺了主体。原因通用 NER 的训练语料里「老师」就是职业名词模型没有教学场景下的角色语义。课堂实录里「老师」有时是称呼「老师好」有时是行为主体「老师说……」上下文角色完全不同通用模型分不出来。解决自定义 NER 实体体系不复用通用的per/loc/org类型单独定义teacher_role、student_role实体用已经标注好的课堂数据微调 NER 模型。角色实体和行为实体分开标不要混在同一套标签里。5.2 Kappa 系数只有 0.5标注员却认为没问题现象两轮标注一致性校验算出来 Kappa 系数只有 0.5 左右低于文档建议的 0.7 阈值但标注员复核后坚持自己的标注是对的两边僵住。原因标注规则手册里「互动行为」的边界定义是定性描述「有来有往的对话」没有量化标准。你觉得「教师问、学生答、教师反馈」算互动标注员觉得「教师连问两个问题才算互动」一致性自然上不去。解决把边界定义改成可执行的量化标准——「互动行为 至少一个完整问答对T 提问 → S 回答 → T 反馈」并在规则手册里补充典型和非典型示例各 5 条。Kappa 低于阈值时的第一反应不是说服标注员而是检查规则手册是不是太模糊。5.3 微调后 F1 比 base 模型还低现象用全部标注数据做了一轮全量微调验证集 F1 不升反降尤其低频类别「评价行为」几乎不识别了。原因课堂实录标注数据只有几百条到几千条全量微调把所有预训练权重都放开更新小数据量撑不住这么大的参数变动空间模型记住了训练集的噪声泛化能力反而下降。解决切到 LoRA 或增量微调只更新一小部分参数学习率再降一个量级从 2e-5 调到 5e-6 起步。文档的经验是教学场景下先跑 LoRAF1 不满意再考虑逐步放开参数。5.4 批量标注时 GPU 利用率低任务排队越来越长现象批量处理几百份课堂实录GPU 利用率只有 30% 左右任务队列越积越长单条标注延迟从 2 秒变成了 30 秒。原因固定 batch size 加长文本 padding大量算力浪费在空 pad token 上。一份实录里既有 10 字的短句也有 200 字的长段固定 batch 意味着每个 batch 都要按最长样本补齐短样本多的 batch 浪费尤其严重。解决按文本长度分桶短样本进小 batch长样本进大 batch再配合动态 batching 让每个 batch 的 padding 占比降到最低。吞吐量通常能翻一倍以上。5.5 Apriori 挖出的序列全是「教师提问 → 学生回答」这种废话现象序列模式挖掘跑完top 序列全是「教师讲解 → 教师提问 → 学生回答」这类高频常识看不出任何教学改进价值。原因支持度阈值设太低高频常规行为被大量挖出来挖掘时没有分层所有教学环节混在一起导致各环节的差异化模式被高频样本淹没。解决按教学环节分组挖掘导入、新授、巩固分别跑 Apriori同时把置信度阈值往上提重点关注「导入环节高支持度且巩固环节低支持度」这类对比差异序列才有教研价值。文档原话是「挖差异而不是挖常识」。6. 进阶技巧蒸馏温度调参与行为序列验证闭环6.1 蒸馏温度与权重系数的调参路径模型蒸馏在课堂实录场景里的意义很实际一个几百亿参数的大模型部署到学校机房不现实教学反思场景需要的是单条实录秒级响应。文档第 37 章把蒸馏的关键参数拆成两个温度 T 和权重系数 α。温度控制软标签的平滑程度T 太低软标签跟硬标签几乎一样蒸馏学不到教师模型的「不确定性知识」T 太高会把噪声平滑进来学生模型学到一堆没用的细节。教学行为分类任务从 T3 起步比较稳文本规模越大、类别边界越模糊T 可以适当上调。权重系数 α 平衡语义蒸馏损失和行为分类损失语义损失占比低了学生模型学到的是「标签」高了学到的是「语义」文档建议 α 取 0.7 左右。调参顺序固定为「先确定 T 再动 α」两个参数一起调翻车了根本分不清是谁的问题。6.2 用行为序列对比验证模式挖掘结果模式挖掘跑出结果下一步不是直接写结论而是验证它是不是稳定规律。我的习惯做法是同一份课堂实录跑两轮独立标注用同一组 Apriori 参数分别挖掘比较两次输出的序列集合是否稳定。如果同一序列在两个标注版本里支持度差距超过 15%说明标注一致性有问题优先回头查标注规则而不是调算法参数。另一个验证思路是分组对比把高效课堂和普通课堂按导入、新授、巩固分段挖序列。我自己跑过的案例里高效课堂在导入环节的「提问 → 等待 → 回答 → 反馈」序列支持度明显高于普通课堂而普通课堂高频的是「讲解 → 提问 → 点名 → 回答」后者丢失了「等待」和「反馈」两个关键动作这个差异对教研员有直接的参考价值。想少踩这些坑直接拿这份 535 页的完整方案对照着做就行文档里每个环节都有验收标准和异常处理流程下载后先翻第 19 章和第 54 章再动手。我前后把这份方案翻了不下三遍最值钱的部分不是某个算法实现而是里面那些教科书不写、真正跑项目才能遇到的坑。从那以后我每次跑课堂实录 NLP 项目都强制把标注一致性校验放在模型训练之前Kappa 过不了 0.7 就不进模型环节。这套操作帮我少走了不少弯路希望帮到你。本文还有配套的精品资源点击获取

相关新闻

Mirror Particle:行为粒子建模与动态势能场分析框架

Mirror Particle:行为粒子建模与动态势能场分析框架

1. “Mirror Particle”不是新APP,而是一次对行为建模范式的悄然重写“Mirror Particle 正在构建人类行为的‘世界模型’”——这句话乍看像某家科技公司的新闻稿标题,带着点科幻感和宏大叙事的味道。但如果你最近翻过几篇前沿AI行为建模的预印本&#x…

2026/10/9 3:18:04 阅读更多 →
Agentic工程实践:从Copilot到自主决策系统的核心设计

Agentic工程实践:从Copilot到自主决策系统的核心设计

1. 先搞清楚:Agentic 工程到底在解决什么问题1.1 从 Copilot 到 Agent 的范式转变过去两年 AI 应用的主流做法是“对话式 AI”——用户提问,模型回答。这套模式在客服、内容生成、知识问答这些场景里够用,但一旦涉及“要完成一件完整的事”&a…

2026/10/9 3:18:04 阅读更多 →
HTTP报文格式详解:从请求行到响应体,掌握网络排错基本功

HTTP报文格式详解:从请求行到响应体,掌握网络排错基本功

1. 为什么搞懂HTTP报文格式,能救你于水火做开发这些年,我发现一个规律:凡是跟HTTP打交道的老哥,十个里有八个都被报文格式坑过。比如开屏就是error response from daemon: get "https://registry-1.docker.io/v2/": net…

2026/10/9 3:18:04 阅读更多 →

最新新闻

论文降重工具怎么选?从查重原理到实战流程全解析

论文降重工具怎么选?从查重原理到实战流程全解析

经常有师弟师妹拿着大篇幅标红的查重报告来找我,第一句话就是:“师兄,用什么工具能一夜之间把重复率降下去?”说实话,每次听到这种问题我都想把“一夜之间”四个字划掉。降重不是体力活,也不是无脑堆工具就…

2026/10/9 3:55:26 阅读更多 →
HeidiSQL 12.10 一个窗口管五种数据库:连接配置、跨库直导与高频功能速查

HeidiSQL 12.10 一个窗口管五种数据库:连接配置、跨库直导与高频功能速查

HeidiSQL 12.10 一个窗口管五种数据库:连接配置、跨库直导与高频功能速查 一、绿色便携,U 盘即用 HeidiSQL 是老牌开源数据库图形客户端(GPL-2.0):MySQL/MariaDB/PostgreSQL/MS SQL/SQLite 五种数据库一个界面管。官方…

2026/10/9 3:55:26 阅读更多 →
低频量化周报:风险溢价比、可转债配债与双低轮动实操复盘

低频量化周报:风险溢价比、可转债配债与双低轮动实操复盘

每周五收盘之后,我都会固定花半个小时左右,把低频量化周报对应的那几张表更新一遍:指数风险溢价比、可转债配债数据集、双低轮动清单、股东福利记录,最后再写一段本周交易总结。这周更新完发现,指数风险溢价比已经连续…

2026/10/9 3:55:26 阅读更多 →
Agent-Reach:为AI智能体打造稳定可控的资源触达中间层

Agent-Reach:为AI智能体打造稳定可控的资源触达中间层

最近半年,我把主要精力都压在一个内部项目上,项目代号叫Agent-Reach。用一句话概括,它要解决的问题只有一个:让 AI 智能体稳定、安全、可控地“触达”执行任务所需的一切资源——内部 API、数据库里的工单、审批流、邮件、文件签名…

2026/10/9 3:55:26 阅读更多 →
基于小波纹理特征的图像检索实现:Matlab代码与调参实战

基于小波纹理特征的图像检索实现:Matlab代码与调参实战

图像检索这些年一直都是计算机视觉里的老话题,但真正落地的时候,很多人会卡在一个点上:怎么把"图像长什么样"变成一组能算距离的数字。深度学习火起来之后,大家习惯性想到卷积神经网络提特征,但现实里经常遇…

2026/10/9 3:55:26 阅读更多 →
OpenClaw云端部署实战:华为云2分钟跑通自动化智能体

OpenClaw云端部署实战:华为云2分钟跑通自动化智能体

从去年开始,OpenClaw 这类的个人自动化助理项目就一直在我关注列表里挂着。以前想跑,总觉得要折腾一堆依赖、模型接口、定时任务脚本,结果总是"收藏了等于会了"。直到这个月我把一台华为云 ECS 重新整理,从头部署了一遍…

2026/10/9 3:54:26 阅读更多 →

日新闻

Java时间API实战:LocalDate、Date与ZonedDateTime的转换与避坑指南

Java时间API实战:LocalDate、Date与ZonedDateTime的转换与避坑指南

Java时间API这个话题,隔三差五就会在群里被翻出来讨论一次。上周还有个同事线上处理一个订单超时问题,排查到最后发现是ZonedDateTime序列化后时区丢了,用户在下单当天晚上看到的时间整整差了8个小时。这类问题几乎每个做Java开发的人都遇到过…

2026/10/9 0:00:49 阅读更多 →
EasyTier实践:从NAT穿透到子网代理的异地组网部署与排错

EasyTier实践:从NAT穿透到子网代理的异地组网部署与排错

前几个月我手头有好几台机器需要互相访问:办公室台式机、家里 NAS、还有一台云主机。如果只是偶尔传个文件倒还好,问题是工作场景经常要在几处环境之间来回切换,每次都先登录跳板机再层层代理,实在折腾。我先后试过端口映射、自建…

2026/10/9 0:00:49 阅读更多 →
AI Agent工程实战:从七要素到七个决策点的系统设计指南

AI Agent工程实战:从七要素到七个决策点的系统设计指南

AI Agent 这个词在过去一年里被反复提及,但真正动手搭过一套能跑起来的 Agent 系统的人都知道,从"知道它是什么"到"让它稳定干活"之间隔着一整套工程决策。我前后参与过几个 Agent 项目的落地,从最初用现成框架拼装&…

2026/10/9 0:01:50 阅读更多 →

周新闻

KT148A语音芯片外挂8002D功放的工程实践指南

KT148A语音芯片外挂8002D功放的工程实践指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/8 15:26:32 阅读更多 →
LLC谐振变换器增益公式推导:从FHA等效到完整归一化表达式

LLC谐振变换器增益公式推导:从FHA等效到完整归一化表达式

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/8 15:26:40 阅读更多 →
ARM架构深度解析:从RISC设计理念到交叉编译实战

ARM架构深度解析:从RISC设计理念到交叉编译实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/8 10:10:36 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/8 21:13:17 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/8 15:26:17 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/7 13:34:55 阅读更多 →