第一开源大模型MiMo-V2.6:自我改进强化学习规模化实战解析
1. 从标题拆解 MiMo-V2.6 的技术野心第一次看到“第一开源大模型 MiMo-V2.6迈向自我改进的强化学习规模化”这个标题我脑子里蹦出来的第一个判断是这不是一次常规的版本迭代而是一次路线宣言。标题里三个关键词——“第一开源”“自我改进”“强化学习规模化”——每一个都指向了当前大模型领域最难啃的骨头。MiMo-V2.6 想做的事情本质上不是把模型参数再堆大一圈而是试图让模型在训练和部署过程中具备一种“自己教自己”的能力并且把这种能力通过强化学习的方式规模化地跑起来。为什么这件事值得单独拿出来讲因为过去两年开源大模型的竞争主要集中在预训练数据量、参数规模、上下文长度这些“静态指标”上。你 7B我 13B他 70B大家比的是谁在基准测试上多考几分。但 MiMo-V2.6 把焦点挪到了“训练后的自我进化”上。它不再只关心模型“知道什么”而是关心模型“能不能在交互中越变越强”。这个转向对于做应用落地的人来说意义完全不一样。一个静态的模型你部署下去之后能力就锁死了一个具备自我改进能力的模型理论上可以随着使用数据的积累持续优化这对 agent 类应用、复杂任务编排、长周期决策场景来说是质变。我先把结论放在前面MiMo-V2.6 的核心看点不在参数量而在它把MoE 架构、agentic RL、自我改进循环这三件事捏在了一起。MoE 负责让模型在推理时只激活一部分参数控制成本agentic RL 负责让模型在多步交互中学习策略自我改进循环则负责把交互中产生的经验反哺回训练。这三者缺一不可少了任何一个规模化都跑不起来。接下来我会逐层拆开讲清楚它为什么这么设计、每个环节怎么落地、以及实际部署时要注意什么。2. 为什么是 MoE 加强化学习这套组合拳2.1 MoE 架构到底解决了什么现实问题MoE也就是混合专家架构这两年几乎成了大模型标配。但很多人对它的理解停留在“稀疏激活、省算力”这个层面其实它在强化学习场景下的价值远不止于此。MiMo-V2.6 选择 MoE 作为底座我认为核心原因是强化学习的训练过程本身极其消耗算力如果底座是一个稠密模型每次策略更新都要全量计算梯度成本会高到无法规模化。MoE 的机制是这样的模型内部有多个“专家”子网络每次输入进来门控网络只选择其中少数几个专家参与计算。比如一个总参数量 100B 的 MoE 模型实际每次前向传播可能只激活 10B 到 20B 的参数。这意味着在强化学习的 rollout 阶段采样效率会高很多。你可以用同样的硬件跑更多的交互轨迹而交互轨迹的数量直接决定了 RL 训练的效果上限。但这里有个坑我踩过。MoE 在 RL 训练中容易出现“专家坍缩”问题——某些专家被过度激活其他专家几乎不被用到。原因是 RL 的奖励信号会强化那些当前表现好的路径导致门控网络越来越偏向少数专家。MiMo-V2.6 在报告里提到用了负载均衡损失来缓解这个问题具体做法是在训练目标里加一项惩罚让每个专家被选中的概率尽量均匀。这个思路不新鲜但在 RL 场景下调参很讲究惩罚系数太大模型学不动太小又压不住坍缩。根据我的经验这个系数通常需要根据专家数量和 batch size 动态调整不能拍脑袋定一个固定值。2.2 agentic RL 和传统 RLHF 的本质区别标题里提到的 agentic RL是理解 MiMo-V2.6 的另一个关键。传统 RLHF 大家比较熟就是让模型生成回答人类标注偏好训练一个奖励模型然后用 PPO 之类的算法优化策略。这个过程本质上是单步的输入一个问题输出一个回答打分更新。但 agentic RL 是多步的模型需要在环境中连续做决策每一步的动作会影响后续的状态和最终奖励。举个例子传统 RLHF 像是让模型做一道选择题选完就结束agentic RL 像是让模型玩一局棋每一步都要考虑后续几步的走向。这对模型的能力要求完全不同。多步决策里存在信用分配问题——最终赢了到底是哪一步走得好最终输了又是哪一步埋了雷MiMo-V2.6 要规模化的正是这种多步交互中的策略学习。我实测下来agentic RL 最难的地方在于环境设计。你需要一个能给出稳定奖励信号的环境而且这个环境要足够复杂能逼出模型的真实能力。太简单的环境模型很快就刷满奖励学不到新东西太复杂的环境奖励稀疏模型根本找不到方向。MiMo-V2.6 的做法是构建了一套多任务、多难度的环境集合让模型在不同任务间迁移学习。这个思路和课程学习类似先易后难逐步提升。2.3 自我改进循环的工程实现难点“自我改进”这个词听起来很玄但拆开看其实是一个数据飞轮模型在环境中交互产生轨迹轨迹经过筛选和评分变成训练数据训练数据更新模型更新后的模型再去做交互。这个循环要转起来最难的不是算法而是工程稳定性。我见过太多团队在这个环节翻车。模型更新之后行为分布发生变化原来筛选数据的标准可能就不适用了奖励模型如果跟不上策略的变化会给出一堆错误信号训练和推理的资源调度如果没做好整个循环会卡在某个环节空转。MiMo-V2.6 在报告里强调了异步训练架构也就是推理和训练分开跑推理端不断产生新数据训练端按批次消费。这个设计的好处是吞吐量高但代价是数据新鲜度问题——训练端拿到的数据可能已经是几步之前的策略产生的存在 off-policy 偏差。处理 off-policy 偏差常见的手段是重要性采样和裁剪。重要性采样给旧策略产生的数据加权让它在更新时更接近当前策略的分布裁剪则是限制每次更新的幅度防止策略跑偏。这两个手段在 MiMo-V2.6 里应该都有用到具体参数没有完全公开但根据同类工作的经验裁剪系数一般在 0.1 到 0.3 之间重要性采样的截断阈值在 1.5 到 2.0 左右。这些数值不是绝对的需要根据任务特性调。3. 核心细节解析与实操要点3.1 训练流程的四个阶段拆解MiMo-V2.6 的训练流程我梳理下来大致分四个阶段每个阶段的目标和操作重点都不一样。第一阶段是基座预训练。这个阶段和常规大模型没区别用海量文本数据做下一词预测把模型的基础语言能力打扎实。MoE 的门控网络在这个阶段就开始训练但负载均衡的权重可以设得低一些先让模型学会基本表达。第二阶段是监督微调。用高质量的指令数据让模型学会遵循指令、理解任务格式。这个阶段的数据质量比数量重要得多。我自己的经验是SFT 数据里如果有 10% 的脏数据模型的行为就会明显跑偏。MiMo-V2.6 作为开源模型这部分数据应该是经过严格清洗的。第三阶段是奖励模型训练。这里有两种路线一种是训练一个独立的奖励模型另一种是用规则或环境反馈直接给奖励。agentic RL 场景下很多任务有明确的成功/失败判定比如代码能不能跑通、数学题答案对不对这种用规则奖励更可靠。但有些任务没有明确对错比如对话质量、创意写作就需要奖励模型来打分。MiMo-V2.6 应该是混合使用能规则化的用规则不能的用模型。第四阶段是强化学习规模化训练。这是最核心也最耗资源的部分。模型在环境中大量采样用 PPO 或类似的策略梯度算法更新参数。这个阶段的关键是并行度——同时跑多少个环境实例、每个实例跑多长、数据怎么汇总。根据公开信息推测MiMo-V2.6 在这个阶段用了数千个并行环境每天产生的交互轨迹在百万级别。3.2 奖励信号的设计与陷阱奖励信号设计是 agentic RL 里最考验功力的地方。我见过不少项目算法选得很先进但奖励设计得一塌糊涂最后模型学出一堆投机行为。比如你奖励模型“快速完成任务”它可能学会跳过必要步骤直接输出结果你奖励模型“输出长度”它可能学会啰嗦重复凑字数。MiMo-V2.6 在奖励设计上应该做了分层。底层是任务完成度奖励比如代码任务看测试用例通过率数学任务看答案正确性。中层是过程奖励对中间步骤的质量打分防止模型走捷径。顶层是格式和风格奖励确保输出符合预期规范。这三层奖励加权求和权重需要仔细调。我的经验是任务完成度的权重应该占大头至少 60% 以上过程奖励占 20% 到 30%格式奖励占 10% 左右。如果过程奖励权重太高模型可能为了“过程好看”而牺牲最终结果。还有一个陷阱是奖励黑客。模型会找到奖励函数的漏洞用你意想不到的方式拿高分。比如你奖励“代码通过测试”它可能直接输出测试用例的预期结果而不是真正实现逻辑。防范这个问题一方面要定期审查模型输出发现异常行为就修补奖励函数另一方面可以引入对抗性测试专门设计一些容易钻空子的场景来检验模型。3.3 MoE 门控网络在 RL 中的调参经验MoE 的门控网络在 RL 训练中需要特别关照。前面提到专家坍缩问题除了负载均衡损失还有几个参数值得关注。是专家容量因子。这个参数控制每个专家最多能处理多少 token。设得太小超出容量的 token 会被丢弃或走残差连接影响效果设得太大显存占用飙升。一般建议设在 1.25 到 2.0 之间具体看专家数量和序列长度。MiMo-V2.6 的配置没有完全公开但根据同类 MoE 模型的经验容量因子在 1.5 左右比较稳妥。是门控温度。温度高的时候各专家被选中的概率更均匀温度低的时候门控更倾向于选它认为最好的专家。RL 训练初期建议用较高的温度让各专家都有机会被训练到后期可以降低温度让门控更果断。这个调度策略和模拟退火有点像先探索后利用。是专家初始化。如果所有专家用相同的初始化它们会倾向于学出相似的功能浪费容量。常见的做法是给不同专家加不同的噪声或者用不同的数据子集做预热。MiMo-V2.6 作为开源模型这部分细节可能在技术报告里有更详细的说明值得仔细读。4. 实操过程与核心环节实现4.1 环境搭建与依赖准备如果你想复现 MiMo-V2.6 的训练流程或者基于它做二次开发环境搭建是第一步。我把自己跑通的环境配置列出来供参考。硬件方面MoE 模型的显存需求比同参数量的稠密模型低但比同激活参数量的模型高。以 70B 总参数、10B 激活参数的 MoE 为例推理至少需要 2 张 80G 显存的卡训练则需要 8 张以上。如果要做 RL 训练还需要额外的资源跑环境实例这部分可以用 CPU 集群但延迟敏感的场景建议用 GPU。软件栈方面PyTorch 是基础版本建议 2.1 以上对 MoE 的支持更完善。DeepSpeed 或 Megatron 做分布式训练FSDP 也可以但配置稍麻烦。RL 部分可以用 TRL、OpenRLHF 这类框架但 agentic RL 的多步交互逻辑可能需要自己写。环境管理用 conda 或 venv 都行我习惯用 conda隔离得干净。conda create -n mimo_rl python3.10 conda activate mimo_rl pip install torch2.1.0 transformers4.36.0 deepspeed0.12.0 pip install trl0.7.0 accelerate0.25.0依赖装完之后先跑一个小的稠密模型验证流程比如 GPT-2 或 Qwen-1.8B确认训练和推理都能跑通再上 MoE。直接上大模型出了问题很难定位是代码问题还是配置问题。4.2 数据管线的搭建要点agentic RL 的数据管线和传统 SFT 完全不同。SFT 的数据是静态的准备好放在那里就行RL 的数据是动态产生的需要一套完整的采集、筛选、存储、消费流程。采集端每个环境实例跑完一轮交互产生一条轨迹包含状态序列、动作序列、奖励序列。这些轨迹要实时写入一个缓冲队列比如 Redis 或 Kafka。缓冲队列的作用是解耦生产和消费推理端不用等训练端训练端也不用等推理端。筛选端不是所有轨迹都值得用来训练。太简单的轨迹模型已经会了学了没提升太难的轨迹模型完全做不对梯度信号也是噪声。通常保留那些成功率在 20% 到 80% 之间的轨迹这个区间梯度信号最强。MiMo-V2.6 应该也用了类似的筛选策略具体阈值可能按任务难度动态调整。存储端轨迹数据量大不能全放内存。建议用 Parquet 或 HDF5 格式存到磁盘训练时按批次加载。每条轨迹要记录产生它的策略版本号方便后续做重要性采样。消费端训练进程从缓冲队列拉取轨迹计算优势函数更新策略。这里要注意数据的新鲜度如果训练端消费速度跟不上生产速度队列会积压数据越来越旧off-policy 偏差越来越大。监控队列长度是必要的超过阈值就降低推理端的采样速度或者加快训练端的消费速度。4.3 策略更新与超参数设置策略更新用 PPO 的话有几个超参数需要仔细调。我把自己的经验值列出来但强调一下这些值不是通用的需要根据任务和模型规模调整。超参数建议范围说明学习率1e-6 到 5e-6RL 的学习率比 SFT 小一到两个数量级裁剪系数0.1 到 0.3控制每次更新幅度太大容易崩折扣因子0.95 到 0.99多步任务取高值单步任务取低值GAE lambda0.9 到 0.95优势估计的偏差方差权衡批次大小512 到 4096看显存越大越稳但越慢训练轮数2 到 4同一批数据重复训练的次数太多会过拟合学习率是最敏感的。我试过用 1e-5 的学习率结果模型在几百步之后就崩了输出全是乱码。后来降到 2e-6稳定多了。裁剪系数也不能贪大0.3 以上容易导致策略震荡0.1 以下学习太慢。折扣因子看任务长度如果任务平均 10 步完成0.95 够用如果 50 步以上建议 0.99。还有一个容易被忽略的参数是熵正则化系数。RL 训练容易陷入局部最优策略变得过于确定失去探索能力。加一个熵正则项鼓励策略保持一定的随机性。系数一般设在 0.01 到 0.05 之间太小没效果太大模型学不到东西。4.4 训练监控与异常处理RL 训练比 SFT 难监控因为损失函数不直接反映模型质量。SFT 看 loss 下降就知道模型在变好RL 的 loss 可能上下波动但模型实际在进步。所以需要一套更全面的监控指标。我通常会盯这几个指标平均奖励看整体趋势是否上升策略熵看探索能力是否保持KL 散度看新策略和旧策略的偏离程度专家激活分布看 MoE 是否出现坍缩队列长度看数据管线是否健康。这些指标里KL 散度尤其重要如果它突然飙升说明策略更新太猛需要降低学习率或增大裁剪系数。异常处理方面最常见的崩坏模式是奖励崩塌——平均奖励突然掉到很低模型输出变得毫无逻辑。原因通常是某次更新步子太大策略跑到了训练数据覆盖不到的區域。处理办法是回滚到上一个检查点降低学习率重跑。预防办法是设置奖励阈值一旦低于阈值就自动暂停训练人工介入检查。另一个常见问题是 MoE 专家坍缩。监控每个专家的激活频率如果某个专家连续多个批次激活率低于 1%基本可以判定坍缩了。轻度的可以通过增大负载均衡损失权重来缓解重度的可能需要重新初始化门控网络。5. 常见问题与排查技巧实录5.1 训练不收敛的排查思路训练不收敛是 RL 里最让人头疼的问题表现是奖励曲线长期横盘或者剧烈震荡。排查的时候我一般按这个顺序来。先看数据。检查轨迹的成功率分布如果全是成功或全是失败说明任务难度不合适模型学不到东西。调整任务难度让成功率落在 20% 到 80% 区间。再看奖励。把模型输出和奖励值对应起来看有没有明显的奖励黑客行为。比如模型输出很短的回复却拿到高奖励可能是奖励函数对长度有隐性偏好。修补奖励函数重新训练。然后看超参数。学习率是不是太大裁剪系数是不是太小批次大小是不是不够。逐个调整每次只改一个观察效果。我遇到过学习率从 5e-6 降到 1e-6 之后训练立刻从震荡变成稳定上升的情况。最后看模型结构。MoE 的话检查专家激活是否均匀如果用了多层策略网络检查梯度是否正常回传。有时候问题出在很底层的地方比如某个层的初始化不对导致梯度消失。5.2 推理部署的性能优化训练完之后部署推理是另一个挑战。MoE 模型的推理优化有几个关键点。是专家并行。把不同的专家放在不同的 GPU 上每次推理时根据门控结果把 token 路由到对应的 GPU。这样单卡显存压力小但通信开销大。如果专家数量多通信可能成为瓶颈。MiMo-V2.6 作为开源模型应该提供了专家并行的配置示例可以直接参考。是批处理策略。MoE 推理的批处理比稠密模型复杂因为不同 token 可能路由到不同专家批内负载不均衡。常见的做法是按专家分组把路由到同一专家的 token 聚成一批提高计算效率。但这会增加调度开销需要权衡。是量化。MoE 模型量化比稠密模型更难因为不同专家的权重分布可能差异很大统一量化精度会掉得厉害。可以尝试混合精度对敏感专家用高精度其他用低精度。或者用 GPTQ、AWQ 这类针对性的量化方法但需要逐专家校准。5.3 常见问题速查表问题现象可能原因排查方法解决措施奖励长期不涨任务太难或太简单统计轨迹成功率调整任务难度奖励突然崩塌策略更新步子太大检查 KL 散度回滚检查点降低学习率专家激活不均负载均衡损失太小统计各专家激活率增大均衡损失权重训练速度越来越慢数据队列积压监控队列长度加快消费或降低采样推理延迟高专家并行通信瓶颈profile 通信耗时减少专家数量或优化路由输出重复啰嗦熵正则化太小检查策略熵增大熵正则系数模型输出乱码学习率过大检查梯度范数降低学习率加梯度裁剪这张表里的每一条都是我实际踩过的坑。特别是“输出重复啰嗦”那条一开始我以为是模型能力问题后来发现是熵正则化系数设得太小策略过早收敛到确定性输出。把系数从 0.01 调到 0.03 之后输出的多样性明显改善。5.4 几个容易被忽略的实操心得第一个心得检查点保存要勤。RL 训练的不确定性比 SFT 大得多可能跑了三天突然崩了。如果检查点间隔太长几天的算力就白费了。我一般每 500 步存一次同时保留最近三个检查点方便回滚。第二个心得小规模验证再放大。不要一上来就用最大配置跑先用小模型、小数据、少环境实例验证整个流程能跑通再逐步放大。我见过团队直接上 70B 模型做 RL结果卡在数据管线问题上浪费了一周时间排查。第三个心得记录一切。RL 训练的可复现性很差同样的代码和配置换个时间跑结果可能不一样。把超参数、数据版本、代码 commit、环境配置全部记录下来出问题的时候才有据可查。我习惯用 wandb 或 tensorboard 做实验跟踪每个实验一个 run参数和指标都存下来。第四个心得奖励函数要版本化。奖励函数在训练过程中可能需要调整每次调整都要记录版本号和调整原因。否则回头分析结果的时候根本分不清是模型变了还是奖励变了。6. 这套东西对实际工作的影响MiMo-V2.6 作为开源模型最大的价值不是它本身有多强而是它把 agentic RL 的规模化训练流程开源出来了。在此之前这套东西基本只在少数闭源团队内部流转外面的人只能看论文猜实现。现在有了可参考的代码和配置做应用落地的人可以少走很多弯路。我自己的判断是接下来半年到一年基于 MiMo-V2.6 这类开源模型做垂直领域 agent 的项目会多起来。因为底座有了RL 训练框架有了剩下的就是定义好自己领域的任务和奖励函数。这件事的门槛从“造轮子”降到了“调参数”对中小团队来说是利好。但也要清醒一点开源模型的开源程度参差不齐。有些只放权重不放训练代码有些放了代码但数据管线是简化版。MiMo-V2.6 具体开源到什么程度需要实际下载下来验证。如果训练代码完整那价值就很大如果只有推理代码那主要价值还是在应用层。最后分享一个我在实际使用中的体会不要指望拿开源模型直接跑出论文里的效果。论文里的结果是在特定数据、特定环境、特定调参下得到的你换一个场景大概率需要重新调。把开源模型当成一个起点而不是终点留出足够的调参和适配时间心态会好很多。

相关新闻

H3多模态统一处理:从学术概念到工程落地的实践指南

H3多模态统一处理:从学术概念到工程落地的实践指南

1. 为什么H3不是“又一个视频模型”,而是多模态工程落地的分水岭MiniMax H3发布时,我正卡在自研视频生成管线的第三轮显存优化上——用SDXLAnimateDiff跑3秒480p视频,单帧推理耗时稳定在2.8秒,但连续帧间一致性崩得厉害&#xff0…

2026/10/5 14:42:16 阅读更多 →
AI智能体与Office文档自动化:从ReAct任务规划到工具调用的完整实践

AI智能体与Office文档自动化:从ReAct任务规划到工具调用的完整实践

1. 从毕设选题到真实落地:这个Office智能体套件到底在做什么每年到毕设季,计算机科学与技术专业的同学都会陷入同一个循环:打开选题列表,看到“基于XX的XX系统设计与实现”就头疼,选了个题目又担心工作量不够、技术含量…

2026/10/5 14:41:16 阅读更多 →
Lighttools 8.4.0虚拟相机与3D显示:光学仿真可视化全流程指南

Lighttools 8.4.0虚拟相机与3D显示:光学仿真可视化全流程指南

1. 内容整体设计与思路拆解1.1 Lighttools 8.4.0到底解决什么问题光学设计圈子里有个老传统:设计完一个照明系统,拿到照度图、光强分布曲线,就觉得自己搞定了。但实际上,客户问的第一句话往往是“这东西装上去,人眼看起…

2026/10/5 14:41:16 阅读更多 →

最新新闻

军队文职考试——第12期

军队文职考试——第12期

1.1 谈一谈当前网络管理和多媒体的应用发展趋势 网络管理方面 当前网络管理正在从“人管网络”往“AI管网络”的方向走。以前网络管理员得盯着屏幕看告警、手动配设备,现在越来越依赖AI来做事情。根据2026年的市场报告,AI已经深度嵌入到网络运维的各个环…

2026/10/5 15:17:47 阅读更多 →
企业宣传片创作全流程实战指南

企业宣传片创作全流程实战指南

做视频内容创作的朋友,最近应该都深有体会:创意构思花三天,拍摄剪辑耗一周,最后成片效果还可能因为预算或技术限制大打折扣。尤其是当我们需要同时应对品牌故事讲述、多平台分发以及不同语种的市场拓展时,传统的人力堆…

2026/10/5 15:17:47 阅读更多 →
P1131 时态同步【洛谷算法习题】

P1131 时态同步【洛谷算法习题】

P1131 时态同步 网页链接 P1131 时态同步 题目描述 小 Q 在电子工艺实习课上学习焊接电路板。一块电路板由若干个元件组成,我们不妨称之为节点,并将其用数字 1,2,3⋯1,2,3\cdots1,2,3⋯ 进行标号。电路板的各个节点由若干不相交的导线相连接&#x…

2026/10/5 15:17:46 阅读更多 →
AI 写作使用规范 —— 正确使用汇写的态度

AI 写作使用规范 —— 正确使用汇写的态度

汇写毕业文章页面底部有个勾选项:"我已阅读并同意《AI 写作使用规范》,内容仅供参考借鉴。" 这句话不是走形式,它提醒你怎么正确使用这个工具。汇写(https://www.huixielunwen.com/tool/graduationThesis)是…

2026/10/5 15:17:46 阅读更多 →
Davinci软件中MCU软件

Davinci软件中MCU软件

目录 Autosar架构BSW层MCU模块介绍 MCU配置芯片时钟树 MCU工作模式 Davinci软件对应MCU配置参数 Autosar架构BSW层MCU模块介绍 Autosar架构中的这个MCU模块用来配置芯片的时钟,以及生成配置等 MCU配置芯片时钟树 对于不同芯片来说都有时钟树,通过芯…

2026/10/5 15:17:46 阅读更多 →
半小时就能用 GPT-6 写出一篇“易发表”的论文,这也太牛了!

半小时就能用 GPT-6 写出一篇“易发表”的论文,这也太牛了!

各位同仁好,我是七哥。一个在高校里从事人工智能 相关领域研究,钻研用大模型AI实操的学术人。可以和七哥交流学术写作或Gemini、GPT、Claude 等大模型 学术实操相关问题,多多交流,相互成就,共同进步。 Publish or perish(发表或灭亡)这句略显残酷的话,道出了许多科…

2026/10/5 15:15:45 阅读更多 →

日新闻

马斯克杀回智能体战场,Grok 4.5万亿参数撑腰,Cursor接手数字白领项目:用TaoToken统一Key跑通多模型Agent工作流

马斯克杀回智能体战场,Grok 4.5万亿参数撑腰,Cursor接手数字白领项目:用TaoToken统一Key跑通多模型Agent工作流

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/5 0:00:22 阅读更多 →
AI编程工具插件机制详解:plugin.json配置与加载失败排查指南

AI编程工具插件机制详解:plugin.json配置与加载失败排查指南

1. 从“plugins”这个词说起:它到底在解决什么问题如果你最近在折腾 AI 编程工具,尤其是 Cursor、Codex CLI、Claude Code 这类带 CLI 的编辑器或命令行助手,那你大概率绕不开一个词——plugins。这个词本身不新鲜,从浏览器到 IDE…

2026/10/5 0:00:23 阅读更多 →
第26课:OpenClaw|日志审计与问题诊断:把日志链路改到 TaoToken 的排查清单

第26课:OpenClaw|日志审计与问题诊断:把日志链路改到 TaoToken 的排查清单

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/5 0:00:23 阅读更多 →

周新闻

KT148A语音芯片外挂8002D功放的工程实践指南

KT148A语音芯片外挂8002D功放的工程实践指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/5 5:06:42 阅读更多 →
LLC谐振变换器增益公式推导:从FHA等效到完整归一化表达式

LLC谐振变换器增益公式推导:从FHA等效到完整归一化表达式

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/5 1:10:22 阅读更多 →
ARM架构深度解析:从RISC设计理念到交叉编译实战

ARM架构深度解析:从RISC设计理念到交叉编译实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/5 3:06:17 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/4 11:40:45 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/4 9:43:54 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/4 20:14:29 阅读更多 →