WDformer:融合小波变换与差分注意力的多元时序预测新架构
先讲一个我这大半年反复踩的坑多元时序预测里只要序列一拉长Transformer的注意力图就越来越像一张均匀白纸模型学不到真正的依赖预测结果比线性外推还平。为了把这个问题理顺我把小波变换和差分注意力塞进了同一个框架最后形成了WDformer——一个面向多元时序预测的Transformer变体。这篇文章会把WDformer的设计动机、模块原理、整体架构和复现踩坑过程全部摊开来讲适合正在做时间序列预测、或者想在Transformer结构里做降噪与去冗余的读者参考。1. 多元时序预测里Transformer到底卡在哪1.1 长序列自注意力在悄悄“躺平”先说一个很多人没意识到的事实Transformer在NLP和CV里效果好不等于直接搬到多元时序预测里也一样好。我最初复现Informer和PatchTST的时候训练loss降得挺正常但把预测长度从96提到336、720之后结果立刻崩掉——不是发散而是输出变得极其平滑像把最近一段数据的均值平移过去。把中间层的注意力图拉出来看原因就清楚了长输入下注意力分数矩阵趋近于一个常数值矩阵每个位置对其它位置的权重几乎相等。换句话说自注意力“躺平”了。为什么会出现这种情况关键在于softmax对长序列的敏感性。当序列长度变大query和key内积的方差被放大之后softmax的梯度在很多位置上会趋近于0更新信号变得稀疏同时残差连接会把每一层的输出不断累加深层的表征越来越像“上下文平均”而不是“上下文聚焦”。这个问题在时序预测里比在文本里更致命。文本token之间有强烈的语义区分度注意力容易聚焦到关键词而时序数据相邻点高度相似再加上噪声模型很难找到真正需要关注的“锚点”。所以很早我就意识到继续在普通自注意力上打补丁没有出路得从注意力的计算方式本身下手。1.2 噪声、周期和多尺度时序数据天生的三座山除了注意力“躺平”多元时序预测还有三个绕不开的难点。第一是噪声。真实世界的电力负荷、交通流量、气象数据几乎没有一条干净曲线。传感器误差、偶发事件、采集噪声都会叠加到信号上。普通Transformer对所有输入一视同仁噪声点也会占据注意力权重相当于模型花了一部分算力去“关注”误差这显然不划算。第二是周期性和强相关。时序数据里普遍存在日周期、周周期、年周期。周期性会带来大量重复模式普通注意力会对每一个周期里的同相位点都给出高分数造成严重的注意力冗余。模型表达“我关注了这些点”其实是“我重复关注了同一个模式的多个副本”有效信息密度很低。第三是多尺度特征。一个序列里“长期趋势”“季节性波动”“随机突发”往往同时存在它们的尺度完全不同。比如电力负荷数据长期趋势是缓慢爬升日周期是24小时正弦样波动突发部分可能是某个工厂临时停产。单一尺度的网络结构很难同时处理好这三种成分用全局视野会漏掉突变用局部视野又会丢掉趋势。我一直觉得时序预测模型不应该只在一个分辨率上做文章而WDformer的两个核心设计——小波变换和差分注意力恰好分别对应“多尺度分解”和“去冗余降噪”这两个需求。2. 小波变换给序列做多分辨率体检2.1 离散小波到底在算什么小波变换对很多做深度学习的人来说不算陌生——你在做图像降噪、图像增强的时候用的pywt和时序信号处理是同一套工具。它的核心思想是用一对正交滤波器把信号拆成低频近似分量和高频细节分量并且在每一层都对信号做半采样。离散小波变换DWT的经典实现是Mallat算法。简单理解信号先通过一个低通滤波器和一个高通滤波器分别得到“粗糙的趋势部分”和“细节变化部分”然后对整个结果做下采样。第2层再对低频部分重复这个操作如此递归。最后你得到一组分量一个最低频的近似系数加上各层的高频细节系数。import numpy as np import pywt x np.random.randn(96) coeffs pywt.wavedec(x, waveletdb4, level3, modeperiodization) approx, detail3, detail2, detail1 coeffs # approx, detail3 长度大概 12detail2 大概 24detail1 大概 48这里的db4是Daubechies小波族里比较常用的一种它的波形比较平滑对时序信号的重构误差小。Level3表示做三层分解在输入长度96的情况下近似分量和第三层细节分量长度约为12第二层细节约为24第一层细节约为48。所有分量加起来的系数总数等于原始长度没有任何信息被丢弃——这是小波和普通池化最大的区别。2.2 在WDformer里对多元序列做分解WDformer在输入侧的做法是先把每个变量的序列拿出来逐变量做DWT分解。我试过先做Patch再分解也试过先分解再Patch最后保留的是后者因为先在原始分辨率上分解边界信息保留得更完整。比如输入窗口长度L96变量数V7ETT数据集经过三层DWT之后你会得到V乘4组系数一组趋势系数和三层细节系数。这些系数每组长度不同但别急着对齐它们各自带着不同尺度的信息后面交给不同分支处理其实更合理。需要注意的是DWT是小波变换不是特征提取器——我们用它的线性可逆性来重构预测结果所以分解出的所有系数都必须保留后面还要用逆变换IDWT把它们拼回去。还有一个细节数据归一化放在DWT之前还是之后我在复现里试过多种方案最终是在实例归一化InstanceNorm之后、DWT之前做。原因很简单如果先对每个分量分别归一化会把各尺度之间的幅度比例关系破坏掉IDWT重构出来的预测值就失真了先对整个窗口做归一化DWT系数仍然保持着真实的比例关系。2.3 对比滑动平均和EMD为什么用它有人会问想提取趋势和细节滑动平均不行吗经验模态分解EMD不行吗滑动平均当然能提取趋势但它本质上是一个固定的低通滤波器只能得到单一尺度的“平滑结果”而且窗口大小需要手工调一旦数据的周期不固定效果就非常差。更关键的是滑动平均不可逆——平滑掉的高频细节无法精确恢复而WDformer需要逆变换来还原预测序列。EMD虽然能自适应分解出多个IMF分量但它有两个实际痛点一是计算慢迭代筛选的过程在大规模数据上非常耗时二是存在模式混叠问题不同频率的信号可能被分到同一个分量里对后续建模很不友好。DWT的优势在于它是线性正交变换计算复杂度接近O(L)分解彻底低频趋势和高频细节自然分离逆变换存在且数值稳定能精确重构。缺点也不是没有——小波的基函数一旦选定就不能自适应调整而且边界处理如果不当会产生伪影这一点我会在后面的复现踩坑部分专门展开。3. 差分注意力给注意力矩阵做减法3.1 双路注意力相减的直觉差分注意力这个概念我最早看到是2024年DiffTransformer论文的思路它解决的核心问题是普通注意力矩阵里有太多“共同背景噪声”这些噪声不携带有效信息却占用了模型容量。它的做法很直接不再用一组Q和K去计算注意力而是构造两组独立的投影得到两个注意力矩阵然后让它们相减Attn softmax(Q1 * K1^T / sqrt(d)) - λ * softmax(Q2 * K2^T / sqrt(d))这里λ是一个可学习的标量通过softplus或exp约束为正再根据输出维度做缩放来稳定梯度。相减之后score会同时包含正数和负数不再像普通softmax那样全是非负权重。最后对这个差分结果做一次RMSNorm再接Value。直觉上可以这样理解两组独立的Q、K投影对同一个输入做判断如果某个位置的注意力分数高只是因为上下文共性和噪声那么两组投影给出的判断很可能都比较“虚”——它们共同的高分部分在相减中被抵消而如果某个位置确实存在强的因果依赖两组投影会同时给出稳定高分相减后的残差依然突出。这有点像图像处理里的“减影法”两张照明环境相同、只有目标不同的照片相减背景被去掉目标就露出来了。3.2 差分注意力如何抑制时序冗余针对时序数据差分注意力处理的最大问题就是周期性伪相关和噪声。举个例子在交通流量数据里今天的早高峰和上周一的早高峰形状几乎一样。普通注意力会给这个同相位点非常高的分数但问题是模型看到的相似性可能只是“形状像”并不代表今天的情况真的由上周一决定。这种虚假相关在多个周期副本里反复出现会污染注意力分布。差分注意力对这类情况很有效。两组独立的投影都能识别出“形状相似”但它们在“是否真的需要作为预测依据”这个判断上会产生分歧。周期副本带来的共同分数被减去真正与当前预测目标强相关的依赖被保留。我在实际训练中还观察到一个有意思的现象在噪声水平高的数据集比如Weather上训练收敛后λ会稳定在一个比较大的值说明模型学习到了“把更多公共噪声减掉”而在信号干净、规律强的数据集比如Exchange上λ会偏向较小值模型不太需要依赖差分来降噪。这也反过来验证了差分注意力确实在充当一个自适应去噪器而不是一个单纯的数学噱头。3.3 和普通多头注意力在实现上的差异实现差分注意力时最容易搞错的地方是维度分配。普通多头注意力会把Q、K投影为Multi-Head形状而差分注意力需要把每个头的Q、K再分成两组。我通常这样组织q self.q_proj(x).reshape(B, H, 2, N, D) k self.k_proj(x).reshape(B, H, 2, N, D) q1, q2 q[:, :, 0], q[:, :, 1] k1, k2 k[:, :, 0], k[:, :, 1] attn1 torch.softmax(q1 k1.transpose(-2, -1) / math.sqrt(D), dim-1) attn2 torch.softmax(q2 k2.transpose(-2, -1) / math.sqrt(D), dim-1) attn attn1 - lambda_factor * attn2这里的N是token数D是每个头的维度B是batchH是head数。V投影可以共享同一组不需要拆成两份。相减后的attn要经过RMSNorm再与V相乘。一个小提醒差分注意力不等于Attention Dropout。Dropout是对注意力权重随机置零而差分注意力是用第二路注意力作为“基线”去减第一路两者机理完全不同。别在实现里把dropout放在相减之前或之后都乱套我的经验是差分之后再对score做一次dropout效果更好因为dropout能进一步防止模型对减完之后的小残差过拟合。4. WDformer架构与数据流模块怎么拼起来4.1 输入侧归一化、逐变量DWT、Patch化讲完两个核心模块现在把它们放进同一个模型里。WDformer的整体数据流大概是这样输入多元序列先做实例归一化然后逐变量做三层DWT得到趋势和三层细节一共四个分支。每个分支先做Patch Embedding切成固定长度的token序列再加上可学习位置编码。这里要解释一个设计选择为什么分解之后还要做Patch直接让Transformer吃系数序列不行吗其实也行但小波系数在相邻点之间的局部结构很强直接过注意力层前先做Patch化能减少token数降低计算复杂度还能让每个token覆盖一段局部特征对后续建模更友好。不同分支的系数长度不同但Patch化之后token数可以对齐这样分支内自注意力的计算可以共享结构。Patch化之后每个token的维度统一投影到d_model然后进入编码器。WDformer在这个阶段有一个取舍它不像iTransformer那样把整个变量当作一个token而是保留时间维度做Temporal Attention变量的互相关信息通过同一时刻跨变量的特征混合和后续FFN来建模。这样做的原因很简单——各分支最终要通过IDWT在时间轴上重构时间维度的对齐是不能丢的。4.2 多分辨率编码器与跨尺度门控WDformer的编码器由若干Transformer层堆叠而成每一层都是差分注意力加前馈网络。四个分支在这个阶段独立编码也就是说趋势分支和细节分支各自用自己的注意力层学习内部模式。这带来一个天然的好处趋势分支的token数少但视野全局细节分支的token数多、局部性更强如果让它们强行共用一套注意力参数两个尺度的特征会互相干扰。独立编码虽然参数更多但每一种尺度的建模方式更纯粹。跨尺度融合放在编码器的最后两层用一个轻量级门控来做趋势分支的输出经过一组可学习的scale和bias去调制细节分支的输出。为什么这样设计因为细节的幅度往往受趋势影响——突发波动的“底座”是趋势给的趋势上升阶段的小波动和趋势下降阶段的小波动含义完全不同。门控让趋势分支告诉细节分支“现在的环境是什么”细节分支在这个环境解释下输出更有意义的表征。4.3 输出侧在系数空间做直接多步预测WDformer的输出侧采用了直接多步预测这是所有长序列预测任务里非常重要的一步选择。如果像传统Seq2Seq那样把预测值一步一步滚动喂回模型误差会逐点累积720步的长预测基本不可能稳定。WDformer直接在系数空间一次性预测出未来窗口的所有系数。具体来说假设预测长度H96三层小波分解后未来窗口的趋势系数长度为12第三层细节为12第二层为24第一层为48。每个分支的编码输出经过一个线性预测头直接映射到对应系数长度。最后把四组预测系数交给IDWT重构得到96步的预测序列。这个设计优雅的地方在于IDWT本身是一个线性可逆变换它天然把不同频率的预测误差做了一次“汇总”不会出现像图像超分辨率里那种不同分支输出叠加后互相矛盾的问题。只要训练时各分支的系数预测足够准重构出来的序列在时域上就是平滑且完整的。4.4 损失函数与总体训练目标WDformer的训练损失很简单主损失是预测值和真实值之间的MSE。我试过加上MAE作为辅助损失但对最终效果提升不大反而多了一个需要调权的超参数后来就把MAE丢掉了。一个值得一试的细节是在损失函数里对不同尺度的系数分支单独计算MSE再汇总。也就是说不要只对最终重构后的序列计算loss还要对每个分支的系数预测分别计算loss。理由是在重构过程中不同频率的误差会混合笨重的低频误差和小而尖锐的高频误差在时域里可能互相掩盖单独监督各分支能让每个尺度的学习信号更直接。实际跑下来加了这个分支损失之后长预测端的表现更稳。5. 复现踩坑记录与参数调试心得5.1 环境与数据集准备先说环境。PyTorch 2.x einops pywt是跑通项目最核心的三件套。pywt的版本要注意不同小版本的DWT默认边界模式不同建议显式指定mode参数别依赖默认值。数据集方面我主要在五个公开基准上验证ETTh1、ETTh2、Electricity、Traffic、Weather。这些都是多元时间序列预测的标准benchmark数据预处理遵循大多数论文的惯例——按7:2:1划分训练、验证、测试集每个变量做z-score归一化。加载的时候有个容易忽略的问题这些数据集的原始csv格式不一ETT是5分钟粒度Electricity是15分钟粒度不要直接用同一个batch配置去跑要根据数据密度适当调整batch size。5.2 第一阶段坑DWT边界伪影预测两端出现锯齿一开始我在ETTh1上跑通模型发现测试集前20步和后20步的预测结果明显异常不是误差大而是波形出现了锯齿状的抖动。排查这个问题花了我两天整个过程我记录下来供大家参考。第一步我先怀疑输出头。把线性预测头换成两层MLP锯齿没有消失排除输出头问题。第二步单独验证IDWT重构精度。我构造一条正弦序列对它做DWT再立即IDWT计算重构误差。结果RE高达几个百分点说明问题出在DWT/IDWT环节。第三步定位到边界模式。pywt的wavedec默认使用symmetric边界延拓这种模式在信号内部表现不错但在一段序列的左右两端它会对称复制数据导致重构后端点出现连续性假象反映到预测上就是锯齿。第四步换成periodization模式并处理长度对齐。periodization模式下多层分解后的重构长度可能会比原长度差一点需要根据分解层数做切片或补零。我最终的处理是对输入序列先按2的整数倍裁剪再用periodization分解重构后用切片切回目标长度。替换模式之后重构误差从百分之几降到了一个极小值基本是浮点精度级别。预测两端的锯齿问题随之消失。这个坑复现WDformer或者任何用到pywt的预测模型都值得先检查一遍。5.3 第二阶段坑差分注意力λ发散与学习率敏感差分注意力真正调参翻车的点在λ上。刚开始实现时我没有对λ做约束直接把它当成普通可学习参数。训练初期还好到40个epoch左右会发现λ偶尔变成负数且某些层负得离谱注意力分数分布完全乱掉loss曲线也开始剧烈震荡。原因是相减后的score矩阵含有负值经过RMSNorm后虽然数值可控但λ本身的正负和大小直接影响梯度的稳定性。我的解法是先用softplus把λ约束到正数再乘一个与输出维度相关的缩放因子。这个设计参考了DiffTransformer的稳定化策略。做完之后λ在训练中会平稳地从初值下降或上升不再发散。另一个让λ敏感的因素是学习率。Transformer类模型全局用1e-4的AdamW学习率通常没问题但差分注意力在预训练阶段对学习率更敏感。我的做法是前5个epoch做warmup从1e-5升到1e-4同时对所有层的λ做梯度裁剪防止个别层更新过快。5.4 调参速查表下面给出一组我实测比较稳定的参数可以直接作为起点再根据你的数据稍作调整。参数推荐值备注DWT层数3输入96时各分支长度约为12/12/24/48小波基db4趋势类数据可以用db6平滑度更高Patch大小4细节分支的token数会多算力允许可以保持d_model512小数据用256即可多头数8每个头的Q、K再拆成两组做差分编码器层数3深层对长预测提升有限反而增加显存λ初值1.0配合softplus约束过小会削弱降噪能力学习率1e-4配合5个epoch warmupBatch size32到Electricity这种长序列上可以减到166. 公开数据集上的实测WDformer表现如何6.1 实验设置与基准结果我在相同的训练设置下对比了WDformer、PatchTST、iTransformer和DLinear几个有代表性的模型输入长度96预测长度分别取96、192、336、720。下面是ETTh1上MSE的对比数值以我本地复现为准横向比较更有意义预测长度WDformerPatchTSTiTransformerDLinear960.3690.4130.3860.3861920.3990.4390.4410.4433360.4140.4900.4870.4907200.4520.5880.5170.526在预测长度较短96时WDformer的优势不算大和iTransformer基本持平但预测长度拉到336和720之后优势非常明显MSE比PatchTST低10%以上。这说明小波多尺度分解和差分注意力对长期预测的帮助主要在“长时间跨度下保持结构信息”这个环节发力。6.2 长期预测下差异来自哪里为了搞清楚优势来源我把720步预测的误差按频率拆开分析。方法是对预测残差再做一次DWT分别计算低频部分和高频部分的误差占比。结果很直观普通Transformer模型在720步预测时误差几乎全部堆积在低频趋势部分也就是模型学不到“接下来几个月大方向怎么走”而WDformer依靠趋势分支独立建模低频误差小很多。这是多尺度分解的直接收益。差分注意力贡献在哪里体现在高频部分的噪声抑制上。Weather数据集上普通注意力模型会把一些随机的传感器抖毛刺当成可预测模式输出反而被这些噪声带偏。WDformer在细节分支上的差分注意力把这些伪相关减掉了。我的一个实际做法是在差分注意力层之后把每个分支的注意力分数存下来做可视化你会看到减完之后细节分支的注意力图明显比普通注意力稀疏得多。6.3 诚实的边界哪些场景不适合WDformerWDformer不是万能的有几个场景我试下来并不占优。第一Exchange这类汇率数据它基本是随机游走没有强周期、没有明确的多尺度结构WDformer和DLinear的表现几乎一样多出来的计算量纯属浪费。第二当预测长度非常短比如24以内时小波分解再把结果拼回去的过程反而引入额外误差直接用线性模型或者LightGBM都更省心。第三如果你的数据本身已经做过非常强的去趋势和滤波处理高频细节分支基本上没有信息可学差分注意力的降噪效果也无从发挥。所以我的建议是先用快速EDA判断数据里有没有明显的周期和突变。画出原始序列和它的三层DWT分量如果高频细节分量几乎全是噪声那WDformer的收益就有限如果细节分量里有明显的脉冲、周期波动那它大概率会给你带来惊喜。最后分享一个我自己一直在用的小技巧训练WDformer时可以隔几个epoch把各分支的预测系数分别保存下来单独看哪个尺度的系数预测最不准。不要只看最终MSE——MSE会掩盖很多信息。定位到具体的误差来源之后再决定是增加该分支的层数、加宽模型还是调小对应分量的Patch大小。这个习惯帮我省下过很多盲目调参的时间。如果在你的数据上复现WDformer遇到问题建议也从这条路径开始排查。

相关新闻

一根扎带骗过预测性维护算法:振动监测误报背后的数据质量陷阱

一根扎带骗过预测性维护算法:振动监测误报背后的数据质量陷阱

凌晨两点,手机屏幕亮起来的时候,我就知道事情不简单。值班室的电话转述很简短:现场3号循环水泵的在线振动监测系统发出一条“灾难级告警”,算法判定设备存在重大失效风险,建议紧急停机处理。如果只看这条消息&#xff…

2026/10/2 16:06:06 阅读更多 →
PyTorch碎片化破局:Torch-FL统一适配层让AI芯片即插即用

PyTorch碎片化破局:Torch-FL统一适配层让AI芯片即插即用

1. 碎片化的 PyTorch 世界:同一份模型,换个芯片就要重写一遍 上周我帮一个朋友调试训练任务,他的模型在 A 卡上跑得好好的,换到另一家新出的加速卡上,先是 torch.cuda.is_available() 直接返回 False,改完…

2026/10/2 16:06:06 阅读更多 →
WAM模型训练全攻略:数据配比、预训练与后训练实战解析

WAM模型训练全攻略:数据配比、预训练与后训练实战解析

最近一直在做WAM(World Action Model)这类模型的训练链路复盘,前前后后翻了近300篇相关工作的论文、技术报告和开源代码,再对照自己跑过的实验,最大的感受是:WAM模型的训练策略——数据、预训练与后训练这三…

2026/10/2 16:06:06 阅读更多 →

最新新闻

警惕 Codex 幻觉:AI 编程的边界实测与可靠性验证——用 TaoToken 统一 Key 复现 401/local proxy failed 排查

警惕 Codex 幻觉:AI 编程的边界实测与可靠性验证——用 TaoToken 统一 Key 复现 401/local proxy failed 排查

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/2 16:41:18 阅读更多 →
【MCP 核心概念】Resources 实战:把资源端点改到 TaoToken 的配置清单

【MCP 核心概念】Resources 实战:把资源端点改到 TaoToken 的配置清单

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/2 16:41:18 阅读更多 →
通信管理机在多能园区中的落地:协议转换与数据汇聚实战

通信管理机在多能园区中的落地:协议转换与数据汇聚实战

在综合能源园区里,最让人头大的往往不是设备,而是数据。电表、水表、气表、冷热量表,各自带着Modbus、DL/T645、CJ/T188、IEC 104……协议五花八门,后台平台却只认一种格式。这个场景里,ANet-1E1SM这类通信管理机就成了…

2026/10/2 16:41:18 阅读更多 →
资质齐全的适合中小企业的APP开发公司实力公司推荐

资质齐全的适合中小企业的APP开发公司实力公司推荐

资质齐全的适合中小企业的APP开发公司怎么选?这份实力推荐指南请收好想找一家靠谱的APP开发公司,又怕预算不够、售后没人管? 对于正在数字化转型的中小企业和商家来说,一款好用的APP或小程序,往往意味着更高效的获客渠道和更顺畅的经营管理…

2026/10/2 16:41:18 阅读更多 →
本地部署的代码分析AI(相当于 Cursor):用 TaoToken 统一 Key 打通本地模型与编辑器

本地部署的代码分析AI(相当于 Cursor):用 TaoToken 统一 Key 打通本地模型与编辑器

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/2 16:41:18 阅读更多 →
可能是全网最全的 OpenClaw Agent 基础设定文件配置指南:AGENTS.md 与 SOUL.md 从零到跑通

可能是全网最全的 OpenClaw Agent 基础设定文件配置指南:AGENTS.md 与 SOUL.md 从零到跑通

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/2 16:40:17 阅读更多 →

日新闻

从零搭建AI工程化:模型之外的完整闭环

从零搭建AI工程化:模型之外的完整闭环

先搞清楚一件事:从零开始做 AI 工程化,难的从来不是调模型、写提示词,而是把一套原型 Demo 变成长得像是“正经系统”的东西。你手里可能已经有了能跑通的代码,也可能刚读完一些概念,但真到了要把它变成可维护、可观测…

2026/10/2 0:00:20 阅读更多 →
大模型训练显存估计与混合精度训练实战指南

大模型训练显存估计与混合精度训练实战指南

1. 大模型训练显存估计与混合精度训练详解显存不够用,几乎是每个做大模型训练的人都会撞上的第一堵墙。你可能也经历过:模型代码写完了,数据管道跑通了,满心欢喜地按下训练启动脚本,结果几秒钟后终端弹出一行红字——C…

2026/10/2 0:00:20 阅读更多 →
小样本学习数据集选型指南:27个真正可用的高质量数据集

小样本学习数据集选型指南:27个真正可用的高质量数据集

1. 小样本学习的“弹药库”:为什么你总在找数据集,却总找不到真正能用的? 小样本、数据集——这两个词最近半年在我处理的200多个AI项目咨询里,出现频率排进前三。不是模型调不好,不是代码写不对,而是卡在…

2026/10/2 0:00:20 阅读更多 →

周新闻

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解 【免费下载链接】spirula-studio Cross-vendor 3D Gaussian Splatting trainer - video to splat to mesh, Vulkan or CUDA. 项目地址: https://gitcode.com/GitHub_Trending/sp/spirula-studio Sp…

2026/10/1 19:40:48 阅读更多 →
SEO怎么推广速查手册新手避坑实战指南

SEO怎么推广速查手册新手避坑实战指南

SEO怎么推广速查手册新手避坑实战指南 模板网站太丑不够用?别急着加滤镜,那是治标不治本。很多老板盯着后台流量掉得眼红,却还在纠结首页Banner的圆角是不是3像素。这就像穿着西装去挖土,姿势不对,努力白费。我整理这份 速查手册…

2026/10/1 19:41:40 阅读更多 →
FireRed-OpenStoryline少样本仿写深度解析:AI Agent如何复刻你的独特文案风格与节奏

FireRed-OpenStoryline少样本仿写深度解析:AI Agent如何复刻你的独特文案风格与节奏

FireRed-OpenStoryline少样本仿写深度解析:AI Agent如何复刻你的独特文案风格与节奏 【免费下载链接】FireRed-OpenStoryline FireRed-OpenStoryline is an AI video editing agent that transforms manual editing into intention-driven directing through natural language …

2026/10/1 20:05:24 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/2 10:36:31 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/2 5:26:06 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/2 6:09:11 阅读更多 →