一个更刁钻的问题——如果我的部署模型是少步生成器,还能不能愉快地吃下 RL 的奖励?
论文MeanFlowNFT: Bringing Forward-Process RL to Average-Velocity Generators项目页 | GitHub | Hugging Face作者团队Tencent Hunyuan一、为什么这篇论文值得你停下来读如果你接触过MeanFlow、DMD、CDM、AnyFlow这类少步生成器你一定被一个问题折磨过模型是少步了但想做奖励对齐RL finetuning时怎么套都套不稳。少步生成器靠“平均速度”做大步采样而 DiffusionNFT 这类 forward-process RL 原本优化的是“瞬时速度”。两者看起来都属于 flow/diffusion 后训练但接口并不一样不能简单把 DiffusionNFT 直接套到 MeanFlow 上。MeanFlowNFT提出了一个干净利落的解决方案推理时仍然保留 MeanFlow 的平均速度和少步采样训练时从平均速度网络里构造一个诱导的瞬时速度预测器再把 DiffusionNFT 的负样本感知奖励目标作用到这个诱导速度上。这样既能吃到 forward-process RL 的奖励优化又不牺牲 MeanFlow 的4-step / few-step 部署优势。这不是又一个在少步模型上硬塞 RL 的“补丁”工作——它从根上回答了“average-velocity generator 的 RL 接口应该长什么样”并把它落地到了Wan2.1 视频生成的真实场景里拿到了VBench 84.33的硬指标。二、核心思想从“瞬时速度”到“平均速度”的接口适配2.1 传统 DiffusionNFT 在做什么DiffusionNFT 的核心是forward-process negative-aware finetuning用旧策略采样用 reward 区分好坏再在 forward matching 中构造正负方向。它面对的是瞬时速度模型所以目标直接作用在瞬时速度 v_theta 上。这套方法在多步扩散模型上效果不错但当我们把它硬套到少步生成器时问题来了平均速度跟瞬时速度在参数化上根本不是一回事。2.2 MeanFlowNFT 的做法构造诱导瞬时速度MeanFlowNFT 的关键改造是一个“接口层”。它不直接把 DiffusionNFT 套在平均速度 u 上而是先构造一个和 DiffusionNFT 接口兼容的瞬时速度对象 V。理解这篇文章最容易卡在符号上。论文里有三类速度符号名称含义vinstantaneous velocity某个时间点 t 上的瞬时速度场传统 Flow Matching 或 DiffusionNFT 主要在这个空间里工作uaverage velocityMeanFlow 的“平均速度”描述从时间 t 到更早时间 s 整个区间的平均速度天然适合少步生成Vinduced instantaneous velocity predictor从平均速度网络 u_theta 诱导出来的瞬时速度预测器不是独立网络由 u_theta、时间导数和空间导数组合而来训练目标作用在V上但参数更新最终回到u_theta。2.3 一句话总结区别维度直接套 DiffusionNFTMeanFlowNFT优化对象直接优化瞬时速度从平均速度诱导出瞬时速度再优化推理效率可能破坏少步结构保留MeanFlow 的 4-step 少步采样训练稳定性容易崩塌有理论保证训练更稳能否迁移到视频不稳定Wan2.1 上拿到 84.33三、三种速度先分清u、v、V 不是一回事公式一MeanFlow 的采样身份这个公式说明 MeanFlow 为什么能少步采样x_t是当前噪声状态x_s是更早时间 s 的状态u_theta(x_t,s,t)是模型预测的从 t 到 s 的平均速度。只要平均速度预测准确就可以用一次大步更新从 x_t 直接跳到 x_s而不是像普通 ODE solver 那样做很多细小瞬时速度积分。公式二诱导瞬时速度 V_theta 是怎么来的这条公式是 MeanFlowNFT 的核心。左边V_theta(x_t,s,t)是要拿去做 RL 优化的诱导瞬时速度。右边第一项u_theta(x_t,s,t)是 MeanFlow 原本预测的平均速度后面乘以t-s的大括号项是平均速度沿时间和状态变化的总导数修正。直觉上这个公式是在问如果一个区间平均速度 u 想对应某个真实瞬时速度那么它不仅要给出区间平均值还要补偿这个平均值随时间和状态变化的趋势。这一步的意义是把 MeanFlow 的 average-velocity 参数化翻译成 DiffusionNFT 能理解的 instantaneous-velocity 接口。没有这个翻译直接把 DiffusionNFT 套到 u 上会丢掉理论保证也容易训练不稳。公式三MeanFlowNFT 的奖励加权目标这个损失函数可以按正负两条线读高奖励样本推动模型朝高奖励方向靠近低奖励样本从低奖励方向拉开这个结构继承了 DiffusionNFT 的negative-aware思想不是只学习好样本而是同时利用低奖励样本形成反方向约束。四、训练流程一轮更新到底发生了什么MeanFlowNFT 的一次训练更新可以拆成六步采样 prompt c用旧的 MeanFlow 策略 u_old 做少步 rollout 得到 x0Reward model 对 x0 和 c 打分得到 r随机采样时间区间 s ≤ t 和噪声 epsilon走 forward process 得到 x_t同时计算条件速度 v_t用 u_old 的有限差分估计总导数项构造 V_theta、V_old、V_theta、V_theta-用奖励加权的 MSE 更新 theta这里和 reverse-process RL 最大不同是训练不需要展开完整反向生成轨迹也不需要每一步 likelihood。它把奖励优化重新写进 forward matching 目标里因此更像“带奖励的流匹配后训练”而不是普通策略梯度。五、工程细节两个让大规模训练成为可能的关键设计5.1 有限差分为什么不用自动微分理论公式里有 partial_t u_theta 和 partial_x u_theta 乘 v_hat_theta本质是 Jacobian-vector product。直接用自动微分算 JVP 很贵而且和大规模 FSDP 训练兼容性差。论文实际实现用central finite difference近似总导数沿着速度方向把 x_t 和 t 向前/向后挪一个很小的 delta t再看 u_old 的差分。这有两个工程意义避免了昂贵的高阶自动微分让 MeanFlowNFT 可以放到视频模型这种更大规模训练里否则一个理论上漂亮的诱导速度公式可能因为计算成本而无法用于Wan2.1这类模型。5.2 共享导数为什么让新旧策略共享导数更稳论文强调shared total derivative。原因在于u_theta 和 u_old 通过 EMA 保持接近但它们各自的导数不一定接近。如果正负预测器用各自导数差异项会被导数噪声放大训练信号就不再是受控的 u_theta - u_old而可能变成不稳定的导数差。论文选择让两者共享由 u_old 估计的导数这样 V_theta 和 V_old 的差异主要来自平均速度本身。六、实验结果从图像到视频4 步打出全场最佳6.1 图像生成SD3.5-M 上的全面领先在 1024 分辨率下MeanFlowNFT 在 few-step 组里多项指标拿到最佳指标MeanFlowNFT (4-step)说明ImageReward1.4504最高CLIPScore0.2967最高PickScore23.5019最高HPSv20.3269最高GenEval20.2375最高OCR0.6534最高这个结果说明它不是只优化单一 reward而是在多种偏好、文本对齐、OCR 和综合生成指标上同时改善。表里还暴露了直接套 DiffusionNFT 的问题DMD DiffusionNFT、CDM DiffusionNFT 的指标并不稳定甚至 HPSv3 出现明显退化。这支持论文的主张少步生成器需要匹配自身参数化的 RL 目标不能把 forward-process RL 当成即插即用外挂。6.2 视频生成Wan2.1 4 步冲到 VBench 84.33这是最让人兴奋的部分。MeanFlowNFT 在Wan2.1 1.3B视频生成上指标MeanFlowNFT (4-step)说明VBench Total84.33最高Quality85.99最高HPSv3-G6.5959最高HPSv3-P10.793最高MQ (运动质量)0.9535最高更关键的是它还超过了 50-step 的 Wan2.1 LongCat-Video RL在所有报告指标上的数值同时函数评估步数少得多。对视频来说少步采样尤其重要因为每一步都要处理时空 token步数减少会直接影响成本和交互速度。七、测试时步数扩展不是只能固定 4 步MeanFlowNFT 在多数步数上保持领先并且随着步数增加仍能获得一定收益。这说明它没有把模型训练成只能在固定 4 步下工作而是保留了 MeanFlow/AnyFlow 类模型的 any-step 或 test-time scaling 特性。对部署很重要低延迟场景可用 4 步高质量离线场景可增加步数。八、理论保证不是纯经验拼接论文的 policy-improvement 保证建立在 idealized setting 上证明诱导预测器的点态最优解等价于旧诱导速度加上一项奖励方向 Delta说明当 beta 与 alpha 匹配时V_theta* 可以恢复 improved policy 的 marginal instantaneous velocity v^利用 MeanFlow consistency 把这个瞬时速度保证转回平均速度网络 u_theta这不是说现实训练一定单调变好。现实里有有限模型容量、有限差分误差、reward 噪声、EMA 滞后和优化不完全。但它至少说明 MeanFlowNFT不是纯经验拼接如果诱导速度目标能被学到那么平均速度采样器对应的策略也应该朝改进策略移动。九、和 DiffusionNFT 的关系继承思想但不是直接套用DiffusionNFT 的核心是 forward-process negative-aware finetuning。MeanFlowNFT 继承了这套思想但关键改造是接口层。DiffusionNFT 面对的是瞬时速度模型所以目标直接作用在 v_theta 上。MeanFlowNFT 面对的是平均速度模型所以必须先从 u_theta 诱导出 V_theta。这个“接口适配”就是文章的核心贡献。没有它平均速度网络会被错误地当成瞬时速度网络优化理论和训练稳定性都会受损。十、谁应该关注这个项目人群你能从中获得什么少步生成模型研究者一个让 average-velocity generator 吃上 RL 奖励的通用框架视频生成工程师Wan2.1 上 4 步 VBench 84.33 的实战方案扩散模型后训练爱好者forward-process RL 从瞬时速度到平均速度的接口适配方法论RLHF / 奖励对齐从业者少步模型做奖励优化时避免训练崩塌的关键设计AI 产品经理少步 更快的推理 更低的部署成本十一、总结少步生成器 RL 的“接口层”革命在大家都在卷“多步扩散怎么对齐奖励”的时候MeanFlowNFT 问了一个更前置的问题如果我的部署模型天生就是少步的RL 的接口应该怎么设计它不追 SOTA 刷分没有去卷更大的模型而是扎进了“average-velocity generator 的 RL 接口”这个被忽视的基础问题理论扎实诱导瞬时速度、policy-improvement 保证、有限差分实现三件事环环相扣工程落地Wan2.1 视频生成上 4 步 VBench 84.33超过 50-step 的 LongCat-Video RL诚实透明明确指出有限差分误差、reward noise、EMA 滞后等现实约束如果你正在做少步生成模型、视频生成、扩散模型后训练或者单纯对“如何让少步模型吃下 RL 奖励”感兴趣这篇论文绝对值得你精读、复现、迁移。论文地址arXiv 2607.15273项目页MeanFlowNFT Project Page代码GitHub · Hugging Face作者团队Tencent HunyuanMeanFlowNFT: bringing forward-process RL to average-velocity generators.

相关新闻

C++游戏开发实战:从环境配置到ECS架构与性能优化

C++游戏开发实战:从环境配置到ECS架构与性能优化

1. 项目概述与核心思路 “C 游戏开发示例(三)”这个标题,听起来像是某个系列教程的第三部分。对于正在学习C游戏开发的朋友来说,这通常意味着内容会深入到更具体的游戏机制、性能优化或者复杂系统的实现。从网络热词来看&#xf…

2026/7/23 1:33:29 阅读更多 →
Python ageliaco-rd 包:功能详解、安装配置与实战案例

Python ageliaco-rd 包:功能详解、安装配置与实战案例

1. 引言ageliaco-rd 是一个面向 Python 生态的专业数据处理与算法加速包,专注于提供高性能的数值计算、数据读取与分布式处理能力。本文将从功能特性、安装配置、核心语法与参数、8 个实际应用案例以及常见错误与注意事项五个维度,全面介绍 ageliaco-rd …

2026/7/21 23:58:25 阅读更多 →
各平台AIGC率要求降到多少?讲清标准和降的方法

各平台AIGC率要求降到多少?讲清标准和降的方法

各平台AIGC率要求降到多少?讲清标准和降的方法 你现在最想要一个明确的数字:AIGC 率到底降到多少才算过?是低于 20% 就行,还是得压到 10% 以内,还是干脆越低越好?你翻了半天,发现每个人说的都不…

2026/7/21 23:58:25 阅读更多 →

最新新闻

最新量化开发卡住,先查规则和流程是否完整

最新量化开发卡住,先查规则和流程是否完整

量化实现并不只是把交易想法翻译成代码。很多时候,代码写不下去,是因为规则本身还没有达到程序需要的清晰程度。手工交易可以依赖临场判断,而量化表达需要把判断拆成固定的条件和流程,这正是 AI 可以参与协作的地方。规则要先变得…

2026/7/23 1:32:53 阅读更多 →
HarmonyOS掌上记账APP开发实践第67篇:鸿蒙权限声明体系 — INTERNET / PUBLISH_AGENT_REMINDER 等权限的合理使用

HarmonyOS掌上记账APP开发实践第67篇:鸿蒙权限声明体系 — INTERNET / PUBLISH_AGENT_REMINDER 等权限的合理使用

鸿蒙权限声明体系 — INTERNET / PUBLISH_AGENT_REMINDER 等权限的合理使用文章简介 HarmonyOS 的应用权限体系是保障用户隐私和应用安全的核心机制。MoneyTrack 作为一款联网记账应用,需要在 module.json5 中声明多项权限,包括网络访问权限(…

2026/7/23 1:32:53 阅读更多 →
Gemini 3.5网页版免登录,国内直连免费使用

Gemini 3.5网页版免登录,国内直连免费使用

在 2026 年,大模型的快速迭代让开发者在编写代码和处理文档时有了更多选择,Gemini 3.5 凭借其出色的多模态能力和超长上下文优势受到了技术圈的广泛关注 。但对于国内开发者来说,官方网页版不仅需要繁琐的登录验证,网络门槛也较高…

2026/7/23 1:32:53 阅读更多 →
AI写作金句植入的临界点突破:从机械插入到语义锚定的72小时速成路径

AI写作金句植入的临界点突破:从机械插入到语义锚定的72小时速成路径

更多请点击: https://codechina.net 第一章:AI写作金句植入的临界点突破:从机械插入到语义锚定的72小时速成路径 传统AI写作中,金句常被当作装饰性“贴片”强行嵌入段落首尾,导致语义断裂、逻辑悬浮。真正的突破发生…

2026/7/23 1:32:53 阅读更多 →
跨境 SaaS  北美联机业务调优:360CDN 搭配 Nginx 跨洋业务完整配置指南

跨境 SaaS 北美联机业务调优:360CDN 搭配 Nginx 跨洋业务完整配置指南

不少技术团队部署跨境 SaaS 平台、多人联机交互业务面向北美市场时,直接使用国内站点的 CDN 配置模板,忽视跨大西洋远距离传输特性,同时没有区分静态页面、动态 API、长连接交互的差异化需求。最终出现东西海岸访问速度差距大、接口提交超时、…

2026/7/23 1:32:53 阅读更多 →
Claude Fable 5:AI编程助手从聊天机器人到工程化工具的质变

Claude Fable 5:AI编程助手从聊天机器人到工程化工具的质变

如果你最近关注AI编程助手领域,可能会注意到一个现象:Claude相关的工具和插件突然密集出现,从Claude Code到Claude Desktop,再到最新的Fable 5版本。这不仅仅是版本号的简单升级,而是标志着AI编程助手正在从"聊天…

2026/7/23 1:31:53 阅读更多 →

日新闻

从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表)

从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表)

更多请点击: https://intelliparadigm.com 第一章:从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表) 当AI副业主理人不再仅满足于单次服务交付,而是主动构建可复用、可裂变、可…

2026/7/23 0:00:25 阅读更多 →
AI写作开头钩子设计:为什么你的AI文案完读率不足18%?——基于2,346篇A/B测试报告的归因分析

AI写作开头钩子设计:为什么你的AI文案完读率不足18%?——基于2,346篇A/B测试报告的归因分析

更多请点击: https://codechina.net 第一章:AI写作开头钩子设计:为什么你的AI文案完读率不足18%?——基于2,346篇A/B测试报告的归因分析 在对2,346篇跨行业AI生成文案的A/B测试数据进行聚类分析后,我们发现&#xff1…

2026/7/23 0:01:26 阅读更多 →
Chitchatter完整指南:免费开源的终极点对点安全聊天工具

Chitchatter完整指南:免费开源的终极点对点安全聊天工具

Chitchatter完整指南:免费开源的终极点对点安全聊天工具 【免费下载链接】chitchatter Secure peer-to-peer chat that is serverless, decentralized, and ephemeral 项目地址: https://gitcode.com/gh_mirrors/ch/chitchatter Chitchatter是一款革命性的安…

2026/7/23 0:01:26 阅读更多 →

周新闻

Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/22 8:58:19 阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/22 19:43:43 阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/22 12:54:44 阅读更多 →

月新闻