论文阅读笔记 | The Script is All You Need: 对话到电影级视频生成的 Agentic 框架
The Script is All You Need: An Agentic Framework for Long-Horizon Dialogue-to-Cinematic Video Generation1. Motivation当前的视频生成模型如 Sora2-Pro、Veo3.1、Wan2.5虽然已经能够根据文本 prompt 合成高质量的短视频但在面对更复杂的创作任务时暴露出根本性的局限从高层叙事概念如一段对话到电影级视频之间存在巨大的语义鸿沟semantic gap。具体来说给定一段粗粒度的角色对话现有模型无法自主完成以下三件事细粒度上下文理解从稀疏对话中消解歧义补全隐含信息电影制作领域知识生成合理的镜头类型、运镜方式等专业规格创意推理将说了什么桥接到应该展示什么。论文的核心论点引用了希区柯克的名言——“拍一部好电影需要三样东西剧本、剧本、还是剧本”认为自动化电影制作中缺失的关键环节正是**剧本Script**本身。因此论文提出在 T2V 生成之前先自动生成一份细粒度、可执行的电影级分镜脚本作为下游视频模型的指导。2. Related Work论文的相关工作主要覆盖三个方向视频生成当前主流方法依赖扩散模型Sora、Wan2.5 等和语言模型CogVideo 等但在长时叙事连贯性方面仍有显著不足特别是受限于固定时长通常 8-12 秒的生成窗口。LLM 用于电影制作Anim-Director、MovieAgent 等系统利用 LLM 进行场景生成和角色规划但普遍依赖人工输入来完成叙事和镜头规划自动化程度有限。故事可视化从早期的 StoryGAN 到近期的 StoryDiffusion、Magic-Me虽然在时序一致性上有所改善但仍缺乏对镜头语言、场景结构和角色交互的自动化高层规划能力。本文的差异化在于提出了一个端到端的多 agent 框架从对话出发自动生成完整的分镜脚本再驱动视频生成减少了人工干预。3. Method整体框架由三个 Agent 组成ScripterAgent剧本生成、DirectorAgent视频执行、CriticAgent质量评测。3.1 ScriptBench 数据集首先构建了 ScriptBench一个大规模的电影级分镜脚本基准数据集包含 1,750 个标注实例1700 训练 50 测试平均视频时长约 15.4 秒。数据来源于高质量电影过场动画具备丰富的对话、专业镜头语言和高视觉一致性。标注流程分三个阶段使用 Gemini-2.5-Pro 作为标注引擎但全程由专家定义的模板和约束规则严格控制上下文重建与对话融合联合分析文本和音频推断角色关系、场景设定、情感倾向等将隐式因果关系显式化镜头级语义规划在镜头完整性、时长适配≤10秒、语义连贯性、技术可行性四个约束下进行分镜规划多轮自适应纠错通过对话完整性、角色外观一致性、场景连贯性、位置与物理合理性四个验证模块进行迭代修正。自动通过率达 94%但专家审核发现了角色瞬移、对话-动作冲突等细微错误这些反馈被融入了后续的约束优化中。3.2 ScripterAgent两阶段训练ScripterAgent 基于Qwen-Omni-7B微调目标是将粗粒度对话转化为结构化的 JSON 格式分镜脚本。阶段一SFT结构能力将任务形式化为 seq2seq 任务输入为多轮对话输出为结构化脚本。使用标准的条件对数似然损失训练 20 个 epoch学习率 1e-5最大序列长度 8192 tokens。此阶段使模型掌握脚本的格式和基本叙事结构。阶段二GRPO电影美学对齐SFT 保证了结构正确性但无法捕捉镜头组合、节奏感、情感冲击力等主观审美。因此引入 Group Relative Policy Optimization (GRPO) 进行偏好对齐。核心是一个混合奖励函数R total ( y ) α ⋅ R structure ( y ) ( 1 − α ) ⋅ R human ( y ) , α 0.4 R_{\text{total}}(y) \alpha \cdot R_{\text{structure}}(y) (1-\alpha) \cdot R_{\text{human}}(y), \quad \alpha0.4Rtotal​(y)α⋅Rstructure​(y)(1−α)⋅Rhuman​(y),α0.4R structure R_{\text{structure}}Rstructure​规则奖励包含格式合规、对话完整性、场景角色一致性、物理合理性四个自动化检查R human R_{\text{human}}Rhuman​人类偏好奖励由 3 位资深美术总监对 500 个 SFT 输出样本打分1-5 分覆盖分镜合理性、角色表演、视觉美学、导演意图四个维度训练了一个 BERT 回归模型作为人类偏好的可扩展代理。GRPO 优化时对每个输入生成 K8 个候选脚本计算组内归一化优势函数并加 KL 散度惩罚β0.04防止偏离 SFT 初始化太远。训练 5000 步学习率 1e-6。3.3 DirectorAgent跨场景连续生成DirectorAgent 负责将脚本转化为连贯的长视频核心是跨场景连续生成策略包含两个关键机制智能分镜分割按照 ScripterAgent 定义的自然镜头边界将脚本切分为多个生成任务而非任意时间切割遵循镜头完整性、时长适配含 10% 安全缓冲、语义连贯性、技术可行性四个原则。帧锚定连续性Frame-Anchoring提取上一个场景的最后一帧作为下一个场景的视觉锚点conditioning image配合文本提示Continuing from the previous scene形成视觉接力显著减少身份漂移和场景突变。本质上是将长时序生成问题转化为一系列局部可解的、保持连续性的子问题。已知局限唇形同步和细粒度动作对齐仍有残差误差。3.4 CriticAgent评测框架CriticAgent 基于 Gemini-2.5-Pro分别对脚本生成和视频生成进行多维度自动评分0-5 分并结合人类专家评分和自动化指标CLIP Score、VBench、VSA构成综合评测体系。其中Visual-Script Alignment (VSA)是论文提出的新指标衡量视频内容是否在脚本指定的时间区间内出现评估时序-语义对齐能力VSA 1 ∑ k 1 K ∣ T k ∣ ∑ k 1 K ∑ t ∈ T k Sim ( E vis ( v t ) , E txt ( I k ) ) \text{VSA} \frac{1}{\sum_{k1}^{K}|T_k|} \sum_{k1}^{K} \sum_{t \in T_k} \text{Sim}(\mathcal{E}_{\text{vis}}(v_t), \mathcal{E}_{\text{txt}}(I_k))VSA∑k1K​∣Tk​∣1​k1∑K​t∈Tk​∑​Sim(Evis​(vt​),Etxt​(Ik​))4. Experiments4.1 脚本生成实验在 ScriptBench 测试集上ScripterAgentFull即 SFTRL在所有 AI 评分和人类评分指标上均显著优于基线方法CHAE、MoPS、SEED-Story方法格式合规分镜合理内容完整叙事连贯角色一致戏剧张力视觉想象SEED-Story3.63.53.73.83.63.73.8ScripterAgent (SFT)3.93.63.83.93.73.63.8ScripterAgent (Full)4.03.94.14.24.04.14.3关键发现SFT 阶段已能学到基本结构但 RL 阶段对主观艺术维度提升显著戏剧张力 3.6→4.1视觉想象 3.8→4.3验证了 GRPO 混合奖励对创意任务的有效性。4.2 视频生成实验对 7 个 SOTA 视频生成模型Vidu2、Seedance1.5-Pro、Kling2.6、Wan2.6、HYVideo1.5、Sora2-Pro、Veo3.1进行了有/无 ScripterAgent 的对比加入 ScripterAgent 后所有模型在所有维度上均有提升平均 AI 评分从 4.2→4.5平均人类评分从 3.7→4.2脚本忠实度Script Faithfulness提升最为显著如 Wan2.6 从 3.2→4.0VSA 指标普遍提升验证了时序-语义对齐的改善发现了一个重要 trade-offSora2-Pro 在视觉效果Visual Appeal 4.8和物理真实性4.5上最强但 HYVideo1.5 在脚本忠实度4.6和叙事连贯性4.3上领先说明当前模型在视觉奇观和脚本遵从之间存在取舍。4.3 消融实验在 Wan2.6 和 HYVideo1.5 上的四阶段消融Baseline → Script → Segment → Full Agent表明ScripterAgent 主要提升视觉描述忠实度和肢体动作表现DirectorAgent分割 帧锚定主要提升叙事节奏和镜头表达维度两者的贡献功能性解耦且三个不同的 LLM 评估器结果高度一致。5. Conclusion论文提出了首个端到端的对话驱动电影级视频生成框架核心思路是先生成专业分镜脚本再驱动视频生成。通过 ScriptBench 数据集和两阶段训练的 ScripterAgent成功弥合了高层叙事与底层视频合成之间的语义鸿沟。实验验证了该方法对所有测试的 SOTA 视频模型均有普适性提升并发现了视觉效果与脚本遵从之间的关键 trade-off。未来方向包括精确唇形同步、自适应生成多样化电影风格的内容。6. 个人思考核心贡献的判断这篇工作的主要贡献其实就是ScripterAgent——训练了一个能将粗粒度对话转化为细粒度分镜脚本的模型。论文的实验设计本质上是在对比不同的 T2V 模型有无 ScripterAgent 辅助时的表现差异以证明脚本规划的价值。关于三个 Agent的包装如果去掉包装来看ScripterAgent 一个经过 SFTGRPO 微调的 7B 模型本质是一个 plannerDirectorAgent 一个基于规则的分割策略 帧锚定的工程 trick并不涉及模型训练CriticAgent 直接调用 Gemini-2.5-Pro 做评测是评估工具而非系统组件。所以整体框架可以简化理解为在 T2V 生成前加了一个 planner脚本生成器用三个 agent 的叙事做了包装。关于流程设计整个 pipeline 是单次前向的——ScripterAgent 生成脚本后直接交给 DirectorAgent 生成视频CriticAgent 只在最终评测时介入不存在生成-评测-修改的反馈循环。如果 CriticAgent 的评估结果能反馈给 ScripterAgent 或 DirectorAgent 进行迭代修正系统的效果可能会更好。这也许是一个值得探索的方向。值得肯定的点Frame-Anchoring 机制虽然不涉及模型训练但它用一个简洁的工程方案上一场景末帧作为下一场景的 conditioning image解决了跨场景视觉一致性这个实际痛点。消融实验也验证了它对叙事节奏和镜头连贯性的独立贡献是一个实用且可迁移的 trick。视觉奇观 vs 指令遵从的 trade-off 发现是本文最有启发性的 insight 。Sora2-Pro 优化方向偏向视觉效果Visual Appeal 4.8, Physical Law 4.5而 HYVideo1.5 优化方向偏向 instruction followingScript Faithfulness 4.6, Character Consistency 4.4。这说明当前的 T2V 模型在训练目标上存在内在分歧——有的追求看起来好看有的追求按指令办事二者尚未统一。这个发现对于实际选型高视觉品质场景 vs 高可控性场景和未来模型设计都有参考价值。VSA 指标关注了内容是否在正确的时间出现这一被忽视的维度有一定新颖性。Related Work 中对前人工作的描述值得商榷论文在 Related Work 中称 MovieAgent 等方法依赖人工输入进行叙事和镜头规划reliance on manual input但 MovieAgent 的全称就是Automated movie generation via multi-agent CoT planning本身就是用多 agent 做自动规划的。论文自己也承认 MovieAgent 使用了 multi-agent 协作紧接着又说它依赖人工输入存在自相矛盾。实际上两者的核心差异不在于人工 vs 自动而在于脚本输出的粒度和专业度——MovieAgent 的输出是较粗的 plot summary 简单运镜描述如 Figure 4 所示而 ScripterAgent 输出的是带精确时间戳、镜头参数、角色外观、空间位置等细粒度信息的可执行分镜脚本。这种在 Related Work 中为突出自身贡献而对前人工作描述稍显不公。不足之处测试集仅 50 个样本规模偏小结果的统计显著性存疑数据来源于游戏过场动画cinematic cutscenes与真实电影场景的多样性和复杂度有差距帧锚定机制虽然有效但比较简单仅用最后一帧做 conditioning在复杂场景变换如跨场景大幅度转场时效果可能有限“Agentic” 的说法有些过度包装整个系统中并没有真正的 agent 间协作或自主决策闭环。

相关新闻

PyTorch环境搭建全攻略:从CUDA版本匹配到实战避坑

PyTorch环境搭建全攻略:从CUDA版本匹配到实战避坑

1. 为什么你的PyTorch环境总是装不对?从版本匹配到实战避坑 每次打开PyTorch官网,看到那一长串的安装命令,是不是感觉头都大了? torch 、 torchvision 、 torchaudio ,再加上 cuda 版本,这几个家伙…

2026/8/1 2:58:52 阅读更多 →
Proteus仿真STM32全攻略:从环境搭建到外设调试实战

Proteus仿真STM32全攻略:从环境搭建到外设调试实战

1. 从零开始:为什么选择Proteus来仿真STM32?如果你刚开始接触STM32,或者想验证一个硬件电路设计,直接焊板子、烧程序、调硬件,这一套流程下来,时间成本和物料成本都不低。更头疼的是,如果程序逻…

2026/8/1 2:57:52 阅读更多 →
Mac版OpenClaw 2026,苹果系统专用AI助手下载

Mac版OpenClaw 2026,苹果系统专用AI助手下载

为什么Mac用户该试试OpenClaw 2026? 用了两年多M系列芯片的MacBook Pro,我一直觉得系统自带的Siri有点“憋屈”——不是它不好,而是面对复杂文档整理、代码片段优化或者写个朋友圈文案时,它给出的结果总像隔靴搔痒。直到上个月刷技…

2026/8/1 2:57:52 阅读更多 →

最新新闻

寒武纪股权激励计划解析:AI芯片人才争夺战的新策略

寒武纪股权激励计划解析:AI芯片人才争夺战的新策略

寒武纪近期发布了一项大规模股权激励计划,拟向超过85%的员工授予500万股限制性股票,授予价格为每股750元。这一举措在芯片行业人才竞争白热化的背景下引发广泛关注,既体现了公司对核心人才的重视,也反映出半导体行业人才争夺战的激…

2026/8/1 3:42:09 阅读更多 →
Windows命令行下Python交互环境全攻略:从入门到高效使用

Windows命令行下Python交互环境全攻略:从入门到高效使用

1. 项目概述:为什么需要掌握命令行下的Python交互作为一名开发者,无论是刚入门的新手还是经验丰富的老手,命令行终端都是我们绕不开的工具。在Windows环境下,cmd和PowerShell是两扇通往系统底层和开发环境的大门。而Python&#x…

2026/8/1 3:42:09 阅读更多 →
实践与认识:从哲学原理到技术人的认知行动指南

实践与认识:从哲学原理到技术人的认知行动指南

1. 从“知道”到“做到”:为什么我们需要重读实践与认识每次翻开《马克思主义基本原理》的第二章,看到“实践与认识及其发展规律”这个标题,很多朋友可能第一反应是:哦,又是那些“实践是检验真理的唯一标准”、“认识来…

2026/8/1 3:42:09 阅读更多 →
仅限头部AI基建团队内部流通:AI网络请求生命周期管理矩阵(含请求溯源ID、意图标签、可信度置信区间三元组标准)

仅限头部AI基建团队内部流通:AI网络请求生命周期管理矩阵(含请求溯源ID、意图标签、可信度置信区间三元组标准)

更多请点击: https://codechina.net 第一章:AI网络请求生命周期管理矩阵的定义与核心价值 AI网络请求生命周期管理矩阵是一种面向高并发、多模态、动态策略驱动的AI服务调用场景而设计的结构化治理模型。它将传统HTTP请求的线性生命周期(发送…

2026/8/1 3:42:09 阅读更多 →
【YOLOv11模型改进系列】07 标签冲突大作战:当Mosaic遇上MixUp,你的损失函数在“打架”

【YOLOv11模型改进系列】07 标签冲突大作战:当Mosaic遇上MixUp,你的损失函数在“打架”

07 标签冲突大作战:当Mosaic遇上MixUp,你的损失函数在“打架” 老伙计们,上回咱们聊到MixUp和Mosaic叠加时标签爆炸的问题,你按我给的采样策略保住了前200个目标,总算没让显存原地升天。 但别急着庆祝——我上周在客户项目里又翻车了:一个无人机航拍数据集,用了Mosaic…

2026/8/1 3:42:09 阅读更多 →
第2章 新篇08 莹姐申请转岗2

第2章 新篇08 莹姐申请转岗2

接上周,本周按约定莹姐1对1谈话。一、莹姐觉得不公平:原本觉得工作没有高低贵贱之分,但现在发现绩效总是集中在做“重点项目”的人身上,其他人也付出了很多,绩效却不够好。运维做得好,也应该是一种能力的体…

2026/8/1 3:41:09 阅读更多 →

日新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/1 0:00:48 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/1 0:00:48 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/1 0:00:48 阅读更多 →

周新闻

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 数据集6000张 完整源码已标注数据集训练好的模型环境配置教程程序运行说明文档,可以直接使用!系统支持图片、视频、摄像头等多种方式检测裂缝,功能强大实用。 1数据集6000张 8各类别

2026/7/31 1:03:03 阅读更多 →
深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

pubg数据集 精选原图1.42万数据 1.49万标签 无任何重复、算法增强或冗余图像! pubg绝地求生目标检测数据集 1分类:e_body,14905个标签,txt格式 共计14244张图,99%为640*640尺寸图像 适合yolo目标检测、AI训练关键词&am…

2026/7/29 14:34:28 阅读更多 →
Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex检测数据集数据集详情检测类别: allies enemy tag图片总量:7247张训练集:5139张验证集:1425张测试集:683张标注状态:全部已标注,即拿即用数据格式:支持YOLO格式及其他格式&#…

2026/7/31 4:19:39 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/1 0:00:48 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/1 0:00:48 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/1 0:00:48 阅读更多 →