在实际视频编辑工作流中,剪辑师往往需要反复在时间线上拖动、剪切、调整,这个过程既耗时又需要一定的专业技能。有没有一种方法,能让开发者或内容创作者通过自然语言描述,就自动完成视频的粗剪、调色、加字幕等重复性工作?这正是 browser-use/video-use 项目试图解决的问题。它是一个开源的、基于代码智能体(Coding Agent)的视频编辑工具,核心思想是让 LLM(如 Claude Code)来“阅读”视频的文本化信息(如逐字稿、时间戳),并驱动脚本完成编辑,而非让 AI 直接“观看”视频。对于需要批量处理视频素材、制作教程或快速产出社交媒体内容的开发者来说,这意味着可以将创意描述转化为可执行的编辑指令,从而将精力集中在内容本身而非软件操作上。本文将带你深入理解 video-use 的工作原理,从零开始完成环境搭建、技能配置,并运行一个完整的视频编辑示例。你将看到如何将原始视频素材放入文件夹,通过聊天指令让智能体分析、剪辑并输出成品。我们还会剖析其背后的“文本优先、按需可视化”设计哲学,解释关键配置参数,并梳理在实际使用中可能遇到的常见问题及排查路径。无论你是想探索 AI 辅助创作的新范式,还是希望为自己的项目集成自动化视频处理能力,这篇文章都将提供一份可复现的实践指南。1. 理解 video-use 的核心机制:为什么是“阅读”而非“观看”在接触具体操作前,必须先理解 video-use 的设计基石。传统基于 AI 的视频理解模型通常需要将视频帧解码为图像序列再输入模型,这个过程会产生巨大的计算和 token 开销。对于一个 1 分钟、30fps 的视频,就是 1800 帧图像,如果每帧用 1500 个 token 描述,总 token 数将高达 270 万,这既不经济也不高效。video-use 采用了截然不同的思路,其核心机制分为两层,共同为 LLM 提供了精确到词语边界进行剪辑所需的一切信息,而无需“观看”原始视频。1.1 第一层:音频转录文本(始终加载)这是 LLM 主要的“阅读”视图。video-use 会为每个视频源调用 ElevenLabs 的 Scribe API(或其他转录服务),生成包含以下关键信息的结构化文本:逐词时间戳:每个词语精确的开始和结束时间。说话人分离:区分视频中不同的讲话者(如 S0, S1)。音频事件标记:识别出非语音内容,如(laughter)、(applause)、(sigh)。所有这些转录结果会被压缩、打包成一个名为takes_packed.md的单一文件,通常只有约 12KB 大小。LLM 通过阅读这个文件,就能完全理解视频的音频内容结构。## C0103 (duration: 43.0s, 8 phrases) [002.52-005.36] S0 Ninety percent of what a web agent does is completely wasted. [006.08-006.74] S0 We fixed this.代码块示意:takes_packed.md文件片段。它清晰地标明了片段 ID、时长、以及每句话的精确时间范围和说话人。1.2 第二层:视觉合成视图(按需生成)当 LLM 基于文本信息做出剪辑决策,但在某些关键点(如模糊的停顿、不同条素材的对比、剪切点合理性检查)需要视觉参考时,才会触发此层。timeline_view脚本会为指定的时间范围生成一张合成 PNG 图片,这张图通常包含:视频帧缩略图(Filmstrip):按时间间隔抽取的关键帧。波形图(Waveform):对应时间段的音频波形,直观显示音量大小和静音区间。词语标签:在时间轴上标注出转录文本中的关键词。这个“按需生成”的策略,避免了海量帧数据的处理,仅在决策点提供必要的视觉上下文,极大地提升了效率。1.3 工作流程与自评估循环理解了输入信息的形式,我们再看 video-use 的完整处理管道(Pipeline):Transcribe(转录) - Pack(打包) - LLM Reasons(推理) - EDL(生成编辑决策列表) - Render(渲染) - Self-Eval(自评估) │ └─ 发现问题? - 修复并重新渲染(最多3次)转录与打包:将原始视频转为结构化的takes_packed.md。LLM 推理:你向智能体(如 Claude Code)发出指令(如“将这些剪辑成一个发布会视频”),智能体阅读takes_packed.md,制定剪辑策略并征求你的确认。生成 EDL:智能体生成一个编辑决策列表(Edit Decision List),这是一个文本文件,精确描述了从哪个源文件的哪个时间点,剪切到哪个时间点。渲染:video-use 调用ffmpeg,根据 EDL 执行实际的视频剪切、拼接、调色、添加字幕和动画覆盖层。自评估:这是保证输出质量的关键。渲染完成后,系统会在每一个剪切点自动调用timeline_view检查输出视频。它会检测视觉跳跃、音频爆音、字幕错误等问题。只有通过了自评估检查的视频,才会呈现给你预览。如果发现问题,系统会尝试自动修复并重新渲染,最多循环3次。这个机制确保了最终输出具备“生产正确性”(Production-correctness),例如30毫秒的音频淡入淡出避免爆音、颜色分级一致等硬性规则会被严格遵守。2. 环境准备与依赖安装要让 video-use 运行起来,需要准备一个兼容的代码智能体运行环境、必要的系统工具和 API 密钥。以下步骤以 macOS/Linux 环境为例,Windows 用户可以通过 WSL 或相应包管理器(如 Chocolatey)安装对应工具。2.1 前置条件检查在开始前,请确保你的系统满足以下基本要求:组件要求检查命令备注Python3.9+python3 --version推荐使