从Copilot到Director:多模态智能体如何接管AIGC全流程
本文整理自 QCon北京 2026 李云鑫《从Copilot到Director多模态智能体如何接管AIGC流程》技术分享通过AI音视频转录总结工具Ai好记转录整理以下为视频转文字后的会议笔记内容。AIGC工具遍地开花但为什么还是用起来费劲现在的 AIGC 工具已经多到数不过来。文生图、图生视频、视频剪辑、语音合成每一个细分赛道都有好几个产品。按理说工具越丰富创作应该越方便。但实际情况恰恰相反工具泛滥反而带来了精力消耗。问题出在哪李云鑫在分享中指出当前 AIGC 工具有三大核心痛点规划无逻辑复杂任务比如生成一段短视频涉及多个步骤但现有工具在长程推理和步骤规划上远远不够。工具调用缺乏统筹要做一条完整的视频往往需要在多个工具之间来回切——完图用A工具配音用B工具剪辑用C工具。人成了那个胶水层。评估标准缺失扩散模型天然有随机性同一段 prompt 生成5条结果可能只有1条能用。谁来帮你挑这三个痛点叠加导致一个荒诞的现实工具在提效人在当调度。最终大部分时间不是花在创作上而是花在串联工具上。解题思路以语言智能为大脑李云鑫团队的核心思路很简单但很有效用大语言模型的强规划和抽象能力来接管整个AIGC工作流的调度。具体来说就是构建一个以语言智能为核心的智能体框架基座是全模态大模型能理解文字、图像、音频、视频上层是多模态智能体框架具备复杂任务规划和长程交互推理能力外挂各类 AIGC 工具把生成任务藏到工具调用里这个架构有个很有意思的设计原则不追求一个模型搞定所有事。团队选择的是大语言模型 外挂模块把具体的生成任务比如画图、配音视为工具调用由语言模型指挥合适的工具去执行。全模态基座模型的构建路径要撑起这个智能体框架基座模型必须同时具备理解和生成两种能力。李云鑫团队走了一条务实的技术路线多专家混合架构MoE 渐进式三阶段训练第一阶段让模型学会理解外部信息图像、音频、视频第二阶段预热各专家模块第三阶段任务级调优他们训练的Uni-MoE-20-Omni模型在仅用75B tokens的训练规模下效果已经超越了千万参数的 Omni 模型。这在当时是相当亮眼的成绩。不过更重要的是团队发现外挂式结构才是构建综合型多模态大模型最方便的路径。原因很简单——生成模型迭代太快今天用的文生图模型下周可能就有更强的替身。外挂式的架构允许你随时换发动机。复杂任务推理用强化学习教模型思考有了基座模型还不够要让智能体真正能干复杂活还得教它怎么推理。李云鑫团队在这块用了迭代式强化学习方案冷启动先用已有数据让模型具备基础能力生成采样让模型在真实场景中生成数据强模型筛选用更大的模型来批改作业只保留有效的推理路径DPO对齐用正负样本对加速对齐效果非常明显。在 AIGC 场景中没有推理过程的模型只能生成粗粒度结果而带了推理过程的模型能显著提升生成质量。更有意思的是他们在 UI 操控场景做的多目标强化学习实验。传统的 RPO 训练只有一个监督目标但在复杂的 UI 工作流中单一目标根本不够。团队的做法是在关键中间节点也施加奖励让模型保持路径多样性。结果是一个 7B 的小模型在 UI 调试场景中达到了 96% 的幻觉通过率超越了 GPT-4o 和 Claude 在未见场景上的表现。从 Copilot 到 ComfyAgent 的实践理论讲完来看实际落地的产品。李云鑫团队做了三个递进式的智能体项目ComfyUI-Copilot给 ComfyUI 配了一个AI副驾驶。用户输入需求中控 Agent 从知识库检索相关技能自动生成工作流然后调试修复最后验证交付。这个项目在 GitHub 上拿了 1500 星标还被官方集成了在阿里国际业务也有落地。Anim-Director四智能体协作框架——导演智能体管剧本和分镜摄影智能体调用视频生成模型评估智能体管质量打分14个维度包括美学、一致性、动作质量等后期智能体管配音和后期处理。配合蒙特卡罗搜索做路径优化生成了《小王子》片段。AIGC智能体员工整合前期所有工作迭代实现了全流程自动化。一句话输入比如被老板PUA了系统自动完成从剧本创作到成片输出的全流程。甚至支持多集续写通过飞书/微信就能交互。这个员工后来被美国电影制片人关注并转发带来了25万关注量。AIGC智能体的未来构想李云鑫在分享的最后给出了AIGC智能体发展的三个支柱工具智能维护好 Skill 与工具包组合保持灵活替换的能力叙事能力大模型在剧本创作上有天然优势这会是智能体的核心差异点智能体自进化通过闭环优化知识蒸馏、记忆库沉淀让智能体越用越好用他提到目前 Agentic RL 还处于起步阶段但像 Kimi 2.5 在并行智能体 RL 上的创新已经让人看到了方向。最终的目标是让内容创作不再被技术流程束缚每个人都能把自己的想法直接变成专业内容。对技术团队的三点启发听完整场分享我觉得有几点特别值得技术团队思考外挂式比大一统更实用。别试图做一个什么都能干的超级模型把生成当作工具调用反而更灵活。推理能力是关键分歧点。同样的模型、同样的工具有没有推理过程输出质量差了一个量级。强化学习是教会模型思考的有效路径。智能体自进化能力决定天花板。能沉淀经验、自我迭代的智能体才会越用越好。FAQQAIGC 智能体框架的开源方案有哪些可以参考AComfyUI-Copilot 是一个不错的起点GitHub 上可以找到相关代码。此外MCP 协议和 GEP 协议也值得关注。Q小模型在智能体场景下真的够用吗A不一定非要大模型。李云鑫团队的实验显示7B 模型在配合强化学习后在特定场景如 UI 调试上的表现可以超越 GPT-4o。关键是训练策略和场景聚焦。Q智能体自进化的具体实现思路是什么A核心是经验沉淀 闭环验证。把每次执行中的有效路径和失败案例都结构化存储定期回训练模型形成正反馈循环。以上内容由Ai好记视频转笔记整理。Ai好记是一款音视频转图文笔记的AI音视频转录总结助手支持解析B站、抖音、小红书、小宇宙等平台链接及本地/网盘音视频文件视频转文字后自动截取PPT关键帧生成精华速览、思维导图和结构化笔记帮助你把几小时的视频内容变成可搜索、可复习的图文笔记。

相关新闻

淘宝闪购骑手智能助手实战:从业务落地到Agent平台化

淘宝闪购骑手智能助手实战:从业务落地到Agent平台化

本文整理自 QCon北京 2026 李克华《淘宝闪购:从骑手智能助手业务落地到Agent平台化建设》技术分享,通过AI音视频转录总结工具 Ai好记 进行视频转文字整理,以下为精炼整理后的会议笔记内容。即时配送的快与骑手的累 淘宝闪购的核心卖点就一个字…

2026/7/28 21:05:28 阅读更多 →
C++模板进阶:typename、非类型参数、特化与分离编译实战

C++模板进阶:typename、非类型参数、特化与分离编译实战

1. 项目概述&#xff1a;深入C模板的“深水区”如果你已经对C的类模板和函数模板有了基本了解&#xff0c;能写出一个简单的vector<T>或者max(T a, T b)&#xff0c;那么恭喜你&#xff0c;你已经踏入了模板编程的大门。但门后的世界&#xff0c;远比想象中要广阔和复杂。…

2026/7/28 21:05:28 阅读更多 →
Obsidian加密插件完全指南:如何在笔记中安全保护敏感信息

Obsidian加密插件完全指南:如何在笔记中安全保护敏感信息

Obsidian加密插件完全指南&#xff1a;如何在笔记中安全保护敏感信息 【免费下载链接】obsidian-encrypt Hide secrets in your Obsidian.md vault 项目地址: https://gitcode.com/gh_mirrors/ob/obsidian-encrypt 在数字化笔记时代&#xff0c;保护个人隐私和敏感信息已…

2026/7/28 21:05:28 阅读更多 →

最新新闻

数据库连接文档都丢了怎么办:AI 分析表结构自动生成接口的实战路径

数据库连接文档都丢了怎么办:AI 分析表结构自动生成接口的实战路径

最近做了一个挺典型的项目&#xff0c;客户是一家老牌纺织企业&#xff0c;2005年上的第一套MES&#xff0c;2011年换过一次财务系统&#xff0c;2015年上的WMS&#xff0c;2019年又追加了个能耗管理系统。现在老板想做数据整合&#xff0c;把这些系统的数据拉到一个平台看。听…

2026/7/28 21:14:33 阅读更多 →
独立站流量暴跌后如何恢复?SEO诊断与多元化流量重建策略

独立站流量暴跌后如何恢复?SEO诊断与多元化流量重建策略

在独立站运营领域,流量来源单一往往是最大的风险点。一个家居装饰类网站,曾经高度依赖谷歌搜索流量实现月入几千美元,却在谷歌算法更新后遭遇流量断崖式下跌,这样的案例在跨境电商和内容创业圈并不少见。真正值得深入研究的,不是它曾经多么成功,而是它在失去主要流量来源…

2026/7/28 21:14:33 阅读更多 →
北京牵头全球首项人形机器人国际标准,2027展彰显主场实力

北京牵头全球首项人形机器人国际标准,2027展彰显主场实力

北京牵头全球首项人形机器人国际标准&#xff0c;2027展彰显主场实力 2027北京具身智能与人形机器人展览会将于2027年6月26日-28日在北京亦庄启幕&#xff0c;展会一大核心亮点&#xff0c;便是依托北京牵头立项的全球首项人形机器人国际标准《人形机器人数据集》&#xff0c;深…

2026/7/28 21:14:33 阅读更多 →
vLLM中的Constraint Decoding技术解析与应用优化

vLLM中的Constraint Decoding技术解析与应用优化

1. Constraint Decoding技术背景解析在大规模语言模型应用中&#xff0c;Constraint Decoding&#xff08;约束解码&#xff09;正成为平衡生成质量与可控性的关键技术手段。这项技术最早可追溯到2017年神经机器翻译领域的词汇约束研究&#xff0c;但在vLLM这类高性能推理框架中…

2026/7/28 21:14:33 阅读更多 →
从零搭建企业级AI简历筛选Pipeline(附GitHub Star超2.4k的开源评估框架实测报告)

从零搭建企业级AI简历筛选Pipeline(附GitHub Star超2.4k的开源评估框架实测报告)

更多请点击&#xff1a; https://codechina.net 第一章&#xff1a;从零搭建企业级AI简历筛选Pipeline&#xff08;附GitHub Star超2.4k的开源评估框架实测报告&#xff09; 企业招聘中&#xff0c;HR平均每天需人工审阅200份简历&#xff0c;而AI驱动的智能筛选Pipeline可将初…

2026/7/28 21:14:33 阅读更多 →
TPIC7710EVM评估板实战:从芯片验证到EPB系统设计的完整指南

TPIC7710EVM评估板实战:从芯片验证到EPB系统设计的完整指南

1. 项目概述与核心价值 在汽车电子&#xff0c;特别是车身控制和安全系统领域&#xff0c;电子驻车制动&#xff08;EPB&#xff09;正迅速取代传统的机械手刹。其核心在于一个高度集成的专用集成电路&#xff08;ASIC&#xff09;&#xff0c;它需要精准地控制电机、监测电流、…

2026/7/28 21:13:32 阅读更多 →

日新闻

告别臃肿!3步让你的暗影精灵笔记本重获新生

告别臃肿!3步让你的暗影精灵笔记本重获新生

告别臃肿&#xff01;3步让你的暗影精灵笔记本重获新生 【免费下载链接】OmenSuperHub Control Omen laptop performance, fan speeds, and keyboard lighting, and unlock power limits. 项目地址: https://gitcode.com/gh_mirrors/om/OmenSuperHub 你是否也曾为官方Om…

2026/7/28 0:00:43 阅读更多 →
RAG必踩坑!财报法规检索不准?这款开源工具让答案浮出水面,准确率飙升98.7%!

RAG必踩坑!财报法规检索不准?这款开源工具让答案浮出水面,准确率飙升98.7%!

做 RAG 的人应该都踩过这个致命的坑&#xff1a;把几百页的财报、法规、技术手册扔给向量库&#xff0c;问一个具体问题&#xff0c;搜出来的全是沾边但没用的内容 —— 关键信息要么被硬切块拆碎了&#xff0c;要么藏在几十条结果的最下面。语义相似≠真正相关&#xff0c;这个…

2026/7/28 0:00:43 阅读更多 →
抖音视频文案提取工具全指南:免费2026版、手机App、在线工具一网打尽

抖音视频文案提取工具全指南:免费2026版、手机App、在线工具一网打尽

2026年做短视频运营&#xff0c;从抖音上扒文案早就不是偷偷抄笔记的事了。我刚开始做内容的时候&#xff0c;每天刷半小时抖音&#xff0c;手动把爆款视频的口播敲进备忘录&#xff0c;一条2分钟的视频得花十来分钟&#xff0c;碰到语速快的还要反复回听。后来试了一圈工具&am…

2026/7/28 0:00:43 阅读更多 →

周新闻

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 数据集6000张 完整源码已标注数据集训练好的模型环境配置教程程序运行说明文档&#xff0c;可以直接使用&#xff01;系统支持图片、视频、摄像头等多种方式检测裂缝&#xff0c;功能强大实用。 1数据集6000张 8各类别

2026/7/28 12:04:22 阅读更多 →
深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

pubg数据集 精选原图1.42万数据 1.49万标签 无任何重复、算法增强或冗余图像&#xff01; pubg绝地求生目标检测数据集 1分类&#xff1a;e_body&#xff0c;14905个标签&#xff0c;txt格式 共计14244张图&#xff0c;99%为640*640尺寸图像 适合yolo目标检测、AI训练关键词&am…

2026/7/28 8:29:16 阅读更多 →
Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex检测数据集数据集详情检测类别&#xff1a; allies enemy tag图片总量&#xff1a;7247张训练集&#xff1a;5139张验证集&#xff1a;1425张测试集&#xff1a;683张标注状态&#xff1a;全部已标注&#xff0c;即拿即用数据格式&#xff1a;支持YOLO格式及其他格式&#…

2026/7/28 5:03:42 阅读更多 →

月新闻