BokeSkill:把小说丢进去,30分钟出一整部广播剧!
当整个AI行业都在卷文生图、文生视频的时候有一个项目选择了一条截然不同的路——它问了一个看似简单却极其硬核的问题如果让AI当编剧、当配音导演、当音效师、当混音师全自动把一本小说变成一部完整的广播剧会怎样项目地址https://github.com/dfytensor/BokeSkill一、为什么这个项目值得你停下来读如果你接触过AI语音合成TTS或AI音频生成你一定对这样的场景习以为常用Fish Speech、ChatTTS克隆一个声音需要录几段干净的参考音频用Stable Audio生成一段音效需要反复调prompt最后还要自己用Audition把配音、音效、BGM一轨一轨拼起来——做一个3分钟的音频片段可能要折腾一整天。但BokeSkill提出了一个颠覆性的问题如果整个流程——从剧本分析、角色声音设计、逐句配音、音效生成、BGM配乐到多轨混音和质量自动评估修复——全部交给AI流水线自动完成会怎样BokeSkill全称Podcast Generator Skill是一套全自动广播剧/有声书生成流水线。你把一篇小说或剧本丢进去它会在约30分钟内输出一部完整的、带角色区分、带音效配乐、带专业混音的广播剧。结果令人震惊7阶段全自动流水线从编剧拆场景到专业混音零人工干预多角色配音每个角色独立音色支持情感控制音效BGM自动生成Stable Audio 3 Medium统一生成配合质量评分自动修复专业级混音四总线(对白/音效/音乐)DSP链LUFS响度归一化质量闭环Qwen2.5-Omni自动评分低分片段触发prompt重写重新生成直到达标这不是在现有TTS工具上做点小修小补——它是从零搭建了一整条AI音频工业流水线。二、核心思想从“手工拼音频”到“全自动工业流水线”2.1 传统AI音频制作在做什么传统做法是工具链割裂的用A工具做TTS配音用B工具生成音效用C工具做BGM最后用D工具手动混音。每个环节都需要人工干预、参数调优、格式转换。BokeSkill的核心洞察是这些环节本质上都是确定性的输入输出映射——输入是文本输出是音频。既然每个环节都可以用AI自动化那为什么不把它们串成一条完整的流水线2.2 BokeSkill的七阶段流水线整个流程分为两个大阶段Agent决策阶段智能编剧音频导演和bridge_final.py执行阶段6个自动化阶段。第一阶段Agent智能决策opencode SKILL.md步骤任务产出Step 1编剧 — 拆场景、设钩子场景结构 开篇钩子设计Step 2音频导演 — 声音设计角色音色描述、SFX/BGM prompt编写第二阶段bridge_final.py全自动执行6阶段用户输入小说/剧本 ↓ Phase 1: Qwen3-TTS VoiceDesign → 角色参考音色voices/*.wav ↓ Phase 2: Qwen3-TTS Base (VoiceClone) → 逐句配音line_*.wav ↓ [可选] ViiTorVoice-NAR → 情感控制配音 ↓ Phase 34: Stable Audio 3 Medium → 音效sfx_*.wav BGMbgm_*.wav Qwen2.5-Omni 质量评估1-10分 低于7分 → 写入 repair_needed.json ↓ Phase 5: Audio-Oscar Mixer DSP → 四总线混音 响度归一化 ↓ 产出: drama_final.wav完整广播剧 audio_manifest.md含评分 repair_needed.json如有低分 ↓ 如有低分Agent修复循环: 读取反馈 → 重写prompt → 重新生成 → 复评2.3 质量闭环自动评分 自动修复这是BokeSkill最精髓的设计——它不是一次性生成就完事了而是一个有质量反馈的闭环系统Qwen2.5-Omni-3B对每个音效/BGM进行1-10分质量评估评分低于7分的片段自动写入repair_needed.jsonAgent读取评分反馈根据Omni的具体评价重写声学prompt删除低分wav文件更新bridge_final.py重新运行生成再次检查repair_needed.json——循环直到全部达标设计原则bridge_final.py不包含任何外部API调用。所有需要智能的决策由agent在脚本外部完成脚本只负责确定性的音频生成/评估/混音。三、技术架构五大外部模型37GB的AI音频引擎BokeSkill整合了5个顶尖的AI音频模型总大小约37GB模型大小用途阶段Qwen3-TTS VoiceDesign4.2 GB根据文字描述生成角色参考音色Phase 1Qwen3-TTS Base (VoiceClone)4.2 GB用参考音色克隆逐句生成配音Phase 2默认ViiTorVoice-NAR~8.5 GB替代引擎原生情感/NVV标签控制CFG权重调强度Phase 2可选Stable Audio 3 Medium9.2 GB统一文本生成音效 背景音乐Phase 34Qwen2.5-Omni-3B11.2 GB音频理解质量评估 低分自动修复触发评估阶段合计~37 GB3.1 VRAM智能管理顺序加载24GB显卡够用所有模型顺序加载/卸载同一时刻最多1-2个模型在显存中Phase 1: VoiceDesign加载(~4GB) → 生成 → 卸载Phase 2 (Qwen3): Base加载(~4GB) → 生成 → 卸载Phase 2 (ViiTorVoice): Encoder(~2.3G) LLM(~2.1G) Decoder(~0.4G) → 生成 → 保持Phase 34: Stable Audio 3 Medium加载(~9GB) → 生成SFXBGM → 卸载Phase 34评估: Omni加载(~11GB) → 评估全部 → [低分修复循环] → 卸载Phase 5: 混音纯CPU无GPU占用最低配置RTX 4090 D 24GB VRAM3.2 两种TTS引擎按需切换BokeSkill支持两套TTS引擎Qwen3-TTS默认语音克隆质量高但推理较慢~5min/句无flash-attn时ViiTorVoice-NAR可选支持原生情感/NVV标签控制推理快6s/句首次加载15s3.3 专业级混音Audio-Oscar DSP链BokeSkill不直接运行Audio-Oscar的完整pipeline而是提取了其最核心的混音能力四总线混音对白/音效/音乐分离处理DSP效果链pedalboard Compressor/Gain/LimiterLUFS响度归一化pyloudnorm确保输出响度专业四、快速上手4.1 硬件要求项目要求当前配置GPUNVIDIA GPU, ≥ 16GB VRAMRTX 4090 D, 24GB VRAMCUDA≥ 12.6CUDA 12.6内存≥ 32GB RAM—磁盘≥ 50GB模型venv产出—4.2 模型下载所有模型均来自HuggingFace完全本地运行无需任何API# Qwen3-TTShttps://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-VoiceDesign https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-Base# ViiTorVoice-NARhttps://huggingface.co/ZzWater/ViiTorVoice-NAR# Stable Audio 3 Mediumhttps://huggingface.co/stabilityai/stable-audio-3-medium# Qwen2.5-Omni-3Bhttps://huggingface.co/Qwen/Qwen2.5-Omni-3B4.3 环境搭建# 1. 创建虚拟环境uv venvF:\voice_design\.venv--python3.12# 2. 安装PyTorch (CUDA 12.6)uv pipinstalltorch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu126# 3. 安装核心依赖uv pipinstalltransformers soundfile librosa scipy numpy pedalboard pyloudnorm# 4. 安装Qwen2.5-Omni依赖uv pipinstallqwen-omni-utils pillow av# 5. 安装stable-audio-toolsuv pipinstalleinops transformers accelerate safetensors alias-free-torch auraloss uv pipinstallstable-audio-tools --no-deps4.4 运行完整流水线cdE:\播客skill\podcast-generatorF:\voice_design\.venv\Scripts\python.exebridge_final.py项目会在output/目录下生成drama_final.wav— 完整广播剧混音后audio_manifest.md— 片段清单含Omni评分line_00_角色名.wav— 逐句配音sfx_00.wav— 音效bgm_00.wav— 背景音乐五、已知限制与未来方向项目团队坦诚地列出了当前版本的局限限制影响变通方案flash-attn无法安装(CUDA 13.1 vs PyTorch cu126)TTS推理慢~5min/句降级CUDA驱动到12.4或等待更新Stable Audio 3 Medium参数体系不同仅需8 stepscfg_scale1.0不要照搬Small版本参数Qwen2.5-Omni-3B是3B小模型评估精度有限偶尔评分偏差可升级到7B版本BGM只铺最长一段多场景音乐切换未实现后续在mixer中按场景分段切换Windowssox未安装librosa部分功能降级不影响核心流程最新进展项目刚刚更新了开篇钩子公式5种模式用于生成20秒注意力钩子。六、总结与思考BokeSkill的价值远不止于“又出了一个AI音频工具”。它真正值得深思的地方在于第一它证明了“AI音频全自动流水线”是可行的。把5个顶尖模型串成一条完整的工业流水线加上质量闭环自动修复——这不是demo而是一个真正能产出成品的系统。第二它展示了“Agent 确定性脚本”的分工范式。opencode agent负责所有需要智能的决策编剧、声音设计、prompt修复bridge_final.py只负责确定性的音频生成/评估/混音。这种分工清晰、可维护、可扩展。第三它完全本地化、零API依赖。所有模型都在本地运行不需要任何云API调用——这对隐私敏感的内容创作场景至关重要。第四它把“质量”纳入了自动化闭环。不是生成完就结束而是用Qwen2.5-Omni自动评分、自动修复直到达标。当然BokeSkill目前还有不少局限TTS推理速度偏慢、BGM切换未实现、评估模型精度有限。但它打开了一扇门如果未来的内容创作不再需要你亲自配音、剪音频、找音效而只需要丢一篇小说进去呢项目地址https://github.com/dfytensor/BokeSkill欢迎star、fork、提issue——一起探索AI音频自动化的另一种可能。

相关新闻

终极指南:5分钟搞定ChromeKeePass自动填充密码

终极指南:5分钟搞定ChromeKeePass自动填充密码

终极指南:5分钟搞定ChromeKeePass自动填充密码 【免费下载链接】ChromeKeePass Chrome extensions for automatically filling credentials from KeePass 项目地址: https://gitcode.com/gh_mirrors/ch/ChromeKeePass 还在为记住各种网站密码而烦恼吗&#x…

2026/7/28 2:15:20 阅读更多 →
智能扫码革命:米哈游游戏登录的终极解决方案

智能扫码革命:米哈游游戏登录的终极解决方案

智能扫码革命:米哈游游戏登录的终极解决方案 【免费下载链接】MHY_Scanner MHY扫码登录器,支持从直播流抢码。 项目地址: https://gitcode.com/gh_mirrors/mh/MHY_Scanner 在米哈游游戏生态中,扫码登录已成为玩家日常体验的关键环节。…

2026/7/28 2:20:11 阅读更多 →
2026年探索家庭网络组播电视分发:解锁内容分发新可能,提升网络性能

2026年探索家庭网络组播电视分发:解锁内容分发新可能,提升网络性能

视频博主提供了相关视频的缩略图,点击可跳转至视频页面([缩略图](/posts/2026/isp_mcast/1.png),视频链接:https://youtu.be/nHzU-sspN54 )。参考资料以下这些视频等资料对博主很有帮助,也推荐给读者&#…

2026/7/27 1:15:56 阅读更多 →

最新新闻

用Micro:bit与纸板制作红外感应击掌机器人:从传感器原理到动手实践

用Micro:bit与纸板制作红外感应击掌机器人:从传感器原理到动手实践

1. 项目概述:当纸板遇上代码,一个“击掌”机器人的诞生如果你手头有一块Micro:bit,又恰好攒了几个快递纸箱,别急着扔掉。今天我想分享的,就是如何用这些看似普通的材料,制作一个能和你“击掌”的互动机器人…

2026/7/28 2:48:41 阅读更多 →
Windows C++ RPC开发实战:基于WinAPI的轻量级进程间通信实现

Windows C++ RPC开发实战:基于WinAPI的轻量级进程间通信实现

1. 项目概述:为什么要在Windows上用C和WinAPI搞RPC?如果你在Windows平台上用C做开发,尤其是涉及到进程间通信(IPC)或者分布式系统雏形,绕不开的一个话题就是RPC(远程过程调用)。你可…

2026/7/28 2:48:41 阅读更多 →
解密MiroFish:基于群体智能的下一代预测引擎架构解析

解密MiroFish:基于群体智能的下一代预测引擎架构解析

解密MiroFish:基于群体智能的下一代预测引擎架构解析 【免费下载链接】MiroFish A Simple and Universal Swarm Intelligence Engine, Predicting Anything. 简洁通用的群体智能引擎,预测万物 项目地址: https://gitcode.com/GitHub_Trending/mi/MiroF…

2026/7/28 2:48:41 阅读更多 →
mGBA模拟器深度解析:从精准模拟到高级调优实战指南

mGBA模拟器深度解析:从精准模拟到高级调优实战指南

mGBA模拟器深度解析:从精准模拟到高级调优实战指南 【免费下载链接】mgba mGBA Game Boy Advance Emulator 项目地址: https://gitcode.com/gh_mirrors/mg/mgba mGBA作为目前最精确的Game Boy Advance模拟器,不仅提供了完美的游戏兼容性&#xff…

2026/7/28 2:48:41 阅读更多 →
如何用Goose桌面应用告别命令行:3个核心技巧提升AI助手使用效率

如何用Goose桌面应用告别命令行:3个核心技巧提升AI助手使用效率

如何用Goose桌面应用告别命令行:3个核心技巧提升AI助手使用效率 【免费下载链接】goose an open source, extensible AI agent that goes beyond code suggestions - install, execute, edit, and test with any LLM 项目地址: https://gitcode.com/GitHub_Trendi…

2026/7/28 2:48:40 阅读更多 →
Arduino实战:用WS2812B灯环与DS1307 RTC制作三色时间显示圆盘钟

Arduino实战:用WS2812B灯环与DS1307 RTC制作三色时间显示圆盘钟

1. 项目概述:从“看时间”到“感受时间”的转变每次看时间,你是不是也和我一样,习惯性地掏出手机,点亮屏幕,瞥一眼数字,然后锁屏?这个动作重复了成千上万次,时间对我们而言&#xff…

2026/7/28 2:47:40 阅读更多 →

日新闻

告别臃肿!3步让你的暗影精灵笔记本重获新生

告别臃肿!3步让你的暗影精灵笔记本重获新生

告别臃肿!3步让你的暗影精灵笔记本重获新生 【免费下载链接】OmenSuperHub Control Omen laptop performance, fan speeds, and keyboard lighting, and unlock power limits. 项目地址: https://gitcode.com/gh_mirrors/om/OmenSuperHub 你是否也曾为官方Om…

2026/7/28 0:00:43 阅读更多 →
RAG必踩坑!财报法规检索不准?这款开源工具让答案浮出水面,准确率飙升98.7%!

RAG必踩坑!财报法规检索不准?这款开源工具让答案浮出水面,准确率飙升98.7%!

做 RAG 的人应该都踩过这个致命的坑:把几百页的财报、法规、技术手册扔给向量库,问一个具体问题,搜出来的全是沾边但没用的内容 —— 关键信息要么被硬切块拆碎了,要么藏在几十条结果的最下面。语义相似≠真正相关,这个…

2026/7/28 0:00:43 阅读更多 →
抖音视频文案提取工具全指南:免费2026版、手机App、在线工具一网打尽

抖音视频文案提取工具全指南:免费2026版、手机App、在线工具一网打尽

2026年做短视频运营,从抖音上扒文案早就不是偷偷抄笔记的事了。我刚开始做内容的时候,每天刷半小时抖音,手动把爆款视频的口播敲进备忘录,一条2分钟的视频得花十来分钟,碰到语速快的还要反复回听。后来试了一圈工具&am…

2026/7/28 0:00:43 阅读更多 →

周新闻

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 数据集6000张 完整源码已标注数据集训练好的模型环境配置教程程序运行说明文档,可以直接使用!系统支持图片、视频、摄像头等多种方式检测裂缝,功能强大实用。 1数据集6000张 8各类别

2026/7/27 4:33:59 阅读更多 →
深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

pubg数据集 精选原图1.42万数据 1.49万标签 无任何重复、算法增强或冗余图像! pubg绝地求生目标检测数据集 1分类:e_body,14905个标签,txt格式 共计14244张图,99%为640*640尺寸图像 适合yolo目标检测、AI训练关键词&am…

2026/7/27 6:31:56 阅读更多 →
Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex检测数据集数据集详情检测类别: allies enemy tag图片总量:7247张训练集:5139张验证集:1425张测试集:683张标注状态:全部已标注,即拿即用数据格式:支持YOLO格式及其他格式&#…

2026/7/27 4:01:12 阅读更多 →

月新闻