BokeSkill:把小说丢进去,30分钟出一整部广播剧!
当整个AI行业都在卷文生图、文生视频的时候有一个项目选择了一条截然不同的路——它问了一个看似简单却极其硬核的问题如果让AI当编剧、当配音导演、当音效师、当混音师全自动把一本小说变成一部完整的广播剧会怎样项目地址https://github.com/dfytensor/BokeSkill一、为什么这个项目值得你停下来读如果你接触过AI语音合成TTS或AI音频生成你一定对这样的场景习以为常用Fish Speech、ChatTTS克隆一个声音需要录几段干净的参考音频用Stable Audio生成一段音效需要反复调prompt最后还要自己用Audition把配音、音效、BGM一轨一轨拼起来——做一个3分钟的音频片段可能要折腾一整天。但BokeSkill提出了一个颠覆性的问题如果整个流程——从剧本分析、角色声音设计、逐句配音、音效生成、BGM配乐到多轨混音和质量自动评估修复——全部交给AI流水线自动完成会怎样BokeSkill全称Podcast Generator Skill是一套全自动广播剧/有声书生成流水线。你把一篇小说或剧本丢进去它会在约30分钟内输出一部完整的、带角色区分、带音效配乐、带专业混音的广播剧。结果令人震惊7阶段全自动流水线从编剧拆场景到专业混音零人工干预多角色配音每个角色独立音色支持情感控制音效BGM自动生成Stable Audio 3 Medium统一生成配合质量评分自动修复专业级混音四总线(对白/音效/音乐)DSP链LUFS响度归一化质量闭环Qwen2.5-Omni自动评分低分片段触发prompt重写重新生成直到达标这不是在现有TTS工具上做点小修小补——它是从零搭建了一整条AI音频工业流水线。二、核心思想从“手工拼音频”到“全自动工业流水线”2.1 传统AI音频制作在做什么传统做法是工具链割裂的用A工具做TTS配音用B工具生成音效用C工具做BGM最后用D工具手动混音。每个环节都需要人工干预、参数调优、格式转换。BokeSkill的核心洞察是这些环节本质上都是确定性的输入输出映射——输入是文本输出是音频。既然每个环节都可以用AI自动化那为什么不把它们串成一条完整的流水线2.2 BokeSkill的七阶段流水线整个流程分为两个大阶段Agent决策阶段智能编剧音频导演和bridge_final.py执行阶段6个自动化阶段。第一阶段Agent智能决策opencode SKILL.md步骤任务产出Step 1编剧 — 拆场景、设钩子场景结构 开篇钩子设计Step 2音频导演 — 声音设计角色音色描述、SFX/BGM prompt编写第二阶段bridge_final.py全自动执行6阶段用户输入小说/剧本 ↓ Phase 1: Qwen3-TTS VoiceDesign → 角色参考音色voices/*.wav ↓ Phase 2: Qwen3-TTS Base (VoiceClone) → 逐句配音line_*.wav ↓ [可选] ViiTorVoice-NAR → 情感控制配音 ↓ Phase 34: Stable Audio 3 Medium → 音效sfx_*.wav BGMbgm_*.wav Qwen2.5-Omni 质量评估1-10分 低于7分 → 写入 repair_needed.json ↓ Phase 5: Audio-Oscar Mixer DSP → 四总线混音 响度归一化 ↓ 产出: drama_final.wav完整广播剧 audio_manifest.md含评分 repair_needed.json如有低分 ↓ 如有低分Agent修复循环: 读取反馈 → 重写prompt → 重新生成 → 复评2.3 质量闭环自动评分 自动修复这是BokeSkill最精髓的设计——它不是一次性生成就完事了而是一个有质量反馈的闭环系统Qwen2.5-Omni-3B对每个音效/BGM进行1-10分质量评估评分低于7分的片段自动写入repair_needed.jsonAgent读取评分反馈根据Omni的具体评价重写声学prompt删除低分wav文件更新bridge_final.py重新运行生成再次检查repair_needed.json——循环直到全部达标设计原则bridge_final.py不包含任何外部API调用。所有需要智能的决策由agent在脚本外部完成脚本只负责确定性的音频生成/评估/混音。三、技术架构五大外部模型37GB的AI音频引擎BokeSkill整合了5个顶尖的AI音频模型总大小约37GB模型大小用途阶段Qwen3-TTS VoiceDesign4.2 GB根据文字描述生成角色参考音色Phase 1Qwen3-TTS Base (VoiceClone)4.2 GB用参考音色克隆逐句生成配音Phase 2默认ViiTorVoice-NAR~8.5 GB替代引擎原生情感/NVV标签控制CFG权重调强度Phase 2可选Stable Audio 3 Medium9.2 GB统一文本生成音效 背景音乐Phase 34Qwen2.5-Omni-3B11.2 GB音频理解质量评估 低分自动修复触发评估阶段合计~37 GB3.1 VRAM智能管理顺序加载24GB显卡够用所有模型顺序加载/卸载同一时刻最多1-2个模型在显存中Phase 1: VoiceDesign加载(~4GB) → 生成 → 卸载Phase 2 (Qwen3): Base加载(~4GB) → 生成 → 卸载Phase 2 (ViiTorVoice): Encoder(~2.3G) LLM(~2.1G) Decoder(~0.4G) → 生成 → 保持Phase 34: Stable Audio 3 Medium加载(~9GB) → 生成SFXBGM → 卸载Phase 34评估: Omni加载(~11GB) → 评估全部 → [低分修复循环] → 卸载Phase 5: 混音纯CPU无GPU占用最低配置RTX 4090 D 24GB VRAM3.2 两种TTS引擎按需切换BokeSkill支持两套TTS引擎Qwen3-TTS默认语音克隆质量高但推理较慢~5min/句无flash-attn时ViiTorVoice-NAR可选支持原生情感/NVV标签控制推理快6s/句首次加载15s3.3 专业级混音Audio-Oscar DSP链BokeSkill不直接运行Audio-Oscar的完整pipeline而是提取了其最核心的混音能力四总线混音对白/音效/音乐分离处理DSP效果链pedalboard Compressor/Gain/LimiterLUFS响度归一化pyloudnorm确保输出响度专业四、快速上手4.1 硬件要求项目要求当前配置GPUNVIDIA GPU, ≥ 16GB VRAMRTX 4090 D, 24GB VRAMCUDA≥ 12.6CUDA 12.6内存≥ 32GB RAM—磁盘≥ 50GB模型venv产出—4.2 模型下载所有模型均来自HuggingFace完全本地运行无需任何API# Qwen3-TTShttps://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-VoiceDesign https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-Base# ViiTorVoice-NARhttps://huggingface.co/ZzWater/ViiTorVoice-NAR# Stable Audio 3 Mediumhttps://huggingface.co/stabilityai/stable-audio-3-medium# Qwen2.5-Omni-3Bhttps://huggingface.co/Qwen/Qwen2.5-Omni-3B4.3 环境搭建# 1. 创建虚拟环境uv venvF:\voice_design\.venv--python3.12# 2. 安装PyTorch (CUDA 12.6)uv pipinstalltorch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu126# 3. 安装核心依赖uv pipinstalltransformers soundfile librosa scipy numpy pedalboard pyloudnorm# 4. 安装Qwen2.5-Omni依赖uv pipinstallqwen-omni-utils pillow av# 5. 安装stable-audio-toolsuv pipinstalleinops transformers accelerate safetensors alias-free-torch auraloss uv pipinstallstable-audio-tools --no-deps4.4 运行完整流水线cdE:\播客skill\podcast-generatorF:\voice_design\.venv\Scripts\python.exebridge_final.py项目会在output/目录下生成drama_final.wav— 完整广播剧混音后audio_manifest.md— 片段清单含Omni评分line_00_角色名.wav— 逐句配音sfx_00.wav— 音效bgm_00.wav— 背景音乐五、已知限制与未来方向项目团队坦诚地列出了当前版本的局限限制影响变通方案flash-attn无法安装(CUDA 13.1 vs PyTorch cu126)TTS推理慢~5min/句降级CUDA驱动到12.4或等待更新Stable Audio 3 Medium参数体系不同仅需8 stepscfg_scale1.0不要照搬Small版本参数Qwen2.5-Omni-3B是3B小模型评估精度有限偶尔评分偏差可升级到7B版本BGM只铺最长一段多场景音乐切换未实现后续在mixer中按场景分段切换Windowssox未安装librosa部分功能降级不影响核心流程最新进展项目刚刚更新了开篇钩子公式5种模式用于生成20秒注意力钩子。六、总结与思考BokeSkill的价值远不止于“又出了一个AI音频工具”。它真正值得深思的地方在于第一它证明了“AI音频全自动流水线”是可行的。把5个顶尖模型串成一条完整的工业流水线加上质量闭环自动修复——这不是demo而是一个真正能产出成品的系统。第二它展示了“Agent 确定性脚本”的分工范式。opencode agent负责所有需要智能的决策编剧、声音设计、prompt修复bridge_final.py只负责确定性的音频生成/评估/混音。这种分工清晰、可维护、可扩展。第三它完全本地化、零API依赖。所有模型都在本地运行不需要任何云API调用——这对隐私敏感的内容创作场景至关重要。第四它把“质量”纳入了自动化闭环。不是生成完就结束而是用Qwen2.5-Omni自动评分、自动修复直到达标。当然BokeSkill目前还有不少局限TTS推理速度偏慢、BGM切换未实现、评估模型精度有限。但它打开了一扇门如果未来的内容创作不再需要你亲自配音、剪音频、找音效而只需要丢一篇小说进去呢项目地址https://github.com/dfytensor/BokeSkill欢迎star、fork、提issue——一起探索AI音频自动化的另一种可能。

相关新闻

终极指南:5分钟搞定ChromeKeePass自动填充密码

终极指南:5分钟搞定ChromeKeePass自动填充密码

终极指南:5分钟搞定ChromeKeePass自动填充密码 【免费下载链接】ChromeKeePass Chrome extensions for automatically filling credentials from KeePass 项目地址: https://gitcode.com/gh_mirrors/ch/ChromeKeePass 还在为记住各种网站密码而烦恼吗&#x…

2026/8/20 3:16:55 阅读更多 →
智能扫码革命:米哈游游戏登录的终极解决方案

智能扫码革命:米哈游游戏登录的终极解决方案

智能扫码革命:米哈游游戏登录的终极解决方案 【免费下载链接】MHY_Scanner MHY扫码登录器,支持从直播流抢码。 项目地址: https://gitcode.com/gh_mirrors/mh/MHY_Scanner 在米哈游游戏生态中,扫码登录已成为玩家日常体验的关键环节。…

2026/8/21 2:50:06 阅读更多 →
2026年探索家庭网络组播电视分发:解锁内容分发新可能,提升网络性能

2026年探索家庭网络组播电视分发:解锁内容分发新可能,提升网络性能

视频博主提供了相关视频的缩略图,点击可跳转至视频页面([缩略图](/posts/2026/isp_mcast/1.png),视频链接:https://youtu.be/nHzU-sspN54 )。参考资料以下这些视频等资料对博主很有帮助,也推荐给读者&#…

2026/8/8 23:33:33 阅读更多 →

最新新闻

PyBaMM 参数集识别报错避坑实录:一次 KeyError 背后的四大根源与三十分钟排查法

PyBaMM 参数集识别报错避坑实录:一次 KeyError 背后的四大根源与三十分钟排查法

PyBaMM 参数集识别报错避坑实录:一次 KeyError 背后的四大根源与三十分钟排查法 【免费下载链接】PyBaMM Fast and flexible physics-based battery models in Python 项目地址: https://gitcode.com/gh_mirrors/py/PyBaMM PyBaMM(Python Battery…

2026/8/21 2:58:07 阅读更多 →
从零实现数据库存储引擎:500行代码理解LSM-Tree与WAL核心原理

从零实现数据库存储引擎:500行代码理解LSM-Tree与WAL核心原理

为什么一个开发者会想要自己动手写一个数据库?这听起来像是只有数据库内核团队才会做的事。但如果你深入思考一下,会发现这背后隐藏着巨大的价值:当你亲手实现一个最简单的键值存储时,你才能真正理解 ACID、B树、WAL(预…

2026/8/21 2:58:07 阅读更多 →
低空经济垂直招聘平台的优势与使用指南

低空经济垂直招聘平台的优势与使用指南

1. 低空经济行业人才需求现状分析低空经济作为新兴的战略性产业,正在经历前所未有的发展机遇。根据行业调研数据显示,2023年我国低空经济规模已突破5000亿元,预计未来五年将保持25%以上的年均复合增长率。这个快速扩张的产业涵盖了无人机研发…

2026/8/21 2:58:07 阅读更多 →
B站4K视频批量下载终极指南:用bilibili-downloader把会员内容永久存进硬盘

B站4K视频批量下载终极指南:用bilibili-downloader把会员内容永久存进硬盘

B站4K视频批量下载终极指南:用bilibili-downloader把会员内容永久存进硬盘 【免费下载链接】bilibili-downloader B站视频下载,支持下载大会员清晰度4K,持续更新中 项目地址: https://gitcode.com/gh_mirrors/bil/bilibili-downloader …

2026/8/21 2:58:07 阅读更多 →
Windows 连不上 iPhone?一条命令免费搞定苹果驱动与 USB 网络共享

Windows 连不上 iPhone?一条命令免费搞定苹果驱动与 USB 网络共享

Windows 连不上 iPhone?一条命令免费搞定苹果驱动与 USB 网络共享 【免费下载链接】Apple-Mobile-Drivers-Installer Powershell script to easily install Apple USB and Mobile Device Ethernet (USB Tethering) drivers on Windows! 项目地址: https://gitcode…

2026/8/21 2:58:07 阅读更多 →
大语言模型推理新范式:生成式递归推理与并行轨迹架构解析

大语言模型推理新范式:生成式递归推理与并行轨迹架构解析

1. 这篇文章真正要解决的问题如果你正在研究或使用大语言模型,可能会遇到一个核心瓶颈:模型的“思考”过程是黑盒的。我们输入一个问题,模型直接给出答案,但中间的逻辑链条、推理步骤,我们无从得知,更无法干…

2026/8/21 2:57:06 阅读更多 →

日新闻

机场边检旅客定位系统国产化白皮书:算法、硬件、底座平台全程自主

机场边检旅客定位系统国产化白皮书:算法、硬件、底座平台全程自主

前言随着国家数字基础设施信创替代、关键技术自主可控战略持续深化,口岸智慧安防、边检智能管控领域正全面进入国产化、自主化、安全可控升级周期。当前国内机场边检旅客识别与定位体系长期依赖国外商用视觉算法、进口成像硬件、闭源通用计算平台,存在核…

2026/8/21 0:00:42 阅读更多 →
别再把“数字孪生”当空间智能了!镜像视界揭开四维时空的真正面纱

别再把“数字孪生”当空间智能了!镜像视界揭开四维时空的真正面纱

别再把“数字孪生”当空间智能了!镜像视界揭开四维时空的真正面纱当下数字化建设浪潮中,很多项目将三维可视化、视频贴图叠加的数字孪生等同于空间智能。传统数字孪生更多停留在三维场景复刻,擅长把物理世界“画出来、展示出来”,…

2026/8/21 0:00:42 阅读更多 →
105、车载温度范围-40°C到85°C的影像质量一致性——ISP参数温漂补偿与产线标定策略

105、车载温度范围-40°C到85°C的影像质量一致性——ISP参数温漂补偿与产线标定策略

105、车载温度范围-40C到85C的影像质量一致性——ISP参数温漂补偿与产线标定策略 去年冬天在北方某车厂做A样评审,凌晨四点的黑河试验场,零下三十三度。客户拿了一台冷启动的车,中控屏上倒车影像全是雪花噪点,暗部细节直接糊成一片。我第一反应是sensor温度没上来,暗电流…

2026/8/21 0:00:42 阅读更多 →

周新闻

基于阿里云与通义千问(Qwen)构建AI应用:从模型调用到生产部署的完整实践指南

基于阿里云与通义千问(Qwen)构建AI应用:从模型调用到生产部署的完整实践指南

如果你是一名开发者,最近可能已经感受到了AI大模型正在从“玩具”变成“生产力工具”的强烈信号。从代码补全到智能Agent,从本地部署到云端API,我们正处在一个技术栈快速重构的节点。然而,面对层出不穷的模型、框架和工具&#xf…

2026/8/19 11:55:18 阅读更多 →
工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

第四篇:反射——高频能量撞墙之后会发生什么? —— 你以为信号已经过去了,其实它正在回来打你 老Q的现场笔记 第五季,我们正式进入工业神经系统层。这里不再是单个设备的战斗,而是整个工厂“经脉”层面的秩序之战。从这一篇开始,你将第一次看清:看似简单的信号传播,背…

2026/8/21 0:02:09 阅读更多 →
【文章复现】非线性值迭代自适应动态规划(ADP):离散时间非线性系统的策略迭代自适应动态规划算法研究附Matlab代码

【文章复现】非线性值迭代自适应动态规划(ADP):离散时间非线性系统的策略迭代自适应动态规划算法研究附Matlab代码

✅作者简介:热爱科研的Matlab仿真开发者,擅长毕业设计辅导、数学建模、数据处理、建模仿真、程序设计、完整代码获取、论文复现及科研仿真。🍎 往期回顾关注个人主页:Matlab科研工作室👇 关注我领取海量matlab电子书和…

2026/8/19 11:55:16 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/20 6:11:08 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/20 21:46:49 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/21 0:14:22 阅读更多 →