ClearerVoice-Studio 上手全攻略:3步跑通语音增强、语音分离与音质修复
ClearerVoice-Studio 上手全攻略3步跑通语音增强、语音分离与音质修复【免费下载链接】ClearerVoice-StudioAn AI-Powered Speech Processing Toolkit and Open Source SOTA Pretrained Models, Supporting Speech Enhancement, Separation, and Target Speaker Extraction, etc.项目地址: https://gitcode.com/gh_mirrors/cl/ClearerVoice-Studio周五深夜你把一盘老磁带转出来的音频拖进播放器访谈嘉宾的声音被电流声、风扇嗡嗡声和翻纸声裹得严严实实十年前的录音又闷又糊。如果你也经历过录音能听但听不清的尴尬那么 ClearerVoice-Studio 就是为你准备的。这个开源的 AI 语音处理工具包主打语音增强去噪、语音分离、语音超分辨率与目标说话人提取预训练模型开箱即用几行代码就能把听不清变成听得清。30秒速览这个工具包到底能做什么判断维度结论项目定位开源 AI 语音处理工具包内置 SOTA 预训练模型核心能力语音增强、语音分离、语音超分辨率、音视频目标说话人提取上手成本纯 WAV 场景一条 pip 命令无需自己训练模型适合人群内容创作者、普通用户、研究者与开发者附带组件Train 训练框架 SpeechScore 语音质量评估工具包整个仓库由三部分组成clearvoice统一推理入口、train训练与微调脚本、speechscore16 种质量评估指标。其中 FRCRN 去噪模型在 ModelScope 上已被调用超过 300 万次属于久经考验的成熟方案。第一步最省事的环境配置方法只用 WAV 文件的用户一行命令搞定pip install clearvoice需要源码安装或参与开发时克隆仓库后以可编辑模式安装git clone https://gitcode.com/gh_mirrors/cl/ClearerVoice-Studio cd ClearerVoice-Studio/clearvoice pip install --editable .关键提醒如果输入的是 MP3、AAC、FLAC、OGG 等非 WAV 格式请先安装 FFmpegUbuntu 用sudo apt install ffmpegmacOS 用brew install ffmpegWindows 下载静态版并配置 PATH。只处理.wav则无需安装。第二步3行代码跑通第一次语音增强新建任意 Python 文件粘贴下面这段带中文注释的最小示例from clearvoice import ClearVoice # 创建语音增强处理器选用全频带 48kHz 模型 myClearVoice ClearVoice(taskspeech_enhancement, model_names[MossFormer2_SE_48K]) # 处理单个音频文件返回波形而不落盘 output_wav myClearVoice(input_pathsamples/input.wav, online_writeFalse) # 把结果写回本地文件 myClearVoice.write(output_wav, output_pathsamples/output_enhanced.wav)第一次运行时模型会自动从 HuggingFace 下载到./clearvoice/checkpoints目录之后可离线使用。前后对比一听便知背景噪音被擦掉、人声更靠前——相当于给声音做了一次磨皮。第三步按真实场景选择任务与模型这套工具不是一套代码只干一件事而是按需求给了四套能力外加一套打分工具。场景一给嘈杂录音降噪三个模型怎么选模型采样率适用特点FRCRN_SE_16K16kHz轻量快速适合实时或大批量去噪MossFormerGAN_SE_16K16kHz效果与速度均衡评测中 PESQ 最高3.47MossFormer2_SE_48K48kHz全频带处理高音质场景首选场景二把多人对话拆成单个人声会议录音、访谈素材里两人同时说话时用语音分离任务myClearVoice ClearVoice(taskspeech_separation, model_names[MossFormer2_SS_16K]) output_wav myClearVoice(input_pathsamples/input_ss.wav, online_writeFalse) myClearVoice.write(output_wav, output_pathsamples/output_separated.wav)写入后会自动生成output_separated_s1.wav和output_separated_s2.wav两个文件。该模型在 WSJ0-2Mix、WHAM! 等公开基准上的 SI-SNRi 指标均处第一梯队如 WSJ0-2Mix 达 22.0 dB。场景三把闷糊的老录音修到 48kHz语音超分辨率带宽扩展能把 16kHz/24kHz/32kHz 的低分辨率音频提升到 48kHz适合修复年代久远的素材myClearVoice ClearVoice(taskspeech_super_resolution, model_names[MossFormer2_SR_48K])官方推荐的流程是先用MossFormer2_SE_48K去噪、再用MossFormer2_SR_48K升采样评测显示该组合能把 16kHz 输入的 Log-Spectral Distance 从 2.80 压低到 1.93PESQ 从 1.97 提升到 3.15。场景四从视频里认人提取目标说话人当手里是一段有画面的视频只想保留画面中某个人的声音时myClearVoice ClearVoice(tasktarget_speaker_extraction, model_names[AV_MossFormer2_TSE_16K]) myClearVoice(input_pathsamples/path_to_input_videos_tse, online_writeTrue, output_pathsamples/path_to_output_videos_tse)模型通过视频中的唇部/人脸信息锁定目标说话人支持 AVI、MP4、MOV、WEBM 等视频格式。场景五效果好不好让客观分数说话听起来不错不够严谨时用 SpeechScore 打分from speechscore import SpeechScore mySpeechScore SpeechScore([PESQ, STOI, SISDR, DNSMOS]) scores mySpeechScore(test_pathaudios/noisy.wav, reference_pathaudios/clean.wav, windowNone, score_rate16000, return_meanFalse)其中 DNSMOS、NISQA、DISTILL_MOS、SRMR 属于非侵入式指标不需要干净参考音频直接传reference_pathNone即可。全部 16 种指标PESQ、STOI、SI-SDR、SNR、LLR、LSD、MCD 等支持任意子集组合与目录批量打分。新手最常踩的4个坑非 WAV 格式报错就怀疑是代码 Bug——其实缺的是 FFmpeg装上即解。忽略首次模型下载——第一次运行偏慢属正常现象若自动下载失败可从 ModelScope 手动下载权重放入./clearvoice/checkpoints。批量处理时忘了开关——online_writeFalse只在处理单文件时返回波形处理目录或.scp列表文件时务必用online_writeTrue并指定output_path。给超分辨率喂过低的采样率——MossFormer2_SR_48K要求输入有效采样率至少 16kHz低于该值请先重采样或直接走增强流程。进阶锦囊给开发者的三种扩展玩法Numpy 直通接口demo_Numpy2Numpy.py演示了输入、输出均为 NumPy 数组的调用方式方便把 ClearVoice 嵌进训练或推理管线省去磁盘 IO。模型微调与重训train/目录提供语音增强16k/48k、语音分离8k/16k、超分辨率48k及目标说话人提取的训练脚本train/data_generation/speech_enhancement还自带加噪、加混响数据生成脚本。官方建议用 conda 创建 Python 3.8 环境后执行pip install -r requirements.txt。统一的评测闭环用 SpeechScore 给处理结果批量打分return_meanTrue可输出均值形成处理→评估→调参的完整闭环。30分钟行动清单与常见问题上手清单执行pip install clearvoice或源码安装并装好 FFmpeg跑通demo.py与demo_with_more_comments.py把各任务开关逐个打开体验用samples/目录下的示例音频测试增强与分离效果用 SpeechScore 给自己的结果打一次分形成量化认知FAQ问完全没有编程基础能用吗能。安装后只需改改示例里的文件路径即可官方演示脚本每个用例都带有开关逐行注释。问没有 GPU 能跑吗可以。CPU 能跑通全部推理流程只是速度较慢有 GPU 会明显加快建议推理任务优先分配 GPU。问支持哪些音频格式WAV 原生支持MP3、AAC、FLAC、OGG、OPUS、WMA、M4A、AIFF 等格式需 FFmpeg 支持同时支持单双声道与 16/32 位精度。问只想快速提升音质先学哪个任务语音增强是性价比最高的入口追求高音质选MossFormer2_SE_48K追求速度选FRCRN_SE_16K先跑通一个场景再横向扩展。ClearerVoice-Studio 的价值在于把前沿模型封装成了普通人都能驾驭的工具。从今晚这条老录音开始去跑通你的第一个语音增强脚本吧。【免费下载链接】ClearerVoice-StudioAn AI-Powered Speech Processing Toolkit and Open Source SOTA Pretrained Models, Supporting Speech Enhancement, Separation, and Target Speaker Extraction, etc.项目地址: https://gitcode.com/gh_mirrors/cl/ClearerVoice-Studio创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

丰田软银亲子出行服务:从场景痛点到商业模式的深度解析

丰田软银亲子出行服务:从场景痛点到商业模式的深度解析

1. 从“顺风车”到“移动育儿室”:丰田与软银的跨界实验最近,丰田和软银联手搞了个大新闻,推出了一个听起来有点“跨界”的服务——带婴儿座椅和零食的“顺风车”。这消息一出,圈内圈外都挺热闹。乍一看,这不就是网约车…

2026/8/21 0:02:13 阅读更多 →
2025 年 3 月青少年软编等考 C 语言六级真题解析

2025 年 3 月青少年软编等考 C 语言六级真题解析

目录 T1. 链表元素分类 思路分析 T2. 出栈序列的合法性 思路分析 T3. 取行李 思路分析 T4. 散列表平均查找时间 思路分析 T1. 链表元素分类 题目链接:SOJ D1395 给定一个单链表,请编写程序将链表元素进行分类排列,使得所有负值元素都排在非负值元素的前面,而 [ 0 , K ] …

2026/8/19 20:38:39 阅读更多 →
ComfyUI-LTXVideo 实战:LTX-2 AI视频生成从零到出片的完整手册

ComfyUI-LTXVideo 实战:LTX-2 AI视频生成从零到出片的完整手册

ComfyUI-LTXVideo 实战:LTX-2 AI视频生成从零到出片的完整手册 【免费下载链接】ComfyUI-LTXVideo LTX-Video Support for ComfyUI 项目地址: https://gitcode.com/GitHub_Trending/co/ComfyUI-LTXVideo 下午三点,你的 ComfyUI 画布里还只有一堆文…

2026/8/19 20:38:39 阅读更多 →

最新新闻

基于GPT-4V的科研图表智能识别与SVG代码生成实践

基于GPT-4V的科研图表智能识别与SVG代码生成实践

科研图表、论文配图、实验数据图,这些PNG、JPG格式的图片,想修改一个标签、调整一条曲线颜色,往往令人头疼。传统的做法是找到原始数据用Origin、Python重新画,或者用Adobe Illustrator手动描摹,费时费力。 现在&…

2026/8/21 2:15:43 阅读更多 →
让Illustrator自动干活的免费效率脚本:一次配置,告别90%的重复操作

让Illustrator自动干活的免费效率脚本:一次配置,告别90%的重复操作

让Illustrator自动干活的免费效率脚本:一次配置,告别90%的重复操作 【免费下载链接】illustrator-scripts Adobe Illustrator scripts 项目地址: https://gitcode.com/gh_mirrors/il/illustrator-scripts 晚上十一点,你还在为一套电商…

2026/8/21 2:15:43 阅读更多 →
Wallpaper Engine创意工坊下载器实测:3步免费极速搞定壁纸批量下载

Wallpaper Engine创意工坊下载器实测:3步免费极速搞定壁纸批量下载

Wallpaper Engine创意工坊下载器实测:3步免费极速搞定壁纸批量下载 【免费下载链接】Wallpaper_Engine 一个便捷的创意工坊下载器 项目地址: https://gitcode.com/gh_mirrors/wa/Wallpaper_Engine 每次逛Steam创意工坊,刷到会动、会变色、带音效的…

2026/8/21 2:15:43 阅读更多 →
猫抓Cat-Catch浏览器资源嗅探扩展深度解析:藏在沙盒里的媒体处理平台

猫抓Cat-Catch浏览器资源嗅探扩展深度解析:藏在沙盒里的媒体处理平台

猫抓Cat-Catch浏览器资源嗅探扩展深度解析:藏在沙盒里的媒体处理平台 【免费下载链接】cat-catch 猫抓 浏览器资源嗅探扩展 / cat-catch Browser Resource Sniffing Extension 项目地址: https://gitcode.com/GitHub_Trending/ca/cat-catch 视频网站播放时&a…

2026/8/21 2:15:43 阅读更多 →
右键菜单又长又乱?用ContextMenuManager一次收拾干净,找回清爽操作体验

右键菜单又长又乱?用ContextMenuManager一次收拾干净,找回清爽操作体验

右键菜单又长又乱?用ContextMenuManager一次收拾干净,找回清爽操作体验 【免费下载链接】ContextMenuManager 🖱️ 纯粹的Windows右键菜单管理程序 项目地址: https://gitcode.com/gh_mirrors/co/ContextMenuManager 某天你右键点开一…

2026/8/21 2:15:43 阅读更多 →
从Claude到GLM:AI应用模型迁移实战与架构解耦指南

从Claude到GLM:AI应用模型迁移实战与架构解耦指南

在实际的 AI 应用开发中,模型选型与集成是决定项目成败和长期维护成本的关键环节。当核心业务逻辑严重依赖某个大模型 API 时,一旦该服务出现访问问题、成本飙升或策略调整,整个应用就可能陷入停滞。我们最近就经历了一次这样的架构迁移&…

2026/8/21 2:14:43 阅读更多 →

日新闻

机场边检旅客定位系统国产化白皮书:算法、硬件、底座平台全程自主

机场边检旅客定位系统国产化白皮书:算法、硬件、底座平台全程自主

前言随着国家数字基础设施信创替代、关键技术自主可控战略持续深化,口岸智慧安防、边检智能管控领域正全面进入国产化、自主化、安全可控升级周期。当前国内机场边检旅客识别与定位体系长期依赖国外商用视觉算法、进口成像硬件、闭源通用计算平台,存在核…

2026/8/21 0:00:42 阅读更多 →
别再把“数字孪生”当空间智能了!镜像视界揭开四维时空的真正面纱

别再把“数字孪生”当空间智能了!镜像视界揭开四维时空的真正面纱

别再把“数字孪生”当空间智能了!镜像视界揭开四维时空的真正面纱当下数字化建设浪潮中,很多项目将三维可视化、视频贴图叠加的数字孪生等同于空间智能。传统数字孪生更多停留在三维场景复刻,擅长把物理世界“画出来、展示出来”,…

2026/8/21 0:00:42 阅读更多 →
105、车载温度范围-40°C到85°C的影像质量一致性——ISP参数温漂补偿与产线标定策略

105、车载温度范围-40°C到85°C的影像质量一致性——ISP参数温漂补偿与产线标定策略

105、车载温度范围-40C到85C的影像质量一致性——ISP参数温漂补偿与产线标定策略 去年冬天在北方某车厂做A样评审,凌晨四点的黑河试验场,零下三十三度。客户拿了一台冷启动的车,中控屏上倒车影像全是雪花噪点,暗部细节直接糊成一片。我第一反应是sensor温度没上来,暗电流…

2026/8/21 0:00:42 阅读更多 →

周新闻

基于阿里云与通义千问(Qwen)构建AI应用:从模型调用到生产部署的完整实践指南

基于阿里云与通义千问(Qwen)构建AI应用:从模型调用到生产部署的完整实践指南

如果你是一名开发者,最近可能已经感受到了AI大模型正在从“玩具”变成“生产力工具”的强烈信号。从代码补全到智能Agent,从本地部署到云端API,我们正处在一个技术栈快速重构的节点。然而,面对层出不穷的模型、框架和工具&#xf…

2026/8/19 11:55:18 阅读更多 →
工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

第四篇:反射——高频能量撞墙之后会发生什么? —— 你以为信号已经过去了,其实它正在回来打你 老Q的现场笔记 第五季,我们正式进入工业神经系统层。这里不再是单个设备的战斗,而是整个工厂“经脉”层面的秩序之战。从这一篇开始,你将第一次看清:看似简单的信号传播,背…

2026/8/21 0:02:09 阅读更多 →
【文章复现】非线性值迭代自适应动态规划(ADP):离散时间非线性系统的策略迭代自适应动态规划算法研究附Matlab代码

【文章复现】非线性值迭代自适应动态规划(ADP):离散时间非线性系统的策略迭代自适应动态规划算法研究附Matlab代码

✅作者简介:热爱科研的Matlab仿真开发者,擅长毕业设计辅导、数学建模、数据处理、建模仿真、程序设计、完整代码获取、论文复现及科研仿真。🍎 往期回顾关注个人主页:Matlab科研工作室👇 关注我领取海量matlab电子书和…

2026/8/19 11:55:16 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/20 6:11:08 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/20 21:46:49 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/21 0:14:22 阅读更多 →