在 Mac 上本地跑通语音合成与识别:MLX-Audio 完整实操教程
在 Mac 上本地跑通语音合成与识别MLX-Audio 完整实操教程【免费下载链接】mlx-audioA text-to-speech (TTS), speech-to-text (STT) and speech-to-speech (STS) library built on Apples MLX framework, providing efficient speech analysis on Apple Silicon.项目地址: https://gitcode.com/GitHub_Trending/ml/mlx-audioMLX-Audio 是一个基于 Apple MLX 框架的本地语音库运行在 M 系列芯片M1/M2/M3/M4的 Mac 上同时覆盖文本转语音TTS、语音转文字STT、语音克隆和音乐生成适合想在设备端做语音应用或自动化的开发者。装好两样东西再跑第一条语音MLX-Audio 需要 Python 3.10 和 MLX 框架后者随 pip 自动安装。如果你的 Mac 是 Apple Silicon基础安装就一行pip install mlx-audio要使用 Web 界面或 API 服务需要带server依赖组从源码安装git clone https://gitcode.com/GitHub_Trending/ml/mlx-audio cd mlx-audio pip install -e .[dev, server]另外保存 MP3、FLAC、OGG 等格式依赖系统里的 ffmpeg提前装好brew install ffmpegWAV 格式不依赖 ffmpeg可以直接生成。一条命令听到第一句合成音 装好之后在终端执行mlx_audio.tts.generate \ --model mlx-community/Qwen3-TTS-12Hz-0.6B-CustomVoice-8bit \ --text Hello, world! \ --voice Vivian \ --play--play让系统直接播放不用翻找文件。--voice指定 Qwen3-TTS 自带的预设音色Vivian和Ryan都可以用。想加快语速加--speed默认 1.0mlx_audio.tts.generate \ --model mlx-community/Qwen3-TTS-12Hz-0.6B-CustomVoice-8bit \ --text 这句话会说得更快一些 \ --voice Vivian \ --speed 1.4一段文字如果生成多个片段默认存为audio_000.wav、audio_001.wav这样的编号文件加--join_audio可以合成一个文件。嵌进自己的 Python 代码from mlx_audio.tts.utils import load_model model load_model(mlx-community/Qwen3-TTS-12Hz-0.6B-CustomVoice-8bit) for result in model.generate( 你好这是本地语音合成。, voiceVivian, lang_codeChinese, ): print(f生成了 {result.audio.shape[0]} 个采样点)result.audio是mx.array波形数据可以直接写盘或送进播放器。换模型、换音色、克隆声音 ️MLX-Audio 内置二十多种 TTS 模型换模型只需改--model。Kokoro-82M是其中比较经典的一款支持英、日、中、法、西、意、葡、印地八种语言自带 54 个预设音色。它需要额外安装文本分词工具pip install misaki # 日文pip install misaki[ja] # 中文pip install misaki[zh]mlx_audio.tts.generate \ --model mlx-community/Kokoro-82M-bf16 \ --text 欢迎使用 MLX-Audio \ --voice af_heart \ --lang_code alang_code是单字母代码a美式英语、b英式英语、j日语、z普通话。完整模型列表和语言支持见 docs/models/tts。用一段参考音频克隆音色不需要录音棚几秒的参考音频就够了。CSM 模型支持 zero-shot 语音克隆mlx_audio.tts.generate \ --model mlx-community/csm-1b \ --text 你好来自 Sesame。 \ --ref_audio ./reference_voice.wav \ --play--ref_audio指向参考音频文件模型提取音色特征后让新文本用同样的声音读出来。反向也跑通语音转文字STT 的命令行入口和 TTS 对称用 Whisper 转写一段录音python -m mlx_audio.stt.generate \ --model mlx-community/whisper-large-v3-turbo-asr-fp16 \ --audio audio.wav \ --format json \ --verboseWhisper 支持 99 种以上语言如果只需要英文且追求速度可以换 Parakeetmlx-community/parakeet-tdt-0.6b-v3覆盖 25 种欧洲语言。Python 里调用同样简短from mlx_audio.stt.generate import generate_transcription result generate_transcription( modelmlx-community/whisper-large-v3-turbo-asr-fp16, audioaudio.wav, ) print(result.text)打开网页版工作台MLX-Audio 自带 FastAPI 后端和 Next.js 前端两个终端分别启动# 终端 1API 服务 mlx_audio.server --host 0.0.0.0 --port 8000 # 终端 2Web 界面 cd mlx_audio/ui npm install npm run dev界面跑在http://localhost:3000API 在http://localhost:8000。界面提供 TTS 生成可选音色和模型、STT 上传转写、3D 音频可视化等功能。API 是 OpenAI 兼容格式已有的 OpenAI 客户端代码只需改base_urlfrom openai import OpenAI client OpenAI( base_urlhttp://localhost:8000/v1, api_keynot-needed, ) response client.audio.speech.create( modelmlx-community/Kokoro-82M-bf16, voiceaf_heart, inputHello from the OpenAI client!, ) response.stream_to_file(output.mp3)量化让大模型跑得更省 降低权重位宽能直接缩小模型体积。4-bit 模型大约是 fp16 的 1/4 大小在 Apple Silicon 的统一内存架构下推理也会更快。量化入口是mlx_audio.convertpython -m mlx_audio.convert \ --hf-path prince-canuma/Kokoro-82M \ --mlx-path ./Kokoro-82M-4bit \ --quantize \ --q-bits 4常用位宽选择4-bit体积和质量的平衡点日常使用推荐6-bit接近无损适合对音质敏感的场景8-bit几乎无质量损失体积约为 fp16 的一半量化模式affine/mxfp4/mxfp8/nvfp4和分组大小等完整选项见 docs/guides/quantization.md。移动端如果目标是 iPhone 或 iPad项目提供了独立的 Swift 包mlx-audio-swift支持 macOS 14.0 和 iOS 16.0可以在设备端直接做 TTS不需要联网。接下来做什么跑一遍examples/里的演示脚本比如examples/streaming_transcription.py展示了流式转写的完整流程打开 docs/getting-started/quickstart-cli.md对照参数表把 TTS 和 STT 的 CLI 选项全部过一遍如果要接入自己的业务下一步建议先跑通mlx_audio.server再用 OpenAI 客户端把 TTS/STT 请求对接到现有代码里【免费下载链接】mlx-audioA text-to-speech (TTS), speech-to-text (STT) and speech-to-speech (STS) library built on Apples MLX framework, providing efficient speech analysis on Apple Silicon.项目地址: https://gitcode.com/GitHub_Trending/ml/mlx-audio创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

Animeko 代码风格与协作规范实践:EditorConfig 格式化、Kotlin 官方风格与 PR Review 惯例

Animeko 代码风格与协作规范实践:EditorConfig 格式化、Kotlin 官方风格与 PR Review 惯例

音视频移动开发视频 【免费下载链接】animation-garden 集找番、追番、看番的一站式弹幕追番平台,云收藏同步 (Bangumi),离线缓存,BitTorrent,弹幕云过滤。100% Kotlin/Compose Multiplatform 项目地址: https://gitco…

2026/9/20 6:57:05 阅读更多 →
RPCS3 2025 版:从源码到跑通 PS3 游戏,30 分钟手把手配置指南

RPCS3 2025 版:从源码到跑通 PS3 游戏,30 分钟手把手配置指南

RPCS3 2025 版:从源码到跑通 PS3 游戏,30 分钟手把手配置指南 【免费下载链接】rpcs3 PlayStation 3 emulator and debugger 项目地址: https://gitcode.com/GitHub_Trending/rp/rpcs3 RPCS3 是一款免费的 PlayStation 3 模拟器,能把你…

2026/9/20 6:57:05 阅读更多 →
MATLAB GUI实现WOA-CNN风电功率预测与超参数优化

MATLAB GUI实现WOA-CNN风电功率预测与超参数优化

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/20 6:57:05 阅读更多 →

最新新闻

arXiv每日论文分析报告:轻量级本地化学术情报流水线

arXiv每日论文分析报告:轻量级本地化学术情报流水线

1. 这不是“爬虫教程”,而是一份可复用的学术情报流水线设计手记你有没有过这样的体验:早上打开arXiv,面对3000篇新提交论文,标题扫过去全是“Vision-Language Alignment via Contrastive Token Refinement with Adaptive Semanti…

2026/9/20 7:42:22 阅读更多 →
接口测试全攻略:从用例设计到Apifox自动化实战

接口测试全攻略:从用例设计到Apifox自动化实战

接口测试知识总结要说接口测试,很多人的第一反应是“发个请求看看通不通”。但真正在服务端项目里滚过几年的人都知道,接口测试绝不只是把接口调通那么简单。我见过太多团队,前端页面测试做得花团锦簇,结果一上生产环境就爆雷&…

2026/9/20 7:42:22 阅读更多 →
kkFileView CAD图纸在线预览+手绘批注:3步跑通,全程零插件

kkFileView CAD图纸在线预览+手绘批注:3步跑通,全程零插件

kkFileView CAD图纸在线预览手绘批注:3步跑通,全程零插件 【免费下载链接】kkFileView Universal File Online Preview Project based on Spring-Boot 项目地址: https://gitcode.com/GitHub_Trending/kk/kkFileView 中午11点40,甲方在…

2026/9/20 7:42:22 阅读更多 →
别把ITSM做成工单流转:面向AI与信创的选型评估指南

别把ITSM做成工单流转:面向AI与信创的选型评估指南

1. 别把ITSM做成工单流转:先把场景想清楚这两年帮几家中大型企业做ITSM(IT服务管理)平台选型评审,有个感受特别明显:很多企业嘴上说“要上一套ITSM”,实际上只想要一个“工单系统”。需求文档翻来覆去就是报…

2026/9/20 7:42:22 阅读更多 →
前牙美学修复的光学逻辑与Kerr分层体系解析

前牙美学修复的光学逻辑与Kerr分层体系解析

1. 前牙美学修复不是“选颜色”,而是重建视觉逻辑链“前牙美学修复用什么品牌?Kerr自然与经典的搭配”——这个标题乍看像一句导购提问,实则藏着临床一线最常被忽视的认知断层:很多医生把前牙修复简化为“挑个好看的颜色”&#x…

2026/9/20 7:42:22 阅读更多 →
Sails 可安装钩子(Installable Hooks)开发完全指南:创建、命名、测试与发布

Sails 可安装钩子(Installable Hooks)开发完全指南:创建、命名、测试与发布

Sails 可安装钩子(Installable Hooks)开发完全指南:创建、命名、测试与发布 【免费下载链接】sails Realtime MVC Framework for Node.js 项目地址: https://gitcode.com/gh_mirrors/sa/sails 导读 可安装钩子(Installabl…

2026/9/20 7:41:22 阅读更多 →

日新闻

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

直接铺开项目本身吧。这几个月我一直在折腾一件事:用Flutter给OpenHarmony做一款游戏集合类的App,说白了就是把若干小游戏塞进一个壳里,用统一入口分发。这个方向本身不算新鲜,真正让我花了不少心思的,是首页那堆游戏卡…

2026/9/20 0:00:46 阅读更多 →
Word表格编号全攻略:从列表编号到题注交叉引用

Word表格编号全攻略:从列表编号到题注交叉引用

写Word文档,最让人头疼的往往是那些“看起来不起眼”的小问题。比如表格编号这事:今天在表后面多加了两个空白行,明天给客户交稿前发现整个章节的编号全部错位,光是挨个改序号就能耗掉大半个下午。我前阵子帮人整理一份上百页的技…

2026/9/20 0:00:46 阅读更多 →
从第一个站到第二个站:独立开发者的静态网站选型与落地实践

从第一个站到第二个站:独立开发者的静态网站选型与落地实践

1. 项目概述1.1 核心需求解析做独立开发者这几年,说实话,第一个网站上线的那天晚上我兴奋得没睡着。但等它跑了半年,流量惨淡、功能臃肿、代码自己都懒得看第二遍之后,我才慢慢琢磨明白一个道理:第一个网站是练手&…

2026/9/20 0:00:46 阅读更多 →

周新闻

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

直接铺开项目本身吧。这几个月我一直在折腾一件事:用Flutter给OpenHarmony做一款游戏集合类的App,说白了就是把若干小游戏塞进一个壳里,用统一入口分发。这个方向本身不算新鲜,真正让我花了不少心思的,是首页那堆游戏卡…

2026/9/20 0:00:46 阅读更多 →
Word表格编号全攻略:从列表编号到题注交叉引用

Word表格编号全攻略:从列表编号到题注交叉引用

写Word文档,最让人头疼的往往是那些“看起来不起眼”的小问题。比如表格编号这事:今天在表后面多加了两个空白行,明天给客户交稿前发现整个章节的编号全部错位,光是挨个改序号就能耗掉大半个下午。我前阵子帮人整理一份上百页的技…

2026/9/20 0:00:46 阅读更多 →
从第一个站到第二个站:独立开发者的静态网站选型与落地实践

从第一个站到第二个站:独立开发者的静态网站选型与落地实践

1. 项目概述1.1 核心需求解析做独立开发者这几年,说实话,第一个网站上线的那天晚上我兴奋得没睡着。但等它跑了半年,流量惨淡、功能臃肿、代码自己都懒得看第二遍之后,我才慢慢琢磨明白一个道理:第一个网站是练手&…

2026/9/20 0:00:46 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/19 23:01:36 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/19 17:50:38 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/19 23:35:34 阅读更多 →