【免费下载链接】mlx-serveNative LLM inference server for Apple Silicon. OpenAI Anthropic API compatible. No Python. Zig backend, Swift frontend macOS app with chat, music, voice, video generation.项目地址https://gitcode.com/gh_mirrors/ml/mlx-serve点击查看免费下载mlx-serve 是一款专为 Apple Silicon 打造的本地推理服务器一个http://localhost:11234端口同时提供聊天、文生图、视频生成、音乐生成、声音克隆和 3D 模型生成能力全程无需 Python、无需云端。对普通用户来说它最诱人的地方在于你不用再为每种生成任务装一套工具——装一个软件五种多模态生成能力一次到位而且所有素材都留在本机。一个服务器五种模态mlx-serve 能生成什么mlx-serve 把媒体生成全部内置到同一个 HTTP 服务里每个模态对应一个独立端点详见 docs/api.md模态内置模型API 端点输出格式 文生图 / 图像编辑FLUX.2、Krea-2-Turbo、Mage-Flow、Qwen-Image-2.1POST /v1/images/generations、/v1/images/editsPNGQwen 支持透明通道 视频生成LTX-Video 2.3 / 2.5、MiniMax-H3POST /v1/video/generations帧 音频 音乐生成ACE-Step 1.5、MiniMax Music 3POST /v1/audio/music-generationsWAV️ 语音合成 / 声音克隆Qwen3-TTS、Kokoro-82MPOST /v1/audio/speechWAV 3D 模型生成Hunyuan3D-2.1POST /v1/3d/generationsGLB可带 PBR 贴图所有媒体端点都支持stream: true实时返回进度事件最后一个 base64 的complete事件携带成品文件——写脚本、做自动化都很顺手。最快安装方法两行命令跑起来使用 macOS 菜单栏应用推荐带图形界面brew install --cask mlx-serve或者只装命令行 服务器brew install mlx-serve也可以从源码构建git clone https://gitcode.com/gh_mirrors/ml/mlx-serve启动后访问浏览器内置控制台GET /里面自带聊天面板、图像/音频工具和 API 参考零配置即可上手。模型在应用里点击Download自动下载各生成面板都会记住你上次使用的模型、质量和种子设置。文生图从提示词到成图支持指令式修图打开 Image 面板输入提示词、选择质量档位Fast / Good / Quality / Super Quality和分辨率点击 Generate 即可。默认模型 FLUX.2-klein 4B 4-bit 约 5 GB8 GB 内存的 MacBook 就能跑追求更高精度可换 9B、Krea-2-Turbo 或 Mage-Flow Edit。几个值得知道的进阶能力图像变体每个图像模型都支持传入源图 强度滑杆从微调重混到完全重新想象随意切换指令式修图附上一张照片输入make the hair blue或remove the monitor in the backgroundFLUX.2-klein 或 Mage-Flow Edit 会在保留主体、姿势和场景的前提下修改指定部分实测结构保持度 0.97源图比例绝不被拉伸透明背景Qwen-Image-2.1 支持transparent: true直接产出带 Alpha 通道的 PNG做 UI 素材很方便风格 LoRA最多同时叠加 8 个.safetensors风格适配器运行时混合、不重新量化基础权重零损失。视频生成首帧动画还能连配乐一起生成视频面板默认使用 LTX-Video 2.3 Q4约 26 GB 下载支持首帧动画把一张图片拖进 First-frame 槽位LTX 会从这张图精确地开始向前动画做照片动起来非常合适对口型说话角色在提示词里给台词加上引号或附加一段真实音频视频会对着该音频轨生成、口型同步最终 mp4 里就是原始音频而非重合成预览与流式开启stream: truepreview: true每个去噪步骤都会附带一张 JPEG 预览帧长任务不用干等。想要更强的选择是MiniMax-H3Hailuo 3.0它在同一次去噪中同时生成画面和立体声原声——声音是长出来的而不是后期配音。描述场景后再用overall_soundscape:写出你想听到的声音即可。Turbo 模式 4 步出片但注意它依然很慢M4 Max 上 1344×768、124 帧约需 50 分钟。音乐生成30 秒歌曲只要约 4 秒音乐是 mlx-serve 多模态能力里性价比最高的一项ACE-Step 1.5 XL Turbo默认8-bit 版约 9 GB 内存一段 30 秒的 48 kHz 立体声歌曲约 4 秒就能渲染完还支持音高、调式、拍号、人声语言等精细控制MiniMax Music 3进阶约 20 GB 内存必须提供lyrics歌词结构标签如[verse]、[chorus]各占一行最长可生成6 分钟的完整歌曲人声最强。一个风格提示词加一段歌词WAV 文件直接落盘到~/.mlx-serve/generations/的按模态、按日期分好的文件夹里播放软件打开就能听。声音克隆几秒钟音频克隆出属于你的声音这是很多用户用一次就回不去的功能零样本声音克隆录音或上传约 8 秒的参考音频24 kHz 单声道 WAVQwen3-TTS 通过说话人编码器提取声纹嵌入之后所有合成文本都用这个音色朗读——无需文字稿、无需训练。API 上就是POST /v1/audio/speech带一个 base64 的ref_audio字段Kokoro-82M轻量备选仅约 345 MB 下载内置 54 种音色且可混合合成速度约为实时的 17 倍完全本地运行全局生效克隆的语音不只用于生成面板还直接接入应用的免提语音模式说Hey Loki就能对话和所有 Agent 场景。3D 模型生成一张照片变 GLB 网格Hunyuan3D-2.1 8-bit约 16 GB 内存能把一张单物体照片转成水密 GLB 网格可选完整 PBR 贴图直接拖进游戏引擎或 3D 打印机切片软件就能用面板里可调 Steps、Guidance 和网格分辨率128 快 / 256 均衡 / 384 精细勾选 Texture 即开启贴图API 端点POST /v1/3d/generations返回 base64 GLB脚本化处理零门槛。硬件需求清单你的 Mac 能跑哪些模态各模态默认模型的内存门槛完整表格见 docs/app.md模态默认模型大致内存要求文生图FLUX.2-klein 4B 4-bit8 GB 起语音克隆Qwen3-TTS 1.7b / Kokoro-82M8 GBKokoro 仅 ~345 MB 下载音乐ACE-Step 1.5 / MiniMax Music 38 GB / ~20 GB3DHunyuan3D-2.1 8-bit16 GB视频LTX-Video 2.5 4-bit / MiniMax-H324 GB / 26–44 GB内存小的机器完全可以从图像、音乐、声音克隆入手应用会在内存不足时阻止启动生成而不是硬撑崩溃。资料与源码索引多模态能力对应的源码模块均位于 src/ 目录方便有兴趣的读者深入文生图与编辑src/flux.zig、src/qwen_image.zig、src/mage_flow.zig视频生成src/ltx_video.zig、src/minimax_h3.zig音乐生成src/acestep.zig、src/music3.zig语音合成与声音克隆src/tts.zig、src/kokoro.zig3D 模型生成src/hunyuan3d.zig官方文档docs/api.mdHTTP API、docs/app.md应用与生成面板、docs/models.md模型注册与分类、docs/cli.md命令行参考一句话总结装一个 mlx-serve聊天、文生图、视频、音乐、声音克隆和 3D 模型全部走同一个本地端口——Apple Silicon 上多模态生成真的只需要一个服务器。赞分享【免费下载链接】mlx-serveNative LLM inference server for Apple Silicon. OpenAI Anthropic API compatible. No Python. Zig backend, Swift frontend macOS app with chat, music, voice, video generation.项目地址https://gitcode.com/gh_mirrors/ml/mlx-serve点击查看免费下载相关推荐3步搞定F5-TTS模型微调从语音风格定制到定制语音生成3步搞定F5 TTS模型微调从语音风格定制到定制语音生成 你是否曾因通用TTS模型无法精准还原特定人声而困扰是否想让AI语音助手拥有专属声线本文将通过F5语音人工智能音频预训练个人数字安全研究资源图谱Personal Security Checklist 精选链接清单深度导读个人数字安全研究资源图谱Personal Security Checklist 精选链接清单深度导读 本文以 articles/4_Privacy_And_S网络安全mlx-audio 实战指南流式音频、声音克隆、量化与 Web/API 服务器完全上手mlx audio 实战指南流式音频、声音克隆、量化与 Web/API 服务器完全上手 本指南以 docs/guides/index.md https://l语音音频人工智能本地部署模型推理服务创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考