【免费下载链接】mlx-serveNative LLM inference server for Apple Silicon. OpenAI Anthropic API compatible. No Python. Zig backend, Swift frontend macOS app with chat, music, voice, video generation.项目地址https://gitcode.com/gh_mirrors/ml/mlx-serve点击查看免费下载mlx-serve 是面向 Apple Silicon 的原生 LLM 推理服务器兼容 OpenAI Anthropic API零 Python 依赖。通过它内置的LAN 共享能力你可以把大模型放在一台内存充裕的 Mac 上让局域网里的其他 Mac 直接调用——不用配 IP、不用端口映射、不经过任何云服务。本教程用 3 步带你完成mlx-serve LAN 共享的 Bonjour 零配置全程约 5 分钟。整个功能由两个开关控制默认全部关闭角色参数作用️ 共享端模型所在的 Mac--lan-share all或--lan-share 模型ID,…发布 Bonjour 服务仅开放推理接口 使用端想用模型的 Mac--lan-discover自动发现网络内对端及其模型透明代理请求工作原理Bonjour 自动发现为什么不用配 IPmlx-serve 的 LAN 共享复用了 macOS 原生的BonjourmDNS机制实现位于 src/lan.zig分为互相独立的两半发布SHARE共享端向局域网注册一个_mlxserve._tcp服务实例名默认取主机名可用--lan-name自定义发现DISCOVER使用端扫描局域网找到对端后拉取其/v1/models并把远程模型以模型ID对端名的格式镜像进本地模型列表例如gemma-4-e4b-it-4bitstudio-mac。客户端请求远程模型时mlx-serve 会把它逐字节透明代理给对端 Mac流式 SSE 也原样透传对端模型按需在主机上冷加载。只暴露推理面对话、embeddings、图像/语音/音乐/视频/3D 生成模型装卸、指标、状态页等管理接口仍仅限本 Mac。在 MLX Serve 图形界面中设置 ▸ LAN Sharing可按模型逐个勾选共享对端的共享模型会以模型 · 对端的形式出现在模型选择器和托盘菜单中聊天与各类生成面板直接可选。第 1 步在模型所在的 Mac 上开启共享假设大模型放在一台 M 系列 Mac 上命令行直接启动mlx-serve --serve \ --model-dir ~/.mlx-serve/models \ --lan-share all \ --lan-name studio-mac--lan-share all共享全部模型也可以传逗号分隔的 ID 只共享部分如--lan-share gemma-4-e4b-it-4bit目录名或org/name均可匹配--lan-name studio-mac是其他 Mac 看到的名字不填则默认取主机名默认端口11234默认绑定0.0.0.0局域网可达完整参数见 docs/cli.md。用图形界面的话打开设置 ▸ LAN 共享启用后勾选要分享的模型即可。第 2 步让其他 Mac 自动发现模型在使用端 Mac本机没有模型、或想复用别人大模型上加一个发现开关mlx-serve --serve --model-dir ~/.mlx-serve/models --lan-discover不需要任何 IP 或端口配置——两台 Mac 通过 Bonjour互相发现。十秒内远程模型就会出现在使用端的/v1/models中ID 形如模型IDstudio-mac并带有lan_peer标记。 这一步是真正的零配置DHCP 换 IP、重启网络共享链路都会自动重新收敛无需人工干预。第 3 步像调用本地模型一样调用它调用方式与 OpenAI API 完全一致只是模型名写成模型ID对端名curl http://localhost:11234/v1/chat/completions \ -H Content-Type: application/json \ -d {model:gemma-4-e4b-it-4bitstudio-mac, messages:[{role:user,content:你好}]}流式stream: true、Claude Code、Ollama 兼容客户端指向localhost都能直接用上对端的大模型/v1/load-model、/v1/unload-model对远程模型返回成功空操作无需处理。验证 LAN 共享是否生效使用端curl http://localhost:11234/v1/models应出现studio-mac后缀的模型条目共享端日志出现[lan] peer … at x.x.x.x:11234 shares N models实测一问对远程模型发一条对话能看到 token 实时流回。完整自动化流程可参考 tests/test_lan_share.sh发现 → 远程对话流式 非流式→ 装卸空操作 → 管理接口 403 边界。安全边界LAN 共享到底暴露了什么mlx-serve 把局域网共享设计成默认安全✅ 对局域网开放/health、/v1/models、对话/completions/messages/responses/embeddings 及各媒体生成接口❌ 局域网客户端永远403模型装卸、/metrics、状态页等管理接口 经peer隧道的请求不会多级跳转杜绝代理环⚠️ 发给共享模型的提示词会在托管 Mac 上以明文参与计算设置页有相应提示——建议只在受信任的家庭/办公网络内共享想再加一道门槛可搭配--api-keylocalhost 请求不受影响非本地请求必须带密钥。常见问题LAN 共享不生效怎么办症状原因与处理看不到远程模型确认两台 Mac 在同一 Wi-FimacOS 首次运行会弹出允许访问本地网络需点允许使用端必须带--lan-discover启动提示 matched no models--lan-share列表没有匹配到任何模型核对模型 ID目录名或org/name请求报 no longer shares对端活着但确实没共享该模型错误信息会如实说明无需等待对端 Mac 重启后请求代理会等待重新发现再响应不会立刻误报 404纯共享端未开发现会提示 discovery is off 而不是误导性的对端离线首次请求偏慢模型在托管端按需冷加载属正常现象共享调用的速度有多快LAN 共享只是一层透明代理不引入调度排队实际速度完全取决于托管端的 GPU。mlx-serve 在同一台 Apple Silicon 上解码可达239 tokens/s多会话并发叠加 MTP 投机解码还能进一步提升吞吐参考资料CLI 与参数文档docs/cli.md · docs/zh-CN/cli.mdFAQ含多台 Mac 能否共享模型一节docs/faq.md · docs/zh-CN/faq.md图形界面指南docs/app.mdLAN 共享实现源码src/lan.zig · 服务端路由门禁src/server.zig端到端集成测试tests/test_lan_share.sh赞分享【免费下载链接】mlx-serveNative LLM inference server for Apple Silicon. OpenAI Anthropic API compatible. No Python. Zig backend, Swift frontend macOS app with chat, music, voice, video generation.项目地址https://gitcode.com/gh_mirrors/ml/mlx-serve点击查看免费下载相关推荐XO与ESLint共享配置生成器创建个性化共享配置XO与ESLint共享配置生成器创建个性化共享配置 你是否还在为团队中代码风格不统一而烦恼是否在多个项目间重复配置ESLint规则本文将带你使用XO与ES开发工具代码质量LintCLIIsaacLab Franka 抓取立方体从跑通到调好新手实操指南IsaacLab Franka 抓取立方体从跑通到调好新手实操指南 IsaacLab Franka 抓取立方体一台 Franka Panda 站在桌前桌人工智能强化学习机器人具身智能深度学习LAN Share零配置跨平台局域网文件共享的革命性体验LAN Share零配置跨平台局域网文件共享的革命性体验 还在为设备间传输文件而烦恼吗LAN Share这款跨平台局域网文件共享工具以零配置自动发现和快速桌面应用网络通信创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考