Dora 分布式部署指南:多机集群、标签调度、滚动升级与 systemd 运维完整手册
Dora 分布式部署指南多机集群、标签调度、滚动升级与 systemd 运维完整手册【免费下载链接】doraDORA (Dataflow-Oriented Robotic Architecture 面向数据流的机器人架构) 是为 AI 与具身智能机器人打造的高性能开发框架以数据流范式重构开发逻辑原生支持分布式部署与端边云协同 —— 无需复杂适配即可实现一体端到端具身大小脑、VLA等模型部署无缝衔接感知、推理、控制全链路让 AI 能力与机器人动作深度融合。 依托 Rust 内核与零拷贝通信技术它将具身大小脑、VLA等模型推理、多模态数据融合延迟压缩至微秒级同时兼容 ROS2 生态与国产 AI 芯片彻底降低具身智能机器人的开发门槛让分布式部署下的 AI 赋能创新更高效、更灵活。项目地址: https://gitcode.com/dora-rs/doraDoraDataflow-Oriented Robotic Architecture是为 AI 与具身智能机器人打造的高性能开发框架内置开箱即用的分布式部署能力一条命令拉起多机集群用标签调度把节点精准放置到目标机器零停机滚动升级整集群再配合systemd服务实现开机自启与崩溃自愈。本文覆盖从cluster.yml配置到生产运维 Runbook 的全部关键步骤帮你把同一份数据流 YAML 从单机开发平滑扩展到多机生产环境。一、三级架构Dora 分布式系统的组成 Dora 的分布式架构分为三层职责清晰、互不干扰CLI -- Coordinator -- Daemon(s) -- Nodes / Operators (单实例) (每机器一个) (用户代码)CLI发送 build / start / stop 等控制命令到 CoordinatorCoordinator单一编排者负责节点放置决策与数据流生命周期管理Daemon每台机器运行一个负责拉起并监管本机节点进程Node用户代码。同机节点走共享内存跨机节点通过 Zenoh 发布订阅通信。数据流量不经过 Coordinator控制面与数据面完全分离——这是 Dora 能把多机推理链路延迟压到微秒级的关键设计。 更完整的网络拓扑LAN、VPN mesh、zenoh 路由跨 NAT见 docs/multi-machine.md完整集群参考见 docs/distributed-deployment.md。二、5 分钟拉起多机集群cluster up 快速上手 ⚡Dora 提供两条部署路径临时模式手动在各机器启动dora daemon适合开发测试和托管集群模式一个cluster.ymldora cluster命令族SSH 管理所有机器。生产环境推荐后者。第 1 步编写 cluster.ymlcoordinator: addr: 10.0.0.1 machines: - id: robot host: 10.0.0.2 user: ubuntu - id: gpu-server host: 10.0.0.3 user: ubuntu第 2 步一条命令拉起集群dora cluster up cluster.yml它会自动启动本地 Coordinator然后 SSH 到每台机器启动 Daemon并轮询直到全部 Daemon 注册成功started dora coordinator on 0.0.0.0 (reachable from other machines) Starting daemon on robot (ubuntu10.0.0.2) Starting daemon on gpu-server (ubuntu10.0.0.3) All 2 daemons connected.第 3 步启动跨机数据流并查看集群健康dora start dataflow.yml --name my-app --attach dora cluster statusDAEMON ID LAST HEARTBEAT robot 2s ago gpu-server 1s ago Active dataflows: 1第 4 步需要时一键拆除dora cluster down 提示Daemon 之间无需手工互指地址——每台 Daemon 会从--coordinator-addr推导出自己的对外地址并注册给 Coordinator由 Coordinator 把先注册者的地址下发给后注册者自动组成全连接 mesh启动顺序任意。三、cluster.yml 配置参考机器清单与标签 ️字段默认值说明coordinator.addr必填Coordinator 绑定地址coordinator.port6013WebSocket 端口machines[].id必填机器唯一标识供deploy.machine引用machines[].host必填SSH 可达的主机名或 IPmachines[].user当前用户SSH 用户名machines[].port22SSH 端口非标准端口时设置machines[].daemon_port53291Daemon 本地监听端口同机多 Daemon 时需区分machines[].zenoh_addr/zenoh_porthost/5456其他 Daemon 拨号到本机的地址与端口machines[].labels空键值标签用于标签调度一个 3 机 GPU 集群的典型写法coordinator: addr: 192.168.1.1 machines: - id: coordinator-host host: 192.168.1.1 labels: role: control - id: gpu-a100 host: 192.168.1.10 user: ml labels: gpu: a100 arch: x86_64 - id: jetson-01 host: 192.168.1.20 user: nvidia labels: gpu: jetson arch: arm64四、节点调度三策略machine、labels、自动分配 在dataflow.yml的节点上通过deploy段控制放置解析优先级为machine labels 未命名。策略 1按机器 ID 精确指定nodes: - id: camera deploy: machine: robot # 匹配 cluster.yml 中的 id path: ./camera-driver outputs: [frames]策略 2按标签匹配推荐nodes: - id: inference deploy: labels: gpu: true # 目标 Daemon 标签必须是其超集 path: ./ml-model inputs: frames: camera/frames outputs: [predictions]Coordinator 会选中第一个标签超集满足要求的已连接 Daemon{gpu: true, arch: arm64}满足{gpu: true}的要求。标签匹配不到任何 Daemon 时部署直接失败并报错no daemon matches labels {gpu: true}——快速失败优于静默放错机器。策略 3未指定时自动分配给第一台无--machine-id的默认Daemon。 最佳实践多用标签、少写死机器 ID。标签把数据流与具体硬件解耦换机器、加机器时无需改dataflow.yml。五、二进制分发策略local、scp、http 怎么选 节点二进制如何送达远机由deploy.distribute控制策略适用场景取舍local默认同构集群、CI 构建每台机器需要构建工具链Daemon 在本机自行编译scp异构集群、交叉编译好的二进制需要 CLI 机器对目标机有 SSH 权限http防火墙隔离、air-gapped DaemonCoordinator 充当制品仓库Daemon 经 HTTP 拉取需认证nodes: - id: my-node deploy: machine: edge-01 distribute: scp # 本地编译后推送到目标机 path: ./my-node六、systemd 服务一键安装守护进程重启自愈 ️生产部署应将 Daemon 安装为 systemd 服务——断电重启不丢、崩溃自动拉起dora cluster install cluster.yml # Installing dora-daemon-robot on ubuntu10.0.0.2... OK # Installing dora-daemon-gpu-server on ubuntu10.0.0.3... OK # 2/2 succeeded.每台机器会生成dora-daemon-id单元核心属性Restarton-failureRestartSec5崩溃 5 秒后自动重启Afternetwork-online.target等网络就绪再启动WantedBymulti-user.target开机自启。验证与卸载ssh ubuntu10.0.0.2 sudo systemctl status dora-daemon-robot dora cluster uninstall cluster.yml # 停止、禁用并删除单元文件七、滚动升级零停机更新整集群 更新集群只需一条命令dora cluster upgrade cluster.yml对每台机器依次执行三步其余机器全程不受影响Upgrading robot (ubuntu10.0.0.2)... SCP binary... OK Restart service... OK Waiting for reconnect... OK (3.2s) 2/2 succeeded.SCP本地dora二进制到目标机/usr/local/bin/dora重启systemd 服务轮询Coordinator 直到该 Daemon 重连30 秒超时。Daemon 重连后自动恢复机制会把该机器上被中断的数据流节点全部重新拉起见下节。前置条件Daemon 已通过dora cluster install装为 systemd 服务目标机具备 sudo 权限本地二进制与集群版本兼容。八、自动恢复Daemon 断线重连后节点自愈 Daemon 因网络抖动、机器重启或服务重启而掉线再重连时Coordinator 会自动修复Daemon 重连并提交当前运行中的StatusReportCoordinator 比对期望状态找出缺失的数据流向该 Daemon 下发SpawnDataflowNodes命令重建缺失节点。为防止节点秒崩 → 无限重建的死循环恢复带30 秒退避同一 Daemon/数据流对每 30 秒最多尝试一次重建节点重新上报运行中后退避清除。注意自动恢复只覆盖dora start启动的托管数据流本地dora run不受 Coordinator 跟踪。单节点粒度的崩溃重启策略restart_policy、max_restarts、指数退避等见 docs/fault-tolerance.md与自动恢复叠加使用形成纵深防御。九、日常运维 Runbook监控、日志与故障排查 日常操作速查dora list # 列出运行中的数据流 dora top # 实时资源监控TUI dora logs my-app --node id --follow # 查看任意机器上节点的日志 dora stop my-app # 停止数据流 dora cluster status # 集群健康Daemon 心跳 活动数据流数 dora cluster restart cluster.yml my-app # 按名称重启数据流故障排查四板斧症状排查动作Daemon 连不上检查 Coordinator 是否监听可路由地址journalctl -u dora-daemon-id -f看日志核对--coordinator-addr/ 端口SSH 命令失败确认ssh -o BatchModeyes userhost echo ok免密可用核对 cluster.yml 中user字段标签不匹配dora cluster status查看已连 Daemon标签在 Daemon 启动时注入运行期不可改需重启 Daemon自动恢复没触发确认数据流由dora start启动查 Coordinator 日志中auto-recovery: re-spawning注意 30 秒退避最佳实践清单✅开发期用dora run dataflow.yml本地验证同一份 YAML 直接上集群deploy字段本地模式下被忽略生产环境务必dora cluster install装 systemd配合节点级restart_policy双保险优先标签调度把cluster.yml与数据流定义一起纳入版本控制升级走滚动方案不要整体停机。多 Daemon 联动的完整示例见 examples/multiple-daemons/更多命令细节见 docs/cli.md。【免费下载链接】doraDORA (Dataflow-Oriented Robotic Architecture 面向数据流的机器人架构) 是为 AI 与具身智能机器人打造的高性能开发框架以数据流范式重构开发逻辑原生支持分布式部署与端边云协同 —— 无需复杂适配即可实现一体端到端具身大小脑、VLA等模型部署无缝衔接感知、推理、控制全链路让 AI 能力与机器人动作深度融合。 依托 Rust 内核与零拷贝通信技术它将具身大小脑、VLA等模型推理、多模态数据融合延迟压缩至微秒级同时兼容 ROS2 生态与国产 AI 芯片彻底降低具身智能机器人的开发门槛让分布式部署下的 AI 赋能创新更高效、更灵活。项目地址: https://gitcode.com/dora-rs/dora创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

基于私有知识库的LLM智能客服问答系统:从RAG到私有化部署实战

基于私有知识库的LLM智能客服问答系统:从RAG到私有化部署实战

简介:这套资源是基于企业私有知识库的大语言模型智能客服问答系统,支持私有化部署,主要面向企业技术团队、AI应用开发者以及需要搭建内部智能问答平台的管理者,尤其适合对数据安全有较高要求的场景。资源包共1302个文件&#xff0…

2026/9/25 23:05:38 阅读更多 →
MaaEnd节点测试教程:如何用测试用例验证识别稳定命中

MaaEnd节点测试教程:如何用测试用例验证识别稳定命中

MaaEnd节点测试教程:如何用测试用例验证识别稳定命中 【免费下载链接】MaaEnd MaaEnd 终末地小助手:基于视觉 AI 的「明日方舟:终末地」自动化工具 项目地址: https://gitcode.com/gh_mirrors/maa/MaaEnd MaaEnd 是基于视觉 AI 的《明…

2026/9/25 23:05:38 阅读更多 →
Apache Pulsar Functions 快速入门实战:从本地运行到集群部署

Apache Pulsar Functions 快速入门实战:从本地运行到集群部署

消息队列后端流处理 【免费下载链接】pulsar Apache Pulsar - distributed pub-sub messaging system 项目地址: https://gitcode.com/gh_mirrors/pulsar28/pulsar 点击查看 免费下载 本指南以 Apache Pulsar 的 Pulsar Functions 轻量级流处理模型为主题&#xff…

2026/9/25 23:05:38 阅读更多 →

最新新闻

阿里云K8s全栈部署:Vue2+Nginx+SpringBoot2.5+Nacos2.0.3实战

阿里云K8s全栈部署:Vue2+Nginx+SpringBoot2.5+Nacos2.0.3实战

简介:这份资源面向需要在阿里云Kubernetes集群上落地前后端分离项目的开发与运维人员,提供一套可直接参考的部署方案,解决Vue2前端、SpringBoot2.5后端与Nacos2.0.3注册配置中心在k8s中协同编排的问题。包内共16个文件,以8个yaml清…

2026/9/25 23:49:18 阅读更多 →
Claude Code 源码泄露背后:从工程化视角拆解 AI 编程工具好用的秘密与 TaoToken 配置实践

Claude Code 源码泄露背后:从工程化视角拆解 AI 编程工具好用的秘密与 TaoToken 配置实践

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/25 23:49:18 阅读更多 →
AI 产品经理必懂:30 个核心指标,一文讲透模型、性能与业务价值(TaoToken 配置避坑版)

AI 产品经理必懂:30 个核心指标,一文讲透模型、性能与业务价值(TaoToken 配置避坑版)

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/25 23:49:18 阅读更多 →
Windows Server 2012 R2 SxS 并行配置错误修复与补丁安装指南

Windows Server 2012 R2 SxS 并行配置错误修复与补丁安装指南

简介:这份资源面向在 Windows Server 2012 R2 Standard 上部署 .NET Framework 3.5 时反复安装失败的系统管理员与运维人员,提供官方 SXS 组件源文件,用于在离线或受限网络环境中通过指定备用路径完成功能安装。压缩包共 1568 个文件&#xf…

2026/9/25 23:49:18 阅读更多 →
Spine for Mac 原生动画工具链落地指南

Spine for Mac 原生动画工具链落地指南

简介:本资源为 macOS 平台专用的 Spine 2D 骨骼动画专业工具安装包,面向游戏开发工程师、独立开发者及数字艺术创作者,解决跨平台 2D 角色动画高效制作与轻量集成难题。压缩包共 188 个文件,主体包含 51 个 dylib 动态库&#xff…

2026/9/25 23:49:18 阅读更多 →
工频与射频电磁辐射测量与防护实战指南

工频与射频电磁辐射测量与防护实战指南

简介:本资源是一份面向公众健康科普与工程防护实践的实用型技术文档,聚焦日常生活中普遍存在的电磁辐射问题,适用于电子电气从业者、环境健康关注者及高校相关专业师生。内容系统梳理了自然源、医疗设备、家用电器与通信基站等多类辐射源的生…

2026/9/25 23:48:18 阅读更多 →

日新闻

AI元人文:从工具使用到思维重构的深度探索

AI元人文:从工具使用到思维重构的深度探索

最近半年我一直在琢磨一件事:AI元人文到底是什么?说白了,就是“用元视角重新审视人与AI的关系”,也在“探索AI如何反向逼着我们发现自己的思考边界”。标题里的“元探索”,在我看就是一层套一层的追问——当你用AI解决…

2026/9/25 0:00:41 阅读更多 →
Python+CNN车牌识别实战:从数据预处理到模型训练与部署

Python+CNN车牌识别实战:从数据预处理到模型训练与部署

简介:基于Python与卷积神经网络的车牌识别项目,面向计算机视觉初学者及智能交通开发者,目标是帮助用户掌握从数据预处理、模型构建到实际部署的完整流程。压缩包共25个文件,包含jpg/png图像样本、py训练脚本、md说明文档、dat数据…

2026/9/25 0:00:41 阅读更多 →
Vim基础操作全攻略:保存退出、模式切换与高频命令实战

Vim基础操作全攻略:保存退出、模式切换与高频命令实战

1. 项目概述1.1 核心需求解析今天聊聊Vim。写这个题目的原因是:几乎每个后端开发者、运维人员、数据工程师某天都会遇到一个场景——深夜加班,服务器登录界面只有黑底白字,编辑器只有vi/vim,你必须在五分钟内完成一次配置修改并保…

2026/9/25 0:00:41 阅读更多 →

周新闻

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

直接铺开项目本身吧。这几个月我一直在折腾一件事:用Flutter给OpenHarmony做一款游戏集合类的App,说白了就是把若干小游戏塞进一个壳里,用统一入口分发。这个方向本身不算新鲜,真正让我花了不少心思的,是首页那堆游戏卡…

2026/9/25 19:27:14 阅读更多 →
Word表格编号全攻略:从列表编号到题注交叉引用

Word表格编号全攻略:从列表编号到题注交叉引用

写Word文档,最让人头疼的往往是那些“看起来不起眼”的小问题。比如表格编号这事:今天在表后面多加了两个空白行,明天给客户交稿前发现整个章节的编号全部错位,光是挨个改序号就能耗掉大半个下午。我前阵子帮人整理一份上百页的技…

2026/9/25 11:15:26 阅读更多 →
从第一个站到第二个站:独立开发者的静态网站选型与落地实践

从第一个站到第二个站:独立开发者的静态网站选型与落地实践

1. 项目概述1.1 核心需求解析做独立开发者这几年,说实话,第一个网站上线的那天晚上我兴奋得没睡着。但等它跑了半年,流量惨淡、功能臃肿、代码自己都懒得看第二遍之后,我才慢慢琢磨明白一个道理:第一个网站是练手&…

2026/9/25 20:29:09 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/25 20:29:43 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/25 20:29:31 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/25 19:27:26 阅读更多 →