【免费下载链接】MinariA standard format for offline reinforcement learning datasets, with popular reference datasets and related utilities项目地址https://gitcode.com/gh_mirrors/mi/Minari点击查看免费下载Minari是 Farama Foundation 推出的离线强化学习Offline RL数据集标准格式可理解为离线版 Gymnasium。它的核心价值在于统一数据集的存储、下载与加载方式并已经与TorchRL、d3rlpy、AgileRL三大主流 RL 训练框架完成官方集成——无论你用哪个框架训练都能一行代码接入 Minari 数据集。为什么需要统一的数据集标准在离线强化学习中不同论文和框架各自使用不同的数据格式HDF5、CSV、自定义二进制……数据准备常常比算法实现更耗时。Minari 解决的正是这个问题标准格式观测、动作、奖励、终止信号、截断信号、环境元数据全部结构化存储一键下载内置远程仓库HuggingFace Hub、GCP 等常用参考数据集如 D4RL 系列开箱即用生态互通TorchRL、d3rlpy、AgileRL 均提供原生适配数据无需手动转换安装非常简单基础依赖一条命令即可框架集成依赖可选装见 pyproject.toml 中的integrations依赖组pip install minari pip install minari[all] # 安装全部可选依赖一站式接入三大 RL 框架Minari 的官方测试套件在 tests/integrations/ 目录下对三个框架逐一做了集成验证以下是每个框架的接入方式。TorchRL用 MinariExperienceReplay 直接采样TorchRL 提供了MinariExperienceReplay数据集对象可以直接把 Minari 数据集当作经验回放缓冲区使用并按 batch 采样TensorDictfrom torchrl.data.datasets.minari_data import MinariExperienceReplay dataset MinariExperienceReplay(D4RL/door/human-v2, batch_size32) sample dataset.sample() # 采样一个 batch字段与 Gym 环境空间对齐如 test_torch_rl.py 所示官方测试验证了采样出的 action / observation 形状与真实环境完全一致且数据集是只读的防止误写。实战效果IQL 训练 Adroit 灵巧手官方教程 IQL_torchrl.py 展示了完整流程用 TorchRL 的 IQL隐式 Q 学习算法仅凭 25 条人类演示的 Minari 数据集训练 24 自由度灵巧手操控笔。训练过程与奖励曲线如下图中左侧为 5 万步迭代的损失曲线右侧为累积奖励曲线可以看到策略随训练稳定提升。教程中还用不同 expectile 参数拟合了价值函数的分位数见 using_datasets 教程目录d3rlpy一行 get_minari 拿到数据集与环境d3rlpy 提供了get_minari函数同时返回 Minari 转换后的数据集和对应的 Gymnasium 环境from d3rlpy.datasets import get_minari dataset, env get_minari(D4RL/door/human-v2)官方集成测试test_d3rlpy.py逐步骤比对了两侧数据环境 spec 一致、每步的观测/动作/奖励完全相等且所有观测都在环境定义的合法空间内——保证训练时不会出现分布外的脏数据。AgileRL两种转换函数覆盖训练全场景AgileRL 提供两个工具函数分别对应离线训练和在线/离线混合训练函数作用适用场景minari_to_agile_dataset将 Minari 数据集转换为 AgileRL 的 HDF5 数据集含 observations / next_observations / actions / rewards / terminals纯离线算法如 IQL、BCQminari_to_agile_buffer把 Minari 数据集直接灌入ReplayBuffer回放缓冲区离线预热缓冲区后继续在线训练from agilerl.utils.minari_utils import minari_to_agile_buffer memory minari_to_agile_buffer(cartpole/test-v0, memory)集成测试test_agile_rl.py验证了转换后的数据集字段完整、缓冲区计数正确。数据集从哪里来三个框架读取的是同一套 Minari 数据集来源有三类内置参考数据集minari.load_dataset(D4RL/door/human-v2)直接下载 D4RL 系列远程仓库通过 minari/storage/hosting.py 支持 HuggingFace Hubhf://与 GCS 等远程源本地自建用 DataCollector 包装任意 Gymnasium 环境采集经验一条env.create_dataset(name/version)即可生成标准 Minari 数据集完整函数 APIdownload_dataset、upload_dataset、combine_datasets等可在 minari/init.py 中查看导出清单。总结选哪个框架就看你的技术栈PyTorch 生态→ TorchRL 的MinariExperienceReplay与TensorDict无缝配合快速原型→ d3rlpy 的get_minari数据集与环境一次到位离线在线混合训练→ AgileRL 的minari_to_agile_buffer数据直接入缓冲区Minari 让数据准备从 RL 研究的绊脚石变成了三行代码的事而三大框架的一站式集成正是它最实用的特性。赞分享【免费下载链接】MinariA standard format for offline reinforcement learning datasets, with popular reference datasets and related utilities项目地址https://gitcode.com/gh_mirrors/mi/Minari点击查看免费下载相关推荐Sentinel Go与主流框架集成指南Gin、Echo、gRPC一站式解决方案Sentinel Go与主流框架集成指南Gin、Echo、gRPC一站式解决方案 Sentinel Go作为阿里巴巴开源的微服务流量治理组件为Go语言微服务Neural Amp Modeler如何用3个步骤解决数字吉他音色的真实性问题Neural Amp Modeler如何用3个步骤解决数字吉他音色的真实性问题 你是否曾经在数字音频工作站中尝试模拟真实吉他音箱的音色却发现总是缺少那种真音视频深度学习用Minari创建第一个离线RL数据集DataCollector快速入门教程用Minari创建第一个离线RL数据集DataCollector快速入门教程 Minari 是离线强化学习Offline RL数据集的标准格式工具库。本教创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考