遇见数据集

Off-the-Grid Multi-Agent Reinforcement Learning (OG-MARL)

收藏
arXiv2023-09-23 更新2024-06-21 收录
官方服务:

资源简介:

OG-MARL 是一个为离线多代理强化学习研究设计的增长数据集库,由InstaDeep和开普敦大学合作创建。该数据集提供了多种环境动态、异构代理、非平稳性、多代理、部分可观测性、次优性、稀疏奖励和示范协调等特性的设置,以模拟真实世界系统。数据集包括不同类型的数据集(如Good, Medium, Poor, Replay),并详细描述了每个数据集的经验组成。OG-MARL旨在作为社区可靠的数据集来源,推动该领域的进步和为新研究者提供入门点。数据集适用于开发有效的分散控制器,解决如交通管理、能源管理等实际问题。

OG-MARL is a growing dataset library designed for offline multi-agent reinforcement learning (MARL) research, co-developed by InstaDeep and the University of Cape Town. This dataset offers configurations featuring a wide range of characteristics, including diverse environmental dynamics, heterogeneous agents, non-stationarity, multi-agent scenarios, partial observability, suboptimality, sparse rewards, and demonstrated coordination, to emulate real-world systems. The library encompasses multiple dataset variants such as Good, Medium, Poor, and Replay, with detailed documentation of the experience composition for each dataset. OG-MARL aims to act as a reliable dataset resource for the global research community, promoting advancements in the field and providing an accessible entry point for novice researchers. This dataset is suitable for developing effective decentralized controllers to address real-world practical problems including traffic management and energy management.

创建时间:
2023-02-01
搜集汇总
数据集介绍
构建方式
离线多智能体强化学习(Offline MARL)作为将强化学习应用于现实世界复杂系统的关键范式,其发展长期受限于标准化基准数据集的匮乏。为填补这一空白,OG-MARL数据集应运而生,其构建遵循严谨的生成与验证流程。数据集的来源基于在多个主流合作型MARL环境(如SMAC、MAMuJoCo、PettingZoo等)中,利用部分训练的在线算法(包括独立学习器如IDQN、ITD3,以及集中训练分散执行算法如QMIX、MATD3)记录环境交互轨迹。为确保数据分布的多样性与覆盖面,每个数据集由三个独立训练的联合策略生成,并注入少量探索噪声,最终依据轨迹的回合回报质量划分为Good、Medium、Poor及Replay四种类型,从而系统性地刻画不同行为策略下的数据特征。
特点
OG-MARL数据集的核心特点在于其高度的多样性与对真实世界应用场景的针对性设计。它涵盖了从2到27个智能体的多智能体规模,支持离散与连续动作空间,以及特征向量与像素矩阵等多种观测模态。数据集不仅包含同质与异质智能体系统,还引入了稀疏奖励、团队与个体奖励并存、程序化生成与随机环境等挑战性设置。尤为突出的是,它首次在离线MARL基准中纳入了基于真实世界问题的领域,如能源管理(CityLearn、Voltage Control)与铁路调度(Flatland),并提供了人类行为策略数据集(Knights, Archers & Zombies),推动离线MARL研究向更贴近实际应用的方向发展。
使用方法
OG-MARL数据集的使用方法设计得直观且灵活,旨在降低研究者的入门门槛并促进标准化评估。用户可通过OG-MARL开源代码库中的离线日志记录器(OfflineLogger)轻松加载现有数据集,或自行在支持的环境中生成新数据。数据集以二进制格式存储,并提供了配套的数据加载工具,支持以完整轨迹或单步转移两种粒度进行访问。为便于算法比较,OG-MARL已集成多种离线MARL基线算法(如MAICQ、QMIX+CQL、OMAR等),并提供了复现实验的脚本。研究者可直接利用这些数据集与基线结果进行性能评估,或基于公开的存储库贡献新数据集,共同推动该领域的进步。
背景与挑战
背景概述
离线多智能体强化学习(Offline MARL)作为一项新兴技术,旨在从预先收集的静态数据集中学习最优分散控制策略,从而规避在线交互的高昂成本与风险。然而,该领域长期受困于标准化基准数据集的缺失,导致研究进展难以量化评估。为填补这一空白,2023年由InstaDeep与开普敦大学联合团队(Claude Formanek、Asad Jeewa、Jonathan Shock及Arnu Pretorius)发布了OG-MARL数据集。该数据集系统性地涵盖了复杂环境动态、异构智能体、非平稳性、部分可观测性及稀疏奖励等真实世界特征,并提供了Good、Medium、Poor及Replay等多种质量等级的轨迹数据,为离线MARL研究奠定了坚实的评测基础。
当前挑战
OG-MARL所解决的核心领域挑战在于:离线MARL算法需应对数据分布偏移引发的动作外推误差累积问题,尤其在多智能体场景下,联合动作空间的维度爆炸使得保守值估计与策略约束的平衡更为棘手。在数据集构建过程中,团队面临多重困难:需确保行为策略的多样性以覆盖充分的状态-动作空间,同时避免轨迹过度集中于单一策略;还需针对不同环境(如SMAC、MAMuJoCo、PettingZoo)设计差异化的数据采集协议,并引入人类操作数据以贴近真实应用场景。此外,如何对数据集进行质量验证(如通过小提琴图可视化回报分布)并建立统一基线,亦是保障基准可靠性的关键挑战。
常用场景
经典使用场景
在离线多智能体强化学习领域,OG-MARL数据集为研究者提供了一个标准化的基准平台,用于评估和比较不同算法在合作场景下的性能。该数据集覆盖了多种经典环境,如SMAC、MAMuJoCo和PettingZoo,并包含Good、Medium、Poor和Replay四种不同质量的数据分布,使得研究者能够系统性地测试算法在面对不同数据质量时的鲁棒性与泛化能力。其经典使用场景包括训练离线MARL控制器,并通过固定数据集的离线训练,评估最终策略在环境中的执行效果。
实际应用
OG-MARL数据集的实际应用场景广泛,尤其适用于那些难以构建精确仿真器但拥有大量历史运行数据的工业系统。例如,在智能电网管理中,多个分布式能源设备需要协同控制以维持电压稳定;在铁路调度系统中,列车需要协调运行以避免冲突;在自动驾驶车队管理中,车辆需共享感知信息以优化交通流。OG-MARL提供的离线训练范式,使得从这些真实系统的历史数据中学习高效、去中心化的控制策略成为可能,从而降低了部署成本与安全风险。
衍生相关工作
OG-MARL数据集的发布催生了一系列重要的后续研究工作。例如,Formanek等人利用该数据集探索了多智能体环境下的选择性‘重生’训练策略,而Zhu等人则基于扩散模型提出了MADiff算法,在离线MARL中实现了策略学习。此外,MAICQ、QMIX+CQL和OMAR等基线算法在OG-MARL上的基准测试结果,为后续算法改进提供了明确的性能参照。这些衍生工作不仅验证了数据集的价值,也进一步拓展了离线多智能体学习的研究边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务