play_ta_frozenlake_avg
收藏资源简介:
该数据集包含强化学习环境中的交互轨迹数据,主要特征包括环境名称(env_name)、环境索引(env_idx)、全局步数(global_step)、回合步数(episode_step)、动作(action)、奖励(reward)、终止标志(done)、离散观测(observation_discrete)、元数据概率(metadata_prob)、环境地图(metadata_map)和最优Q值(metadata_q_star)。数据集分为训练集(2,000,000条)、验证集(20,000条)和测试集(20,000条)三个部分,总大小约261MB。数据存储为分片文件,适用于强化学习算法训练与评估任务。
This dataset contains interactive trajectory data from reinforcement learning (RL) environments. Its core features include: environment name (env_name), environment index (env_idx), global step (global_step), episode step (episode_step), action (action), reward (reward), termination flag (done), discrete observation (observation_discrete), metadata probability (metadata_prob), environment map (metadata_map), and optimal Q-value (metadata_q_star). The dataset is split into three subsets: training set (2,000,000 samples), validation set (20,000 samples), and test set (20,000 samples), with an overall size of approximately 261 MB. The data is stored as sharded files, and is suitable for training and evaluating reinforcement learning algorithms.




