登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Transformer_Reinforcement_Learning
Transformer_Reinforcement_Learning
收藏
kaggle
2024-04-12 更新
2024-05-06 收录
强化学习
Transformer模型
数据链接:
https://www.kaggle.com/datasets/zjp2origin/transformer-reinforcement-learning
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
It may be deleted at any time.
本内容可能随时被删除。
应用场景:
创建时间:
2024-04-12
相关数据集
drone_fsd_dataset
无人机导航
强化学习
这是一个无人机导航的强化学习数据集,描述了无人机在一个60×60的房间内导航的训练过程,房间内有15个静态和12个浮动障碍物。数据集包含了一次训练运行的详细信息,包括性能指标(如最佳时间、成功率、碰撞次数等)、网络架构(MLP策略/价值头)、文件列表(如策略权重、训练摘要、遥测数据等)和环境设置(如房间大小、难度、障碍物属性等)。数据集的预期用途包括分析早期PPO行为、研究探索与利用的权衡、可视化
Hugging Face
2026-01-21 更新
49
0
visual_distracting_metaworld
强化学习
机器人操作
该数据集包含三个配置:'metaworld_hammer'、'metaworld_hammer_distractor'和'metaworld_hammer_distractor_low'。每个配置包含以下特征:观察(图像)、状态(float32列表,长度39)、掩码(图像)、动作(float32列表,长度4)、奖励(float32)、终止(布尔值)和截断(布尔值)。数据集提供训练集分割,每个配置的
Hugging Face
2026-02-03 更新
10
0
InsultedByMathematics/all-online_alpha_1e-4_beta_3e-3-base-as-reference_update_387_eval
自然语言处理
强化学习
该数据集是一个文本生成相关的数据集,包含多个候选响应、提示文本以及对应的奖励值等信息。数据集使用了LLAMA模型,并记录了每个候选响应、拒绝响应和中立响应的token数量和对应的对数概率。数据集分为测试集,测试集名称为test_prefs,包含1678个示例,数据大小为132,683,235字节。
Hugging Face
2025-02-10 更新
6
0
nlile/NuminaMath-1.5-RL-Verifiable
数学问题生成
强化学习
NuminaMath-1.5-RL-Verifiable是一个专门为强化学习应用设计的数学问题数据集,包含了经过严格筛选的131,063个数学单词问题。这些问题都有明确的数值答案,并经过了问题和解决方案的验证,确保来源是高质量的非合成内容。数据集覆盖了代数、几何、数论等多个数学领域。
Hugging Face
2025-03-25 更新
17
0
CodeDPO/rl_dataset_llama3_instruct_8b_20241230_human_eval_format
强化学习
自然语言处理
该数据集包含了问题ID、样本ID、预处理提示文本、处理后的响应、未处理的响应等信息的文本数据,适用于自然语言处理任务。数据集分为训练集,共包含284,419个示例,总大小为1,650,704,840字节。
Hugging Face
2025-01-03 更新
6
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广