官方服务:
资源简介:
294,000 science-relevant tuples
应用场景:
相关数据集
SPOC
SPOC(Shortest Path Oracle Clone)是由 Allen Institute for AI 等机构开发的用于机器人导航与操作的数据集。该数据集旨在通过模仿仿真环境中的最短路径规划器,训练机器人在真实世界中高效导航与操作。数据集包含约 20 万套程序化生成的家庭环境,涵盖 41133 个独特 3D 资产,以及数百万帧的专家轨迹数据。这些数据基于 AI2-THOR 模拟器和 P
github620
olmOCR-mix-1025
olmOCR-mix-1025是一个包含约270,000个PDF页面的数据集,这些页面已被使用gpt-4.1和特殊提示策略OCR识别为自然阅读顺序的纯文本,并保留了页面上的原生数字内容。该数据集可用于训练、微调或评估OCR文档管道。
Hugging Face2025-10-22 更新290
tulu-3-sft-reused-on-policy-70b
该数据集是Tulu 3偏好混合的一部分,包含来自Tulu-3-SFT的提示,这些提示包含约束条件,并且包含19,444个生成对(其中一些是来自allenai/Llama-3.1-Tulu-3-70B的on-policy数据)。生成对是通过多种模型生成的,包括Mistral 7B Instruct v0.2、Mistral Nemo Instruct 2407、Tulu 2 7B、Tulu 2 13
Hugging Face2024-11-22 更新150
molmo2-burst
Burst Tracking Dataset 是一个专注于视频对象跟踪标注的数据集,适用于视频分类和对象检测任务。数据集包含三种配置:'track'(默认配置,跟踪所有帧中的点)、'ground'(点的首次和末次出现)和 'single_point_track'(给定起点,跟踪到终点),每种配置均提供训练集分割。数据集采用 Apache 2.0 许可证发布,适用于视频对象跟踪和视频分割等应用场景。
Hugging Face2026-03-03 更新330
tulu-3-sft-prompts-ultrafeedback
该数据集是Tulu 3偏好混合的一部分,包含来自Tulu 3 SFT的提示和使用多种模型生成的内容。数据集的特征包括ID、提示、被选中的内容和角色以及被拒绝的内容和角色。数据集分为多个拆分,每个拆分包含不同数量的字节和示例。生成完成和偏好的方法结合了在线和离线数据,并使用Ultrafeedback模板和LLM判断进行偏好注释。数据集根据ODC-BY-1.0许可证授权,适用于研究和教育用途。
Hugging Face2024-11-22 更新160



