The Integral Lets Go Dataset
收藏资源简介:
该数据集由卡内基梅隆大学语言技术研究所提供,后移至德国班贝格大学自然语言生成与对话系统组。数据集来源于Lets Go对话系统的使用,包含171,128个对话,主要用于提供公交信息调度。数据集覆盖了从2005年8月1日至2016年3月15日的对话记录,是当时最大的公开可用真实用户数据集之一。
This dataset was provided by the Language Technologies Institute at Carnegie Mellon University and later transferred to the Natural Language Generation and Dialogue Systems Group at the University of Bamberg in Germany. The dataset originates from the usage of the Lets Go dialogue system, encompassing 171,128 dialogues primarily used for providing bus information scheduling. It covers dialogue records from August 1, 2005, to March 15, 2016, and was one of the largest publicly available real-user datasets at the time.
数据集概述
数据集名称
The Integral LETS GO! Dataset
数据集来源
原始由卡内基梅隆大学语言技术研究所提供,现由德国巴姆堡大学的自然语言生成与对话系统组托管。
数据集内容
- 主要数据集:包含171,128个对话,时间范围从2005年8月1日至2016年3月15日。数据包括WAV文件、日志文件和由ASR自动生成的标签。
- 子集 - 口语对话挑战:2010年的挑战数据,涉及四个团队的系统比较。
- 子集 - 对话状态跟踪挑战 (DSTC1):使用Lets Go系统的对话数据,用于对话状态跟踪研究。
- 事件和系统变更日志:记录系统架构变更、公交时刻表变更等重要变更的Excel文件。
- 众包注释:2008年10月至2009年9月的对话文字转录,由Amazon Mechanical Turk工作者完成。
- Lets Go每日报告:2006年至2016年的每日报告,包括对话数量、平均对话轮数等统计信息。
数据集结构
数据按月份组织,每个月份的数据包含多个文件夹,每个文件夹内包含当月的对话数据,包括WAV文件、日志文件和自动生成的标签。
数据集下载
可通过提供的Shell脚本下载完整数据集或特定时间段的数据。完整数据集大小为715GB。
数据集使用许可
使用数据前需同意相关许可协议,并在所有使用该数据的研究成果中引用。




