CORAL
收藏资源简介:
CORAL数据集是由中国人民大学高瓴人工智能学院创建的一个大规模多轮对话增强生成语言基准。该数据集包含8000条多样化的信息寻求对话,自动从维基百科中提取,旨在评估和提升多轮对话中的检索增强生成系统。数据集的创建过程包括从维基百科页面中提取标题树,并通过四种采样策略生成对话流。CORAL数据集的应用领域主要集中在多轮对话中的检索和生成任务,旨在解决现实世界中复杂的多轮对话问题。
CORAL is a large-scale multi-turn dialogue retrieval-augmented generation language benchmark developed by the Gaoling School of Artificial Intelligence, Renmin University of China. The dataset contains 8,000 diverse information-seeking dialogues automatically extracted from Wikipedia, and is designed to evaluate and enhance retrieval-augmented generation systems in multi-turn dialogues. The dataset creation process involves extracting title trees from Wikipedia pages and generating dialogue flows using four sampling strategies. The application scenarios of CORAL primarily focus on retrieval and generation tasks in multi-turn dialogues, aiming to address complex real-world multi-turn dialogue problems.
CORAL: Benchmarking Conversational Retrieval-Augmentation Generation
数据集概述
- 名称: CORAL
- 描述: 一个大规模的对话式检索增强生成(RAG)基准,旨在标准化和评估各种对话式RAG基线。
- 关键特征:
- 开放领域覆盖
- 知识密集型
- 自由形式响应生成
- 处理话题转移
- 引用标注
- 任务:
- 对话式段落检索: 评估系统根据多轮上下文从大型文档集中检索相关信息的能力。
- 响应生成: 评估系统生成准确、上下文丰富答案的能力。
- 引用标注: 确保生成的响应通过要求正确归属来源来保持透明和基于事实。
数据集构建
- 概述: 数据集构建过程包括四个不同的对话流程采样。
- 数据统计:
- LDS:
- 训练集: 1800个对话, 5934个回合
- 测试集: 200个对话, 651个回合
- SIDS:
- 训练集: 1800个对话, 16082个回合
- 测试集: 200个对话, 1727个回合
- STRW:
- 训练集: 1800个对话, 18165个回合
- 测试集: 200个对话, 1949个回合
- DTRW:
- 训练集: 1800个对话, 19411个回合
- 测试集: 200个对话, 2153个回合
- LDS:
数据格式
- 文件格式: JSONL
- 文件结构: json { "conv_id": "Train_type_convid", "turns": [ { "turn_id": 1, "question": "", "response": "", "golden_rewrite": "", "golden_docs_pids": [], "golden_docs_text": [] }, { "turn_id": 2, "question": "", "response": "", "golden_rewrite": "", "golden_docs_pids": [], "golden_docs_text": [] }, ... ] }
许可证
- 代码: MIT License
- 数据集: CC BY-SA-4.0




