Harvard-DCML/tis-dolci-subset-datasets-Llama-3.2-3B
收藏资源简介:
该数据集是一个多配置的对话格式数据集,用于训练和评估语言模型,特别是针对推理和问答任务。它包含多个子集,每个子集基于不同的源数据集(如BBH(Big-Bench Hard)、GSM8K(数学问题)、MMLU Pro(多学科选择题)、TyDiQA(多语言问答)和Codex(代码生成))构建,并采用不同的数据采样或增强方法(例如less_dg、less_knn_kde、less_rr、less_uot、rds_rr)。每个配置包含10,000个训练示例,数据以消息列表形式组织,包括角色(如用户或助手)和内容字段,适用于监督微调或对话生成任务。数据集未提供验证或测试分割,仅包含训练分割。
This dataset is a multi-configuration dialogue-formatted dataset designed for training and evaluating language models, particularly for reasoning and question-answering tasks. It includes multiple subsets, each built from different source datasets (e.g., BBH (Big-Bench Hard), GSM8K (math problems), MMLU Pro (multidisciplinary multiple-choice questions), TyDiQA (multilingual QA), and Codex (code generation)) and employs various data sampling or augmentation methods (such as less_dg, less_knn_kde, less_rr, less_uot, rds_rr). Each configuration contains 10,000 training examples, with data organized as message lists including roles (e.g., user or assistant) and content fields, suitable for supervised fine-tuning or dialogue generation tasks. The dataset does not provide validation or test splits, only training splits.



