zhongshupeng/dataset_4090_1
收藏资源简介:
# Disclaimer: this dataset is curated for NeurIPS 2023 LLM efficiency challange, and currently work in progress. Please use at your own risk. # Data composition: All data were derived from the training set portion of the open source dataset. **gsm8k_dolly15k_cnnadd8k_mmlulog1.7w_bbqabc8k.json**: -gsm8k_8000: https://huggingface.co/datasets/gsm8k -dolly_15000: https://huggingface.co/datasets/databricks/databricks-dolly-15k -cnn_dailymail_8000: https://huggingface.co/datasets/cnn_dailymail -mmlu_17000: https://huggingface.co/datasets/cais/mmlu -bbq_8000: https://huggingface.co/datasets/tasksource/bigbench **lima_4kall.json** -lima_1000: https://huggingface.co/datasets/GAIR/lima -3000 of gsm8k_dolly15k_cnnadd8k_mmlulog1.7w_bbqabc8k.json
数据集概述
数据来源
所有数据均来源于开源数据集的训练集部分。
数据文件
gsm8k_dolly15k_cnnadd8k_mmlulog1.7w_bbqabc8k.json
- gsm8k_8000: 来自 gsm8k
- dolly_15000: 来自 databricks-dolly-15k
- cnn_dailymail_8000: 来自 cnn_dailymail
- mmlu_17000: 来自 mmlu
- bbq_8000: 来自 bigbench
lima_4kall.json
- lima_1000: 来自 lima
- 3000: 来自 gsm8k_dolly15k_cnnadd8k_mmlulog1.7w_bbqabc8k.json



