Self-taught-evaluator-DPO-data
收藏资源简介:
该数据集是作为[Self-taught evaluators](https://arxiv.org/abs/2408.02666)研究项目的一部分发布的。它基于[WildChat](https://huggingface.co/datasets/allenai/WildChat-1M)的提示,使用[Llama-3.1-70B-Instruct](https://huggingface.co/meta-llama/Llama-3.1-70B-Instruct)生成响应和评估计划。数据集的构建细节可以在[Self-taught evaluators](https://arxiv.org/abs/2408.02666)中找到。数据集的使用和相关资源受[Self-Taught Evaluator Research License](https://huggingface.co/facebook/Self-taught-evaluator-llama3.1-70B/blob/main/Research%20License%20for%20Self-taught%20Evaluator.pdf)的约束。
本数据集系作为**自训练评估器(Self-taught evaluators)**研究项目的组成部分正式发布。其数据提示源自[WildChat](https://huggingface.co/datasets/allenai/WildChat-1M)数据集,采用[Llama-3.1-70B-Instruct](https://huggingface.co/meta-llama/Llama-3.1-70B-Instruct)模型生成应答内容与评估规划方案。该数据集的完整构建细节可参阅自训练评估器相关研究论文(https://arxiv.org/abs/2408.02666)。本数据集的使用及关联资源需遵循[自训练评估器研究许可协议(Self-Taught Evaluator Research License)](https://huggingface.co/facebook/Self-taught-evaluator-llama3.1-70B/blob/main/Research%20License%20for%20Self-taught%20Evaluator.pdf)的相关约束条款。
Self-taught-evaluator-DPO-data 数据集概述
基本信息
- 许可证: other
- 许可证名称: other
- 许可证链接: LICENSE
- 语言:
- en
数据集来源
- 该数据集是 Self-taught evaluators 研究项目的一部分。
- 数据集基于 WildChat 提示,使用 Llama-3.1-70B-Instruct 生成响应和评估计划。
加载数据集
- 使用
transformers库加载数据集的示例代码如下: python from datasets import load_dataset dataset = load_dataset("facebook/Self-taught-evaluator-DPO-data")
引用
-
如果使用该数据集,请引用以下 BibTex 条目:
@article{wang2024self, title={Self-taught evaluators}, author={Wang, Tianlu and Kulikov, Ilia and Golovneva, Olga and Yu, Ping and Yuan, Weizhe and Dwivedi-Yu, Jane and Pang, Richard Yuanzhe and Fazel-Zarandi, Maryam and Weston, Jason and Li, Xian}, journal={arXiv preprint arXiv:2408.02666}, year={2024} }
许可证
- 使用该数据集及相关资源受 Self-Taught Evaluator Research License 约束。




