ifeval-like-data
收藏资源简介:
该数据集包含由Qwen/Qwen2.5-72B-Instruct模型生成的指令-响应对,模仿了google/IFEval数据集的风格,并通过lm-evaluation-harness进行了正确性验证。数据集分为两个子集:'default'包含50k未过滤的行,可能包含冲突的指令和错误的响应;'filtered'包含经过过滤的行,适合微调。数据集主要用于文本生成任务,语言为英语。
This dataset comprises instruction-response pairs generated by the Qwen/Qwen2.5-72B-Instruct model, which mirrors the style of the google/IFEval dataset and was validated for correctness via the lm-evaluation-harness framework. The dataset is split into two subsets: the 'default' subset includes 50k unfiltered rows that may contain conflicting instructions and erroneous responses, while the 'filtered' subset consists of pre-filtered rows suitable for fine-tuning. This dataset is primarily intended for text generation tasks and features content in English.
IFEval Like Data 数据集概述
数据集信息
许可证
- 许可证名称: qwen
- 许可证链接: https://huggingface.co/Qwen/Qwen2.5-72B-Instruct/blob/main/LICENSE
数据集大小
- 数据集大小: 1K<n<10K
配置信息
配置: default
- 特征:
- instruction: string
- response: string
- model_name: string
- instruction_id_list: sequence[string]
- distilabel_metadata: struct
- raw_input_i_f_eval_kwargs_assignator_0: list
- content: string
- role: string
- raw_output_i_f_eval_kwargs_assignator_0: string
- raw_input_i_f_eval_kwargs_assignator_0: list
- kwargs: string
- 分割:
- train:
- 字节数: 449730370
- 样本数: 50000
- train:
- 下载大小: 53292952
- 数据集大小: 449730370
配置: filtered
- 特征:
- key: int64
- prompt: string
- response: string
- instruction_id_list: sequence[string]
- kwargs: list
- capital_frequency: int64
- capital_relation: string
- end_phrase: string
- first_word: string
- forbidden_words: sequence[string]
- frequency: int64
- keyword: string
- keywords: sequence[string]
- let_frequency: int64
- let_relation: string
- letter: string
- nth_paragraph: int64
- num_bullets: int64
- num_highlights: int64
- num_paragraphs: int64
- num_placeholders: int64
- num_sections: int64
- num_sentences: int64
- num_words: int64
- postscript_marker: string
- relation: string
- section_spliter: string
- prompt_level_strict_acc: bool
- inst_level_strict_acc: sequence[bool]
- prompt_level_loose_acc: bool
- inst_level_loose_acc: sequence[bool]
- 分割:
- train:
- 字节数: 10543956.482782291
- 样本数: 5614
- train:
- 下载大小: 3228407
- 数据集大小: 10543956.482782291
配置文件
- 配置: default
- 数据文件:
- 分割: train
- 路径: data/train-*
- 分割: train
- 数据文件:
- 配置: filtered
- 数据文件:
- 分割: train
- 路径: filtered/train-*
- 分割: train
- 数据文件:
标签
- synthetic
- distilabel
- rlaif
任务类别
- text-generation
语言
- en
数据集名称
- IFEval Like Data




