conversations-en2bn
收藏资源简介:
该数据集包含会话信息,每个会话包括ID、使用的模型、具体内容和角色、会话轮次、语言。此外,每个会话都经过OpenAI的审核,审核结果包括是否包含骚扰、威胁、仇恨、自我伤害、性内容、针对未成年人的性内容、暴力或图形暴力等分类,以及对应的分数。数据集还包含是否标记为有问题和是否编辑过的信息。数据集分为训练集,并提供了默认配置文件。
This dataset contains conversation records. Each conversation includes an ID, the utilized model, specific content and corresponding role, conversation turn count, and language. Additionally, each conversation has been reviewed by OpenAI, with the review results covering categories such as whether it contains harassment, threats, hate speech, self-harm content, sexual content, sexual content targeting minors, violence or graphic violence, alongside corresponding scores. The dataset also includes information on whether it is marked as problematic and whether it has been edited. The dataset is divided into training sets, and a default configuration file is provided.
数据集概述
基本信息
- 数据集名称: conversations-en2bn
- 数据集地址: https://huggingface.co/datasets/intelsense/conversations-en2bn
- 下载大小: 58,083,752 字节
- 数据集大小: 196,273,026 字节
- 训练集样本数: 22,880
数据集结构
特征
- conversation_id: 字符串类型,表示对话的唯一标识符。
- model: 字符串类型,表示生成对话的模型。
- conversation: 列表类型,包含以下子特征:
- content: 字符串类型,表示对话内容。
- role: 字符串类型,表示对话角色。
- turn: 整型,表示对话的轮次。
- language: 字符串类型,表示对话的语言。
- openai_moderation: 列表类型,包含以下子特征:
- categories: 结构体类型,包含以下布尔类型的子特征:
- harassment
- harassment/threatening
- hate
- hate/threatening
- self-harm
- self-harm/instructions
- self-harm/intent
- sexual
- sexual/minors
- violence
- violence/graphic
- category_scores: 结构体类型,包含以下浮点类型的子特征:
- harassment
- harassment/threatening
- hate
- hate/threatening
- self-harm
- self-harm/instructions
- self-harm/intent
- sexual
- sexual/minors
- violence
- violence/graphic
- flagged: 布尔类型,表示是否被标记。
- categories: 结构体类型,包含以下布尔类型的子特征:
- redacted: 布尔类型,表示是否被编辑。
数据分割
- train: 训练集,包含22,880个样本,大小为196,273,026字节。
配置
- 默认配置:
- 数据文件:
- 分割: train
- 路径: data/train-*
- 数据文件:




