遇见数据集

uproai/endex-700k-ns

收藏
Hugging Face2024-03-05 更新2024-06-22 收录
官方服务:

资源简介:

该数据集包含多个文本特征和评分,主要用于英语文本分类任务。数据集包含训练集,共有686046个样本,文件大小为403461950字节。数据集的下载大小为251097681字节,许可证为MIT。

该数据集包含多个文本特征和评分,主要用于英语文本分类任务。数据集包含训练集,共有686046个样本,文件大小为403461950字节。数据集的下载大小为251097681字节,许可证为MIT。

提供机构:
uproai
原始信息汇总

数据集概述

数据特征

  • text_a: 字符串类型
  • text_b: 字符串类型
  • RE: 浮点数类型
  • AR: 浮点数类型
  • BE: 浮点数类型
  • EE: 浮点数类型
  • num_score: 浮点数类型
  • labels: 整数类型
  • Unnamed: 0: 浮点数类型
  • toxicity: 浮点数类型
  • sentiment: 浮点数类型
  • engagingness_score: 浮点数类型
  • method: 字符串类型

数据分割

  • train: 包含686046个样本,总大小为403461950字节

数据集大小

  • 下载大小: 251097681字节
  • 数据集大小: 403461950字节

配置

  • config_name: default
  • data_files:
    • split: train
    • path: data/train-*

许可证

  • license: MIT

任务类别

  • text-classification

语言

  • en

标签

  • endex
  • roleplay
搜集汇总
数据集介绍
uproai/endex-700k-ns 数据集图片
构建方式
该数据集名为uproai/endex-700k-ns,源自于endex项目,专为文本分类任务设计,尤其聚焦于角色扮演场景中的互动评估。数据集构建基于大规模文本对(text_a与text_b),通过自动化流程与人工标注相结合的方式,为每个样本赋予多重数值指标,如相关性(RE)、吸引力(AR)、趣味性(BE)和共情性(EE),并整合了毒性、情感倾向及参与度得分等多维度特征。最终形成约68.6万条训练样本,以JSON格式存储,确保数据的高效加载与处理。
使用方法
使用该数据集时,可直接通过HuggingFace的datasets库加载,指定配置为default,数据分割为train。每条样本包含文本对及对应的评分向量,适用于训练回归或分类模型。研究人员可基于RE、AR等指标构建自定义损失函数,或利用toxicity和sentiment进行安全过滤。数据以Parquet格式存储,支持高效迭代。建议结合endex项目代码进行预处理,以充分利用其评估框架,提升角色扮演场景下的模型表现。
背景与挑战
背景概述
在自然语言处理领域,对话系统与角色扮演文本生成任务近年来备受关注,其核心挑战在于如何使模型生成兼具逻辑连贯性与情感真实性的交互内容。uproai/endex-700k-ns数据集由研究团队于近期构建,依托GitHub上的endex项目(https://github.com/gxxu-ml/endex),旨在为文本分类任务提供精细化的多维度标注资源。该数据集包含约68.6万条训练样本,每条样本涵盖文本对(text_a与text_b)以及反应性(RE)、真实性(AR)、信念性(BE)、共情性(EE)等连续型评分,同时整合了毒性、情感、参与度等辅助指标。通过引入角色扮演场景下的多属性评估,该数据集为探究人机交互中文本的社交信号与情感层次提供了标准化基准,推动了对话系统在个性化表达与伦理约束之间的平衡研究,对社交机器人、虚拟助手等应用领域具有重要影响力。
当前挑战
该数据集当前面临的核心挑战集中于多维度标注的领域适配性与构建过程中的数据质量管控。首先,在领域问题层面,文本分类任务需同时处理反应性、真实性等抽象概念的量化评分,这些指标缺乏统一客观定义,导致标注一致性难以保障;角色扮演场景下的文本多样性进一步加剧了分类边界模糊的问题,例如情感与毒性标签可能因语境不同而产生冲突。其次,在构建过程中,数据集依赖自动化工具生成部分评分(如toxicity、sentiment),这些工具在特定角色扮演语境下的偏差可能引入系统性噪声;此外,原始数据中存在的缺失值(如'Unnamed: 0'列)与标签分布不均衡(如num_score的浮点范围)增加了模型训练的稳定性风险。如何设计更鲁棒的标注协议以降低主观性偏差,同时通过数据清洗与增强策略提升样本代表性,是释放该数据集潜力的关键瓶颈。
常用场景
经典使用场景
在角色扮演与对话系统的研究领域中,uproai/endex-700k-ns数据集以其丰富的文本对样本和多重标注维度,成为评估与训练对话模型质量的重要基准。该数据集包含近70万条英文文本对,每条样本均标注了响应性(RE)、可信度(AR)、吸引力(BE)、参与度(EE)以及毒性、情感倾向和引人入胜度等细粒度指标。研究者可利用这些标注,对生成式对话模型进行多维度评分与优化,尤其适用于需要控制对话安全性和情感一致性的角色扮演场景。该数据集不仅支持传统的文本分类任务,更为构建高质量、低毒性的交互式AI系统提供了标准化的训练与评估框架。
解决学术问题
该数据集的核心学术价值在于解决了角色扮演对话中质量评估标准模糊、标注维度单一的问题。传统对话数据集往往仅依赖单一指标(如流畅性)或人工评分,难以全面捕捉角色扮演中角色一致性、情感共鸣与互动吸引力等复杂属性。endex-700k-ns通过引入响应性、可信度、吸引力等多元量化指标,为研究者提供了可复现的评估范式,从而推动了对话系统在角色扮演场景下的可控生成研究。其意义在于:一方面,使学术社区能够基于统一标准比较不同模型的性能;另一方面,促进了针对对话毒性检测与情感调控的专项研究,为构建更安全、更具共情能力的AI助手奠定了数据基础。
实际应用
在实际应用中,该数据集可广泛服务于社交机器人、虚拟角色扮演游戏和在线客服系统的开发。例如,在虚拟偶像或游戏NPC的对话设计中,开发者可利用数据集中标注的吸引力和参与度分数,筛选出高互动性的对话样本,用于训练能维持用户兴趣的对话模型。同时,毒性评分可直接用于过滤不当内容,确保生成文本符合社区规范。此外,情感倾向与引人入胜度指标有助于优化客服机器人的情感回应策略,使交互更具人性化。该数据集因其多维度的标注特性,已成为工业界构建安全、生动且富有角色感的对话系统的实用工具。
数据集最近研究
最新研究方向
在自然语言处理与角色扮演对话系统的交叉领域,uproai/endex-700k-ns数据集为文本分类任务提供了兼具深度与广度的训练资源。该数据集聚焦于角色扮演场景中的多维语义评估,通过整合文本对、回归标签(如RE、AR、BE、EE)以及毒性、情感、参与度等细粒度评分,推动了对话系统在拟人化交互与情感对齐方面的前沿探索。当前研究热点集中于利用此类多标签数据优化大语言模型在角色扮演中的一致性表达与伦理约束,例如通过毒性评分实现安全过滤,借助情感与参与度指标提升对话的沉浸感与自然度。该数据集的发布为构建更贴近人类社交规范的虚拟角色奠定了数据基础,尤其在元宇宙与智能客服等应用场景中具有显著意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务