遇见数据集

mb7419/legal-advice-reddit

收藏
Hugging Face2024-02-17 更新2024-03-04 收录
官方服务:

资源简介:

--- dataset_info: features: - name: ques_title dtype: string - name: ques_text dtype: string - name: ques_created dtype: string - name: ques_score dtype: int64 - name: ans_text dtype: string - name: ans_created dtype: string - name: ans_score dtype: float64 - name: dominant_topic_name dtype: string - name: __index_level_0__ dtype: int64 splits: - name: train num_bytes: 228451850 num_examples: 115359 - name: validation num_bytes: 49046245 num_examples: 24720 - name: test num_bytes: 49058903 num_examples: 24720 download_size: 197856704 dataset_size: 326556998 configs: - config_name: default data_files: - split: train path: data/train-* - split: validation path: data/validation-* - split: test path: data/test-* ---

数据集信息: 特征字段: - 名称:问题标题(ques_title),数据类型:字符串 - 名称:问题正文(ques_text),数据类型:字符串 - 名称:问题创建时间(ques_created),数据类型:字符串 - 名称:问题得分(ques_score),数据类型:64位整数(int64) - 名称:回答正文(ans_text),数据类型:字符串 - 名称:回答创建时间(ans_created),数据类型:字符串 - 名称:回答得分(ans_score),数据类型:64位浮点数(float64) - 名称:主导主题名称(dominant_topic_name),数据类型:字符串 - 名称:索引层级0(__index_level_0__),数据类型:64位整数 数据集划分: - 训练集(train):字节占用量228451850,样本数量115359 - 验证集(validation):字节占用量49046245,样本数量24720 - 测试集(test):字节占用量49058903,样本数量24720 下载总大小:197856704,数据集总存储大小:326556998 数据集配置: - 配置名称:默认配置(default),数据文件路径: - 训练集对应 data/train-* - 验证集对应 data/validation-* - 测试集对应 data/test-*

提供机构:
mb7419
原始信息汇总

数据集概述

数据集特征

  • ques_title: 问题标题,数据类型为字符串。
  • ques_text: 问题文本,数据类型为字符串。
  • ques_created: 问题创建时间,数据类型为字符串。
  • ques_score: 问题评分,数据类型为整数(int64)。
  • ans_text: 回答文本,数据类型为字符串。
  • ans_created: 回答创建时间,数据类型为字符串。
  • ans_score: 回答评分,数据类型为浮点数(float64)。
  • dominant_topic_name: 主要话题名称,数据类型为字符串。
  • index_level_0: 索引级别,数据类型为整数(int64)。

数据集分割

  • train: 训练集,包含115359个样本,总字节数为228451850。
  • validation: 验证集,包含24720个样本,总字节数为49046245。
  • test: 测试集,包含24720个样本,总字节数为49058903。

数据集大小

  • 下载大小: 197856704字节
  • 数据集大小: 326556998字节

配置信息

  • config_name: default
    • data_files:
      • train: 路径为data/train-*
      • validation: 路径为data/validation-*
      • test: 路径为data/test-*
搜集汇总
数据集介绍
mb7419/legal-advice-reddit 数据集图片
构建方式
该数据集源自Reddit平台上法律咨询子版块的用户互动内容,通过系统化爬取与结构化处理构建而成。原始数据经过清洗与筛选,保留了包含问题标题、问题正文、问题发布时间与得分、回答正文、回答发布时间与得分等关键字段。进一步利用主题建模技术对法律咨询内容进行语义归类,赋予每条数据一个主导主题标签,从而形成具有主题分类能力的高质量语料库。数据集划分为训练集、验证集和测试集,分别包含约11.5万、2.47万和2.47万条样本,为模型训练与评估提供了充足且均衡的数据基础。
特点
该数据集的核心特色在于其真实性与领域专精性。所有样本均来源于真实用户的法律困惑与专业回答,反映了日常生活中常见的法律议题,如合同纠纷、家庭法、刑事问题等。通过引入主题标签,数据集不仅提供了问答对,还赋予了语义层面的组织能力,便于研究者按需筛选特定法律子领域的数据。此外,问题与回答的得分字段可作为质量代理指标,支持对内容权威性与用户认可度的量化分析,为构建更精准的法律问答模型提供了多维度的信息支撑。
使用方法
该数据集可直接用于训练法律领域的问答系统、文本分类模型或对话生成模型。使用时,可从HuggingFace Datasets库加载默认配置,自动获取训练、验证和测试三个子集。研究者可将问题标题与正文拼接作为输入,回答文本作为目标输出,构建序列到序列模型。主题标签字段可辅助进行多任务学习或条件生成,提升模型在特定法律主题上的表现。得分字段可用于过滤低质量样本或作为样本权重,优化训练效果。数据以Parquet格式存储,支持高效读取与批处理,便于集成至现有NLP工作流。
背景与挑战
背景概述
在法律人工智能领域,面向公众的法律咨询数据集长期匮乏,制约了法律文本理解与生成模型的进步。由研究团队于近期构建的legal-advice-reddit数据集,系统化地采集了Reddit法律咨询子版块中的真实问答内容,涵盖超过11万条训练样本及近5万条验证与测试样本。该数据集聚焦于将非结构化的公众法律困惑与专业建议转化为可学习的语料,为法律知识问答、争议焦点识别及法律文本生成等任务提供了宝贵资源。其影响力在于弥合了通用语言模型与专业法律领域之间的鸿沟,推动了法律科技在普惠性法律服务中的应用探索。
当前挑战
该数据集面临的核心挑战首先在于法律领域的专业性与复杂性,Reddit上的问答虽贴近真实需求,但用户表述常包含口语化、非规范术语甚至错误法律认知,模型需具备从噪声中提炼准确法律要点的能力。其次,数据构建过程中面临标签体系设计的难题,如何将多样的法律话题(如合同、婚姻、刑事)合理归类并确保主题标注的一致性,直接影响下游任务效果。此外,问答对的时间跨度与评分差异反映了信息时效性与质量参差不齐的问题,模型需适应不同语境下的回答可靠性判断,这对训练数据的平衡性与鲁棒性提出了更高要求。
常用场景
经典使用场景
在法律人工智能与自然语言处理交叉领域,legal-advice-reddit数据集凭借其源自真实用户法律咨询帖文的独特优势,成为研究法律文本理解与生成任务的重要基石。该数据集包含逾11万条训练样本,每条数据涵盖问题标题、问题正文、回答内容及用户评分等多维信息,为构建法律问答系统、法律文本摘要模型以及法律领域对话生成模型提供了海量、真实且带有社区质量标注的语料资源。研究者常利用该数据集训练模型以理解非专业用户的法律表述,进而实现自动化的法律咨询回应。
解决学术问题
该数据集有效攻克了法律领域因专业壁垒导致的数据稀缺难题,为学术研究开辟了从非结构化社区讨论中提取法律知识的新路径。它解决了传统法律数据集依赖专家标注、成本高昂且规模受限的痛点,使得研究者能够探索弱监督学习、迁移学习在特定法律子领域(如劳动纠纷、租赁合同、家庭法)中的应用。通过分析问题与回答的评分机制,该数据集还支持研究基于用户反馈的答案质量评估模型,推动了法律信息检索与自动问答系统的评价方法论发展。
衍生相关工作
该数据集衍生了一系列具有影响力的经典研究工作,例如基于注意力机制的法律文本匹配模型,通过捕捉问答对间的语义关联提升答案检索精度;以及结合法律本体库的知识增强生成模型,在保留社区回答通俗性的同时融入专业法律术语。另有工作利用该数据集训练法律领域预训练语言模型,并探索其在合同审查、法律文书分类等下游任务上的迁移效果。这些研究共同推动了法律人工智能从实验室走向实际司法辅助场景的进程。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务