遇见数据集

daqc/constitucion-politica-del-peru-1993-qa-gemma-2b-it-format

收藏
Hugging Face2024-04-10 更新2024-06-11 收录
官方服务:

资源简介:

--- dataset_info: features: - name: pregunta dtype: string - name: respuesta dtype: string splits: - name: train num_bytes: 1807541 num_examples: 2075 download_size: 680292 dataset_size: 1807541 configs: - config_name: default data_files: - split: train path: data/train-* ---

数据集信息: 特征: - 名称:问题(pregunta),数据类型:字符串 - 名称:答案(respuesta),数据类型:字符串 数据集划分: - 划分名称:训练集(train),字节大小:1807541,样本数量:2075 下载大小:680292 数据集总大小:1807541 配置项: - 配置名称:默认(default),数据文件: - 划分:训练集(train),文件路径:data/train-*

提供机构:
daqc
原始信息汇总

数据集概述

数据集特征

  • 名称: pregunta
    • 数据类型: string
  • 名称: respuesta
    • 数据类型: string

数据集分割

  • 名称: train
    • 字节数: 1807541
    • 样本数: 2075

数据集大小

  • 下载大小: 680292
  • 数据集大小: 1807541

配置

  • 配置名称: default
    • 数据文件:
      • 分割: train
      • 路径: data/train-*
搜集汇总
数据集介绍
构建方式
该数据集基于秘鲁1993年政治宪法构建,旨在为问答系统提供高质量的训练数据。数据集从宪法原文中提取关键条款与法律条文,精心设计了一组问答对,其中包含‘pregunta’(问题)和‘respuesta’(答案)两个字段。所有数据经过人工审核与格式转换,最终适配Gemma 2B指令微调模型,以标准化的JSON格式存储,共包含2075个训练样本,总数据量约1.8MB。
特点
数据集的核心特点在于其高度专业化与领域聚焦性,专注于秘鲁宪法这一特定法律文本,确保了问答内容的权威性与准确性。每个问答对均直接对应宪法条款,问题设计覆盖宪法的主要章节与核心原则,答案简洁明确,便于模型学习法律知识的精确映射。此外,数据集规模适中,既避免了冗余噪声,又为模型提供了足够的领域知识训练基础。
使用方法
数据集可直接用于监督微调或指令微调任务,尤其适合需要法律知识问答能力的语言模型。使用时,将‘pregunta’作为输入问题,‘respuesta’作为目标输出,通过标准的序列到序列训练框架进行模型优化。推荐加载HuggingFace的datasets库,指定配置名为‘default’,并读取‘train’分片,无需额外预处理即可直接集成至训练流水线。
背景与挑战
背景概述
在自然语言处理与法律智能交叉领域,面向特定国家宪法文本的问答数据集构建,是推动法律知识自动化检索与理解的关键基石。daqc/constitucion-politica-del-peru-1993-qa-gemma-2b-it-format数据集诞生于对秘鲁1993年宪法进行结构化问答建模的需求之中,旨在将宪法条文转化为可由大语言模型直接交互的问答对形式。该数据集由相关研究人员创建,包含2075条训练样本,每条样本由“pregunta”(问题)和“respuesta”(答案)组成,覆盖宪法核心条款的解释与查询。其核心研究问题在于如何利用精简但高质量的问答数据,使轻量级模型(如Gemma 2B)能够准确理解并回答涉及秘鲁宪法的具体法律问题。该数据集的出现,为法律NLP领域提供了首个针对秘鲁宪法的标准化评估基准,对推动南美法律智能系统的发展具有开创性意义。
当前挑战
该数据集面临的挑战体现在多个层面。首先,从领域问题角度看,宪法文本具有高度抽象性和解释弹性,同一法条可能对应多种合法答案,这使得模型在回答时必须兼顾准确性与包容性,避免产生误导性法律解读。其次,构建过程中,原始宪法文本的语义复杂性与问答对的手工标注难度形成主要瓶颈:2075个样本需要法律专家逐条设计问题,确保问题覆盖关键法条且答案无歧义,同时需平衡问题类型的多样性(如定义类、条件类、比较类)。此外,数据集规模较小,可能不足以让模型泛化至宪法未直接覆盖的边缘案例,且缺乏多轮对话或跨法条推理的样本,限制了其在复杂法律咨询场景中的实用性。这些挑战共同指向如何在数据稀缺与法律严谨性之间取得平衡,以提升数据集的鲁棒性与应用价值。
常用场景
经典使用场景
在自然语言处理与法律智能的交叉领域中,该数据集以秘鲁1993年宪法为知识基底,构建了包含2075条问答对的训练集,每条样本由宪法条文相关的提问与对应解答组成。其经典使用场景聚焦于对法律领域大语言模型进行指令微调,尤其适用于基于Gemma-2B-IT架构的模型,通过问答形式强化模型对宪法条款的理解与生成能力,为法律文本的自动化问答系统奠定数据基础。
衍生相关工作
基于该数据集,后续衍生工作包括构建多语言宪法问答基准,用于评估模型在不同法律体系下的迁移能力;以及开发宪法条文检索增强生成系统,结合外部知识库提升复杂问题回答的准确性。此外,该数据集还激发了针对法律文本的对抗性攻击防御研究,探索如何使模型在面对语义模糊或误导性提问时保持稳健表现,进一步拓展了法律AI的安全性与可靠性边界。
数据集最近研究
最新研究方向
该数据集聚焦于秘鲁1993年宪法文本的问答对构建,结合Gemma 2B指令微调格式,为法律领域的生成式AI提供结构化训练资源。当前前沿研究方向包括利用此类领域专用数据集提升大语言模型在拉丁美洲法律条文理解与司法咨询中的准确性,尤其关注宪法条款的语义解析与多轮对话推理能力。相关热点事件如秘鲁国内司法数字化改革与AI辅助法律服务的试点项目,促使研究者探索如何通过高质量、低资源语言的问答数据集,增强模型对特定国家法律体系的适应性。该数据集的发布填补了安第斯地区宪法知识库的空白,对推动法律NLP的本地化应用与可解释AI发展具有示范意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务