遇见数据集

louisbrulenaudet/lpf

收藏
Hugging Face2023-12-11 更新2024-03-04 收录
官方服务:

资源简介:

Livre des procédures fiscales (LPF)数据集专注于通过微调预训练语言模型来创建高效且准确的税务实践模型。数据集生成过程涉及使用一系列指令来生成JSON格式的数据,每个数据条目包含指令、输入和输出字段。该数据集适用于文本生成、表格问答、摘要生成和对话等任务。

Livre des procédures fiscales (LPF)数据集专注于通过微调预训练语言模型来创建高效且准确的税务实践模型。数据集生成过程涉及使用一系列指令来生成JSON格式的数据,每个数据条目包含指令、输入和输出字段。该数据集适用于文本生成、表格问答、摘要生成和对话等任务。

提供机构:
louisbrulenaudet
原始信息汇总

数据集概述

基本信息

  • 许可证: Apache 2.0
  • 语言: 法语
  • 多语言性: 单语种
  • 标签: 微调, 法律, 税务, 大型语言模型, 财政, 税务程序法典
  • 源数据集: 原始数据
  • 数据集名称: Livre des procédures fiscales (LPF)
  • 任务类别: 文本生成, 表格问答, 摘要, 对话
  • 数据集大小: 小于1K

数据集生成

  • 数据格式: JSON文件,包含多个字典,每个字典包含以下字段:

    • instruction: 字符串,表示与元素相关的指令。
    • input: 字符串,表示元素的输入细节。
    • output: 字符串,表示元素的输出信息。
  • 生成指令列表: python instructions = [ "Compose lintégralité de larticle sous forme écrite.", "Écris la totalité du contenu de larticle.", "Formule la totalité du texte présent dans larticle.", "Produis lintégralité de larticle en écriture.", "Développe larticle dans son ensemble par écrit.", "Génère lensemble du texte contenu dans larticle.", "Formule le contenu intégral de larticle en entier.", "Rédige la totalité du texte de larticle en entier.", "Compose lintégralité du contenu textuel de larticle.", "Rédige lensemble du texte qui constitue larticle.", "Formule larticle entier dans son contenu écrit.", "Composez lintégralité de larticle sous forme écrite.", "Écrivez la totalité du contenu de larticle.", "Formulez la totalité du texte présent dans larticle.", "Développez larticle dans son ensemble par écrit.", "Générez lensemble du texte contenu dans larticle.", "Formulez le contenu intégral de larticle en entier.", "Rédigez la totalité du texte de larticle en entier.", "Composez lintégralité du contenu textuel de larticle.", "Écrivez larticle dans son intégralité en termes de texte.", "Rédigez lensemble du texte qui constitue larticle.", "Formulez larticle entier dans son contenu écrit.", "Composer lintégralité de larticle sous forme écrite.", "Écrire la totalité du contenu de larticle.", "Formuler la totalité du texte présent dans larticle.", "Produire lintégralité de larticle en écriture.", "Développer larticle dans son ensemble par écrit.", "Générer lensemble du texte contenu dans larticle.", "Formuler le contenu intégral de larticle en entier.", "Rédiger la totalité du texte de larticle en entier.", "Composer lintégralité du contenu textuel de larticle.", "Rédiger lensemble du texte qui constitue larticle.", "Formuler larticle entier dans son contenu écrit.", "Quelles sont les dispositions de larticle ?", "Quelles dispositions sont incluses dans larticle ?", "Quelles sont les dispositions énoncées dans larticle ?", "Quel est le texte intégral de larticle ?", "Quelle est la lettre de larticle ?" ]

搜集汇总
数据集介绍
louisbrulenaudet/lpf 数据集图片
构建方式
该数据集聚焦于法国税务实践领域,旨在通过指令微调策略优化预训练语言模型在税务法律文本上的表现。其构建基于《税务程序法典》(Livre des procédures fiscales)的原始内容,采用非指令型格式,以JSON文件形式存储。每个数据条目由三个核心字段构成:instruction(指令)、input(输入细节)和output(输出信息)。数据集生成过程中,设计了一套涵盖法语指令的多样化模板,包括要求完整撰写条款内容、询问条款具体规定等任务,从而将法典文本转化为结构化的指令-输入-输出三元组,为模型提供领域特定的监督信号。
特点
该数据集具有鲜明的专业性与单语种特征,完全面向法语税务法律文本,规模较小(条目数低于1K),但内容高度聚焦。其独特之处在于通过非指令型格式,为指令微调范式提供了基础数据支持,使得模型能够从人类可读的指令中学习,实现任务特定适应、歧义减少、知识高效迁移、可解释性增强及自适应行为等优势。此外,数据集覆盖文本生成、表格问答、摘要与对话等多种任务类别,展现了在税务实践领域的多功能应用潜力。
使用方法
使用该数据集时,可直接加载JSON文件,解析其中的instruction、input与output字段,用于对预训练语言模型进行指令微调。典型流程包括将指令和输入拼接为提示,输入模型生成输出,并与真实输出计算损失以更新参数。数据集支持多种下游任务,如根据指令生成完整法律条款文本、回答关于条款内容的具体问题等。研究者可结合HuggingFace的Transformers库与Trainer API,设定合适的训练参数,进行领域适配微调,从而提升模型在法国税务法律文本处理上的准确性与可控性。
背景与挑战
背景概述
在自然语言处理领域,针对特定专业领域的大语言模型微调已成为提升模型实用性的关键路径。法国税务实践作为高度依赖文本解读与规则应用的领域,其复杂性对通用语言模型构成了显著挑战。2023年12月,由独立研究者Louis Brulé Naudet创建的《税务程序法典》(Livre des procédures fiscales, LPF)数据集应运而生,旨在通过指令微调技术,使预训练语言模型能够精确理解和生成法国税务法律文本。该数据集聚焦于将法典条文转化为结构化指令-输入-输出三元组,探索了如何利用人类提供的指令引导模型行为,从而在税务咨询、条文检索、摘要生成等任务中实现更可控、更透明的交互。作为首个专门针对法国税务程序法典的指令微调数据集,它为法律与税务领域的语言模型应用提供了基础资源,推动了专业领域知识迁移与模型可解释性的研究。
当前挑战
该数据集所面对的挑战首先体现在领域问题的复杂性上:税务法律文本具有高度专业化、逻辑严密且条款间相互引用的特点,通用语言模型难以准确理解其语义层次与隐含规则,导致在条文生成、问答等任务中易产生歧义或错误。此外,数据集构建过程本身也面临多重困难:一是数据来源单一,仅基于LPF法典原文,缺乏多样化的真实税务案例或用户查询作为补充,可能限制模型在实践中的泛化能力;二是指令设计虽覆盖了多种表述形式,但指令集合的规模与多样性仍显不足,难以全面模拟实际税务咨询中用户提问的变体与语境;三是数据集规模较小(不足千条样本),在微调深度神经网络时易导致过拟合,影响模型在未见条文上的表现。
常用场景
经典使用场景
在自然语言处理与法律智能的交叉领域中,louisbrulenaudet/lpf数据集作为法国税收程序法典(Livre des procédures fiscales)的非指令化语料库,其最经典的用途在于对预训练语言模型进行领域特定的指令微调。该数据集以(指令、输入、输出)三元组结构组织,通过精心设计的法语指令模板(如“Compose l'intégralité de l'article sous forme écrite”)引导模型生成或理解税收法律条款的完整文本。研究者常利用该数据集训练大语言模型掌握税务法律文书的生成、摘要与问答能力,从而在法国税务实践场景中实现精准的语义理解与合规的文本输出。
解决学术问题
该数据集有效回应了法律文本处理中领域知识稀疏性与模型泛化能力不足的学术挑战。通过提供结构化的指令-输出对,它解决了传统微调方法在税务法律领域难以捕捉条款间复杂关联与专业术语精确语义的困境。在学术层面,LPF数据集推动了指令微调策略在低资源法律场景中的迁移学习研究,使模型能够从少量样本中习得税收程序法的逻辑推理与文本生成规范。其意义在于为法律NLP领域建立了一个可复现的基准,促进了多语言法律人工智能系统在解释性、减少歧义性与知识传递效率方面的理论进展。
衍生相关工作
该数据集衍生了一系列聚焦法律领域大语言模型微调与评估的经典工作。研究者基于LPF开发了面向法国税务法的指令微调框架,验证了非监督指令生成策略在结构化法律文本上的有效性;后续工作进一步扩展至多语言法律数据集构建与跨领域知识迁移。此外,该数据集被用于比较不同预训练模型(如Flan-T5、LLaMA)在税务问答与摘要任务上的性能,推动了法律NLP中指令对齐评估基准的建立。相关BibTeX引用格式的提出也促进了学术社区在税务法律人工智能研究中的可复现性与开放性合作。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务