遇见数据集

tasksource/patent-phrase-similarity

收藏
Hugging Face2024-05-28 更新2024-06-12 收录
官方服务:

资源简介:

--- license: cc-by-4.0 configs: - config_name: default data_files: - split: train path: data/train-* - split: validation path: data/validation-* - split: test path: data/test-* dataset_info: features: - name: anchor dtype: string - name: target dtype: string - name: rating dtype: string - name: score dtype: float64 - name: context dtype: string - name: label dtype: string splits: - name: train num_bytes: 3052810 num_examples: 36473 - name: validation num_bytes: 242695 num_examples: 2843 - name: test num_bytes: 770452 num_examples: 9232 download_size: 721129 dataset_size: 4065957 ---

许可证:CC BY 4.0 配置项: - 配置名称:默认(default) 数据文件: - 数据集划分:训练集(train),路径:data/train-* - 数据集划分:验证集(validation),路径:data/validation-* - 数据集划分:测试集(test),路径:data/test-* 数据集信息: 特征字段: - 名称:锚点(anchor),数据类型:字符串(string) - 名称:目标(target),数据类型:字符串(string) - 名称:评分(rating),数据类型:字符串(string) - 名称:得分(score),数据类型:64位浮点数(float64) - 名称:上下文(context),数据类型:字符串(string) - 名称:标签(label),数据类型:字符串(string) 数据集划分统计: - 训练集:字节数3052810,样本量36473 - 验证集:字节数242695,样本量2843 - 测试集:字节数770452,样本量9232 下载大小:721129 字节,数据集总大小:4065957 字节

提供机构:
tasksource
原始信息汇总

数据集概述

许可证

  • 类型: CC-BY-4.0

配置

  • 默认配置 (config_name: default)
    • 训练集 (split: train)
      • 路径: data/train-*
    • 验证集 (split: validation)
      • 路径: data/validation-*
    • 测试集 (split: test)
      • 路径: data/test-*

数据集信息

  • 特征

    • anchor
      • 数据类型: 字符串
    • target
      • 数据类型: 字符串
    • rating
      • 数据类型: 字符串
    • score
      • 数据类型: 浮点数 (float64)
    • context
      • 数据类型: 字符串
    • label
      • 数据类型: 字符串
  • 分割信息

    • 训练集 (name: train)
      • 字节数: 3052810
      • 示例数: 36473
    • 验证集 (name: validation)
      • 字节数: 242695
      • 示例数: 2843
    • 测试集 (name: test)
      • 字节数: 770452
      • 示例数: 9232
  • 下载大小: 721129

  • 数据集大小: 4065957

搜集汇总
数据集介绍
tasksource/patent-phrase-similarity 数据集图片
构建方式
在专利信息检索与语义匹配的研究背景下,tasksource/patent-phrase-similarity数据集应运而生,旨在评估和推动短语级别语义相似度计算的进展。该数据集的构建以专利文本中的关键短语为核心,通过人工标注的方式,为每对锚点短语与目标短语分配一个连续的相似度分数(rating字段以字符串形式存储,score字段为对应的浮点数值),并辅以上下文信息(context字段)以增强语义理解。数据划分为训练集(36,473条)、验证集(2,843条)和测试集(9,232条),确保模型训练与评估的独立性。
特点
该数据集的核心特色在于其专注于专利领域的短语语义相似性,填补了特定垂直领域细粒度语义匹配数据的空白。每条样本包含anchor、target、rating、score、context和label六个字段,其中context字段提供了短语所在的专利上下文,使得相似度评分更具领域特异性。评分采用连续值而非离散类别,能够捕捉细微的语义差异,而label字段则提供了可选的离散化标签,便于多任务学习。数据集规模适中,总计约4.8万条样本,兼顾了训练效率与模型泛化能力。
使用方法
该数据集适用于训练和评估基于文本的语义相似度模型,尤其在专利分析、技术文档检索等场景中。使用时,可将anchor和target字段作为模型输入,score字段作为回归任务的目标值,或利用label字段进行分类任务。context字段可作为额外输入以提升模型对领域术语的理解。数据集以HuggingFace Datasets格式提供,支持通过load_dataset('tasksource/patent-phrase-similarity')直接加载,并可按split参数(train、validation、test)划分数据,便于集成到标准的机器学习流水线中。
背景与挑战
背景概述
在自然语言处理与知识产权信息检索的交叉领域,专利文本的语义理解一直是技术难点。tasksource/patent-phrase-similarity数据集由国际研究团队于近年构建,旨在评估模型对专利术语间语义关联的捕捉能力。该数据集以专利文档中的短语对为核心,通过人工标注的相似度评分(如“完全匹配”“部分相关”等)作为监督信号,推动模型从字面匹配向深层语义推理演进。其训练集包含36,473个样本,覆盖机械、电子、化学等多领域术语,为专利检索、侵权检测及技术图谱构建提供了标准化基准。自发布以来,该数据集已成为评测专利语义理解模型的重要资源,显著促进了领域内预训练语言模型的针对性优化。
当前挑战
该数据集面临的核心挑战源于专利语言的独特性和标注复杂性。首先,专利文本中大量使用法律化、技术性极强的术语(如“耦合装置”与“连接机构”),其语义相似度往往需结合上下文语境判断,传统基于词向量的模型难以捕捉这类领域专精的细粒度差异。其次,构建过程中,人工标注者需在专利专家的指导下,对跨技术领域的短语对进行一致性评分,而不同子领域间术语的抽象程度(如“算法”与“流程”)导致标注标准难以统一,容易引入主观偏差。此外,数据集仅包含短语级标签,缺乏对完整专利段落或权利要求结构的建模,限制了模型在真实检索场景中的泛化能力。
常用场景
经典使用场景
在自然语言处理与知识工程交叉领域中,专利文本的语义匹配任务始终是技术创新的重要基石。tasksource/patent-phrase-similarity数据集专为评估短语级语义相似度而设计,其核心场景聚焦于专利术语间的精确语义对齐。通过提供锚定短语与目标短语的配对数据,并辅以上下文语境及专家标注的相似度评分,该数据集为训练和测试语义嵌入模型、短语表示学习算法提供了标准化的基准平台。研究人员常利用其训练集与验证集来微调预训练语言模型,例如BERT或RoBERTa,以捕捉专利语言中细微的语义差异,进而在测试集上验证模型的泛化能力。这一经典用法不仅推动了专利信息检索技术的进步,也为跨领域术语映射研究奠定了数据基础。
衍生相关工作
围绕tasksource/patent-phrase-similarity数据集,学术界已衍生出一系列经典工作。其中,基于对比学习的专利短语表示模型通过在此数据集上预训练,有效提升了跨语言专利匹配的鲁棒性。另有研究将之与知识图谱嵌入相结合,探索短语间隐式语义关系的推理能力。此外,该数据集常被用作领域适应实验的评估基准,例如在通用语义相似度模型基础上进行微调,以适配专利领域的特定语言风格。这些衍生工作不仅拓展了数据集的应用边界,还催生了诸如专利短语检索系统、多模态专利分析框架等创新成果,持续推动着专利信息处理领域的前沿进展。
数据集最近研究
最新研究方向
在自然语言处理与知识产权信息检索的交叉领域,专利文本的语义相似度评估正成为前沿热点。tasksource/patent-phrase-similarity数据集聚焦于专利短语间的语义匹配任务,其核心价值在于为专利检索、侵权检测及技术趋势分析提供精细化基准。该数据集通过锚定短语与目标短语的关联性标注,结合上下文语境与多级评分体系,推动了深度学习模型在专业术语歧义消解和跨领域语义泛化方面的研究。当前,随着大语言模型在专利自动化审查中的探索,该数据集被广泛用于评估模型对法律与技术混合文本的理解能力,其影响在于加速了知识产权领域从关键词匹配向语义理解的范式转型,对提升专利分析效率与降低人工审查成本具有显著意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务