遇见数据集

community-datasets/generics_kb

收藏
Hugging Face2024-06-25 更新2024-06-15 收录
官方服务:

资源简介:

GenericsKB数据集是一个包含超过350万句子的知识库,主要包含自然生成的通用句子。这些句子被标注了主题词、上下文信息以及一个基于BERT的置信度评分。数据集还包含GenericsKB-Best子集,该子集包含了质量最高的句子,并补充了从WordNet和ConceptNet中合成的句子。数据集主要用于NLP应用和语言学研究中。

The GenericsKB dataset is a knowledge base containing over 3.5 million sentences, primarily composed of naturally generated generic sentences. These sentences are annotated with topic terms, contextual information, and a BERT-based confidence score. The dataset also includes the GenericsKB-Best subset, which contains the highest-quality sentences and is supplemented with synthetic sentences derived from WordNet and ConceptNet. This dataset is mainly utilized in NLP applications and linguistic research.

提供机构:
community-datasets
原始信息汇总

数据集概述

基本信息

  • 数据集名称: GenericsKB
  • 语言: 英语
  • 许可证: CC BY 4.0
  • 多语言性: 单语种
  • 数据量: 10K<n<100K 和 1M<n<10M
  • 源数据: 原始数据
  • 任务类别: 其他
  • 标签: 知识库

数据集配置

  • generics_kb_best

    • 特征:
      • source: 字符串
      • term: 字符串
      • quantifier_frequency: 字符串
      • quantifier_number: 字符串
      • generic_sentence: 字符串
      • score: 浮点数
    • 分割:
      • train: 99897719 字节, 1020868 样本
    • 下载大小: 94850525 字节
    • 数据集大小: 99897719 字节
  • generics_kb

    • 特征:
      • source: 字符串
      • term: 字符串
      • quantifier_frequency: 字符串
      • quantifier_number: 字符串
      • generic_sentence: 字符串
      • score: 浮点数
    • 分割:
      • train: 348158966 字节, 3433000 样本
    • 下载大小: 343284785 字节
    • 数据集大小: 348158966 字节
  • generics_kb_simplewiki

    • 特征:
      • source_name: 字符串
      • sentence: 字符串
      • sentences_before: 字符串序列
      • sentences_after: 字符串序列
      • concept_name: 字符串
      • quantifiers: 字符串序列
      • id: 字符串
      • bert_score: 浮点数
      • headings: 字符串序列
      • categories: 字符串序列
    • 分割:
      • train: 10039355 字节, 12765 样本
    • 下载大小: 16437369 字节
    • 数据集大小: 10039355 字节
  • generics_kb_waterloo

    • 特征:
      • source_name: 字符串
      • sentence: 字符串
      • sentences_before: 字符串序列
      • sentences_after: 字符串序列
      • concept_name: 字符串
      • quantifiers: 字符串序列
      • id: 字符串
      • bert_score: 浮点数
    • 分割:
      • train: 4277214701 字节, 3666725 样本
    • 下载大小: 0 字节
    • 数据集大小: 4277214701 字节

数据字段

  • generics_kb_best 和 generics_kb:

    • SOURCE: 通用语句的来源
    • TERM: 通用语句的主题类别
    • GENERIC SENTENCE: 语句本身
    • SCORE: BERT训练的分数,衡量通用语句代表“有用的、普遍真理”的程度
    • QUANTIFIER_FREQUENCY: 包含显式量词(如“通常”、“经常”、“频繁”)的通用语句的量词
    • QUANTIFIER_NUMBER: 包含显式量词(如“所有”、“任何”、“大多数”、“一些”等)的通用语句的量词
  • generics_kb_simplewiki 和 generics_kb_waterloo:

    • source_name: 通用语句来源的语料库名称
    • sentence: 通用语句
    • sentences_before: 原始语料库中通用语句之前的最多五个句子
    • sentences_after: 原始语料库中通用语句之后的最多五个句子
    • concept_name: 通用语句的主题概念
    • quantifiers: 通用语句的关键概念的量词
    • id: 通用语句的唯一标识符
    • bert_score: BERT基于的通用语句分类器的分数
    • headings: 仅适用于SimpleWiki数据集,文章的章节/子章节标题
    • categories: 仅适用于SimpleWiki数据集,文章所属的分类
搜集汇总
数据集介绍
community-datasets/generics_kb 数据集图片
构建方式
在自然语言处理与常识推理领域,泛型语句(generic sentences)承载着关于世界的一般性知识,其系统化收集对于知识图谱构建至关重要。GenericsKB数据集通过大规模自动挖掘与筛选的方式构建而成,其数据源自SimpleWikipedia页面及Waterloo语料库(约280GB英文纯文本)。研究者利用基于BERT的二元分类器对原始句子进行泛型性评分,筛选出具有普遍真理价值的陈述,并辅以WordNet和ConceptNet中合成的泛型语句进行扩充。最终形成包含343.3万句子的GenericsKB核心集,以及经过质量筛选的GenericsKB-Best子集(102万句)。
特点
该数据集的核心特色在于其规模与语义完整性。GenericsKB是首个大规模收录自然语境中泛型语句的资源,每个句子均标注了主题术语(term)、量化词类型(如频率与数量修饰语)以及BERT置信度评分。数据集提供四种配置:完整版、高质量筛选版(score>0.234)、带上下文语境的SimpleWiki版(含前后五句语境及文章层级标题),以及最大规模的Waterloo版(366万句)。这种多粒度结构既支持语言学中量化现象的研究,也为常识推理任务提供了丰富的训练样本。
使用方法
借助HuggingFace Datasets库,用户可通过指定配置名便捷加载数据。例如,使用`load_dataset('community-datasets/generics_kb', 'generics_kb_best')`获取高质量子集,或通过`'generics_kb_simplewiki'`配置获取带语境的实例。数据集仅含训练集,字段包括source、term、generic_sentence及score等。对于SimpleWiki配置,还提供headings与categories字段以支持层次化分析。所有数据采用CC-BY-4.0许可,适用于学术研究与商业应用,可直接用于泛型语句分类、常识知识抽取等下游任务。
背景与挑战
背景概述
GenericsKB是由艾伦人工智能研究所(Allen Institute for AI)的Sumithra Bhakthavatsalam、Chloe Anastasiades和Peter Clark于2020年创建的大规模知识库,专注于收录自然语言中蕴含的泛型陈述(generic sentences)。泛型陈述作为表达一般性世界知识与常识的语言载体,在自然语言处理与常识推理研究中占据核心地位,然而此前缺乏高质量、大规模且自然涌现的此类语料资源。该数据集从SimpleWikipedia和Waterloo语料库等来源中爬取并筛选出超过340万条句子,每条句子均标注了主题词、上下文语境及基于BERT模型计算的可信度分数,旨在为语言学研究与NLP应用提供丰富的泛型知识支撑。GenericsKB的发布填补了该领域的数据空白,成为首个大规模自然泛型语句资源,对推动常识推理、知识图谱构建及语义理解等相关研究产生了深远影响。
当前挑战
GenericsKB面临的核心挑战在于泛型陈述的定义与筛选本身具有高度主观性。自然语言中的泛型表达常与具体语境交织,如何从海量文本中准确识别出真正反映一般性世界知识的句子,是构建过程中遇到的重大难题。该数据集采用BERT分类器对句子进行评分,以衡量其‘泛型性’与‘有用性’,但机器学习模型难以完全捕捉人类对普遍真理的微妙判断,导致低分句子的可靠性存疑。此外,数据来源的多样性虽丰富了内容,却也引入了噪声与偏差,例如Waterloo语料库采集自2001年的.edu域网页,时代局限性与领域偏向可能影响泛型陈述的代表性。在应用层面,如何有效利用这些泛型知识增强下游NLP系统的常识推理能力,仍是亟待突破的研究瓶颈。
常用场景
经典使用场景
GenericsKB作为首个大规模自然涌现的泛型语句知识库,在自然语言处理领域开辟了崭新的研究范式。该数据集收录了超过340万条蕴含普遍性世界知识的陈述句,每条语句均经过BERT模型置信度评分,并标注了主题词、量词类型及上下文语境。研究者可基于其丰富的语义完整性,开展常识推理、知识图谱补全及文本蕴含等经典任务,尤其适用于评估模型对抽象范畴知识的理解能力。其子集GenericsKB-Best精选出102万条高质量泛型语句,为构建稳健的常识推理基准提供了黄金标准数据源。
实际应用
在实际应用中,GenericsKB为智能问答系统、对话机器人和教育辅助工具提供了坚实的常识支撑。例如,当用户询问‘企鹅会飞吗?’时,系统可调用库中‘企鹅是鸟类但不会飞’的泛型陈述,避免因统计共现偏差导致的错误回答。在医疗健康领域,该数据集可辅助构建疾病常识图谱,如‘抗生素对病毒感染无效’这类普遍性知识,有助于提升临床决策支持系统的可靠性。此外,GenericsKB还被用于自动化生成科普文本,通过提取‘食肉动物以其他动物为食’等通用知识,增强内容生成的逻辑连贯性与常识准确性。
衍生相关工作
GenericsKB催生了多项具有影响力的衍生研究。Bhaktavatsalam等人基于该数据集提出了GenericsKB-Best,通过融合WordNet和ConceptNet的合成泛型语句,进一步提升了知识库的覆盖度与质量。Clark等研究者利用其BERT评分机制,开发了面向常识推理的泛型分类器,为后续的语句可信度评估任务奠定了方法论基础。在知识图谱领域,GenericsKB被整合进ATOMIC事件推理框架,用于增强对事件因果关系的泛化理解。此外,该数据集还启发了SimpleQuestions等问答数据集的构建,推动了大语言模型在零样本场景下对隐性常识的显式利用研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务