遇见数据集

ESBM

收藏
arXiv2020-03-08 更新2024-06-21 收录
数据链接:
官方服务:

资源简介:

ESBM是由南京大学国家软件新技术重点实验室创建的数据集,旨在解决现有实体摘要评估基准的不足。该数据集包含175个从两个不同数据集中抽样的异构实体,由30位专家创建了2,100个通用目的的地面实况摘要。ESBM支持多种应用,如搜索引擎中的实体卡片展示、文档背景知识丰富及人类参与的研究活动。数据集的创建过程涉及从DBpedia和LinkedMDB中选择实体,并由专家独立创建摘要。ESBM的应用领域广泛,主要用于解决信息过载问题,帮助用户快速识别所需信息。

ESBM is a dataset developed by the State Key Laboratory for Novel Software Technology at Nanjing University, aiming to address the limitations of existing entity summarization evaluation benchmarks. This dataset includes 175 heterogeneous entities sampled from two separate datasets, with 2,100 general-purpose ground-truth summaries created by 30 experts. ESBM supports a variety of applications, such as entity card display in search engines, enrichment of background knowledge in documents, and human-involved research activities. The dataset construction process involves selecting entities from DBpedia and LinkedMDB, with summaries independently generated by experts. ESBM has a wide range of application scenarios, mainly used to solve the problem of information overload and help users quickly identify the required information.

创建时间:
2020-03-08
搜集汇总
数据集介绍
构建方式
实体摘要(Entity Summarization)旨在从RDF数据中为实体挑选规模受限的三元组子集,形成简洁的摘要。然而,现有基准数据集存在规模小、可用性差或处理三元组类型不全面等局限。为克服这些不足,ESBM(Entity Summarization BenchMark)应运而生。该数据集从DBpedia和LinkedMDB两个异质数据源中,分别采样来自Agent、Event、Location、Species、Work以及Film、Person共7个类别的175个实体,每个实体至少包含20个三元组。邀请了30名熟悉RDF的研究人员,为每个实体分别创建包含5个和10个三元组的通用型摘要,每个实体由6名参与者独立标注,共生成2100条人工摘要。摘要创建过程中,所有三元组按属性分组随机展示,并支持查看实体值的描述信息,确保标注的准确性与多样性。
使用方法
使用ESBM评估实体摘要器时,需将机器生成的摘要与人工摘要进行对比,计算精确率、召回率与F1值。评估时设定摘要规模与人工摘要一致(5或10个三元组),对每个实体分别与6份人工摘要计算F1后取均值作为最终得分。数据集支持对无监督摘要器进行超参数调优,可利用提供的训练集与验证集完成。对于监督学习方法,可基于数据集中的特征(如属性频率、值频率、自信息及类型指示特征)训练排序模型。ESBM已公开在GitHub及w3id.org上,配有开源评估代码与示例,便于研究者复现实验并开发新方法。
背景与挑战
背景概述
实体摘要(Entity Summarization)是知识图谱与语义Web领域中的一项关键研究任务,旨在从RDF数据中为某个实体选取一组规模受限的三元组子集,形成简洁且信息密集的摘要,以缓解用户在浏览大规模实体描述时的信息过载问题。该任务广泛应用于搜索引擎实体卡片生成、文档语义增强以及人机协同的知识处理场景。为系统评估各类通用实体摘要方法的性能,南京大学计算机软件新技术国家重点实验室的刘青霞、程龚等人,联合三星美国研究院的Kalpa Gunaratna,于2020年共同创建了ESBM(Entity Summarization BenchMark)数据集。该基准涵盖来自DBpedia与LinkedMDB两大异构数据源的175个实体,由30名领域专家手工生成了2100条通用型标准摘要,是当时规模最大、覆盖最广的实体摘要评估基准,对推动该领域的系统性研究具有里程碑意义。
当前挑战
ESBM所应对的核心领域挑战在于,现有实体摘要方法虽已提出多种基于统计信息、图排序或聚类策略的无监督算法,但缺乏统一、全面且可复现的评估基准来横向比较其性能。此前可用的基准如WhoKnows?Movies!、FACES和FACES-E存在规模小、过滤了类或文字值、任务针对性过强等局限,无法支持对通用摘要器的综合评测。在数据集构建过程中,团队面临两大挑战:一是需从海量实体中科学采样,确保实体类型多样且描述充分(每实体至少20条三元组),同时控制人工标注成本;二是需设计合理的标注界面与流程,使30名标注者在无统一强制共识的前提下,为同一实体生成多份独立且具有适度一致性的标准摘要,最终通过统计重叠度验证了标注质量的可靠性。
常用场景
经典使用场景
在知识图谱与语义Web研究领域,实体摘要(Entity Summarization)旨在从RDF数据中为每个实体选取一组规模受限的三元组,构成简洁而信息丰富的摘要。ESBM(Entity Summarization BenchMark)作为当前规模最大的通用实体摘要评估基准,涵盖了从DBpedia和LinkedMDB两个异构数据集中采样的175个实体,并由30位专家手工创建了2100条黄金标准摘要。该数据集为评估不同实体摘要器在多种实体类型和规模约束下的性能提供了标准化平台,尤其适用于对比无监督方法与监督学习方法的摘要质量。
解决学术问题
ESBM有效解决了实体摘要领域长期存在的评估基准缺失问题。此前可用的基准数据集规模小、任务特定或过滤了类与字面量,难以全面评估通用摘要器。ESBM通过提供包含实体值、类值与字面值的完整三元组集合,以及跨五个大类(Agent、Event、Location、Species、Work)和两个电影领域类的多样化实体,使得研究者能够系统性地衡量摘要器在信息性、多样性和泛化能力上的表现。该基准推动了实体摘要研究的可重复性与可比性,揭示了现有无监督方法(如BAFREC、MPSUM)与监督方法之间的显著差距,为后续算法改进指明了方向。
实际应用
在实际应用中,实体摘要技术直接服务于搜索引擎中的实体卡片生成、文档背景知识增强以及人机协同的研究活动。ESBM所评估的摘要器能够帮助从海量RDF数据中自动提炼出用户最关心的核心事实,例如在知识问答系统中快速呈现人物的出生日期、成就与关联实体,或在电影数据库中高亮显示导演、主演与获奖信息。此外,摘要结果还可用于丰富社交媒体内容、优化推荐系统的知识表示,以及提升语义搜索的响应效率,从而在信息过载环境下显著改善用户体验。
数据集最近研究
最新研究方向
实体摘要研究领域正朝着构建大规模、多领域、通用型基准数据集的方向演进,以克服现有评估资源稀缺、规模有限及领域偏向性等瓶颈。ESBM作为当前最大的通用实体摘要基准,整合了来自DBpedia与LinkedMDB的175个异构实体,涵盖7个类别,并由30位专家生成了2100条高质量人工摘要,支持5元和10元两种规模约束下的系统性评估。该基准不仅填补了以往数据集在类别、文字量及跨领域泛化能力上的空白,还首次引入监督学习方法作为参考基线,揭示了现有无监督摘要器在性能上限与多样性表现上的显著差距。ESBM的发布为实体卡生成、知识图谱交互式浏览及语义搜索等下游应用提供了标准化评测框架,推动了摘要方法在可复现性、公平性及实用性方面的前沿探索。
相关研究论文
  • 1
    ESBM: An Entity Summarization BenchMark国家软件新技术重点实验室,南京大学,中国 · 2020年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务