遇见数据集

HAGRID

收藏
arXiv2023-08-01 更新2024-06-21 收录
官方服务:

资源简介:

HAGRID是由滑铁卢大学计算机科学学院创建的一个用于生成信息检索模型的数据集,包含2638个查询。该数据集通过人类与大型语言模型(如GPT-3.5)的协作构建,旨在通过引用支持来源来生成解释性答案。数据集内容包括信息检索问题及其相关文本片段,以及由GPT-3.5生成的答案。创建过程中,首先由语言模型自动收集引用解释,然后由人类注释者评估其信息性和可归属性。HAGRID的应用领域主要集中在开发具有更好引用能力的信息检索模型,以解决模型输出缺乏足够知识来源支持的问题。

HAGRID is a dataset for developing information retrieval models, created by the School of Computer Science at the University of Waterloo, which contains 2638 queries. This dataset is built through the collaboration between human annotators and large language models (LLMs, e.g., GPT-3.5), with the objective of generating explanatory answers supported by cited sources. The dataset encompasses information retrieval questions, their associated text snippets, as well as answers generated by GPT-3.5. During the construction process, language models were first utilized to automatically collect cited explanations, which were then evaluated for informativeness and attributability by human annotators. The primary applications of HAGRID focus on developing information retrieval models with enhanced citation capabilities, to address the issue where model outputs lack sufficient support from valid knowledge sources.

创建时间:
2023-08-01
搜集汇总
数据集介绍
HAGRID 数据集图片
构建方式
在生成式信息检索领域,大型语言模型的兴起催生了能够生成带引文自然语言答案的搜索引擎,然而,缺乏公开可用的高质量数据集成为该领域发展的瓶颈。为填补这一空白,HAGRID数据集应运而生,其构建依托于MIRACL信息检索数据集中的英文子集,该子集包含信息寻求型问题及人工标注的相关段落。数据集的构建采用人机协作的巧妙方式:首先,利用GPT-3.5模型,基于给定的相关段落以零样本方式生成遵循IEEE引文格式的解释性答案,并经过正则表达式过滤以符合格式要求;随后,招募四名经验丰富的标注员,依据信息丰富性与可归因性两大标准对生成的答案进行人工评估。信息丰富性判断答案是否提供有用回应,可归因性则验证答案中的事实性陈述能否被所引段落充分支持。最终,训练集包含1922个问题与3214个答案,开发集包含716个问题与1318个答案,其中部分答案经人工标注了可归因性信息。
特点
HAGRID数据集展现出若干独特而深刻的特质。其一,它强调开放性,基于MIRACL这一公开检索数据集构建,并采用Apache 2.0许可证发布,为开源社区提供了宝贵的资源。其二,数据集的核心在于对可归因性的精细刻画,通过人工标注确保答案中的每个事实性陈述都能追溯到具体引文,从而有效缓解大型语言模型常见的幻觉问题。分析揭示,当相关段落数量增多时,模型生成的答案在信息丰富性与可归因性上更易出现偏差,且生成的答案倾向于从引文中提取词汇,呈现较高的提取性特征。此外,可归因性标注的耗时性(约为信息丰富性标注的3至5倍)凸显了数据集在质量控制上的严谨性,而信息丰富性与可归因性在训练集与开发集上的一致性分布(分别约84%与90%为信息丰富,73%与71%可归因)则保证了数据的可靠性。
使用方法
HAGRID数据集的使用旨在推动端到端生成式信息检索模型的发展,尤其聚焦于检索增强生成范式。研究者可利用其训练集与开发集,构建能够根据输入查询检索候选引文并生成带归属答案的模型。具体而言,数据集中的每个样本包含问题、相关段落列表以及经GPT-3.5生成并由人工评估的答案,答案以IEEE格式标注引文索引。模型训练时,可借鉴检索增强生成框架,将生成过程同时基于查询与检索到的段落进行条件化,以提升答案的准确性与可归因性。评估时,信息丰富性与可归因性作为核心指标,其中信息丰富性衡量答案的效用,可归因性则验证答案与引文之间的事实一致性。值得注意的是,数据集中约40%的GPT-3.5生成答案未被标注为信息丰富,超过20%未能充分归因,这为模型改进指明了方向,即需着力提升在多段落场景下的归因能力与事实准确性。
背景与挑战
背景概述
随着大语言模型的蓬勃发展,生成式信息检索引擎如Bing Chat与Perplexity.ai应运而生,它们能够以自然语言文本呈现搜索结果并附上引用来源,极大地提升了用户体验。然而,这类模型常因缺乏对知识源的充分锚定而产生幻觉或传播不实信息,这对搜索引擎的可信度构成了严峻挑战。为应对这一困境,滑铁卢大学的Ehsan Kamalloo、Aref Jafari等研究者于2023年推出了HAGRID数据集。该数据集基于公开的MIRACL信息检索数据集构建,通过人机协作方式——先利用GPT-3.5自动生成带有上下文引用的解释性答案,再由人工标注员评估其信息丰富度与可归因性——旨在为端到端生成式信息检索模型提供开放、高质量的基准资源,从而推动该领域向更透明、更可靠的方向演进。
当前挑战
HAGRID所应对的核心领域挑战在于大语言模型生成内容缺乏可验证性,即模型输出的陈述难以追溯到确切的支撑来源,这增加了虚假信息传播的风险。在构建过程中,研究者面临多重挑战:首先,MIRACL数据集中的查询缺乏标准答案,需借助GPT-3.5零样本生成答案,但模型生成的回答往往偏向抽取式,即大量复制原文,缺乏抽象与综合;其次,当关联引文数量增多(超过5条)时,LLM倾向于过度引用排名靠前的引文而忽略后续内容,导致归因不均衡;此外,人工标注可归因性的耗时是标注信息丰富度的3至5倍,预算限制使得仅有约24%的训练集答案获得了归因评估。这些挑战共同凸显了生成式信息检索模型在准确性与可归因性上的提升空间。
常用场景
经典使用场景
在生成式信息检索领域,HAGRID数据集的核心应用场景在于构建端到端且具备归因能力的生成式搜索模型。该数据集以MIRACL的英文子集为基础,通过人类与大型语言模型(如GPT-3.5)的协同合作,为每个查询生成带有内联引用的解释性答案,并由人工标注员评估其信息丰富度与可归因性。研究者可借助HAGRID训练模型,使其能够根据输入查询检索相关引文片段,并生成附有来源引用的自然语言回答,从而推动生成式搜索引擎从封闭专有走向开放可复现。
实际应用
在实际应用中,HAGRID赋能了新一代交互式搜索引擎与智能问答系统。基于该数据集训练的模型,能够像Bing Chat或Perplexity.ai一样,在回答用户问题时主动提供引用来源,使信息验证变得直观高效。这一能力在医疗咨询、法律检索、学术研究等对事实准确性要求严苛的领域尤为关键,用户可一键追溯答案出处,显著降低误信风险。此外,HAGRID的开源特性允许开发者在本地部署定制化搜索工具,推动企业级知识管理、智能客服等场景的归因增强。
衍生相关工作
HAGRID的发布催生了一系列旨在提升归因质量与生成准确性的后续研究。例如,ALCE等同期工作探索了自动评估引用质量的方法,而WebGLM等模型则在此基础上进一步整合网页检索与人类偏好。此外,受HAGRID中关于引文分布规律的启发(如少量引文时引用均匀、多引文时前三位占优),研究者开发了优化引用策略的注意力机制与多文档摘要技术。该数据集还促进了检索增强生成(RAG)领域的标准化评测,激励学界开发更鲁棒的归因评估指标,最终形成从数据构建到模型训练再到效果验证的完整闭环。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务