遇见数据集

RoMQA

收藏
arXiv2022-11-16 更新2024-07-24 收录
官方服务:

资源简介:

RoMQA是由华盛顿大学和Meta AI共同创建的第一个用于健壮、多证据、多答案问答(QA)的基准数据集。该数据集包含从Wikidata知识图中挖掘的相关约束派生的问题集群,旨在评估QA模型对不同约束的鲁棒性。与之前的QA数据集相比,RoMQA包含更多的人工编写问题,这些问题需要对更多的证据文本进行推理,并且平均而言,有更多的正确答案。此外,人类标注者认为RoMQA问题更自然,更可能被人们提出。数据集的创建过程涉及从知识库中采样约束、聚类相关约束、采样形成逻辑查询的隐含约束以及标注语言问题。RoMQA的应用领域在于测试大型语言模型在零样本、少样本和微调设置下的性能,旨在构建更鲁棒的QA方法。

RoMQA is the first benchmark dataset for robust, multi-evidence, multi-answer question answering (QA), co-created by the University of Washington and Meta AI. This dataset comprises question clusters derived from relevant constraints mined from the Wikidata knowledge graph, and it aims to evaluate the robustness of QA models against various constraints. Compared with prior QA datasets, RoMQA includes more manually written questions that require reasoning over multiple pieces of evidence text, and on average, has more correct answers per question. Additionally, human annotators consider RoMQA questions to be more natural and more likely to be posed by ordinary people. The dataset creation process involves sampling constraints from the knowledge base, clustering related constraints, sampling implicit constraints to form logical queries, and annotating natural language questions. The application scenarios of RoMQA focus on testing the performance of large language models under zero-shot, few-shot, and fine-tuning settings, with the goal of developing more robust QA methods.

创建时间:
2022-10-26
原始信息汇总

RoMQA 数据集概述

数据来源与获取

  • 数据生成:RoMQA 数据集可以通过脚本从标注、Wikidata 和 T-REx 中重新生成,脚本位于 dataset_construction 目录下。
  • 第三方数据下载:也可以从第三方下载已生成的数据集,下载链接为 romqa_data.zip
  • 数据解压与放置:下载后需解压至 ./data 目录,实验代码默认该目录包含正确数据文件。

数据集结构

  • 数据分割:如果自行生成数据,应将分割文件手动放置在 data/{open,closed,gold} 目录中。

实验运行

  • 开放设置: bash python train_baselines.py --config-name open --multirun hydra/launcher=slurm hydra.launcher.partition=<partition> model=seq2seq_nl,seq2seq_dpr_nl hydra.launcher.constraint=volta32gb seed=1,2,3,4,5 project=open-1

  • 封闭设置: bash python train_baselines.py --config-name closed --multirun hydra/launcher=slurm hydra.launcher.partition=<partition> model=binary_nl,binary_dpr_nl hydra.launcher.constraint=volta32gb seed=1,2,3,4,5 project=closed-1

  • 黄金证据设置: bash python train_baselines.py --config-name gold --multirun hydra/launcher=slurm hydra.launcher.partition=<partition> model=binary_gold_sent_nl hydra.launcher.constraint=volta32gb seed=1,2,3,4,5 project=gold-1

提交与评估

  • 提交格式:提交的 JSON 文件应包含示例 id 和模型预测的 top-k 实体列表。

  • 开发集验证: bash python predict.py --fdata data/open/top_20.dev.json.bz2 --fout pred.open.dev.json saves/open-1/sweep/15-seq2seq_dpr_nl-default/ python evaluation.py --fpred saves/open-1/sweep/15-seq2seq_dpr_nl-default/pred.open.dev.json --fdata data/gold/dev.json.bz2 --fout open.dev.eval.json

  • 测试集预测: bash python predict.py --fdata data/open/top_20.test.noanswer.json.bz2 --fout pred.open.test.json saves/open-1/sweep/15-seq2seq_dpr_nl-default/ python predict.py --fdata data/closed/top_20.test.noanswer.json.bz2 --fout pred.closed.test.json saves/closed-1/sweep/15-binary_dpr_nl-default/

  • CodaLab 提交与评估: bash cl upload pred.open.dev.json cl run -n <open_or_closed>dev<my_model_name> -d "<model_name> by <my_name> at <my_affiliation>" --request-docker-image vzhong/romqa:0.1 --request-memory 8g evaluation.py:0x627bae34595e4bf4971197c9cb917f5e pred.json:<my_open_dev_uid> data.json.bz2:0x110deb430b3d46459099462ea65ceaf1 --- python evaluation.py --fpred pred.json --fdata data.json.bz2 --fout results.json

提交限制

  • 每月提交次数:每个团队每月最多提交一次。
  • 滥用处理:滥用提交系统的作者将被从排行榜中除名。

匿名提交

  • 匿名处理:如需匿名提交,请在 CodaLab 中使用 anonymous 作为名称和机构,并通过电子邮件联系作者获取结果。

许可证

  • 主要许可证:RoMQA 主要采用 CC-BY-NC 许可证。
  • 部分组件许可证:部分组件采用其他许可证,如 Apache 2.0、MIT 等。
搜集汇总
数据集介绍
RoMQA 数据集图片
构建方式
RoMQA的构建基于Wikidata知识图谱中抽取的实体-关系约束,通过采样知识库三元组形成约束集合,并依据共享答案实体对相关约束进行聚类。每个聚类至少包含三个约束,以生成多样化的逻辑查询。随后,从聚类中采样约束并随机进行删除或否定操作,形成包含合取与差集的逻辑查询。最后,由亚马逊Mechanical Turk的众包工作者将这些逻辑查询转化为自然语言问题,并经过双重验证确保与原始约束一致,仅保留完全一致的标注结果。
特点
RoMQA是首个同时评估鲁棒性、多证据和多答案的问答基准。其问题聚类设计允许通过聚类内最差性能衡量模型对约束变化的鲁棒性。与现有数据集相比,RoMQA的问题平均包含108.6个答案,需引用41.6篇证据文本,显著提升了复杂性和多样性。此外,人工评估表明RoMQA的问题更自然,更贴近人类真实提问习惯,避免了过度精确的约束或异常属性比较等人工痕迹。
使用方法
RoMQA支持封闭式和开放式两种评估设置。封闭设置中,模型需从100个候选实体中识别正确答案,采用F1和准确率作为指标,并计算鲁棒性变体(聚类内最差性能)。开放设置不提供候选实体,模型需直接生成答案集,以精确率@K评估。实验表明,零样本和少样本大语言模型性能与简单基线相当,而监督方法虽优于前者,但仍远低于黄金证据的上限,凸显了模型在组合推理和鲁棒性方面的显著提升空间。
背景与挑战
背景概述
RoMQA(Robust Multi-evidence Multi-answer Question Answering)是由华盛顿大学与Meta AI的研究者Victor Zhong、Weijia Shi、Wen-tau Yih及Luke Zettlemoyer于2022年联合构建的基准数据集,旨在评估问答系统在面对多证据、多答案及约束变化时的鲁棒性。该数据集从Wikidata知识图谱中挖掘关联约束,形成问题簇,通过测量簇内最差性能来量化模型对约束变异的稳健程度。与以往仅关注单答案或单证据的问答基准不同,RoMQA平均每个问题需处理41.6篇证据文本、涵盖108.6个正确答案,且问题由人工撰写,自然度显著优于HotpotQA、ComplexWebQuestions等数据集。其发布填补了鲁棒性多答案问答评估的空白,为大型语言模型在复杂推理场景下的能力检验提供了严苛标尺。
当前挑战
RoMQA所面临的挑战主要体现在两个层面。其一,领域问题层面,模型需应对多证据交织与多答案并存的复杂推理任务,例如从海量实体中筛选出满足多重约束的答案集合,这对零样本与少样本大型语言模型构成巨大困难——实验显示,最优的OPT-175B在闭卷设定下F1仅38.5,与朴素全预测基线持平。其二,构建过程层面,数据集需从Wikidata中采样约束并聚类,面临知识图谱中关系分布极度不均的问题,研究者通过逆概率重采样缓解了高频关系(如country)的过度表征。此外,人工标注环节需确保问题与逻辑查询严格对应,仅保留100%一致性的标注,导致11%的数据被舍弃,凸显了自然语言与结构化约束对齐的艰巨性。
常用场景
经典使用场景
在自然语言处理领域,RoMQA作为首个面向鲁棒、多证据、多答案问答的基准数据集,被广泛用于评估模型对问题约束变化的鲁棒性。其独特之处在于包含由相关约束聚类而成的问题簇,通过衡量模型在簇内最差性能来量化鲁棒性。研究者利用该数据集测试大语言模型在零样本、少样本及微调场景下的表现,揭示现有模型在面对细微语义扰动时的脆弱性,从而推动更稳健问答方法的研发。
实际应用
在实际应用中,RoMQA助力构建更智能的问答系统,尤其适用于信息检索、知识图谱查询和智能客服等需要处理多约束、多答案场景的领域。例如,用户可能提出“出生于巴黎的古典钢琴家有哪些?”这类复杂问题,系统需同时处理地域、职业和音乐流派等多重约束。RoMQA通过评估模型在类似约束变化下的稳定性,指导开发者优化检索与推理模块,从而提升产品在真实用户查询中的准确性和可靠性。
衍生相关工作
RoMQA衍生了一系列关于鲁棒问答和组合推理的经典工作,包括基于约束聚类训练的鲁棒性增强方法,以及融合检索与推理的混合模型。研究者借鉴其约束簇设计,提出了更细粒度的鲁棒性评估框架,并探索了利用对抗训练或对比学习提升模型对约束变化的适应能力。此外,该数据集还催生了针对多证据推理的文档检索优化策略,推动了开放域问答系统在复杂查询场景下的性能突破。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务