遇见数据集

allenai/multinews_sparse_max

收藏
Hugging Face2022-11-24 更新2024-03-04 收录
官方服务:

资源简介:

--- annotations_creators: - expert-generated language_creators: - expert-generated language: - en license: - other multilinguality: - monolingual pretty_name: Multi-News size_categories: - 10K<n<100K source_datasets: - original task_categories: - summarization task_ids: - news-articles-summarization paperswithcode_id: multi-news train-eval-index: - config: default task: summarization task_id: summarization splits: train_split: train eval_split: test col_mapping: document: text summary: target metrics: - type: rouge name: Rouge --- This is a copy of the [Multi-News](https://huggingface.co/datasets/multi_news) dataset, except the input source documents of its `test` split have been replaced by a __sparse__ retriever. The retrieval pipeline used: - __query__: The `summary` field of each example - __corpus__: The union of all documents in the `train`, `validation` and `test` splits - __retriever__: BM25 via [PyTerrier](https://pyterrier.readthedocs.io/en/latest/) with default settings - __top-k strategy__: `"max"`, i.e. the number of documents retrieved, `k`, is set as the maximum number of documents seen across examples in this dataset, in this case `k==10` Retrieval results on the `train` set: | Recall@100 | Rprec | Precision@k | Recall@k | | ----------- | ----------- | ----------- | ----------- | | 0.8793 | 0.7460 | 0.2213 | 0.8264 | Retrieval results on the `validation` set: | Recall@100 | Rprec | Precision@k | Recall@k | | ----------- | ----------- | ----------- | ----------- | | 0.8748 | 0.7453 | 0.2173 | 0.8232 | Retrieval results on the `test` set: | Recall@100 | Rprec | Precision@k | Recall@k | | ----------- | ----------- | ----------- | ----------- | | 0.8775 | 0.7480 | 0.2187 | 0.8250 |

annotations_creators: - 专家生成 language_creators: - 专家生成 language: - 英语(en) license: - 其他 multilinguality: - 单语 pretty_name: Multi-News size_categories: - 10000 < 样本数量 < 100000 source_datasets: - 原生数据集 task_categories: - 文本摘要 task_ids: - 新闻文章摘要 paperswithcode_id: multi-news train-eval-index: - config: 默认(default) task: 文本摘要 task_id: summarization splits: train_split: train eval_split: test col_mapping: document: 文本 summary: 目标 metrics: - type: ROUGE name: Rouge 本数据集为[Multi-News](https://huggingface.co/datasets/multi_news)数据集的复刻版本,仅其测试划分(test split)的输入源文档已被替换为稀疏检索器(sparse retriever)的检索结果。所采用的检索流程如下: - 查询(query):每个样本的`summary`字段 - 检索语料库(corpus):训练、验证与测试划分中所有文档的并集 - 检索器(retriever):基于[PyTerrier](https://pyterrier.readthedocs.io/en/latest/)实现的BM25算法,采用默认参数配置 - Top-K选取策略(top-k strategy):采用"max"模式,即检索文档数`k`被设置为该数据集中所有样本所需的最大文档数,本次配置中`k=10` 训练集检索效果: | 召回率@100 | R精度(Rprec) | 精确率@k | 召回率@k | | ----------- | ----------- | ----------- | ----------- | | 0.8793 | 0.7460 | 0.2213 | 0.8264 | 验证集检索效果: | 召回率@100 | R精度(Rprec) | 精确率@k | 召回率@k | | ----------- | ----------- | ----------- | ----------- | | 0.8748 | 0.7453 | 0.2173 | 0.8232 | 测试集检索效果: | 召回率@100 | R精度(Rprec) | 精确率@k | 召回率@k | | ----------- | ----------- | ----------- | ----------- | | 0.8775 | 0.7480 | 0.2187 | 0.8250 |

提供机构:
allenai
原始信息汇总

数据集概述

  • 名称: Multi-News
  • 语言: 英语 (en)
  • 许可证: 其他 (other)
  • 多语言性: 单语 (monolingual)
  • 大小: 10K<n<100K
  • 来源: 原始 (original)
  • 任务类别: 摘要生成 (summarization)
  • 任务ID: news-articles-summarization
  • 训练与评估配置:
    • 任务: 摘要生成
    • 任务ID: summarization
    • 分割:
      • 训练分割: train
      • 评估分割: test
    • 列映射:
      • 文档: text
      • 摘要: target
    • 评估指标:
      • 类型: rouge
      • 名称: Rouge

数据集特点

  • 注释创建者: 专家生成 (expert-generated)
  • 语言创建者: 专家生成 (expert-generated)
搜集汇总
数据集介绍
构建方式
该数据集基于Multi-News语料库构建,通过引入稀疏检索机制对测试集进行重构。具体而言,以每条样本的摘要为查询,以训练集、验证集与测试集中所有文档的并集作为检索语料库,借助PyTerrier工具实现BM25算法,并采用最大文档数策略(k=10)进行检索,从而将原始文档替换为检索结果中的稀疏表示。
特点
数据集保留了Multi-News的多文档摘要任务特性,但输入文档经由稀疏检索重新组织,具备更高的信息筛选效率。检索性能指标显示,在测试集上Recall@100达0.8775,Rprec为0.7480,表明检索结果在覆盖度和排名质量上均表现优异。这种稀疏表示方式有助于探索检索增强型摘要任务中信息压缩与语义保留的平衡。
使用方法
该数据集适用于多文档摘要模型的训练与评估,尤其关注稀疏检索对生成质量的影响。用户可直接加载预定义的数据分割,将document字段作为模型输入,summary字段作为目标输出。建议采用Rouge等自动评估指标衡量摘要性能,或结合检索召回率分析检索与生成之间的协同效应。
背景与挑战
背景概述
多文档摘要任务旨在从多篇相关新闻文章中提炼出核心信息,生成简洁连贯的摘要,是自然语言处理领域的重要研究方向。在此背景下,艾伦人工智能研究所于2019年发布了Multi-News数据集,由专家标注构建,包含超过5万组新闻文章与对应摘要,为多文档摘要研究提供了标准化基准。该数据集聚焦于如何有效整合来自不同来源的信息,克服冗余与矛盾,推动了许多基于抽取式与生成式模型的创新。其影响力体现在成为评估多文档摘要性能的主流基准之一,并催生了大量后续工作,如稀疏检索增强摘要的探索,其中allenai/multinews_sparse_max便是对原始测试集文档进行BM25稀疏检索替换的变体,旨在研究检索质量对摘要生成的影响。
当前挑战
该数据集所解决的领域挑战在于多文档摘要中源文档的冗余性、信息冲突与选择性问题,即如何从多篇内容重叠或视角各异的新闻中提取一致且关键的信息。构建过程中,挑战包括确保摘要的忠实度与覆盖度,专家需人工判断并整合复杂信息,耗时且主观性难以完全消除。此外,allenai/multinews_sparse_max变体引入的新挑战是稀疏检索的局限性:基于BM25的词频匹配可能遗漏语义相关但词汇不重叠的文档,导致检索召回率不足,如测试集上Recall@k仅为0.8250,表明约17.5%的相关文档未被检索到,这限制了摘要模型接触完整信息的能力,加剧了生成摘要的信息缺失风险。
常用场景
经典使用场景
Multi-News Sparse Max数据集作为多文档新闻摘要领域的经典基准,其最核心的使用场景在于评估和训练基于稀疏检索的生成式摘要模型。研究者利用该数据集中的文档-摘要配对,通过BM25检索器从大规模新闻语料库中召回相关文档,构建稀疏检索环境下的输入源,从而检验模型在有限信息密度下的摘要生成能力。该场景尤其适用于对比稠密与稀疏检索策略对摘要质量的影响,为多文档摘要任务中的信息筛选与融合提供标准化测试平台。
实际应用
在实际应用中,该数据集支撑了新闻聚合平台与信息简报系统的智能化升级。例如,通过训练基于稀疏检索的摘要模型,系统能够从多个新闻源中自动提取关键事件脉络,生成简洁且信息完整的每日新闻综述,显著提升用户的信息获取效率。此外,该数据集还用于优化搜索引擎的摘要模块,帮助用户在海量新闻中快速定位核心内容,其稀疏检索特性尤其适用于计算资源受限或索引规模庞大的生产环境。
衍生相关工作
该数据集衍生了一系列关于稀疏检索与摘要生成协同优化的经典工作。例如,研究者基于其检索结果分析了BM25召回质量对长文本生成模型(如Pegasus、BART)性能的影响,提出了面向稀疏文档集的注意力掩码策略。后续工作进一步探索了检索器与摘要器的联合训练范式,如通过强化学习调整检索文档的权重分配,以及引入对比学习增强跨文档的语义对齐。这些成果共同深化了检索增强自然语言生成领域的理论框架与实践路径。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务