遇见数据集

MReD

收藏
arXiv2022-07-05 更新2024-06-21 收录
数据链接:
官方服务:

资源简介:

MReD是一个针对结构可控文本生成的新型数据集,由阿里巴巴达摩院创建。该数据集包含7,089个元评论及其45,000个句子,每个句子都经过人工标注,属于9个精心定义的类别之一。MReD数据集的创建旨在深入理解元评论的结构,使模型能够根据输入文本和控制信号生成符合特定结构的元评论。该数据集的应用领域主要集中在提高文本生成的灵活性和实用性,特别是在学术论文的同行评审系统中,帮助区域主席根据不同的控制信号生成不同结构的元评论。

MReD is a novel dataset for structured controllable text creation, developed by Alibaba DAMO Academy. This dataset includes 7,089 meta-reviews and 45,000 corresponding sentences, each of which has been manually annotated into one of nine meticulously defined categories. The MReD dataset is designed to achieve in-depth understanding of the structure of meta-reviews, allowing models to generate meta-reviews with specific structures based on input texts and control signals. Its application focuses on improving the flexibility and practicality of text generation, especially in academic paper peer review systems, where it assists area chairs in generating meta-reviews of different structures based on varied control signals.

提供机构:
阿里巴巴达摩院
创建时间:
2021-10-14
搜集汇总
数据集介绍
构建方式
在学术同行评审领域,元评述(meta-review)作为领域主席综合多篇评审意见后撰写的总结性文本,其结构蕴含丰富的领域知识。为突破传统文本生成数据集缺乏结构控制信号的局限,MReD数据集应运而生。该数据集从ICLR 2018至2021年的开放评审平台收集了7,089篇元评述及其对应的23,675篇评审文本,并对其中的45,929个句子进行了精细的人工标注。标注工作由12名专业标注员完成,每句由两人独立标注,分歧由第三方专家裁决,Cohen's kappa达到0.778,确保了标注的高质量。最终,每个句子被归入预定义的9个意图类别之一,包括摘要、优势、劣势、评分总结、领域主席异议、反驳过程、建议、决策及其他。
特点
MReD数据集的核心特色在于其首次为结构可控的文本生成任务提供了丰富的标注资源。与以往仅关注新闻摘要等领域的文本生成数据集不同,MReD深入挖掘了学术评审中元评述的领域特性,使得模型能够学习到生成文本的宏观结构控制。数据集中的每个句子都被赋予明确的意图标签,这允许模型在生成时不仅关注内容,还能根据给定的结构控制序列(如“摘要|优势|决策”)调整输出段落的结构。此外,数据集规模庞大,远超传统的多文档摘要数据集,且涵盖了从高分到低分论文的多样化元评述模式,为研究不同评分区间下的生成行为提供了宝贵资源。
使用方法
使用MReD数据集进行结构可控文本生成时,研究者需将多篇评审文本线性化为单一输入,并前置控制序列作为结构信号。控制序列可采用句子级(sent-ctrl)或段落级(seg-ctrl)两种形式,分别对应精细或粗粒度的结构控制。模型训练采用编码器-解码器架构,如BART、T5等预训练模型,通过微调使其学习在控制信号引导下生成符合意图的元评述。实验表明,句子级控制方法在ROUGE指标上表现最优,且通过注意力机制分析可验证模型能准确关注对应控制标签。该数据集还可用于提取式与生成式摘要的对比研究,以及探索不同评审组合方式对生成质量的影响。
背景与挑战
背景概述
MReD数据集由阿里巴巴达摩院与新加坡国立大学、新加坡科技设计大学、南洋理工大学的研究团队于2021年提出,旨在解决文本生成领域中对输出结构缺乏精细控制的问题。该数据集聚焦于同行评审系统中的元评审(meta-review)文本,收集了2018至2021年间ICLR会议的7089篇元评审,并对其中约4.5万条句子进行了人工标注,划分出摘要、优势、劣势、决策等9个细粒度类别。不同于传统新闻摘要数据集(如CNN/Daily Mail)仅提供输入-输出对,MReD首次引入结构可控的文本生成任务,允许模型根据用户指定的控制序列(如“摘要|优势|决策”)生成符合预期篇章结构的元评审。这一创新不仅推动了文本生成向更灵活、更贴近实际应用场景的方向发展,也为理解学术评审领域的写作模式提供了宝贵资源。
当前挑战
MReD数据集面临的挑战主要体现在两个方面。在领域问题层面,传统文本生成模型缺乏对输出篇章结构的显式控制能力,难以满足用户对内容侧重点的个性化需求,例如在元评审中,同一组评审意见可能因控制信号不同而产生强调优势或聚焦缺陷的迥异输出。在数据集构建层面,元评审句子类别的标注存在歧义性,例如同时包含“优势”与“劣势”信息的句子需要依据上下文和最终决策进行优先级判断,这要求标注规则细致且一致。此外,部分类别(如“AC异议”)数据量稀少,导致模型在学习这些罕见模式时面临样本不均衡的挑战,进而影响生成内容的全面性与准确性。
常用场景
经典使用场景
MReD数据集的核心经典使用场景在于结构可控的文本生成任务,尤其是元评论的自动撰写。在同行评审系统中,领域主席需综合多篇审稿意见撰写元评论,而MReD通过细粒度标注(9类意图标签,如摘要、优势、劣势、决策等),首次支持用户通过指定输出结构序列(如“摘要|优势|决策”)来引导生成模型,从而在同一输入下产生不同侧重点的元评论。这为学术会议或期刊的自动化辅助决策提供了高效工具,尤其适用于需要快速生成结构化摘要的评审场景。
实际应用
在实际应用中,MReD可直接服务于学术出版领域的自动化元评论生成系统。例如,期刊或会议的程序委员会可利用该数据集训练模型,根据不同的评审反馈自动生成结构定制化的决策摘要,从而减轻人工撰写负担。此外,其控制机制可迁移至其他领域,如新闻摘要生成中指定“背景|事件|影响”的结构,或产品评论总结中突出“优点|缺点|建议”,具有广泛的工业落地潜力。
衍生相关工作
MReD衍生了一系列经典工作,包括基于BART、T5等预训练模型的结构可控生成方法,以及结合注意力机制的分析(如交叉注意力权重可视化)。后续研究还拓展了其标注范式至其他学科领域,或将其用于可解释性分析(如探究模型如何根据控制信号选择输入信息)。此外,该数据集催生了针对长文本、多文档输入的融合策略研究(如rate-concat方法),为结构可控生成任务的标准化评估提供了基准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务