CroCoSum
收藏数据链接:
官方服务:
资源简介:
CroCoSum是由布朗大学创建的一个专注于跨语言代码切换摘要的数据集,包含超过24,000篇英文源文章和18,000篇人工编写的中文新闻摘要,其中超过92%的摘要包含代码切换短语。该数据集通过收集solidot.org上的技术新闻摘要构建,旨在研究代码切换现象在跨语言摘要中的应用,解决现有数据集依赖翻译而忽视自然语言表达的问题。
CroCoSum is a dataset dedicated to cross-lingual code-switching summarization, created by Brown University. It encompasses over 24,000 English source articles and 18,000 manually curated Chinese news summaries, with more than 92% of these summaries containing code-switching phrases. Developed by collecting technical news content from solidot.org, this dataset is designed to study the application of code-switching in cross-lingual summarization, aiming to address the issue that existing datasets rely on translation while neglecting naturally occurring linguistic expressions.
提供机构:
布朗大学创建时间:
2023-03-08
搜集汇总
数据集介绍
构建方式
在跨语言摘要研究领域,现有数据集多依赖机器翻译,难以捕捉语码转换这一自然语言现象。CroCoSum数据集应运而生,其构建过程独具匠心:源摘要取自solidot.org这一中文科技新闻平台,由IT专业人士与开源爱好者撰写,经编辑审核后发布。研究团队通过回溯帖子中嵌入的英文原始新闻链接,从互联网档案馆抓取对应文章,运用语言检测工具筛选纯英文来源,并剔除提取失败的网页。最终获得超过24,000篇英文源文章与18,000余条中文摘要,其中逾92%的摘要包含中英语码转换短语,形成独特的源-目标配对结构。
使用方法
CroCoSum为跨语言摘要研究提供了多元化的使用范式。研究者可采用流水线方法,将任务分解为翻译与摘要两个子模块,或直接运用端到端模型进行跨语言监督学习。数据集支持对mT5、mBART等多语言预训练模型的微调,也适用于GPT-3等大语言模型的零样本提示。值得注意的是,实验表明现有跨语言摘要资源作为预训练步骤反而会降低性能,凸显了CroCoSum在评估模型泛化能力方面的独特价值。通过对比自动评估指标与语码转换度量,研究者能够深入分析模型在生成含代码转换摘要时的表现与局限。
背景与挑战
背景概述
跨语言摘要(Cross-Lingual Summarization, CLS)作为自然语言处理领域的重要分支,旨在将一种语言的源文档转化为另一种语言的摘要,近年来得益于大规模多语言模型与网络挖掘数据集的涌现而备受瞩目。然而,现有CLS数据集多依赖机器翻译或人工翻译构建,生成的文本常带有“翻译腔”(Translationese)痕迹,与人类自然书写的语体存在显著差异。2023年,布朗大学与图宾根大学的研究团队合作推出了CroCoSum数据集,专门聚焦于跨语言场景中的语码转换(Code-Switching)现象。该数据集包含超过24,000篇英文科技新闻源文章与18,000条人工撰写的中文摘要,其中逾92%的摘要含有中英语码转换短语,为探索有机跨语言摘要生成提供了前所未有的基准资源,填补了该领域在自然语码转换现象研究上的空白。
当前挑战
CroCoSum数据集所面临的挑战主要体现在两个层面。首先,在领域问题层面,现有CLS方法(包括流水线、端到端及零样本模型)在生成语码转换摘要时表现欠佳:它们常出现过度转换(将本应中文的短语保留英文)、欠转换(未在应转换处插入英文)、遗漏源文中的语码转换短语以及产生拼写错误或与事实不符的英文短语,暴露出当前模型对语码转换语义与语用规则的捕捉能力不足。其次,在构建过程中,数据采集需从Solidot平台爬取用户撰写的摘要并追溯至Internet Archive中的英文源文,面临链接失效、页面解析失败、多源匹配等工程挑战,同时需通过人工标注确保摘要的流畅性、连贯性、信息量与相关性达到出版标准,这一系列步骤对数据质量管控提出了严苛要求。
常用场景
经典使用场景
CroCoSum作为首个聚焦于跨语言代码转换摘要的基准数据集,在自然语言处理领域开辟了独特的研究路径。该数据集包含超过2.4万篇英文科技新闻源文章与1.8万条人工撰写的中文摘要,其中92%以上的摘要蕴含中英文代码转换现象。这一资源为探究多语言环境中自然出现的语码混合行为提供了理想试验场,使得研究者能够观察人类在摘要写作中如何有机地交替使用两种语言,而非依赖翻译产生的生硬语料。
解决学术问题
CroCoSum解决了跨语言摘要研究中长期被忽视的代码转换现象数据匮乏问题。现有数据集多依赖机器翻译或人工翻译构建,导致摘要中充斥着‘翻译腔’伪影,无法真实反映多语言使用者的自然表达习惯。该数据集揭示了当前主流方法(如流水线、端到端及零样本方法)在生成代码转换摘要时的局限性——预训练于其他跨语言摘要资源反而导致性能下降,凸显了现有数据集泛化能力的不足。通过定性错误分析,研究者得以识别过度切换、欠切换、未提及及错误生成四类典型问题,为开发更全面的评估框架奠定了实证基础。
实际应用
在实际应用中,CroCoSum推动的技术突破可显著提升科技新闻跨语言传播的效率与自然度。例如,国际科技媒体平台可借助基于该数据集训练的模型,自动生成中英混杂的新闻摘要,既保留英文专有名词(如产品名、技术术语)的原貌,又确保中文读者高效理解核心信息。此外,该数据集还可服务于多语言社交媒体内容聚合、跨国企业技术文档本地化等场景,帮助系统在保持信息准确性的同时,模仿人类写作者在特定语境下惯用的语码混合策略,从而增强跨语言交流的流畅性与亲和力。
数据集最近研究
最新研究方向
CroCoSum作为首个面向跨语言代码转换摘要的基准数据集,聚焦于科技新闻领域中人机语码混用现象的前沿探索。当前研究热点集中于揭示现有跨语言摘要数据集因过度依赖机器翻译而产生的“翻译腔”缺陷,并推动对自然语码转换行为的建模。该数据集涵盖超过24,000篇英文源文与18,000条人工撰写的中文摘要,其中92%以上包含中英文混合表达,显著区别于传统基于翻译的语料库。研究挑战在于现有端到端模型(如mBART-50)虽在ROUGE指标上表现最优,但面对语码转换复杂度时仍存在过度切换、漏译及实体错误等问题,且预训练于其他跨语言数据集反而导致性能下降,揭示了当前资源的泛化局限。该工作为多语言信息传播中的语用灵活性评估提供了关键测试平台,推动了更贴近真实交际场景的摘要生成研究。
相关研究论文
- 1CroCoSum: A Benchmark Dataset for Cross-Lingual Code-Switched Summarization布朗大学 · 2024年
以上内容由遇见数据集搜集并总结生成



