遇见数据集

mlenjoyneer/RuTextSegNews

收藏
Hugging Face2023-09-03 更新2024-03-04 收录
官方服务:

资源简介:

--- annotations_creators: - machine-generated language_creators: - found language: - ru size_categories: - 10K<n<100K license: - unknown multilinguality: - monolingual source_datasets: - original --- # Dataset Card ## Table of Contents - [Table of Contents](#table-of-contents) - [Dataset Description](#dataset-description) - [Dataset Summary](#dataset-summary) - [Supported Tasks and Leaderboards](#supported-tasks-and-leaderboards) - [Languages](#languages) - [Dataset Structure](#dataset-structure) - [Data Instances](#data-instances) - [Data Fields](#data-fields) - [Data Splits](#data-splits) - [Additional Information](#additional-information) - [Licensing Information](#licensing-information) - [Citation Information](#citation-information) ## Dataset Description ### Dataset Summary Dataset for automatic text segmentation of Russian news. News corpora based on Yuri Baburov's news dataset https://github.com/buriy/russian-nlp-datasets/releases/ for 2014 and 2015 years. Markup was generated automatically based on 2 methods: taking texts with ready division into paragraphs and random joining parts of different texts. ### Supported Tasks and Leaderboards Dataset designed for text segmentation task. ### Languages The dataset is in Russian. ### Usage ```python from datasets import load_dataset dataset = load_dataset('mlenjoyneer/RuTextSegNews') ``` ### Other datasets mlenjoyneer/RuTextSegWiki ## Dataset Structure ### Data Instances For each instance, there is a list of strings for text sentences, a list of ints for labels (1 is new topic starting and 0 is previous topic continuation) and a string for sample generation method (base or random_joining). ``` { "sentences": [ "В среду в столице Катара Дохе начался чемпионат мира по плаванию на короткой воде.", "За пять соревновательных дней в бассейне Hamad Aquatic Complex будет разыграно 46 комплектов наград.", "Соревнования в Дохе станут последней серьезной проверкой спортсменов перед чемпионатом мира по водным видам спорта, который пройдет в Казани в следующем году.", "В первый день соревнований серебро на дистанции 200 метров вольным стилем выиграли россиянин Данила Изотов и мужская сборная России в эстафете 4х100 метров кролем.", "Для российских спортсменов главным отборочным турниром к ЧМ стал чемпионат России, который состоялся месяц назад в Казани.", "Тренерский штаб сборной освободил от квалификации только одного спортсмена – Владимира Морозова, который на прошлом ЧМ в Стамбуле выиграл на дистанциях 50 и 100 м вольным стилем.", "Он стал единственным пловцом в составе россиян, кто выиграл на том чемпионате золотые медали.", "Изначально планировалось, что Морозов в Дохе стартует сразу на четырех дистанциях, но в итоге его программу сократили вдвое – до 100 м в комплексном плавании и 50 м кролем.", "Остальным спортсменам, в том числе и двукратному серебряному медалисту Олимпиады-2012 в Лондоне Евгению Коротышкину, пришлось проходить отбор.", "По окончании чемпионата России Коротышкин в интервью РБК отмечал, что его победного результата на чемпионате России на дистанции 100 м баттерфляем (50,1 с) может не хватить для попадания на пьедестал.", "«Чтобы бороться за медали в Дохе, необходимо улучшать это время на полсекунды, а может, и больше, – отметил Коротышкин в разговоре с автором этих строк.", "– Думаю, для бронзовой награды хватит 49,3 с, а победитель вполне может пробить отметку в 49 с».", "Российский пловец в начале ноября отмечал, что за месяц до старта чемпионата мира в Дохе у него есть резервы в улучшении результата.", "«В первую очередь надо работать над стартом и переворотами», – рассказал Коротышкин РБК.", "Главным соперником Евгения на стометровке баттерфляем станет южноафриканец Чад де Кло, накануне признанный FINA пловцом года.", "По словам Коротышкина, де Кло находится нынче в великолепной форме и постарается побить мировой рекорд россиянина на этой дистанции, который составляет 48,48 с. Еще до старта чемпионата одним из претендентов на медали помимо Морозова и Коротышкина в составе россиян являлся Данила Изотов.", "Вчера он сначала пробился в финал на дистанции 200 м вольным стилем с третьим результатом (1:42,45), а в решающем заплыве уступил лишь 22 сотые секунды Чаду де Кло и принес России первую серебряную медаль чемпионата мира в Дохе.", "Вместе со сборной России Изотов отобрался с пятым временем (3:08,15) в финал эстафеты 4 х 200 кролем.", "Женская команда России также выступит в решающем заплыве в этом виде программы.", "В эстафете 4 х 100 метров кролем мужская сборная России завоевала серебряную медаль, уступив только французскому квартету."], "labels": [0, 0, 0, 0, 1, 0, 0, 0, 0, 0, 0, 0, 0, 0, 1, 0, 0, 0, 0, 0], "method": "base"} ``` ### Data Splits | Dataset Split | Number of Instances in Split | |:---------|:---------| | Train | 20000 | | Test | 4000 | ## Additional Information ### Licensing Information In progress ### Citation Information ```bibtex In progress ```

提供机构:
mlenjoyneer
原始信息汇总

数据集概述

数据集描述

数据集摘要

该数据集用于俄语新闻的自动文本分割。数据基于Yuri Baburov的新闻数据集(https://github.com/buriy/russian-nlp-datasets/releases/),涵盖2014年和2015年。标记是基于两种方法自动生成的:使用已有段落划分的文本和随机合并不同文本的部分。

支持的任务和排行榜

该数据集设计用于文本分割任务。

语言

数据集为俄语。

数据集结构

数据实例

每个实例包含文本句子的字符串列表、标签的整数列表(1表示新主题开始,0表示前一主题继续)以及样本生成方法的字符串(base或random_joining)。

json { "sentences": [ "В среду в столице Катара Дохе начался чемпионат мира по плаванию на короткой воде.", "За пять соревновательных дней в бассейне Hamad Aquatic Complex будет разыграно 46 комплектов наград.", "Соревнования в Дохе станут последней серьезной проверкой спортсменов перед чемпионатом мира по водным видам спорта, который пройдет в Казани в следующем году.", "В первый день соревнований серебро на дистанции 200 метров вольным стилем выиграли россиянин Данила Изотов и мужская сборная России в эстафете 4х100 метров кролем.", "Для российских спортсменов главным отборочным турниром к ЧМ стал чемпионат России, который состоялся месяц назад в Казани.", "Тренерский штаб сборной освободил от квалификации только одного спортсмена – Владимира Морозова, который на прошлом ЧМ в Стамбуле выиграл на дистанциях 50 и 100 м вольным стилем.", "Он стал единственным пловцом в составе россиян, кто выиграл на том чемпионате золотые медали.", "Изначально планировалось, что Морозов в Дохе стартует сразу на четырех дистанциях, но в итоге его программу сократили вдвое – до 100 м в комплексном плавании и 50 м кролем.", "Остальным спортсменам, в том числе и двукратному серебряному медалисту Олимпиады-2012 в Лондоне Евгению Коротышкину, пришлось проходить отбор.", "По окончании чемпионата России Коротышкин в интервью РБК отмечал, что его победного результата на чемпионате России на дистанции 100 м баттерфляем (50,1 с) может не хватить для попадания на пьедестал.", "«Чтобы бороться за медали в Дохе, необходимо улучшать это время на полсекунды, а может, и больше, – отметил Коротышкин в разговоре с автором этих строк.", "– Думаю, для бронзовой награды хватит 49,3 с, а победитель вполне может пробить отметку в 49 с».", "Российский пловец в начале ноября отмечал, что за месяц до старта чемпионата мира в Дохе у него есть резервы в улучшении результата.", "«В первую очередь надо работать над стартом и переворотами», – рассказал Коротышкин РБК.", "Главным соперником Евгения на стометровке баттерфляем станет южноафриканец Чад де Кло, накануне признанный FINA пловцом года.", "По словам Коротышкина, де Кло находится нынче в великолепной форме и постарается побить мировой рекорд россиянина на этой дистанции, который составляет 48,48 с. Еще до старта чемпионата одним из претендентов на медали помимо Морозова и Коротышкина в составе россиян являлся Данила Изотов.", "Вчера он сначала пробился в финал на дистанции 200 м вольным стилем с третьим результатом (1:42,45), а в решающем заплыве уступил лишь 22 сотые секунды Чаду де Кло и принес России первую серебряную медаль чемпионата мира в Дохе.", "Вместе со сборной России Изотов отобрался с пятым временем (3:08,15) в финал эстафеты 4 х 200 кролем.", "Женская команда России также выступит в решающем заплыве в этом виде программы.", "В эстафете 4 х 100 метров кролем мужская сборная России завоевала серебряную медаль, уступив только французскому квартету."], "labels": [0, 0, 0, 0, 1, 0, 0, 0, 0, 0, 0, 0, 0, 0, 1, 0, 0, 0, 0, 0], "method": "base" }

数据分割

数据集分割 分割中的实例数量
训练集 20000
测试集 4000

附加信息

许可信息

正在进行中

引用信息

正在进行中

搜集汇总
数据集介绍
mlenjoyneer/RuTextSegNews 数据集图片
构建方式
RuTextSegNews数据集专为俄语新闻的自动文本分割任务而设计,其构建依托于Yuri Baburov提供的2014至2015年新闻语料库。为了生成高质量的标注数据,研究者采用了两种自动化策略:一是直接选取已有明确段落划分的新闻文本,二是通过随机拼接不同来源的文本片段来模拟复杂的主题转换场景。这种双轨并行的构建方式确保了数据集的多样性与挑战性,为文本分割模型的训练提供了坚实的语料基础。
特点
该数据集包含约24000个实例,其中训练集20000条、测试集4000条,规模适中且分布合理。每个样本以句子列表形式呈现,并配有二进制标签序列(1表示新主题起始,0表示主题延续),同时记录了生成方法(base或random_joining)。这种结构不仅支持传统的序列标注任务,还能通过方法字段分析不同构建策略对模型性能的影响,展现了数据集在细粒度评估上的独特优势。
使用方法
用户可通过HuggingFace的datasets库便捷加载该数据集,仅需一行代码即可完成:load_dataset('mlenjoyneer/RuTextSegNews')。加载后,数据以字典格式呈现,包含'sentences'、'labels'和'method'三个字段,便于直接用于文本分割模型的训练与评估。此外,该数据集与同作者发布的RuTextSegWiki形成互补,可共同用于跨领域文本分割研究,拓展了应用场景的广度。
背景与挑战
背景概述
在自然语言处理领域,文本分割是一项基础而关键的任务,旨在将连续的文本流划分为语义连贯的段落或主题单元,为信息检索、摘要生成和对话系统等下游应用提供结构化支持。RuTextSegNews数据集由研究者基于Yuri Baburov在2014至2015年间收集的俄语新闻语料库构建而成,创建时间约为2023年,主要依托于HuggingFace平台发布。该数据集的核心研究问题聚焦于自动文本分割,特别是针对俄语新闻文本中主题边界的检测。通过结合基于段落划分的自动标注与随机拼接不同文本片段的方法,数据集提供了约24000个实例,为俄语文本分割任务的模型训练与评估提供了标准化资源。其影响力在于填补了俄语领域高质量文本分割数据集的空白,推动了多语言自然语言处理技术的发展。
当前挑战
RuTextSegNews数据集所解决的领域问题在于俄语新闻文本的自动主题分割,这一任务面临的核心挑战包括:新闻文本中主题边界的模糊性,例如同一主题下包含多个子事件或观点,导致标签定义难以统一;以及自动标注方法引入的噪声,如基于段落划分可能忽略跨段落的主题延续,随机拼接则可能生成不自然的文本边界。在数据集构建过程中,挑战主要体现在:依赖机器生成的标注缺乏人工验证,可能降低标签的准确性与一致性;新闻语料的时间跨度(2014-2015年)可能导致语言风格过时,影响模型对当代文本的泛化能力。此外,数据集规模有限(训练集20000例、测试集4000例),难以覆盖多样化的新闻体裁与主题结构,可能限制模型的鲁棒性与实际应用效果。
常用场景
经典使用场景
RuTextSegNews数据集专为俄语新闻的自动文本分割任务而生,其核心应用在于将连续文本精准切分为语义连贯的段落或主题单元。该数据集基于2014至2015年间的俄语新闻语料库,通过两种自动化标注策略生成:一是保留原始文本的自然段落结构,二是随机拼接不同文本片段以模拟主题切换。这种设计使得模型能够在多主题交织的新闻篇章中,识别出主题边界,从而提升文本结构化分析的效率与准确性。
解决学术问题
该数据集直面自然语言处理领域中文本分割的经典挑战,尤其聚焦于俄语新闻文本的主题边界检测问题。传统方法往往依赖人工标注或规则匹配,难以应对新闻中频繁的主题跳跃与信息密度差异。RuTextSegNews通过大规模自动化标注,为监督学习提供了可靠的训练基准,推动了序列标注与边界预测模型的发展。其意义在于填补了俄语文本分割资源的空白,为跨语言文本分割研究提供了对比基准,并促进了篇章级语义理解技术的进步。
衍生相关工作
RuTextSegNews的发布催生了一系列相关研究,包括基于Transformer的文本分割模型(如结合BERT的边界预测架构)以及多任务学习框架(联合主题分割与情感分析)。此外,研究者还将其与同系列的RuTextSegWiki数据集结合,探索跨领域文本分割的泛化能力。该数据集也常作为俄语篇章分析任务的基线,用于评估新提出的分割算法(如层次注意力网络)在新闻领域的表现,间接推动了俄语自然语言处理工具链的完善。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务