遇见数据集

wecover/OPUS_OpenSubtitles

收藏
Hugging Face2024-01-31 更新2024-03-04 收录
官方服务:

资源简介:

--- configs: - config_name: default data_files: - split: train path: '*/*/train.parquet' - split: valid path: '*/*/valid.parquet' - split: test path: '*/*/test.parquet' - config_name: af data_files: - split: train path: '*/*af*/train.parquet' - split: test path: '*/*af*/test.parquet' - split: valid path: '*/*af*/valid.parquet' - config_name: ar data_files: - split: train path: '*/*ar*/train.parquet' - split: test path: '*/*ar*/test.parquet' - split: valid path: '*/*ar*/valid.parquet' - config_name: bg data_files: - split: train path: '*/*bg*/train.parquet' - split: test path: '*/*bg*/test.parquet' - split: valid path: '*/*bg*/valid.parquet' - config_name: bn data_files: - split: train path: '*/*bn*/train.parquet' - split: test path: '*/*bn*/test.parquet' - split: valid path: '*/*bn*/valid.parquet' - config_name: bs data_files: - split: train path: '*/*bs*/train.parquet' - split: test path: '*/*bs*/test.parquet' - split: valid path: '*/*bs*/valid.parquet' - config_name: cs data_files: - split: train path: '*/*cs*/train.parquet' - split: test path: '*/*cs*/test.parquet' - split: valid path: '*/*cs*/valid.parquet' - config_name: da data_files: - split: train path: '*/*da*/train.parquet' - split: test path: '*/*da*/test.parquet' - split: valid path: '*/*da*/valid.parquet' - config_name: de data_files: - split: train path: '*/*de*/train.parquet' - split: test path: '*/*de*/test.parquet' - split: valid path: '*/*de*/valid.parquet' - config_name: el data_files: - split: train path: '*/*el*/train.parquet' - split: test path: '*/*el*/test.parquet' - split: valid path: '*/*el*/valid.parquet' - config_name: en data_files: - split: train path: '*/*en*/train.parquet' - split: test path: '*/*en*/test.parquet' - split: valid path: '*/*en*/valid.parquet' - config_name: eo data_files: - split: train path: '*/*eo*/train.parquet' - split: test path: '*/*eo*/test.parquet' - split: valid path: '*/*eo*/valid.parquet' - config_name: es data_files: - split: train path: '*/*es*/train.parquet' - split: test path: '*/*es*/test.parquet' - split: valid path: '*/*es*/valid.parquet' - config_name: et data_files: - split: train path: '*/*et*/train.parquet' - split: test path: '*/*et*/test.parquet' - split: valid path: '*/*et*/valid.parquet' - config_name: fa data_files: - split: train path: '*/*fa*/train.parquet' - split: test path: '*/*fa*/test.parquet' - split: valid path: '*/*fa*/valid.parquet' - config_name: fi data_files: - split: train path: '*/*fi*/train.parquet' - split: test path: '*/*fi*/test.parquet' - split: valid path: '*/*fi*/valid.parquet' - config_name: fr data_files: - split: train path: '*/*fr*/train.parquet' - split: test path: '*/*fr*/test.parquet' - split: valid path: '*/*fr*/valid.parquet' - config_name: he data_files: - split: train path: '*/*he*/train.parquet' - split: test path: '*/*he*/test.parquet' - split: valid path: '*/*he*/valid.parquet' - config_name: hi data_files: - split: train path: '*/*hi*/train.parquet' - split: test path: '*/*hi*/test.parquet' - split: valid path: '*/*hi*/valid.parquet' - config_name: hr data_files: - split: train path: '*/*hr*/train.parquet' - split: test path: '*/*hr*/test.parquet' - split: valid path: '*/*hr*/valid.parquet' - config_name: hu data_files: - split: train path: '*/*hu*/train.parquet' - split: test path: '*/*hu*/test.parquet' - split: valid path: '*/*hu*/valid.parquet' - config_name: id data_files: - split: train path: '*/*id*/train.parquet' - split: test path: '*/*id*/test.parquet' - split: valid path: '*/*id*/valid.parquet' - config_name: it data_files: - split: train path: '*/*it*/train.parquet' - split: test path: '*/*it*/test.parquet' - split: valid path: '*/*it*/valid.parquet' - config_name: ja data_files: - split: train path: '*/*ja*/train.parquet' - split: test path: '*/*ja*/test.parquet' - split: valid path: '*/*ja*/valid.parquet' - config_name: lt data_files: - split: train path: '*/*lt*/train.parquet' - split: test path: '*/*lt*/test.parquet' - split: valid path: '*/*lt*/valid.parquet' - config_name: mk data_files: - split: train path: '*/*mk*/train.parquet' - split: test path: '*/*mk*/test.parquet' - split: valid path: '*/*mk*/valid.parquet' - config_name: ml data_files: - split: train path: '*/*ml*/train.parquet' - split: test path: '*/*ml*/test.parquet' - split: valid path: '*/*ml*/valid.parquet' - config_name: ms data_files: - split: train path: '*/*ms*/train.parquet' - split: test path: '*/*ms*/test.parquet' - split: valid path: '*/*ms*/valid.parquet' - config_name: nl data_files: - split: train path: '*/*nl*/train.parquet' - split: test path: '*/*nl*/test.parquet' - split: valid path: '*/*nl*/valid.parquet' - config_name: no data_files: - split: train path: '*/*no*/train.parquet' - split: test path: '*/*no*/test.parquet' - split: valid path: '*/*no*/valid.parquet' - config_name: pl data_files: - split: train path: '*/*pl*/train.parquet' - split: test path: '*/*pl*/test.parquet' - split: valid path: '*/*pl*/valid.parquet' - config_name: pt data_files: - split: train path: '*/*pt*/train.parquet' - split: test path: '*/*pt*/test.parquet' - split: valid path: '*/*pt*/valid.parquet' - config_name: ro data_files: - split: train path: '*/*ro*/train.parquet' - split: test path: '*/*ro*/test.parquet' - split: valid path: '*/*ro*/valid.parquet' - config_name: ru data_files: - split: train path: '*/*ru*/train.parquet' - split: test path: '*/*ru*/test.parquet' - split: valid path: '*/*ru*/valid.parquet' - config_name: si data_files: - split: train path: '*/*si*/train.parquet' - split: test path: '*/*si*/test.parquet' - split: valid path: '*/*si*/valid.parquet' - config_name: sk data_files: - split: train path: '*/*sk*/train.parquet' - split: test path: '*/*sk*/test.parquet' - split: valid path: '*/*sk*/valid.parquet' - config_name: sl data_files: - split: train path: '*/*sl*/train.parquet' - split: test path: '*/*sl*/test.parquet' - split: valid path: '*/*sl*/valid.parquet' - config_name: sq data_files: - split: train path: '*/*sq*/train.parquet' - split: test path: '*/*sq*/test.parquet' - split: valid path: '*/*sq*/valid.parquet' - config_name: sr data_files: - split: train path: '*/*sr*/train.parquet' - split: test path: '*/*sr*/test.parquet' - split: valid path: '*/*sr*/valid.parquet' - config_name: sv data_files: - split: train path: '*/*sv*/train.parquet' - split: test path: '*/*sv*/test.parquet' - split: valid path: '*/*sv*/valid.parquet' - config_name: ta data_files: - split: train path: '*/*ta*/train.parquet' - split: test path: '*/*ta*/test.parquet' - split: valid path: '*/*ta*/valid.parquet' - config_name: th data_files: - split: train path: '*/*th*/train.parquet' - split: test path: '*/*th*/test.parquet' - split: valid path: '*/*th*/valid.parquet' - config_name: tr data_files: - split: train path: '*/*tr*/train.parquet' - split: test path: '*/*tr*/test.parquet' - split: valid path: '*/*tr*/valid.parquet' - config_name: uk data_files: - split: train path: '*/*uk*/train.parquet' - split: test path: '*/*uk*/test.parquet' - split: valid path: '*/*uk*/valid.parquet' - config_name: vi data_files: - split: train path: '*/*vi*/train.parquet' - split: test path: '*/*vi*/test.parquet' - split: valid path: '*/*vi*/valid.parquet' - config_name: br data_files: - split: train path: '*/*br*/train.parquet' - split: test path: '*/*br*/test.parquet' - split: valid path: '*/*br*/valid.parquet' - config_name: ca data_files: - split: train path: '*/*ca*/train.parquet' - split: test path: '*/*ca*/test.parquet' - split: valid path: '*/*ca*/valid.parquet' - config_name: eu data_files: - split: train path: '*/*eu*/train.parquet' - split: test path: '*/*eu*/test.parquet' - split: valid path: '*/*eu*/valid.parquet' - config_name: gl data_files: - split: train path: '*/*gl*/train.parquet' - split: test path: '*/*gl*/test.parquet' - split: valid path: '*/*gl*/valid.parquet' - config_name: hy data_files: - split: train path: '*/*hy*/train.parquet' - split: test path: '*/*hy*/test.parquet' - split: valid path: '*/*hy*/valid.parquet' - config_name: is data_files: - split: train path: '*/*is*/train.parquet' - split: test path: '*/*is*/test.parquet' - split: valid path: '*/*is*/valid.parquet' - config_name: ka data_files: - split: train path: '*/*ka*/train.parquet' - split: test path: '*/*ka*/test.parquet' - split: valid path: '*/*ka*/valid.parquet' - config_name: kk data_files: - split: train path: '*/*kk*/train.parquet' - split: test path: '*/*kk*/test.parquet' - split: valid path: '*/*kk*/valid.parquet' - config_name: ko data_files: - split: train path: '*/*ko*/train.parquet' - split: test path: '*/*ko*/test.parquet' - split: valid path: '*/*ko*/valid.parquet' - config_name: te data_files: - split: train path: '*/*te*/train.parquet' - split: test path: '*/*te*/test.parquet' - split: valid path: '*/*te*/valid.parquet' - config_name: tl data_files: - split: train path: '*/*tl*/train.parquet' - split: test path: '*/*tl*/test.parquet' - split: valid path: '*/*tl*/valid.parquet' - config_name: ur data_files: - split: train path: '*/*ur*/train.parquet' - split: test path: '*/*ur*/test.parquet' - split: valid path: '*/*ur*/valid.parquet' ---

提供机构:
wecover
原始信息汇总

数据集配置

默认配置

  • 训练集: */*/train.parquet
  • 验证集: */*/valid.parquet
  • 测试集: */*/test.parquet

语言特定配置

  • 阿非利卡语 (af)
    • 训练集: */*af*/train.parquet
    • 验证集: */*af*/valid.parquet
    • 测试集: */*af*/test.parquet
  • 阿拉伯语 (ar)
    • 训练集: */*ar*/train.parquet
    • 验证集: */*ar*/valid.parquet
    • 测试集: */*ar*/test.parquet
  • 保加利亚语 (bg)
    • 训练集: */*bg*/train.parquet
    • 验证集: */*bg*/valid.parquet
    • 测试集: */*bg*/test.parquet
  • 孟加拉语 (bn)
    • 训练集: */*bn*/train.parquet
    • 验证集: */*bn*/valid.parquet
    • 测试集: */*bn*/test.parquet
  • 波斯尼亚语 (bs)
    • 训练集: */*bs*/train.parquet
    • 验证集: */*bs*/valid.parquet
    • 测试集: */*bs*/test.parquet
  • 捷克语 (cs)
    • 训练集: */*cs*/train.parquet
    • 验证集: */*cs*/valid.parquet
    • 测试集: */*cs*/test.parquet
  • 丹麦语 (da)
    • 训练集: */*da*/train.parquet
    • 验证集: */*da*/valid.parquet
    • 测试集: */*da*/test.parquet
  • 德语 (de)
    • 训练集: */*de*/train.parquet
    • 验证集: */*de*/valid.parquet
    • 测试集: */*de*/test.parquet
  • 希腊语 (el)
    • 训练集: */*el*/train.parquet
    • 验证集: */*el*/valid.parquet
    • 测试集: */*el*/test.parquet
  • 英语 (en)
    • 训练集: */*en*/train.parquet
    • 验证集: */*en*/valid.parquet
    • 测试集: */*en*/test.parquet
  • 世界语 (eo)
    • 训练集: */*eo*/train.parquet
    • 验证集: */*eo*/valid.parquet
    • 测试集: */*eo*/test.parquet
  • 西班牙语 (es)
    • 训练集: */*es*/train.parquet
    • 验证集: */*es*/valid.parquet
    • 测试集: */*es*/test.parquet
  • 爱沙尼亚语 (et)
    • 训练集: */*et*/train.parquet
    • 验证集: */*et*/valid.parquet
    • 测试集: */*et*/test.parquet
  • 波斯语 (fa)
    • 训练集: */*fa*/train.parquet
    • 验证集: */*fa*/valid.parquet
    • 测试集: */*fa*/test.parquet
  • 芬兰语 (fi)
    • 训练集: */*fi*/train.parquet
    • 验证集: */*fi*/valid.parquet
    • 测试集: */*fi*/test.parquet
  • 法语 (fr)
    • 训练集: */*fr*/train.parquet
    • 验证集: */*fr*/valid.parquet
    • 测试集: */*fr*/test.parquet
  • 希伯来语 (he)
    • 训练集: */*he*/train.parquet
    • 验证集: */*he*/valid.parquet
    • 测试集: */*he*/test.parquet
  • 印地语 (hi)
    • 训练集: */*hi*/train.parquet
    • 验证集: */*hi*/valid.parquet
    • 测试集: */*hi*/test.parquet
  • 克罗地亚语 (hr)
    • 训练集: */*hr*/train.parquet
    • 验证集: */*hr*/valid.parquet
    • 测试集: */*hr*/test.parquet
  • 匈牙利语 (hu)
    • 训练集: */*hu*/train.parquet
    • 验证集: */*hu*/valid.parquet
    • 测试集: */*hu*/test.parquet
  • 印度尼西亚语 (id)
    • 训练集: */*id*/train.parquet
    • 验证集: */*id*/valid.parquet
    • 测试集: */*id*/test.parquet
  • 意大利语 (it)
    • 训练集: */*it*/train.parquet
    • 验证集: */*it*/valid.parquet
    • 测试集: */*it*/test.parquet
  • 日语 (ja)
    • 训练集: */*ja*/train.parquet
    • 验证集: */*ja*/valid.parquet
    • 测试集: */*ja*/test.parquet
  • 立陶宛语 (lt)
    • 训练集: */*lt*/train.parquet
    • 验证集: */*lt*/valid.parquet
    • 测试集: */*lt*/test.parquet
  • 马其顿语 (mk)
    • 训练集: */*mk*/train.parquet
    • 验证集: */*mk*/valid.parquet
    • 测试集: */*mk*/test.parquet
  • 马拉雅拉姆语 (ml)
    • 训练集: */*ml*/train.parquet
    • 验证集: */*ml*/valid.parquet
    • 测试集: */*ml*/test.parquet
  • 马来语 (ms)
    • 训练集: */*ms*/train.parquet
    • 验证集: */*ms*/valid.parquet
    • 测试集: */*ms*/test.parquet
  • 荷兰语 (nl)
    • 训练集: */*nl*/train.parquet
    • 验证集: */*nl*/valid.parquet
    • 测试集: */*nl*/test.parquet
  • 挪威语 (no)
    • 训练集: */*no*/train.parquet
    • 验证集: */*no*/valid.parquet
    • 测试集: */*no*/test.parquet
  • 波兰语 (pl)
    • 训练集: */*pl*/train.parquet
    • 验证集: */*pl*/valid.parquet
    • 测试集: */*pl*/test.parquet
  • 葡萄牙语 (pt)
    • 训练集: */*pt*/train.parquet
    • 验证集: */*pt*/valid.parquet
    • 测试集: */*pt*/test.parquet
  • 罗马尼亚语 (ro)
    • 训练集: */*ro*/train.parquet
    • 验证集: */*ro*/valid.parquet
    • 测试集: */*ro*/test.parquet
  • 俄语 (ru)
    • 训练集: */*ru*/train.parquet
    • 验证集: */*ru*/valid.parquet
    • 测试集: */*ru*/test.parquet
  • 僧伽罗语 (si)
    • 训练集: */*si*/train.parquet
    • 验证集: */*si*/valid.parquet
    • 测试集: */*si*/test.parquet
  • 斯洛伐克语 (sk)
    • 训练集: */*sk*/train.parquet
    • 验证集: */*sk*/valid.parquet
    • 测试集: */*sk*/test.parquet
  • 斯洛文尼亚语 (sl)
    • 训练集: */*sl*/train.parquet
    • 验证集: */*sl*/valid.parquet
    • 测试集: */*sl*/test.parquet
  • 阿尔巴尼亚语 (sq)
    • 训练集: */*sq*/train.parquet
    • 验证集: */*sq*/valid.parquet
    • 测试集: */*sq*/test.parquet
  • 塞尔维亚语 (sr)
    • 训练集: */*sr*/train.parquet
    • 验证集: */*sr*/valid.parquet
    • 测试集: */*sr*/test.parquet
  • 瑞典语 (sv)
    • 训练集: */*sv*/train.parquet
    • 验证集: */*sv*/valid.parquet
    • 测试集: */*sv*/test.parquet
  • 泰米尔语 (ta)
    • 训练集: */*ta*/train.parquet
    • 验证集: */*ta*/valid.parquet
    • 测试集: */*ta*/test.parquet
  • 泰语 (th)
    • 训练集: */*th*/train.parquet
    • 验证集: */*th*/valid.parquet
    • 测试集: */*th*/test.parquet
  • 土耳其语 (tr)
    • 训练集: */*tr*/train.parquet
    • 验证集: */*tr*/valid.parquet
    • 测试集: */*tr*/test.parquet
  • 乌克兰语 (uk)
    • 训练集: */*uk*/train.parquet
    • 验证集: */*uk*/valid.parquet
    • 测试集: */*uk*/test.parquet
  • 越南语 (vi)
    • 训练集: */*vi*/train.parquet
    • 验证集: */*vi*/valid.parquet
    • 测试集: */*vi*/test.parquet
  • 布列塔尼语 (br)
    • 训练集: */*br*/train.parquet
    • 验证集: */*br*/valid.parquet
    • 测试集: */*br*/test.parquet
  • 加泰罗尼亚语 (ca)
    • 训练集: */*ca*/train.parquet
    • 验证集: */*ca*/valid.parquet
    • 测试集: */*ca*/test.parquet
  • 巴斯克语 (eu)
    • 训练集: */*eu*/train.parquet
    • 验证集: */*eu*/valid.parquet
    • 测试集: */*eu*/test.parquet
  • 加利西亚语 (gl)
    • 训练集: */*gl*/train.parquet
    • 验证集: */*gl*/valid.parquet
    • 测试集: */*gl*/test.parquet
  • 亚美尼亚语 (hy)
    • 训练集: */*hy*/train.parquet
    • 验证集: */*hy*/valid.parquet
    • 测试集: */*hy*/test.parquet
  • 冰岛语 (is)
    • 训练集: */*is*/train.parquet
    • 验证集: */*is*/valid.parquet
    • 测试集: */*is*/test.parquet
  • 格鲁吉亚语 (ka)
    • 训练集: */*ka*/train.parquet
    • 验证集: */*ka*/valid.parquet
    • 测试集: */*ka*/test.parquet
  • 哈萨克语 (kk)
    • 训练集: */*kk*/train.parquet
    • 验证集: */*kk*/valid.parquet
    • 测试集: */*kk*/test.parquet
  • 韩语 (ko)
    • 训练集: */*ko*/train.parquet
    • 验证集: */*ko*/valid.parquet
    • 测试集: */*ko*/test.parquet
  • 泰卢固语 (te)
    • 训练集: */*te*/train.parquet
    • 验证集: */*te*/valid.parquet
    • 测试集: */*te*/test.parquet
  • 塔加路语 (tl)
    • 训练集: */*tl*/train.parquet
    • 验证集: */*tl*/valid.parquet
    • 测试集: */*tl*/test.parquet
  • 乌尔都语 (ur)
    • 训练集: */*ur*/train.parquet
    • 验证集: */*ur*/valid.parquet
    • 测试集: */*ur*/test.parquet
搜集汇总
数据集介绍
wecover/OPUS_OpenSubtitles 数据集图片
构建方式
在自然语言处理与机器翻译领域,高质量的双语平行语料是模型训练的关键基石。wecover/OPUS_OpenSubtitles 数据集依托于 OpenSubtitles 电影字幕资源,通过系统化的语言筛选与文件组织进行构建。其核心架构围绕语言特定的配置(config)展开,为每个语种(如英语、法语、中文等)提供了独立的子集。每个子集内的数据被严格划分为训练(train)、验证(valid)和测试(test)三个标准分片,并以高效的 Parquet 格式存储于结构化路径中,从而确保了数据加载的便捷性与跨语言研究的可重复性。
特点
该数据集最显著的特点在于其卓越的多语言覆盖广度与规模,囊括了从印欧语系到亚非语系、从常见语言到低资源语言的数十种语种,为跨语言研究提供了丰富的资源。数据源自电影字幕,语料天然贴近日常口语与对话场景,具有高度的自然性和语境丰富度。此外,数据集针对每一语种都提供了独立配置,并预设了统一的三分片划分,这种设计极大地方便了研究者进行单语或多语模型的开发与评估,同时保证了数据切分的一致性与标准化。
使用方法
研究者可通过 HuggingFace Datasets 库便捷地调用该数据集。加载时,只需指定对应的语言配置名称(如 'en'、'fr'、'zh' 等)即可获取特定语种的完整数据。数据集内部已预处理好 'train'、'valid'、'test' 三个标准分片,用户可直接通过参数选择所需子集。对于需要构建双语平行语料的场景,可分别加载源语言与目标语言的对应分片,利用字幕中的对齐信息进行配对,从而快速生成用于机器翻译模型训练的高质量数据管道。
背景与挑战
背景概述
OPUS_OpenSubtitles数据集是基于OpenSubtitles社区大规模影视字幕语料库构建的多语言平行语料集合,由欧洲语言资源领域的多个研究机构联合维护与迭代更新。该数据集的核心研究问题聚焦于低资源语言与高资源语言之间的机器翻译模型训练,旨在通过海量、真实且覆盖多种语言对的对话式文本,推动神经机器翻译在口语化、非正式语境下的性能突破。自发布以来,OPUS_OpenSubtitles已成为跨语言自然语言处理领域的重要基准资源,尤其在处理字幕特有的简练表达、俚语及文化负载词方面,为多语言翻译系统提供了不可或缺的训练与评估基础。
当前挑战
该数据集面临的核心挑战在于影视字幕固有的噪声特性与领域适配难题。字幕文本常包含时间戳标记、说话人标识、翻译压缩乃至拼写错误,这些非标准元素对翻译模型的鲁棒性构成严峻考验。构建过程中,从海量多语言字幕中自动对齐平行句对需克服语言歧义与片段错配,尤其在低资源语言对中,稀疏的平行数据进一步加剧了过拟合风险。此外,字幕口语风格与正式书面语的显著差异,使得基于该数据集训练的模型在迁移至新闻、法律等正式领域时性能骤降,凸显了跨领域泛化能力的瓶颈。
常用场景
经典使用场景
OPUS_OpenSubtitles数据集汇聚了来自影视作品的多语言平行字幕语料,其经典使用场景聚焦于神经机器翻译模型的训练与评估。凭借覆盖数十种语言的大规模、高质量句对对齐资源,该数据集为构建跨语言翻译系统提供了坚实的基石,尤其适用于低资源语言对的翻译能力提升,成为机器翻译领域基准测试与模型迭代的核心数据支撑。
实际应用
在实际应用中,OPUS_OpenSubtitles数据集支撑了影视字幕的自动翻译与本地化服务,大幅提升了跨文化内容分发的效率。基于该数据训练的模型被集成到实时翻译工具、视频流媒体平台的多语言字幕生成系统以及辅助翻译软件中,降低了人工翻译成本,加速了全球视听内容的无障碍传播。
衍生相关工作
该数据集衍生了多个经典研究工作,包括多语言机器翻译模型M2M-100、TED演讲翻译系统以及基于对比学习的跨语言句子嵌入方法。这些工作利用OPUS_OpenSubtitles的大规模平行语料,验证了多任务学习与知识蒸馏在翻译任务中的有效性,同时推动了对话翻译、领域自适应等前沿方向的探索,成为后续研究的重要参考基准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务