登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
1,282万组中韩平行语料数据
1,282万组中韩平行语料数据
收藏
数据堂
2024-05-23 收录
机器翻译
平行语料库
数据链接:
https://www.datatang.com/dataset/1200
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
1282万组中韩平行互译语料,数据存储格式为txt文档,覆盖口语、旅游、新闻、金融等多个领域。已进行数据清洗脱敏质检,可作为文本类数据分析的基础语料库,用于机器翻译等领域。
应用场景:
提供机构:
数据堂
相关数据集
501万组汉藏平行语料数据
机器翻译
平行语料库
汉藏平行语料数据包括501万组汉语、藏语平行互译语料,数据存储格式为txt文档。已进行数据清洗脱敏质检,可作为文本类数据分析的基础语料库,用于机器翻译等领域。
数据堂
72
0
Parikshith/grow-1-monolingual-ha-en-comet-wmt21
机器翻译
翻译质量评估
--- dataset_info: features: - name: src dtype: string - name: mt dtype: string - name: score dtype: float64 splits: - name: small num_bytes: 24923873 num_examples: 1000
Hugging Face
2023-12-02 更新
17
0
task1263_ted_translation_pl_fa
机器翻译
自然语言处理
该数据集名为'task1263_ted_translation_pl_fa',属于文本生成任务类别,主要用于波兰语(PL)和波斯语(FA)之间的翻译任务。数据集包含5118个训练样本、640个验证样本和640个测试样本。每个样本包含输入文本、输出文本和唯一标识符。数据集的创建是通过众包方式完成的,语言为英语,许可证为Apache-2.0。
Hugging Face
2025-01-02 更新
6
0
English-to-Igbo Translation Dataset
自然语言处理
机器翻译
该数据集是一个为英-伊博语翻译任务设计的低资源数据集,包含约12,000个并行句子对。数据集来源于圣经语料库、本地新闻、维基百科文章和Common Crawl,所有数据都经过母语专家验证。数据集用于训练和评估神经机器翻译模型,旨在解决低资源语言翻译任务中的性能差距问题。
arXiv
2025-04-24 更新
22
0
alvations/c4p0-v1-en-ja
机器翻译
文本生成
该数据集包含多个特征字段,如source、target、prompt等,主要用于存储文本数据及其相关信息。数据集包含一个训练集(train),共有17956个样本,总大小为22109670字节。数据集的下载大小为8614674字节。这些信息表明该数据集可能用于自然语言处理任务,如文本生成或翻译。
Hugging Face
2024-03-23 更新
11
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广