官方服务:
资源简介:
About 64 languages' parallel translations
该数据集包含约64种语言的平行翻译语料
应用场景:
创建时间:
2018-05-22
相关数据集
qmeeus/vp-er-14l
--- dataset_info: - config_name: multilang features: - name: audio_id dtype: string - name: audio dtype: audio: sampling_rate: 16000 - name: text dtype: string - na
Hugging Face2024-02-14 更新220
What would disprove interdependence? (data and code)
These are the datasets and R code accompanying the article "What would disprove interdependence? Lessons learned from a study on biliteracy in Portuguese heritage language speakers in Switzerland" by
DataCite Commons2020-09-02 更新120
my-euro-values-greek-parallel
该数据集包含训练集(train)拆分,共5个样本,总大小18.4KB。每个样本包含四个字段:1) prompt(字符串类型,原始提示文本),2) rubrics(字符串列表,评估标准),3) translated_prompt(字符串类型,翻译后的提示文本),4) translated_rubrics(字符串列表,翻译后的评估标准)。数据集未提供背景说明或具体任务描述,但从字段命名推断可能用于多语
Hugging Face2026-03-24 更新90
rinto/dgt-tm
DGT-Translation Memory数据集包含了欧盟立法文件(Acquis Communautaire)的24种官方语言的平行文本,主要用于机器翻译、文本分类、文本生成等NLP任务。数据集以TMX格式存储,并通过Java和Python工具进行提取和预处理。数据涵盖了从2007年到2012年的欧盟立法文件,并且每年都会更新。数据集的使用受到欧盟委员会的许可条件限制,用户需要遵守相关的知识产权
Hugging Face2024-11-30 更新140
SAW3-041 - Highlands Pidgin Part 1
Highlands Pidgin Course, Part 1. Stephen Wurm material for a course in Highlands Pidgin. Wurm is the speaker in these course recordings. Elicitation sessions in English and Highland Pidgin. Recorded i
Research Data Australia110



