相关数据集
neulab/ted_hrlr
该数据集名为TEDHrlr,主要来源于TED演讲的转录文本,用于比较高资源和低资源语言对的翻译任务。数据集包含多种语言的翻译对,如阿塞拜疆语到英语、白俄罗斯语到英语等。数据集的创建过程涉及专家生成和众包注释,且数据集的大小在1M到10M之间。数据集的许可证为CC BY-NC-ND 4.0。
Hugging Face2024-01-18 更新1000
neulab/conala
CoNaLa数据集是一个用于代码生成任务评估的基准数据集,包含代码和自然语言对。数据集从Stack Overflow爬取,经过自动过滤和人工标注,分为2,379个训练样本和500个测试样本。此外,还提供了一个自动挖掘的数据集,包含近60万个样本。数据集主要用于评估代码生成任务,语言为英语和Python代码。数据集结构包括两个版本:经过人工标注的版本和自动挖掘的版本,分别包含不同的字段和分割。
Hugging Face2022-10-20 更新540
HuiHuang/NER-CoT
ReasoningNER是一个为支持命名实体识别(NER)推理范式而设计的数据库。它包含了详细的推理轨迹(Chain-of-Thought, CoT)注释,这些注释详细说明了如何基于上下文线索、语义提示和逻辑约束来识别实体,而不是仅仅依赖语义模式。该数据集基于PILE-NER数据库构建,对其样本进行了详细的推理注释增强。
Hugging Face2025-11-13 更新370
neulab/wiki_asp
--- annotations_creators: - crowdsourced language_creators: - crowdsourced language: - en license: - cc-by-sa-4.0 multilinguality: - monolingual size_categories: - 10K<n<100K source_datasets: - origin
Hugging Face2024-01-18 更新690
neulab/ted_multi
TEDMulti数据集是一个包含60种语言的大规模多语言数据集,源自TED演讲的转录文本。每个记录由语言和文本的并行数组组成,缺失和不完整的翻译会被过滤掉。数据集包含训练集、验证集和测试集,分别包含258098、6049和7213个样本。数据集的下载文件大小为352.23 MB,生成的数据集大小为791.01 MB,总磁盘使用量为1.14 GB。数据集的字段包括`translations`(多语言
Hugging Face2024-01-18 更新400



