数据链接:
官方服务:
资源简介:
300余种编程语言的代码片段,其中包括主流编程语言如:Java,JavaScript,PHP,Pyhton,C#,C,C++,Go,CSS,Shell,matlab等;
应用场景:
提供机构:
数据堂相关数据集
coref-data/corefud_raw
该数据集包含多个语言版本的共指消解数据,涵盖了加泰罗尼亚语、捷克语、德语、英语、西班牙语、法语、匈牙利语、立陶宛语、挪威语、波兰语、俄语和土耳其语等。每个语言版本的数据集都包含训练集和验证集,数据特征包括文档ID、句子、核心指代实体、词性标注、依存关系等。数据集用于自然语言处理中的共指消解任务。
Hugging Face2025-03-26 更新460
aremuadeolajr/NaijaRC
--- license: cc-by-nc-4.0 language: - ig - yo - ha size_categories: - n<1K multilinguality: - multilingual pretty_name: NaijaRC language_details: ibo, yor, hau tags: - naijarc task_categories: - multi
Hugging Face2024-05-07 更新220
stefan-it/autotrain-flair-hipe2022-de-hmbert
该数据集主要用于命名实体识别(NER)模型的微调,涉及多种语言和数据集,包括英语、德语、法语、芬兰语、瑞典语和荷兰语。数据集来源于HIPE-2020、HIPE-2022和Europeana等项目,涵盖了多种历史文献和新闻数据。
Hugging Face2023-09-04 更新150
Vikhrmodels/Grounded-RAG-QA-RU
该数据集是基于13,000篇俄语维基百科文章构建的,使用了GPT-4-turbo-1106生成的合成问题和答案。数据集中的对话格式遵循HuggingFace的标准,包含文档、用户和助手三个角色。特别地,助手的角色在对话末尾重复出现,第一次出现时提供文档ID的JSON数组,第二次出现时提供对用户问题的完整回答。数据集旨在训练模型回答基于多个文档的复杂和简单问题,并学会拒绝那些无法在提供文档中找到答案
Hugging Face2024-07-04 更新340
RicardoRei/wmt-da-human-evaluation
该数据集包含了之前WMT新闻翻译共享任务中的所有DA(直接评估)人工标注数据。数据被组织成8列:语言对(lp)、输入文本(src)、翻译(mt)、参考翻译(ref)、z分数(score)、直接评估(raw)、标注者数量(annotators)、输入文本的领域(domain,例如新闻)和收集年份(year)。数据集主要用于机器翻译评估,涵盖了41种语言对,并且大多数数据来自新闻领域。
Hugging Face2023-02-17 更新170



