登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Cavani (vydání ELTeC)
Cavani (vydání ELTeC)
收藏
B2FIND
2026-04-28 收录
文学数字化
自然语言处理
数据链接:
https://b2find.eudat.eu/dataset/7bcf05f3-abcc-5652-9906-4dcf5587b764
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
Source: Cavani (vydání ELTeC) : ELTeC Edition
来源:卡瓦尼(ELTeC版):ELTeC版
应用场景:
相关数据集
Magpie-Align/Magpie-Reasoning-150K
自然语言处理
模型推理
该数据集由Qwen2-72B-Instruct和Llama 3 70B Instruct模型通过Magpie方法生成,旨在通过高质量的指令-响应对增强模型的推理能力。数据集包含150,000个训练样本,主要涉及推理、数学、编码和调试等任务类别,且所有数据均为英文。数据集的生成和选择过程中,考虑了输入质量、难度、任务类别、指令奖励等多个因素,并去除了重复和不完整的指令。
Hugging Face
2024-07-22 更新
87
0
Sindhi语言大型语料库
Sindhi语
自然语言处理
本研究为资源匮乏的Sindhi语言开发了一个包含超过6100万单词的大型语料库。该语料库通过网络爬虫从多个网络资源中收集,并经过精心预处理以过滤噪声文本。语料库的创建解决了Sindhi语言在自然语言处理(NLP)领域缺乏大规模未标注语料的问题,为训练神经词嵌入提供了基础。此外,本研究还利用了GloVe、Skip-Gram和Continuous Bag of Words等先进的词2vec算法来生成S
arXiv
2020-12-30 更新
16
0
freococo/myanmar-written-corpus
缅甸语
自然语言处理
缅甸书面语料库是一个包含高质量缅甸书面文本的全面集合,用于支持缅甸自然语言处理(NLP)的研究和开发。该语料库包含1000万句文本,采用Parquet格式,并遵循CC0 1.0许可协议。它适用于训练NLP模型、文本转语音、自动语音识别、机器翻译和文本生成等多种应用。
Hugging Face
2025-05-22 更新
7
0
Thanmay/xquad-hi
跨语言问答评估
自然语言处理
该数据集包含多个特征,如id、标题、上下文、问题、答案、答案起始位置、类别、聚类、最近聚类和最近页面。这些特征以不同的数据类型存储,包括字符串、整数序列和结构化数据。数据集仅包含一个验证集,大小为36745196字节,包含1190个示例。数据集的下载大小为1189437字节。
Hugging Face
2024-06-28 更新
19
0
Text-to-SQL Dataset
自然语言处理
SQL转换
该数据集包含了超过2万个样本,旨在将自然语言查询转换为SQL命令,以提高SQL生成的效率。它是Spider家族基准测试的一部分,用于文本到SQL转换的任务。
arXiv
14
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广