登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
WikiText-TL-39
WikiText-TL-39
收藏
OpenXLab
2026-04-18 收录
菲律宾语
自然语言处理基准
数据链接:
https://openxlab.org.cn/datasets/OpenDataLab/WikiText-TL-39
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
WikiText-TL-39 是菲律宾语的基准语言建模数据集,在训练集中有 3900 万个标记。
应用场景:
提供机构:
OpenDataLab
创建时间:
2022-05-24
相关数据集
MultiviewX
行人检测
计算机视觉
MultiviewX 是一个合成的 Multiview 行人检测数据集。它是在 Unity 中使用 PersonX 的行人模型构建的。 MultiviewX 数据集覆盖 16 米 x 25 米的正方形。地平面被量化为 640x1000 网格。 MultiviewX 数据集中有 6 个具有重叠视野的摄像机,每个摄像机输出一个 1080x1920 分辨率的图像。平均而言,4.41 个摄像头覆盖同一位置
OpenDataLab
2026-07-12 更新
45
0
aidatatang
中文文字识别
声纹识别
aidatatang语料库的内容和相应的描述包括: 语料库包含200小时的声学数据,主要是移动记录的数据。 邀请了来自中国不同口音地区的600位演讲者参与录音。 每个句子的转录准确率大于 98%。 录音在安静的室内环境中进行。 数据库按7:1:2的比例分为训练集、验证集和测试集。 语音数据编码和说话人信息等详细信息保留在元数据文件中。 还提供了分段的成绩单。 该语料库旨在支持语音识别、机器翻译、声
OpenXLab
19
0
VOICES (Voices Obscured In Complex Environmental Settings)
远场语音识别
嘈杂环境语音增强
VOICES 语料库是一个数据集,用于促进对远场麦克风在嘈杂的房间条件下录制的语音进行语音和信号处理研究。对于这个语料库,音频是在带家具的房间中录制的,背景噪音与从 LibriSpeech 语料库中选择的前景语音一起播放。每个房间都记录了多个会话,以适应所有前景语音-背景噪声组合。使用放置在整个房间的 12 个麦克风录制音频,每个麦克风可录制 120 小时的音频。
OpenXLab
6
0
CompGuessWhat?!
图像识别
自然语言处理
CompGuess什么?!扩展了原来的 GuessWhat?!具有丰富语义表示的数据集,以场景图的形式与用作猜谜游戏的参考场景的每个图像相关联。
OpenDataLab
2026-07-12 更新
27
0
RuShiftEval
自然语言处理
语义变化
RuShiftEval 是一个手动注释的俄语词汇语义变化数据集。它的新颖性是通过一组目标词来确保其跨三个时间段的历时语义变化而注释的,而之前的工作要么仅使用两个时间段,要么使用不同的目标词集。
OpenDataLab
2026-07-12 更新
11
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广