遇见数据集

ADIMA

收藏
OpenDataLab2026-07-12 更新2024-05-09 收录
官方服务:

资源简介:

ADIMA是一个新颖的,语言多样,伦理来源,专家注释和平衡良好的多语言亵渎检测音频数据集,包含10种印度语言的11,775个音频样本,历时65小时,由6,446个唯一用户说。

ADIMA is a novel, language-diverse, ethically sourced, expert-annotated, and well-balanced multilingual profanity detection audio dataset, consisting of 11,775 audio samples across 10 Indian languages, with a total duration of 65 hours of speech, and uttered by 6,446 unique speakers.

提供机构:
OpenDataLab
创建时间:
2022-06-07
搜集汇总
数据集介绍
ADIMA 数据集图片
背景与挑战
背景概述
ADIMA是一个用于多语言亵渎检测的音频数据集,包含10种印度语言的11,775个样本,总计65小时,由6,446名唯一用户录制。该数据集具有语言多样、伦理来源和专家注释的特点,于2022年发布。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务