cis-lmu/udhr-lid
收藏资源简介:
UDHR-LID数据集是基于《世界人权宣言》(UDHR)构建的语言识别数据集。该数据集经过清理和筛选,去除了无关的语言文本和错误数据,保留了具有丰富语言内容的段落。数据集主要用于语言识别任务,建议作为测试集而非训练集使用。数据集包含多种语言,每个数据行都属于确定的语言,并且经过清理,具有丰富的语言内容。
The UDHR-LID dataset is a language identification dataset constructed based on the Universal Declaration of Human Rights (UDHR). This dataset has been cleaned and filtered, removing irrelevant linguistic texts and erroneous data while preserving paragraphs with rich linguistic content. It is primarily designed for language identification tasks, and it is recommended to use it as a test set rather than a training set. The dataset includes multiple languages, where each data row belongs to a confirmed language, and has been cleaned to contain rich linguistic content.
UDHR-LID 数据集概述
数据集信息
许可证
- 数据集遵循 cc0-1.0 许可证。
配置
- 默认配置包含一个数据文件:
- 分割:测试
- 路径:
udhr-lid.csv
多语言性
- 数据集支持多语言。
语言列表
- 数据集包含以下语言:
- tir, rmn, arb, mxv, mal, fij, som, cot, fur, vie, zlm, bam, chr, maz, yad, ztu, ykg, ccp, alt, ayr, njo, bci, gyr, run, haw, rgn, cak, kwi, fra, agr, duu, ilo, nhn, kdh, cnh, bod, mya, ady, pol, ydd, cos, lot, arl, glv, gag, bfa, afr, lij, zlm, ibb, toi, tzm, ron, ojb, san, eng, bum, pam, kqs, dje, auc, smo, por, fry, lad, pov, tyv, guc, huu, ese, kbp, eve, yrk, lin, tdt, qvc, top, nav, twi, oss, lia, ame, hun, lit, que, qug, nku, csa, lao, knc, kjh, jav, mam, ita, ppl, aar, tbz, ssw, bug, srp, kaz, min, mad, orh, tgk, kat, uig, tzo, hat, shn, kbd, niv, idu, krl, abk, mto, gla, ijs, cri, uzn, tah, tob, kir, quy, hnj, srr, lvs, nan, hns, snk, swh, ekk, guu, div, dzo, spa, hms, ell, ace, war, ind, cjy, cfm, nds, ewe, tel, src, fuf, vmw, zro, men, kqn, nzi, taj, khk, ddn, nso, mxi, pon, fvr, hau, ktu, tem, yor, pnb, ltz, evn, cjs, nba, niu, dan, acu, zgh, chj, heb, lua, quz, uig, cbi, jav, cpu, wuu, mah, kmb, mcd, ben, lus, ajg, azj, tha, dga, isl, sus, fuf, fkv, jiv, mor, nio, als, buc, kde, nbl, ceb, ven, sun, cbt, swb, tur, dyo, sin, pbu, ada, pap, qvh, loz, pan, qva, sme, bax, tuk, hsb, hus, qvn, ban, cha, zyb, hin, tat, uzn, qxu, gej, quc, mnw, bho, udu, kha, kbr, tsz, pau, mkd, shp, ike, lue, tgl, yap, yua, koi, hrv, emk, tet, ndo, cbu, vep, cmn, sag, nym, rus, gjn, guk, kri, ote, lun, vai, bis, arn, tsn, gle, hak, gkp, ura, tca, xho, wln, amc, mos, lld, bul, qxn, bcl, ctd, dip, dag, kek, bre, mri, fin, sah, cym, kan, fao, gsw, sey, bem, bos, bin, chv, tpi, ami, oaa, lob, ast, nno, sco, tuk, khm, pes, pbb, tam, ibo, san, sid, plt, guj, hsn, kin, lug, slr, koo, xsm, jpn, oki, deu, rar, pcm, hni, vec, gld, sot, crs, fuv, srp, npi, nya, kea, blt, roh, cbr, chk, kal, mfq, quh, kor, slv, cof, shk, zul, qwh, fon, mic, prs, mag, bel, iii, mar, dyu, boa, swe, pis, mlt, amh, umb, cnr, mai, toj, csw, ina, bba, cbs, kng, oci, pcd, miq, lat, qvm, wwa, bos, urd, kmr, ido, gaa, epo, gaz, cat, hye, cni, suk, gug, gan, cjk, tzh, zam, ces, cic, mcf, not, kaa, tso, piu, fat, mzi, snn, tly, eus, nld, nob, wol, hlt, sna, tiv, ton, hea, skr, lns, rup, cab, glg, tgl, yao, nyn, aii, tzm, slk, ukr, kkh, zdj, amr, yue, crh, hil, tags: UDHR, udhr, language identification, LID, glot, GlotLID, pretty_name: UDHR-LID
数据集清理
- 数据集从 XML 文件中清理并筛选出段落。
- 移除了无关语言文本和不正确的案例。
- 删除的文件包括:
- ckb_Latn (阿拉伯语在使用)
- azb_Latn (阿拉伯语在使用)
- khk_Mong (西里尔字母在使用,但内蒙古的其他蒙古语方言使用蒙古文书写系统)
- vie_Hani (拉丁字母在使用)
数据集用途
- 数据集适用于语言识别评估任务。
- 建议将 UDHR 作为测试或验证集,而不是训练集。
下载方式
-
可通过 Hugging Face 数据加载器下载: python from datasets import load_dataset dataset = load_dataset(cis-lmu/udhr-lid, split=test) print(dataset[0]) # 第一行数据
-
也可直接下载 CSV 文件或克隆整个仓库。
引用
- 如果使用该数据集,请引用相关文献和 UDHR 来源。




