遇见数据集

SEACrowd/uit_victsd

收藏
Hugging Face2024-06-24 更新2024-06-29 收录
官方服务:

资源简介:

--- license: unknown language: - vie pretty_name: Uit Victsd task_categories: - intent-classification - abusive-language-prediction tags: - intent-classification - abusive-language-prediction --- The UIT-ViCTSD (Vietnamese Constructive and Toxic Speech Detection dataset) is a compilation of 10,000 human-annotated comments intended for constructive and toxic comments detection. The dataset spans 10 domains, reflecting the diverse topics and expressions found in social media interactions among Vietnamese users. ## Languages vie ## Supported Tasks Intent Classification, Abusive Language Prediction ## Dataset Usage ### Using `datasets` library ``` from datasets import load_dataset dset = datasets.load_dataset("SEACrowd/uit_victsd", trust_remote_code=True) ``` ### Using `seacrowd` library ```import seacrowd as sc # Load the dataset using the default config dset = sc.load_dataset("uit_victsd", schema="seacrowd") # Check all available subsets (config names) of the dataset print(sc.available_config_names("uit_victsd")) # Load the dataset using a specific config dset = sc.load_dataset_by_config_name(config_name="<config_name>") ``` More details on how to load the `seacrowd` library can be found [here](https://github.com/SEACrowd/seacrowd-datahub?tab=readme-ov-file#how-to-use). ## Dataset Homepage [https://github.com/tarudesu/ViCTSD](https://github.com/tarudesu/ViCTSD) ## Dataset Version Source: 1.0.0. SEACrowd: 2024.06.20. ## Dataset License Unknown (unknown) ## Citation If you are using the **Uit Victsd** dataloader in your work, please cite the following: ``` @inproceedings{, author = {Nguyen, Luan Thanh and Van Nguyen, Kiet and Nguyen, Ngan Luu-Thuy}, title = {Constructive and Toxic Speech Detection for Open-domain Social Media Comments in Vietnamese}, booktitle = {Advances and Trends in Artificial Intelligence. Artificial Intelligence Practices}, year = {2021}, publisher = {Springer International Publishing}, address = {Kuala Lumpur, Malaysia}, pages = {572--583}, } @article{lovenia2024seacrowd, title={SEACrowd: A Multilingual Multimodal Data Hub and Benchmark Suite for Southeast Asian Languages}, author={Holy Lovenia and Rahmad Mahendra and Salsabil Maulana Akbar and Lester James V. Miranda and Jennifer Santoso and Elyanah Aco and Akhdan Fadhilah and Jonibek Mansurov and Joseph Marvin Imperial and Onno P. Kampman and Joel Ruben Antony Moniz and Muhammad Ravi Shulthan Habibi and Frederikus Hudi and Railey Montalan and Ryan Ignatius and Joanito Agili Lopo and William Nixon and Börje F. Karlsson and James Jaya and Ryandito Diandaru and Yuze Gao and Patrick Amadeus and Bin Wang and Jan Christian Blaise Cruz and Chenxi Whitehouse and Ivan Halim Parmonangan and Maria Khelli and Wenyu Zhang and Lucky Susanto and Reynard Adha Ryanda and Sonny Lazuardi Hermawan and Dan John Velasco and Muhammad Dehan Al Kautsar and Willy Fitra Hendria and Yasmin Moslem and Noah Flynn and Muhammad Farid Adilazuarda and Haochen Li and Johanes Lee and R. Damanhuri and Shuo Sun and Muhammad Reza Qorib and Amirbek Djanibekov and Wei Qi Leong and Quyet V. Do and Niklas Muennighoff and Tanrada Pansuwan and Ilham Firdausi Putra and Yan Xu and Ngee Chia Tai and Ayu Purwarianti and Sebastian Ruder and William Tjhi and Peerat Limkonchotiwat and Alham Fikri Aji and Sedrick Keh and Genta Indra Winata and Ruochen Zhang and Fajri Koto and Zheng-Xin Yong and Samuel Cahyawijaya}, year={2024}, eprint={2406.10118}, journal={arXiv preprint arXiv: 2406.10118} } ```

UIT-ViCTSD(越南建设性和有毒言论检测数据集)是一个包含10,000条人工标注评论的集合,旨在用于建设性和有毒评论的检测。该数据集涵盖了10个领域,反映了越南用户在社交媒体互动中的多样化话题和表达方式。数据集支持的任务包括意图分类和辱骂语言预测。

提供机构:
SEACrowd
原始信息汇总

Uit Victsd 数据集概述

数据集名称

Uit Victsd (Vietnamese Constructive and Toxic Speech Detection dataset)

数据集描述

Uit Victsd 是一个包含10,000条人工标注评论的数据集,用于检测建设性和有毒评论。该数据集涵盖10个领域,反映了越南用户在社交媒体互动中的多样化主题和表达方式。

语言

越南语 (vie)

支持的任务

  • 意图分类 (Intent Classification)
  • 辱骂语言预测 (Abusive Language Prediction)

数据集版本

  • 源版本: 1.0.0
  • SEACrowd版本: 2024.06.20

数据集许可证

未知 (Unknown)

引用

如果使用 Uit Victsd 数据集,请引用以下内容:

@inproceedings{, author = {Nguyen, Luan Thanh and Van Nguyen, Kiet and Nguyen, Ngan Luu-Thuy}, title = {Constructive and Toxic Speech Detection for Open-domain Social Media Comments in Vietnamese}, booktitle = {Advances and Trends in Artificial Intelligence. Artificial Intelligence Practices}, year = {2021}, publisher = {Springer International Publishing}, address = {Kuala Lumpur, Malaysia}, pages = {572--583}, }

@article{lovenia2024seacrowd, title={SEACrowd: A Multilingual Multimodal Data Hub and Benchmark Suite for Southeast Asian Languages}, author={Holy Lovenia and Rahmad Mahendra and Salsabil Maulana Akbar and Lester James V. Miranda and Jennifer Santoso and Elyanah Aco and Akhdan Fadhilah and Jonibek Mansurov and Joseph Marvin Imperial and Onno P. Kampman and Joel Ruben Antony Moniz and Muhammad Ravi Shulthan Habibi and Frederikus Hudi and Railey Montalan and Ryan Ignatius and Joanito Agili Lopo and William Nixon and Börje F. Karlsson and James Jaya and Ryandito Diandaru and Yuze Gao and Patrick Amadeus and Bin Wang and Jan Christian Blaise Cruz and Chenxi Whitehouse and Ivan Halim Parmonangan and Maria Khelli and Wenyu Zhang and Lucky Susanto and Reynard Adha Ryanda and Sonny Lazuardi Hermawan and Dan John Velasco and Muhammad Dehan Al Kautsar and Willy Fitra Hendria and Yasmin Moslem and Noah Flynn and Muhammad Farid Adilazuarda and Haochen Li and Johanes Lee and R. Damanhuri and Shuo Sun and Muhammad Reza Qorib and Amirbek Djanibekov and Wei Qi Leong and Quyet V. Do and Niklas Muennighoff and Tanrada Pansuwan and Ilham Firdausi Putra and Yan Xu and Ngee Chia Tai and Ayu Purwarianti and Sebastian Ruder and William Tjhi and Peerat Limkonchotiwat and Alham Fikri Aji and Sedrick Keh and Genta Indra Winata and Ruochen Zhang and Fajri Koto and Zheng-Xin Yong and Samuel Cahyawijaya}, year={2024}, eprint={2406.10118}, journal={arXiv preprint arXiv: 2406.10118} }

搜集汇总
数据集介绍
构建方式
UIT-ViCTSD(越南语建设性与有害言论检测数据集)是一项针对社交媒体评论中建设性与有害言论识别的研究成果。该数据集由10000条经过人工标注的越南语评论构成,覆盖了10个不同领域,旨在反映越南用户在网络互动中的多样化话题与表达方式。其构建过程严格遵循标注标准,确保每条评论的类别标签真实可靠,为后续的意图分类与有害语言预测任务提供了高质量的基础数据。
特点
该数据集的核心特点在于其双任务设计,同时支持意图分类与有害语言预测,适用于多维度分析越南语社交媒体文本。数据集涵盖了10个领域,具有广泛的代表性,能够捕捉不同语境下的语言变体与表达特征。此外,所有评论均经过人工标注,确保了标签的准确性与一致性,为研究越南语中的建设性对话与有害内容检测提供了稀缺的标注资源。
使用方法
研究者可通过HuggingFace的datasets库便捷加载该数据集,使用load_dataset函数指定数据集名称即可获取。此外,SEACrowd库也提供了兼容接口,支持通过seacrowd.load_dataset加载,并可查看所有可用的配置名称。用户可根据具体任务选择默认配置或指定子集,灵活适用于意图分类与有害语言预测等场景。详细的使用指南可在SEACrowd数据集的官方文档中查阅。
背景与挑战
背景概述
在社交媒体日益普及的背景下,网络言论的治理成为自然语言处理领域的重要议题。越南语作为一种低资源语言,其有害言论检测研究长期受限于标注数据的匮乏。在此背景下,由Luan Thanh Nguyen、Kiet Van Nguyen和Ngan Luu-Thuy Nguyen等研究人员于2021年构建的UIT-ViCTSD数据集应运而生。该数据集汇集了10,000条人工标注的越南语社交媒体评论,覆盖十大领域,旨在同时支持建设性言论与有害言论的二元分类任务。作为越南语领域首个兼具意图分类与辱骂性语言预测功能的公开数据集,UIT-ViCTSD为东南亚语言安全研究提供了关键基准,其发布显著推动了低资源语言中网络言论治理技术的进展。
当前挑战
UIT-ViCTSD数据集面临的核心挑战在于越南语社交媒体言论的复杂性:同一表达在不同语境中可能兼具建设性与攻击性,导致分类边界模糊。此外,数据集虽覆盖十大领域,但各领域样本分布不均,部分小众话题的标注数量有限,可能影响模型泛化能力。构建过程中,人工标注的歧义性是另一大难点,标注者需在文化背景差异下判断言论意图,一致性难以保证。同时,网络用语中大量存在的缩写、表情符号及语法变异,进一步增加了预处理与特征提取的难度。这些挑战共同制约了模型在真实场景中的鲁棒性,亟需更精细化的标注策略与多模态融合方法的介入。
常用场景
经典使用场景
在越南语社交媒体内容分析的广阔图景中,UIT-ViCTSD数据集作为一座精心构建的桥梁,连接了自然语言处理与网络言论治理的交叉领域。其最经典的使用场景聚焦于建设性与毒性言论的二元及多分类任务,研究者可基于该数据集训练模型以精准区分建设性批评与恶意攻击,从而为越南语社交平台的内容审核提供核心算法支撑。
解决学术问题
该数据集系统性地回应了低资源语言中建设性与毒性言论自动检测的学术困境。通过覆盖10个领域的10,000条人工标注评论,它解决了越南语社交媒体语境下言论分类缺乏高质量基准数据的瓶颈问题,推进了跨领域、多主题的言论理解研究,并为东南亚语言的情感分析与仇恨言论检测领域树立了重要标杆。
衍生相关工作
围绕UIT-ViCTSD已衍生出多项代表性工作,包括基于多任务学习的言论分类框架、融合越南语词性特征的深度模型,以及跨语言零样本迁移的毒性检测研究。这些工作不仅验证了数据集在越南语场景下的有效性,更推动了东南亚低资源语言在言论治理、社会计算等交叉领域的学术探索,形成了从数据到理论再到应用的闭环创新链条。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务