遇见数据集

DADIT

收藏
arXiv2024-03-09 更新2024-06-21 收录
数据链接:
官方服务:

资源简介:

DADIT数据集是由博科尼大学创建的一个包含20,000个意大利Twitter用户及其3000万条推文的数据集。该数据集不仅包括用户的个人简介和头像,还提供了高质量的性别、年龄和地理位置标签,其中43%的用户有地理位置信息。数据集的创建过程涉及通过Twitter API收集数据,并手动验证性别和年龄标签的准确性。DADIT数据集主要用于训练和比较不同性别和年龄预测模型的性能,特别是在社交媒体用户的人口统计分类任务中。

The DADIT dataset, developed by Bocconi University, is a collection of 20,000 Italian Twitter users and their 30 million tweets. In addition to users' profile information and profile pictures, the dataset provides high-quality demographic labels including gender, age, and geographic location, with 43% of the users having associated geographic location data. The construction of the DADIT dataset involved data collection via the Twitter API and manual verification of the accuracy of the gender and age labels. The DADIT dataset is mainly used for training and comparing the performance of different gender and age prediction models, particularly in demographic classification tasks for social media users.

提供机构:
博科尼大学
创建时间:
2024-03-09
搜集汇总
数据集介绍
构建方式
DADIT数据集的构建始于2023年初,通过Twitter API采集了802位意大利政治人物的关注者用户ID,共获得320万个唯一用户标识。随后,研究团队收集了这些用户的个人资料与推文,最终获取了约210万用户的8.301亿条推文。在标注阶段,基于用户全名中的意大利语性别特征,为130万用户标注了二元性别标签;通过正则表达式匹配个人简介或推文中提及的出生年份或年龄,为3.3万用户标注了年龄信息。此外,利用个人资料中的位置信息与意大利地区及市镇列表进行匹配,确定了部分用户的地理位置。最终,筛选出同时具备性别与年龄标签的近2万名用户,形成核心数据集。为确保标注质量,三名研究人员随机抽取了1200名用户的性别标签和350名用户的年龄标签进行人工校验,性别标注准确率超过99%,年龄标注准确率超过93%。
特点
DADIT数据集的核心特点在于其高标注质量与代表性。该数据集包含约2万名意大利Twitter用户的3000万条推文、个人简介及头像,并附有经过人工校验的性别、年龄及部分用户的地理位置标签。与现有工具不同,DADIT不仅涵盖传统的人口统计信息,还整合了用户的推文内容,这为探索文本信息在人口统计预测中的价值提供了独特资源。实验表明,基于推文与个人简介训练的文本分类器(如XLM)在性别和年龄预测上显著优于依赖头像的多模态模型M3,F1值最高提升53%。此外,数据集的用户分布与意大利Twitter整体人口统计特征高度吻合,确保了研究结论的泛化性。
使用方法
DADIT数据集适用于训练和评估人口统计分类模型,尤其是性别与年龄预测任务。使用时,可将用户的个人简介与最新推文拼接为连续文本,作为文本分类器的输入特征,避免使用用户名或年龄、出生年份等显式信息以模拟真实场景。推荐基于twitter-XLM-roberta-base等预训练语言模型进行微调,或结合M3(基于个人简介与头像)与XLM的预测结果构建集成学习器以提升性能。数据集已按85%、9.5%、5.5%划分为训练集、验证集和测试集,其中测试集用户均包含头像以确保多模态评估的完整性。代码与最佳模型已通过Hugging Face和GitHub公开,支持研究者复现实验或扩展至其他语言任务。
背景与挑战
背景概述
在计算社会科学领域,社交媒体数据为研究公众态度、信念与行为提供了宝贵资源,而用户人口统计学特征的精确分层是分析群体差异的关键。2024年,意大利博科尼大学的Lorenzo Lupo、Paul Bose、Mahyar Habibi、Dirk Hovy与Carlo Schwarz联合构建并发布了DADIT数据集,旨在解决意大利Twitter用户人口统计学分类中的数据稀缺问题。该数据集包含约2万名代表性意大利用户的3000万条推文、个人简介与头像,并附有经过人工验证的高质量性别、年龄及位置标签。DADIT的核心研究问题在于探究推文内容能否弥补传统基于个人资料分类方法的不足,其发布为多语言、多模态用户属性预测提供了重要基准,对推动社交媒体分析中的公平性与准确性具有深远影响。
当前挑战
DADIT面临的核心领域挑战在于用户人口统计学分类的准确性,尤其是年龄预测,因大量用户缺乏性别或年龄线索,传统基于资料图像或简介的模型(如M3)在信息缺失时性能骤降。构建过程中,数据集遭遇多重技术障碍:Twitter API在2023年初因平台政策变更而关闭,导致数据采集被迫中断;年龄标注仅能覆盖3.3万用户,远少于性别标注的130万,凸显自动化年龄推断的困难;此外,数据集需严格遵循GDPR规范,通过匿名化处理与推文ID脱水发布平衡隐私保护与科研可用性,同时确保样本对意大利Twitter总体的代表性,这对数据质量验证提出了严苛要求。
常用场景
经典使用场景
在计算社会科学领域,DADIT数据集为研究者提供了一个极具价值的资源,用于探索意大利Twitter用户的性别、年龄和地理位置等人口统计学特征。其经典使用场景在于训练和评估基于文本与多模态信息的用户属性分类模型。通过整合用户发布的推文内容、个人简介及头像,DADIT支持对传统仅依赖用户档案信息的分类方法进行系统性改进,尤其适用于缺乏完整档案信息时的人口统计推断研究。
解决学术问题
DADIT数据集有效解决了社交媒体用户人口统计学属性自动标注的学术难题。传统方法如M3分类器依赖用户姓名、头像等档案信息,但在大量用户缺失这些信息时性能骤降。DADIT通过提供大规模、高质量标注的推文文本,证明了推文内容在性别和年龄预测中的关键作用。其基于XLM的文本分类器较M3在F1分数上提升高达53%,揭示了文本特征在人口统计推断中的核心价值,推动了计算语言学与社会科学的交叉研究。
衍生相关工作
DADIT数据集催生了多项经典衍生工作,包括对多模态融合方法的深入探索。研究者基于该数据集训练了集成XLM与M3的混合模型,在性别预测上取得90.8%的F1分数。此外,工作延伸至跨语言泛化验证——仅使用意大利语微调的XLM模型在德语测试集上仍达到年龄预测最优性能,凸显了多语言模型的迁移潜力。后续研究还探讨了分类质量与覆盖率之间的权衡,通过置信度阈值控制实现了高精度推断,为实际部署提供了灵活策略。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务