D-HUMOR
收藏资源简介:
D-HUMOR是一个包含4,379个Reddit表情包的多模态数据集,专门用于黑色幽默理解研究。数据集标注了黑色幽默内容、目标类别(性别、心理健康、暴力、种族、残疾等)以及三级强度评级(轻度、中度、严重)。该数据集支持三个子任务:黑色幽默识别、目标识别和强度分类
D-HUMOR is a multimodal dataset containing 4,379 Reddit memes, specifically designed for dark humor comprehension research. It is annotated with dark humor content, target categories (including gender, mental health, violence, race, disability, etc.), and three-level intensity ratings (mild, moderate, severe). This dataset supports three subtasks: dark humor recognition, target recognition, and intensity classification.
D-HUMOR 数据集概述
数据集简介
D-HUMOR 是一个专注于暗黑幽默理解的多模态开放推理数据集,包含 4,379 个来自 Reddit 的模因(meme)样本。该数据集旨在促进多模态幽默理解和内容审核的研究。
核心贡献
- 新颖数据集:提出了一个关于暗黑幽默的新数据集,收集自 Reddit。
- 角色反转自循环优化:引入一种提示技术,使大型语言模型(LLM)能够像帖子作者一样思考,从而改善 LLM 对齐以生成更好的解释。
- 三流交叉推理网络(TCRNet):开发了一个推理增强框架,用于增强对暗黑幽默内容的理解和处理。
子任务
数据集包含三个评估暗黑幽默理解的子任务:
- 暗黑幽默识别(是/否):二分类任务,判断帖子是否包含暗黑幽默。
- 目标识别:六分类任务,识别帖子中针对的目标类别:
- 性别/性相关话题
- 心理健康
- 残疾
- 种族/民族
- 暴力/死亡
- 其他(不属于以上类别的帖子)
- 强度分类:幽默强度级别:轻度(1)、中度(2)、重度(3)。
数据集访问
由于暗黑幽默内容的敏感性,D-Humor 数据集仅在严格条件下共享:
- 访问仅限学术和研究目的(非商业用途)。
- 数据集不得公开重新分发或上传至第三方平台。
- 用户必须确保数据的道德处理和保密性。
数据集源自 Reddit 上公开可用的模因。请求或使用该数据集即表示同意:
- 遵守 Reddit 的内容和 API 政策。
- 尊重道德研究指南,包括非商业使用和不重新分发。
- 负责任地使用数据集,理解其敏感性和潜在冒犯性。
访问请求
访问仅在完成 D-Humor 数据集访问协议表格后授予,以确保责任和正确使用:
- 协议表格(PDF):https://drive.google.com/file/d/1rWRuUamn21nNbOUP7703GAFXr8KbjH-Y/view?usp=sharing
- 请求表格:https://forms.gle/t9ynkpq4XGd8Kp93A
批准后,用户将收到数据集及使用说明。




