Ego4D-M & EPIC-KITCHENS-M
收藏资源简介:
我们贡献了MisEngine,一个可扩展的数据引擎,产生了Ego4D-M(257K)和EPIC-KITCHENS-M(221K)数据集。这些数据集用于细粒度理解人类在自我中心视频中的错误。
We contribute MisEngine, a scalable data engine that generates the Ego4D-M (257K) and EPIC-KITCHENS-M (221K) datasets. These datasets enable fine-grained understanding of human errors in egocentric videos.
数据集概述
数据集基本信息
- 数据集名称: MATT (Mistake Attribution)
- 关联任务: 第一人称视频中的细粒度错误理解(Mistake Attribution)
- 来源论文: CVPR 2026 - "Mistake Attribution: Fine-Grained Mistake Understanding in Egocentric Videos"
- 论文地址: https://arxiv.org/abs/2511.20525
- 项目主页: https://yayuanli.github.io/MATT/
- 许可证: MIT
包含的数据集
本项目通过数据引擎 MisEngine 构建了以下两个核心数据集:
- Ego4D-M: 包含 257K 样本。
- EPIC-KITCHENS-M: 包含 221K 样本。
数据标注与类别
- 标注目标: 超越检测错误是否发生,旨在将错误归因于:
- What: 违反了哪个语义角色。
- When: 偏差在何时变得不可逆转(不可返回点,Point-of-No-Return)。
- Where: 错误出现在帧中的哪个位置。
- 标签类别: 数据生成脚本产生的样本包含四种类别标签:
标签 含义 0 对齐(无错位) 1 动词错位 2 参数错位 3 动词和参数均错位
数据来源与处理
数据集基于以下现有第一人称视频数据集,通过程序化生成语义角色错位样本进行增强:
- Ego4D
- EgoPER
- EPIC-Kitchens
- HoloAssist
数据构建流程 (MisEngine)
每个数据集的处理流程均涉及解析原始标注、运行语义角色标注(SRL)以提取动词/参数对、生成平衡的错位样本,并创建训练/验证/测试分割。
数据获取与准备
- 数据集地址: https://huggingface.co/datasets/yayuanli/MATT-Bench
- 帧提取: 使用各数据集目录下提供的脚本从视频中提取帧,并组织成模型数据加载器要求的特定目录结构。
关联模型
- 核心模型: MisFormer,一个在所有权责归属子任务上均优于特定任务SOTA方法的统一模型。
- 模型获取: 评估脚本会自动从 Hugging Face (
mistakeattribution/<dataset>) 下载相应的模型检查点。 - 视觉骨干网络: 依赖于预训练的 LaViLa 模型检查点。
引用
bibtex @inproceedings{li2026mistakeattribution, title = {Mistake Attribution: Fine-Grained Mistake Understanding in Egocentric Videos}, author = {Li, Yayuan and Jain, Aadit and Bellos, Filippos and Corso, Jason J.}, booktitle = {Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)}, year = {2026}, }




