MMLA
收藏资源简介:
MMLA是一个综合性的多模态语言分析基准,旨在评估基础模型在理解人类对话语义方面的能力。它包含超过61K的多模态话语,覆盖六个核心维度:意图、情感、对话行为、情感、说话风格和沟通行为。数据集来自多种来源,包括电影、电视剧、YouTube、Vimeo、Bilibili、TED等。
MMLA is a comprehensive multimodal language analysis benchmark designed to evaluate the capability of foundation models in understanding the semantics of human conversations. It contains over 61K multimodal utterances, covering six core dimensions: intent, emotion, conversational behavior, sentiment, speaking style, and communicative behavior. The dataset is sourced from diverse origins including films, TV series, YouTube, Vimeo, Bilibili, TED and more.
MMLA 数据集概述
数据集简介
- 名称: MMLA (Multimodal Language Analysis Benchmark)
- 目的: 评估多模态大语言模型(MLLMs)在理解人类对话中高级语义的能力
- 特点:
- 包含超过61K多模态话语样本
- 覆盖舞台和真实场景
- 包含6个核心语义维度
核心语义维度
- 意图(Intent)
- 情感(Emotion)
- 对话行为(Dialogue Act)
- 情感倾向(Sentiment)
- 说话风格(Speaking Style)
- 交流行为(Communication Behavior)
数据来源
- 样本数量: 61K+
- 模态: 3种
- 视频时长: 76.6小时
- 来源类型:
- 电影
- 电视剧
- YouTube/Vimeo/Bilibili/TED视频
- 即兴剧本
评估数据集
| 维度 | 数据集 | 来源 |
|---|---|---|
| Intent | MIntRec, MIntRec2.0 | ACM MM 2022, ICLR 2024 |
| Emotion | MELD, IEMOCAP | ACL 2019, Language Resources and Evaluation 2008 |
| Dialogue Act | MELD-DA, IEMOCAP-DA | ACL 2020 |
| Sentiment | MOSI, CH-SIMS v2.0 | IEEE Intelligent Systems 2016, ICMI 2022 |
| Speaking Style | UR-FUNNY-v2, MUStARD | ACL 2019 |
| Communication Behavior | Anno-MI (client/therapist) | ICASSP 2022 |
评估模型
大语言模型(LLMs)
- Qwen2 (0.5B/1.5B/7B)
- Llama3 (8B)
- InternLM2.5 (7B)
多模态大语言模型(MLLMs)
- VideoLLaMA2 (7B)
- Qwen2-VL (7B/72B)
- LLaVA-Video (7B/72B)
- LLaVA-OneVision (7B/72B)
- MiniCPM-V-2.6 (8B)
评估方法
- 零样本推理(Zero-shot Inference)
- 监督微调(Supervised Fine-tuning)
- 指令微调(Instruction Tuning)
主要结果
零样本推理排名
- GPT-4o (52.60% ACC)
- Qwen2-VL-72B (52.55% ACC)
- LLaVA-OV-72B (52.44% ACC)
监督微调/指令微调排名
- Qwen2-VL-72B (SFT, 69.18% ACC)
- MiniCPM-V-2.6-8B (SFT, 68.88% ACC)
- LLaVA-Video-72B (IT, 68.87% ACC)
引用信息
bibtex @article{zhang2025mmla, author={Zhang, Hanlei and Li, Zhuohang and Zhu, Yeshuang and Xu, Hua and Wang, Peiwu and Zhu, Haige and Zhou, Jie and Zhang, Jinchao}, title={Can Large Language Models Help Multimodal Language Analysis? MMLA: A Comprehensive Benchmark}, year={2025}, journal={arXiv preprint arXiv:2504.16427}, }




