Multi-Crit
收藏资源简介:
Multi-Crit是首个专门设计用于评估多模态判断模型是否能够遵循多样化、细粒度评估标准并提供可靠标准级别判断的基准测试。它为每对候选模型响应提供多标准人类偏好注释,并引入额外指标来评估LMM判断模型遵循多元标准以及处理标准级别权衡和冲突的能力。Multi-Crit提供了一个具有挑战性的测试套件,用于严格研究和改进多模态判断模型的可靠性和可操控性。
Multi-Crit is the first benchmark specifically designed to evaluate whether multimodal judgment models can adhere to diverse, fine-grained evaluation criteria and provide reliable criterion-level judgments. It provides multi-criteria human preference annotations for each pair of candidate model responses, and introduces additional metrics to assess the ability of LMM-based judgment models to follow multiple criteria and handle trade-offs and conflicts between different criteria. Multi-Crit offers a challenging test suite for rigorous research into and improvement of the reliability and controllability of multimodal judgment models.
Multi-Crit 数据集概述
数据集简介
Multi-Crit是首个专门设计用于评估多模态评判模型是否能够遵循多样化、细粒度评估标准并提供可靠标准级别判断的基准。该数据集提供每对候选模型响应的多标准人类偏好标注,并引入额外指标来评估LMM评判器遵循多元标准的能力以及处理标准级别权衡和冲突的能力。
核心特性
评估范围覆盖
- 开放式内容生成:响应为自由形式,传统固定指标有限
- 可验证推理任务:评判模型评估导致客观可验证答案的模型生成推理过程的质量
评估标准体系
开放式任务标准
- 完整性与覆盖度:处理用户查询中任务的全部范围
- 视觉基础与细节:引用图像中可观察元素
- 事实性/无幻觉:避免视觉或事实错误
- 创造力与表达力:展示想象力和原创性
- 清晰度与连贯性:清晰逻辑地传达思想
推理任务标准
- 视觉基础:引用重要视觉元素
- 逻辑连贯性与一致性:遵循清晰逐步逻辑
- 事实性/无幻觉:确保所有声明的准确性
- 反思与探索:通过反思展示推理深度
- 简洁性与效率:保持简洁专注
数据规模与构成
- 425个多模态提示:来自8个评估源
- 响应对:来自11个现成LMMs
- 1,425个标准级别人类判断:
- 1,000个用于开放式任务
- 425个用于可验证推理任务
- 782个标准级别冲突案例:两个标准偏好不同响应
评估指标
核心指标
- 多元准确率:评判器为每个评估实例获得所有标准正确的程度
- 权衡敏感性:评判器在人类意见分歧时检测至少一个标准级别权衡的能力
- 冲突匹配率:评判器正确解决每个冲突标准对的能力
数据获取与使用
数据文件结构
datasets/ ├── images/ ├── multi-crit-openEnded-flatten.jsonl # 开放式分割数据 └── multi-crit-reasoning-flatten.jsonl # 推理分割数据
数据格式
数据采用JSONL格式,包含以下关键字段:
question_id:问题标识符image_path:图像路径split:数据分割类型criterion:评估标准preference:偏好选择critic:评判器输出
相关资源
- 项目网页:https://multi-crit.github.io
- 数据集地址:https://huggingface.co/datasets/txiong23/multi-crit/




