HoliSafe
收藏资源简介:
HoliSafe是一个全面的安全调整数据集和基准,用于视觉语言模型(VLMs),涵盖了所有五种安全/不安全的图像-文本组合,为训练和评估提供了更坚实的基础。
HoliSafe is a comprehensive safety adjustment dataset and benchmark designed for Visual Language Models (VLMs), encompassing all five combinations of safe/unsafe image-text pairs, providing a more solid foundation for training and evaluation.
HoliSafe数据集概述
基本信息
- 数据集名称: HoliSafe
- 论文标题: HoliSafe: Holistic Safety Benchmarking and Modeling with Safety Meta Token for Vision-Language Model
- 论文链接: https://www.arxiv.org/pdf/2506.04704
- 作者: Youngwan Lee, Kangsan Kim, Kwanyong Park, Ilchae Jung, Sujin Jang, Seanie Lee, Young-Ju Lee, Sung Ju Hwang
- 机构: ETRI, KAIST, UOS, DeepAuto.ai
- 主页: https://youngwanlee.github.io/holisafe
- 数据集链接: https://huggingface.co/datasets/etri-vilab/holisafe (即将发布)
数据集简介
- 目的: 为视觉语言模型(VLMs)提供全面的安全调优数据集和基准测试。
- 特点:
- 涵盖所有五种安全/不安全的图像-文本组合。
- 提供更稳健的训练和评估基础。
- 相关模型: SafeLLaVA,一种配备安全元标记和安全头的新型VLM。
数据集统计
| 数据集 | 图像数量 | 问答数量 | U<sub>I</sub>U<sub>T</sub> | U<sub>I</sub>S<sub>T</sub> | S<sub>I</sub>U<sub>T</sub> | S<sub>I</sub>S<sub>T</sub>→U | S<sub>I</sub>S<sub>T</sub>→S |
|---|---|---|---|---|---|---|---|
| HoliSafe-Bench | 1,779 | 4,163 | ✅ | ✅ | ✅ | ✅ | ✅ |
待办事项
- [ ] 发布HoliSafe数据集
- [ ] HoliSafe-Bench评估代码
- [ ] 训练SafeLLaVA代码
引用
bibtex @article{lee2025holisafe, title={HoliSafe: Holistic Safety Benchmarking and Modeling with Safety Meta Token for Vision-Language Model}, author={Lee, Youngwan and Kim, Kangsan and Park, Kwanyong and Jung, Ilcahe and Jang, Soojin and Lee, Seanie and Lee, Yong-Ju and Hwang, Sung Ju}, journal={arXiv preprint arXiv:2506.04704}, year={2025}, url={https://arxiv.org/abs/2506.04704}, archivePrefix={arXiv}, eprint={2506.04704}, primaryClass={cs.AI}, }




