遇见数据集

MBZUAI/palo_multilingual_dataset

收藏
Hugging Face2024-03-03 更新2024-03-04 收录
官方服务:

资源简介:

该数据集是一个多语言多模态数据集,用于训练PALO模型。数据集包含从LLaVA-v1.5中提取的665K英语指令,以及将LLaVA-Instruct-150K翻译成中文、法语、西班牙语、俄语、日语、阿拉伯语、印地语、孟加拉语和乌尔都语的指令,总计近2.1M指令。此外,数据集还包括从COCO、GQA、OCR-VQA、TextVQA和VisualGenome等数据集中下载的图像数据,这些图像数据需要按照特定的目录结构进行组织。

This multilingual multimodal dataset is developed for training the PALO model. It contains 665K English instructions extracted from LLaVA-v1.5, as well as instructions translated from LLaVA-Instruct-150K into nine languages including Chinese, French, Spanish, Russian, Japanese, Arabic, Hindi, Bengali and Urdu, totaling nearly 2.1M instructions overall. Additionally, the dataset includes image data downloaded from datasets such as COCO, GQA, OCR-VQA, TextVQA and VisualGenome, which need to be organized following a specific directory structure.

提供机构:
MBZUAI
原始信息汇总

PALO 多语言多模态数据集

数据集概述

PALO 数据集是一个多语言、多模态的数据集,用于训练 PALO 模型。该数据集包含以下内容:

  • 语言种类:英语、中文、法语、西班牙语、俄语、日语、阿拉伯语、印地语、孟加拉语和乌尔都语。
  • 数据量:总计约 2.1M 条指令。
    • 665K 条英语指令来自 LLaVA-v1.5。
    • LLaVA-Instruct-150K 的翻译版本,涵盖上述所有非英语语言。

图像数据准备

数据集包含以下图像数据:

下载所有图像数据后,应按以下结构组织数据:

├── coco │ └── train2017 ├── gqa │ └── images ├── ocr_vqa │ └── images ├── textvqa │ └── train_images └── vg ├── VG_100K └── VG_100K_2

搜集汇总
数据集介绍
MBZUAI/palo_multilingual_dataset 数据集图片
构建方式
在跨语言多模态大模型研究领域,PALO数据集应运而生,旨在弥合语言障碍,服务于全球50亿非英语用户。该数据集以LLaVA-v1.5中的665K英文指令为基础,通过机器翻译技术将LLaVA-Instruct-150K精准转化为中文、法语、西班牙语、俄语、日语、阿拉伯语、印地语、孟加拉语和乌尔都语等九种语言,最终构建出涵盖近210万条指令的多语言多模态语料库。其构建过程严格遵循论文第3.1节所述方法,确保翻译质量与语义保真度。
特点
PALO数据集最显著的特征在于其卓越的多语言覆盖能力,横跨印欧、汉藏、闪含及南亚四大语系,直接呼应全球人口分布格局。数据来源多元化,整合了COCO、GQA、OCR-VQA、TextVQA和VisualGenome五大经典视觉数据集,为视觉语言任务提供丰富场景。每条指令均关联对应图像,形成视觉与文本的深度对齐,同时保持各语言版本在任务类型上的均衡性,涵盖描述、推理、对话等多样化交互模式。
使用方法
使用PALO数据集时,研究者需首先从各源头下载对应图像数据,包括COCO train2017、GQA images、OCR-VQA图像(需统一转为jpg格式)、TextVQA train_val_images以及VisualGenome的两部分图像。随后按照指定目录结构将图像组织至PALO/data文件夹下,确保各子文件夹命名与数据集规范一致。完成图像准备后,即可结合多语言指令文件进行模型微调,支持直接加载至PALO框架或兼容的视觉语言模型训练流程中。
背景与挑战
背景概述
PALO多语言数据集由穆罕默德·本·扎耶德人工智能大学(MBZUAI)的ORYX研究团队于2024年创建,旨在突破视觉-语言模型在语言多样性上的局限,服务于全球约50亿非英语母语使用者。该数据集以LLaVA-v1.5的66.5万条英文指令为基础,通过高质量翻译将LLaVA-Instruct-150K扩展至中文、法语、西班牙语、俄语、日语、阿拉伯语、印地语、孟加拉语和乌尔都语等九种语言,构建了约210万条多语言多模态指令。这一工作填补了大规模多语言视觉对话数据的空白,为开发真正具备跨语言理解能力的多模态大模型奠定了数据基础,其影响力体现在推动了多语言多模态领域的标准化研究,并促进了低资源语言的视觉语言理解发展。
当前挑战
该数据集面临的核心挑战在于多语言多模态数据的质量与一致性。首先,机器翻译可能引入语义偏差或文化特异性错误,尤其在视觉概念描述中,不同语言对同一图像内容的表达差异可能导致模型学习到不准确的跨模态映射。其次,构建过程中需解决多源图像数据的异构性,涉及COCO、GQA、OCR-VQA等五个数据集的图像格式、标注粒度与版权协议的协调问题,例如OCR-VQA图像需要统一转换为JPG格式。此外,低资源语言如孟加拉语和乌尔都语的翻译资源匮乏,使得指令的语法自然度与视觉场景的适配性难以保证,这直接影响了模型在这些语言上的泛化能力与对话流畅性。
常用场景
经典使用场景
PALO多语言数据集的核心价值在于支撑多模态大模型在非英语语言环境下的视觉-语言对话能力。该数据集巧妙融合了LLaVA-v1.5的665K英文指令以及翻译自LLaVA-Instruct-150K的九种语言(中文、法语、西班牙语、俄语、日语、阿拉伯语、印地语、孟加拉语和乌尔都语)扩展版本,构建了约210万条多语言指令。研究者可借助该数据集,对视觉语言模型进行微调,使其能够理解并生成跨越多种语言的自然语言描述,从而打破语言壁垒,实现真正的多语言视觉对话交互。
衍生相关工作
PALO数据集催生了一系列重要的后续研究,包括多语言视觉指令微调范式的探索、跨语言迁移学习方法的优化以及多语言多模态模型的评估基准构建。基于该数据集,研究者进一步提出了多语言视觉语言模型的鲁棒性分析框架,并衍生出针对低资源语言的零样本视觉问答任务。此外,PALO的工作启发了后续将机器翻译与视觉语义对齐相结合的数据增强策略,推动了多语言多模态领域从模型架构到数据工程的系统性创新。
数据集最近研究
最新研究方向
当前多模态大模型研究正积极向多语言与跨文化方向拓展,以服务全球非英语用户群体。PALO多语言数据集应运而生,其核心贡献在于将LLaVA-Instruct-150K等英文视觉语言指令翻译为包括中文、法语、西班牙语、俄语、日语、阿拉伯语、印地语、孟加拉语和乌尔都语在内的九种语言,构建了约210万条多语言多模态指令数据。这一工作直面了现有模型主要覆盖英语人口的局限,通过大规模翻译对齐,使得视觉语言对话能力能够惠及全球约50亿非英语使用者。该数据集不仅支撑了PALO模型的训练,更为后续研究提供了基准资源,推动了多语言视觉理解、跨文化常识对齐以及低资源语言多模态生成等前沿方向的发展,对构建更具包容性的人工智能系统具有里程碑式的意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务