遇见数据集

WaltonFuture/InstructionGPT-4

收藏
Hugging Face2023-10-09 更新2024-03-04 收录
官方服务:

资源简介:

--- task_categories: - visual-question-answering size_categories: - n<1K --- # InstructionGPT-4: A 200-Instruction Paradigm for Fine-Tuning MiniGPT-4 [Lai Wei](https://waltonfuture.github.io/), Zihao Jiang, [Weiran Huang](https://www.weiranhuang.com/), [Lichao Sun](https://lichao-sun.github.io/). **Shanghai Jiao Tong University, Lehigh University** [Paper](https://arxiv.org/abs/2308.12067), [Link](https://mp.weixin.qq.com/s/s4Acec71v5oMlFkyhlCL_g), [Code](https://github.com/waltonfuture/InstructionGPT-4) ## Introduction Multimodal large language models acquire their instruction-following capabilities through a two-stage training process: pre-training on image-text pairs and fine-tuning on supervised vision-language instruction data. Recent studies have shown that large language models can achieve satisfactory results even with a limited amount of high-quality instruction-following data. In this paper, we introduce InstructionGPT-4, which is fine-tuned on a small dataset comprising only 200 examples, amounting to approximately 6% of the instruction-following data used in the alignment dataset for MiniGPT-4. We first propose several metrics to access the quality of multimodal instruction data. Based on these metrics, we present a simple and effective data selector to automatically identify and filter low-quality vision-language data. By employing this method, InstructionGPT-4 outperforms the original MiniGPT-4 on various evaluations (e.g., visual question answering, GPT-4 preference). Overall, our findings demonstrate that less but high-quality instruction tuning data is efficient to enable multimodal large language models to generate better output. ## Usage You can download our vision-language dataset containing only 200 high-quality examples and replace the original cc_sbu_align dataset used in the fine-tuning stage of MiniGPT-4. The training settings are the same as [MiniGPT-4](https://github.com/Vision-CAIR/MiniGPT-4). If you're using InstructionGPT-4 in your research or applications, please cite using this BibTeX: ```bibtex @article{wei2023instructiongpt, title={InstructionGPT-4: A 200-Instruction Paradigm for Fine-Tuning MiniGPT-4}, author={Wei, Lai and Jiang, Zihao and Huang, Weiran and Sun, Lichao}, journal={arXiv preprint arXiv:2308.12067}, year={2023} } ```

任务类别: - 视觉问答(visual-question-answering) 样本量类别: - n<1K # InstructionGPT-4:面向MiniGPT-4微调的200条指令范式 [赖伟(Lai Wei)](https://waltonfuture.github.io/), 江梓豪, [黄伟然(Weiran Huang)](https://www.weiranhuang.com/), [孙立超(Lichao Sun)](https://lichao-sun.github.io/). **上海交通大学,利哈伊大学** [论文](https://arxiv.org/abs/2308.12067), [微信链接](https://mp.weixin.qq.com/s/s4Acec71v5oMlFkyhlCL_g), [代码](https://github.com/waltonfuture/InstructionGPT-4) ## 引言 多模态大语言模型通过两阶段训练流程获得指令遵循能力:先在图像-文本配对数据上进行预训练,再在监督式视觉语言指令数据上进行微调。近期研究表明,即便仅使用少量高质量的指令遵循数据,大语言模型也能取得令人满意的效果。本文提出InstructionGPT-4,其仅基于包含200条样本的小型数据集完成微调,该数据集规模约为MiniGPT-4对齐阶段所用指令遵循数据的6%。本文首先提出若干指标以评估多模态指令数据的质量,并基于这些指标设计了一款简单高效的数据选择器,可自动识别并过滤低质量的视觉语言数据。通过应用该方法,InstructionGPT-4在多项评估任务(如视觉问答、GPT-4偏好性评估)中均优于原始MiniGPT-4。综上,本研究结果证实,使用更少但高质量的指令微调数据,能够有效赋能多模态大语言模型生成更优质的输出。 ## 使用方法 您可下载仅包含200条高质量样本的视觉语言数据集,替换MiniGPT-4微调阶段所使用的原始cc_sbu_align数据集。训练设置与[MiniGPT-4](https://github.com/Vision-CAIR/MiniGPT-4)保持一致。 若您在研究或应用中使用InstructionGPT-4,请引用如下BibTeX格式的条目: bibtex @article{wei2023instructiongpt, title={InstructionGPT-4: A 200-Instruction Paradigm for Fine-Tuning MiniGPT-4}, author={Wei, Lai and Jiang, Zihao and Huang, Weiran and Sun, Lichao}, journal={arXiv preprint arXiv:2308.12067}, year={2023} }

提供机构:
WaltonFuture
原始信息汇总

InstructionGPT-4 数据集概述

基本信息

  • 任务类别: 视觉问答 (visual-question-answering)
  • 数据集规模: 小于1000条 (n<1K)

数据集介绍

  • 名称: InstructionGPT-4
  • 来源: 上海交通大学, 理海大学
  • 作者: Lai Wei, Zihao Jiang, Weiran Huang, Lichao Sun
  • 相关链接: 论文, 代码

数据集详情

  • 数据集大小: 仅包含200个高质量示例
  • 用途: 用于替换MiniGPT-4微调阶段的原始cc_sbu_align数据集
  • 训练设置: 与MiniGPT-4相同

引用信息

bibtex @article{wei2023instructiongpt, title={InstructionGPT-4: A 200-Instruction Paradigm for Fine-Tuning MiniGPT-4}, author={Wei, Lai and Jiang, Zihao and Huang, Weiran and Sun, Lichao}, journal={arXiv preprint arXiv:2308.12067}, year={2023} }

搜集汇总
数据集介绍
WaltonFuture/InstructionGPT-4 数据集图片
构建方式
InstructionGPT-4数据集的构建根植于多模态大语言模型领域对高质量指令微调数据的迫切需求。研究团队首先提出了一套多模态指令数据质量评估指标,涵盖图像-文本对齐度、指令语义明确性等维度。基于这些指标,设计了一种简单而高效的数据选择器,能够自动识别并过滤低质量的视觉语言数据。通过这一筛选机制,从原始MiniGPT-4对齐数据集中精挑细选出仅200个高保真样本,构建了本数据集,其规模仅占原始指令微调数据的约6%。这一构建范式颠覆了传统依赖海量数据的思路,强调数据质量对模型性能的杠杆效应。
特点
该数据集的核心特点在于其极致的精炼性与高效性。仅包含200个样本,却能在微调后使MiniGPT-4在视觉问答和GPT-4偏好评估等多项任务上超越原版模型,彰显了少而精的数据哲学。每个样本均经过严格质量把关,确保指令清晰、视觉信息与语言描述高度耦合,避免了噪声数据的干扰。数据集聚焦于多模态指令跟随能力的关键场景,覆盖多样化的视觉推理任务,为模型提供了高信息密度的训练素材。这种设计不仅降低了计算开销,还验证了数据质量对多模态大模型性能的支配性影响。
使用方法
使用InstructionGPT-4数据集时,可直接将其作为MiniGPT-4微调阶段的高质量替代数据,替换原始的cc_sbu_align数据集。训练配置与MiniGPT-4官方流程完全兼容,无需额外调整超参数或模型架构。用户只需将下载的200个样本加载到标准数据加载器中,即可启动微调过程。该数据集特别适合资源受限的研究场景,能显著缩短训练周期并提升模型输出质量。建议在应用时引用原始论文,以遵循学术规范。对于希望复现实验或探索数据效率极限的研究者,此数据集提供了理想的基准测试平台。
背景与挑战
背景概述
多模态大语言模型在视觉与语言融合领域取得了突破性进展,其指令遵循能力通常依赖于大规模监督数据的微调。然而,数据规模与质量之间的权衡始终是制约模型高效训练的关键瓶颈。在此背景下,由上海交通大学与里海大学的魏来、姜子豪、黄维然和孙立超等研究者于2023年共同提出的InstructionGPT-4数据集应运而生。该数据集仅包含200条精心标注的高质量视觉语言指令样本,旨在探索以极小量数据实现模型性能跃升的可能性。通过设计多维质量评估指标与自动化数据筛选机制,研究者证明了精简但精良的指令数据能够显著提升MiniGPT-4在视觉问答、GPT-4偏好评估等任务上的表现,为多模态模型的轻量化微调开辟了新范式,对推动数据高效学习领域的发展具有重要启示意义。
当前挑战
InstructionGPT-4所面临的核心挑战在于如何定义并量化多模态指令数据的质量。传统方法依赖大规模数据堆砌,但冗余与噪声往往导致模型过拟合或泛化能力下降。为此,研究者需突破数据筛选的模糊边界,构建可自动识别低质量样本的评估体系,例如检测图像-文本语义对齐度、指令复杂性与多样性等维度。此外,构建过程中仅使用200个样本的极端约束,要求所选数据必须涵盖关键任务场景且避免偏差,这对数据采样的代表性与平衡性提出了严苛要求。同时,如何确保筛选出的数据在不同多模态模型间具有迁移性,以及验证其效果优于更大规模但未经优化的数据集,亦是该研究需解决的关键技术难题。
常用场景
经典使用场景
InstructionGPT-4数据集专为多模态大语言模型的指令微调而设计,其经典使用场景在于以极少量(仅200条)的高质量视觉语言指令数据,替代传统大规模对齐数据集(如MiniGPT-4使用的cc_sbu_align)进行微调。研究者可通过该数据集直接替换原始微调阶段的数据源,在保持模型参数规模不变的前提下,显著提升模型在视觉问答、图像描述生成等任务中的指令遵循能力。这一范式颠覆了以往对海量数据驱动的依赖,为资源受限环境下的多模态模型高效训练提供了新路径。
解决学术问题
该数据集核心解决了多模态大语言模型微调中数据质量与数量之间的权衡问题。传统研究认为模型性能随数据量增加而提升,但InstructionGPT-4通过实验证明:经过精心筛选的少量高质数据(仅占原始数据量的6%)即可超越全量数据训练效果。这挑战了“数据越多越好”的学术共识,揭示了数据质量对指令对齐的关键作用,并为后续研究开辟了“数据高效微调”这一新方向,极大地降低了多模态模型训练的计算与标注成本。
衍生相关工作
InstructionGPT-4数据集衍生了一系列围绕“数据高效多模态学习”的经典工作。其提出的基于多维质量指标的数据筛选器,启发了后续研究如ALLaVA和Qwen-VL中动态数据选择策略的设计。同时,该工作验证的“200条指令微调”范式被广泛应用于低资源多模态场景的迁移学习,例如在医学图像报告生成、遥感图像理解等领域,研究者借鉴其方法论构建领域特化的小样本指令集,推动了多模态模型在垂直行业的轻量化适配。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务