LongVPO-Training-Data
收藏资源简介:
LongVPO是一个用于长视频偏好优化的多模态数据集,旨在通过两个渐进式训练阶段提升模型的视频理解能力。第一阶段(Anchored Cues Optimization)使用来自LLaVA-Video-178K的短到长视频对齐数据,专注于锚定关键时间事件以防止注意力漂移。第二阶段(Self-Reasoning Optimization)则利用Vript的长视频数据集,训练模型自主推理跨视频的多个事件。数据集规模在10K到100K之间,适用于视频文本到文本和视觉问答任务。
LongVPO is a multimodal dataset for long-form video preference optimization, aiming to enhance the video understanding capability of models through two progressive training stages. The first stage, Anchored Cues Optimization, utilizes short-to-long video alignment data from LLaVA-Video-178K, focusing on anchoring key temporal events to prevent attention drift. The second stage, Self-Reasoning Optimization, leverages Vript's long-form video dataset to train models to autonomously reason about multiple events across videos. With a scale ranging from 10K to 100K, this dataset is applicable to video-text-to-text and visual question answering (VQA) tasks.
LongVPO-Training-Data 数据集概述
基本信息
- 数据集名称: LongVPO-Training-Data
- 发布者: MCG-NJU
- 许可证: MIT
- 主要语言: 英语
- 关联基础模型: OpenGVLab/InternVL3-8B
- 核心任务: 视频-文本到文本、视觉问答
- 类别: 多模态
- 规模: 10K < n < 100K
数据集结构与配置
数据集包含两个训练阶段的数据配置:
-
Stage 1 配置
- 配置名称: stage1
- 数据文件: InternVL3_stage1_short2long_training.jsonl
- 数据划分: train
- 默认配置: 是
-
Stage 2 配置
- 配置名称: stage2
- 数据文件: InternVL3_stage2_long_training.jsonl
- 数据划分: train
训练方法与数据来源
训练过程分为两个渐进阶段,使用不同的数据集以增强模型的视频理解能力:
-
第一阶段:锚定线索优化
- 目标:将模型的注意力锚定在关键时间事件上,防止其在长上下文中的注意力漂移。
- 数据与方法:使用源自 LLaVA-Video-178K 的短到长视频对齐数据。偏好优化利用锚定的时间线索(例如,特定时间戳或关键帧)来教导模型在生成答案前如何准确定位和提取相关信息。
-
第二阶段:自我推理优化
- 目标:内化推理过程,使模型能够自主连接视频中的多个事件,而无需依赖明确的外部线索。
- 数据与方法:专注于纯长视频数据集,利用 Vript。训练模型生成自己的推理链(自我推理)以推导正确答案,使其输出与人类对逻辑性和全面性长视频理解的偏好保持一致。
相关资源
- GitHub 项目地址: https://github.com/MCG-NJU/LongVPO
- 论文地址: https://arxiv.org/abs/2602.02341
- 模型地址: https://huggingface.co/MCG-NJU/LongVPO-Stage2-InternVL3-8B
- 论文引用地址: https://openreview.net/forum?id=LKAp7Dknxf



