OpenGVLab/LORIS
收藏官方服务:
资源简介:
LORIS数据集是一个大规模的有节奏的视频配乐数据集,包含86.43小时的高质量原始视频,以及相应的2D姿势、RGB特征和优化的音频波形。该数据集最初用于视频背景音乐生成任务(也称为视频配乐)。
The LORIS dataset is a large-scale rhythmic video soundtrack dataset. It contains 86.43 hours of high-quality raw videos, along with corresponding 2D poses, RGB features, and optimized audio waveforms. This dataset was initially used for the task of background music generation for videos (also known as video soundtracking).
提供机构:
OpenGVLab原始信息汇总
LORIS 数据集概述
数据集描述
- 数据集名称: LORIS
- 数据集用途: 视频背景音乐生成任务(视频音轨)
- 数据集内容: 包含86.43小时的高质量原始视频,以及相应的2D姿态、RGB特征和改进的音频波形。
- 数据集规模: 包含10,000至100,000个数据项。
- 语言: 英语
- 许可证: CC-BY-NC-SA-4.0
- 联系人: Jiashuo Yu (yujiashuo@pjlab.org.cn)
如何开始使用
python from datasets import load_dataset dataset = load_dataset("OpenGVLab/LORIS")
引用信息
bibtex @inproceedings{Yu2023Long, title={Long-Term Rhythmic Video Soundtracker}, author={Yu, Jiashuo and Wang, Yaohui and Chen, Xinyuan and Sun, Xiao and Qiao, Yu }, booktitle={International Conference on Machine Learning (ICML)}, year={2023} }
搜集汇总
数据集介绍

构建方式
LORIS数据集是面向视频背景音乐生成任务的大规模节奏性视频配乐数据集。其构建过程首先从海量原始视频中精选出86.43小时的长时段、高质量素材,确保视频内容的多样性与完整性。随后,通过前沿的计算机视觉技术提取每一帧的二维人体姿态与RGB特征,同时利用音频处理算法对原始音轨进行优化,生成改善后的音频波形。这一多模态数据的协同采集与标准化处理,为后续的节奏对齐与生成模型训练奠定了坚实基础。
使用方法
使用LORIS数据集极为便捷,研究者可通过HuggingFace的datasets库直接加载。只需一行代码`from datasets import load_dataset; dataset = load_dataset("OpenGVLab/LORIS")`,即可获取完整的视频、姿态、RGB特征与音频数据。该数据集适用于训练视频背景音乐生成模型,用户可根据任务需求灵活提取不同模态的特征进行模型输入,或利用其长序列特性探索时序生成与节奏同步算法。详细的论文与代码仓库进一步降低了使用门槛。
背景与挑战
背景概述
在人工智能与多媒体内容生成领域,视频背景音乐的自动创作正逐渐成为研究热点,其核心在于实现视觉内容与听觉韵律的深度耦合。由上海人工智能实验室OpenGVLab团队主导,联合多位学者于2023年在ICML会议上发布的LORIS数据集,旨在解决长时程视频配乐生成这一极具挑战性的任务。该数据集由Jiashuo Yu等研究人员构建,囊括了86.43小时的高质量原始视频,并同步提供了二维人体姿态、RGB特征及经优化的音频波形,为模型学习视频中的运动节奏与音乐节拍之间的映射关系奠定了坚实的数据基础。LORIS的提出不仅填补了大规模、高保真视听对齐数据集的空白,更推动了视频自动配乐技术从短片段向长视频、从粗粒度向细粒度的跨越式发展,在AIGC领域产生了广泛影响。
当前挑战
LORIS数据集所面临的挑战首先体现在领域问题的复杂性上:视频背景音乐生成需要模型精准捕捉视觉场景中如人物动作、镜头切换等动态要素的节律,并将其转化为连贯且风格匹配的音乐序列,这一跨模态时序对齐问题远较传统的图像分类或语音识别更为棘手。在数据集构建层面,挑战同样显著:原始视频的采集需兼顾时长(长视频)、质量(高分辨率低噪声)与多样性(涵盖不同场景与动作类型),而二维姿态与RGB特征的提取则要求算法在复杂光照和遮挡条件下保持鲁棒性;此外,音频波形的优化处理需在保留原始环境音的同时消除干扰,以确保配乐生成模型能够学习到纯净的视听关联。这些因素共同构成了LORIS在数据规模、标注精度与模态一致性上的多重技术瓶颈。
常用场景
经典使用场景
LORIS数据集专为视频背景音乐生成任务而设计,其核心应用在于实现长时序、高节奏感的音画同步。该数据集包含86.43小时的高质量原始视频,并配套提供2D人体姿态、RGB特征及优化后的音频波形,为多模态学习提供了理想的数据基础。研究者可基于此数据集训练模型,以自动为无声视频配乐,尤其适用于舞蹈、运动等节奏感强烈的场景。经典使用方式包括利用时序对齐的视觉与音频特征,学习从动作序列到音乐节拍的映射关系,从而生成与视频内容节奏高度契合的背景音乐。
解决学术问题
LORIS数据集解决了视频配乐领域中长期存在的两大难题:一是缺乏大规模、多模态对齐的高质量数据,二是现有方法难以捕捉长时序视频中的节奏连贯性。通过提供精细标注的2D姿态与音频波形,该数据集使研究者能够深入探索视觉运动与音乐节奏之间的内在关联,推动了从短片段配乐向长视频连续配乐的跨越。其学术意义在于为跨模态生成任务建立了标准化评估基准,并促进了音乐信息检索、计算机视觉与生成式模型等交叉领域的发展。
实际应用
在实际应用中,LORIS数据集为短视频创作、影视后期制作及虚拟现实内容生产提供了自动化配乐解决方案。例如,用户上传一段舞蹈或运动视频后,基于该数据集训练的模型可实时生成节奏匹配的背景音乐,显著降低人工配乐的时间与成本。此外,该技术可集成至视频编辑软件或社交媒体平台,帮助非专业创作者快速产出高质量音画作品。在游戏开发与互动艺术中,LORIS还能用于生成动态音效,增强用户体验的沉浸感。
数据集最近研究
最新研究方向
在人工智能与多媒体内容生成交叉领域,视频背景音乐自动生成技术正成为前沿热点。LORIS数据集作为大规模节奏性视频配乐数据集,涵盖86.43小时高质量原始视频、2D姿态、RGB特征及优化音频波形,为长时程视频配乐任务提供了关键训练与评估资源。该数据集推动了基于节奏对齐的跨模态生成研究,使模型能够学习视频运动与音乐节拍之间的深层语义关联,在短视频创作、影视后期及虚拟现实等场景中具有重要应用价值。其开源发布不仅促进了AIGC在音乐与视觉融合方向的技术突破,也为探索视频内容与音频情感表达的协同生成奠定了数据基础,体现了多模态学习从静态理解向动态创作演进的前沿趋势。
以上内容由遇见数据集搜集并总结生成



