遇见数据集

OpenScore String Quartet for Optical Music Recognition (OSSQ-OMR)

收藏
arXiv2026-08-11 更新2026-08-13 收录
官方服务:

资源简介:

OSSQ-OMR是由西江大学与阿利坎特大学联合打造的首个面向多声部乐谱光学音乐识别的基准数据集。该数据集基于116首弦乐四重奏作品,涵盖24,544张系统级图像与98,172张单行谱图像,分别源自合成渲染与原始扫描版本,并经过精细的视觉对齐与人工校正,确保数字编码与扫描图像在符号层面严格匹配。数据集提供LMXE、**kern和ABC三种符号编码格式,以及系统级和谱行级两种粒度,旨在解决多声部乐谱自动转录的复杂挑战,为弦乐四重奏这类高复杂度乐谱的光学音乐识别研究奠定标准化评测基础。

OSSQ-OMR is the first benchmark dataset for polyphonic sheet music Optical Music Recognition (OMR), jointly developed by Sogang University and the University of Alicante. This dataset is built upon 116 string quartet compositions, comprising 24,544 system-level images and 98,172 single-staff images, which originate from synthetically rendered and original scanned materials respectively. It has undergone rigorous visual alignment and manual correction to ensure strict symbol-level matching between digitally encoded scores and scanned images. The dataset offers three symbolic encoding formats, namely LMXE, **kern, and ABC, alongside two granularity levels: system-level and staff-level. It aims to address the complex challenges in automatic polyphonic sheet music transcription, and establish a standardized evaluation foundation for OMR research on high-complexity sheet music such as string quartets.

创建时间:
2026-08-11
原始信息汇总

OSSQ-OMR 数据集与基准概述

基本信息

该数据集用于弦乐四重奏乐谱的光学音乐识别(OMR),由论文《A Dataset and Benchmark for Optical Music Recognition of String Quartet Scores》发布,作者为 Dongmin Kim、Brian Liu、Jose J. Valero-Mas 和 Dasaem Jeong,发表于 ISMIR 2026 会议。此仓库是整体发布的入口,整合了四个组件仓库。

数据规模与内容

  • 作品规模:包含 116 部弦乐四重奏作品,来自 47 位作曲家,编码为 122 个 MuseScore 文件,作品年份跨度 1773-1994 年。
  • 图像数据:包含合成(渲染)和扫描两类乐谱图像;按 systemwise 和 partwise 两种方式分割。具体为 24,544 张系统图像98,172 张声部(分部)图像,其下细分为 13,240 张合成/11,304 张扫描(系统级),52,960 张合成/45,212 张扫描(声部级)。
  • 符号目标格式:提供多种符号音乐转写格式,包括 LMXE(LMXE/PLMXE/RLMXE)、KRN(KRN/EKRN)和 ABC(ABC/EABC)。
  • 来源类型:93 部总谱、17 部分谱和 6 部手稿,涵盖 32 家出版商;扫描图像覆盖 93 部总谱。
  • 数据划分:在乐谱层面进行划分以防止跨划分泄漏,共形成四个随机划分,且测试集互不重叠。

基准评估

  • 评估模型:SMT、Zeus、混合架构 smt-zeus 和 zeus-smt(编码器-解码器组合),以及 LEGATO 基线模型。
  • 评估指标:使用 OMR-NED(OMR 归一化编辑距离)。

组件仓库与角色

仓库 角色 许可证
ossq-omr 数据集源仓库,保存 MuseScore/MusicXML 注释源及修订历史,批量派生产物通过 Zenodo 和 Hugging Face 分发 CC0 1.0(数据)
omr-data-preprocessor 预处理流水线,从数据源构建所有派生符号格式 MIT
sqomr 模型训练与评估实验 MIT
lmxe LMXE 符号格式库(派生自 OMR-Research/lmx MIT
LEGATO 基线(sqomr 子模块) 基准基线模型 MIT(其中 abc2xml.py 为 LGPL-3.0)

版本固定信息

各组件仓库在发布时的提交版本:

  • ossq-omr:分支 omr-dev,提交 7a17e45
  • omr-data-preprocessor:分支 main,提交 bdea0d1
  • sqomr:分支 main,提交 4926e69
  • lmxe:分支 main,提交 7eed5c9

数据获取与使用方式

  • 仅获取数据:可从 Zenodo(带 DOI,尚未发布)或 Hugging Face(便于流式加载,尚未发布)下载预构建数据集。
  • 复现基准:递归克隆 sqomr(含 LEGATO 子模块),获取数据后按 sqomr 的 README 说明进行训练与评估。
  • 从源码重建:克隆 ossq-omr 获取 MuseScore 注释史,使用 omr-data-preprocessor 将 MuseScore 转换为 MusicXML、LMXE/PLMXE/RLMXE、KRN/EKRN、ABC/EABC,并进行对齐、分割和渲染;omrdp 依赖 lmxe 库。

对外引用建议

使用本数据集或基准时,根据使用的具体组件(LMXE/Zeus、OSSQ-OMR 数据集、SMT 基线、LEGATO 基线)分别引用对应的原始论文(如 OpenScore String Quartets 语料库、Mayer 等 2024、Ríos-Vila 等 2024、Yang 等 2026),主引用为本文 ISMIR 2026 论文。

搜集汇总
数据集介绍
OpenScore String Quartet for Optical Music Recognition (OSSQ-OMR) 数据集图片
构建方式
光学乐谱识别(OMR)领域长期聚焦于单声部及钢琴谱式作品,多声部总谱的自动转录因缺乏适配数据集而进展滞缓。OSSQ-OMR数据集依托OpenScore String Quartet语料库,精选116部弦乐四重奏作品,系统收集其对应的IMSLP扫描乐谱,并历经逾百小时的人工精校,使数字编码的渲染图像与原始扫描件在音符级视觉对齐。随后采用三阶段YOLOv8模型流水线,将图像精准分割为系统级与声部级,同时将符号转录统一转换为LMXE、**kern及ABC三种编码格式,最终构建包含24,544张系统图像与98,172张声部图像的多维数据集。
特点
OSSQ-OMR作为首个专为多声部OMR设计的数据集,其核心特性在于视觉对齐的严谨性与编码的多样性。数据源横跨1773年至1994年的出版乐谱、手稿及现代数字重制版,涵盖32家出版商与6部亲笔手稿,充分体现了版式风格与源档状况的丰富差异。所有图像均提供系统级与声部级两种粒度,并配套三种互补的符号编码,其中LMXE以其紧凑的序列化表示和度量级嵌套结构,显著增强了多声部转录的鲁棒性。此外,数据集的构建过程完全可审计,所有修正均以Git提交形式记录,确保了研究的可复现性。
使用方法
该数据集配备了完善的基准测试协议,可系统评估不同OMR模型在多声部乐谱识别中的性能。研究者可按照预设的四种随机划分策略,在系统级或声部级图像上训练并测试模型,并通过OMR-NED指标跨编码格式公平比较结果。数据集支持多种主流编码方案,包括LMXE、**kern及其细粒度变体、ABC及其字节对编码变体,便于探究编码选择对识别精度的影响。基准实验表明,LMXE编码配合声部级输入可取得最优效果,在合成图像上达到3.6%的错误率,在扫描图像上达到5.9%,为多声部OMR研究提供了可靠的参考基线与优化方向。
背景与挑战
背景概述
光学乐谱识别(OMR)领域长期聚焦于单声部与钢琴体乐谱的数字化转录,而对多声部合奏乐谱的自动识别研究却因缺乏合适数据集而进展迟缓。为填补这一空白,韩国西江大学MALer实验室的Dongmin Kim等人联合阿利坎特大学研究团队,于2026年构建了首个面向多声部OMR的专用数据集OSSQ-OMR。该数据集基于OpenScore弦乐四重奏语料库,将116部弦乐四重奏作品的数字编码乐谱与IMSLP原始扫描版本逐视觉对齐,提供系统级与声部级图像,并配套LMXE、**kern、ABC三种符号编码,总计包含24,544张系统图像与98,172张声部图像。该数据集的发布突破了多声部OMR研究的瓶颈,为后续算法评估提供了标准化基准,对音乐文化遗产的数字化保存与分析具有重要推动作用。
当前挑战
OSSQ-OMR数据集在构建与应用中面临多重挑战。领域层面,多声部乐谱的识别远比单声部复杂,涉及四声部独立进行的垂直对齐、宽广音域导致的频繁加线、跨乐章多次谱号变更等难题,且现有OMR模型多针对单声部或钢琴体设计,直接迁移至四声部场景时性能显著下降。构建层面,数字编码与扫描版本间的视觉错位需耗费超100小时人工逐项修正,涵盖谱面布局、连音线、符杠等众多符号的调整;此外,多种编码格式的转换需经过严格的往返验证,约5%至21%的系统级样本因结构或音乐错误被排除,进一步加剧了数据稀缺性。扫描输入的领域偏移亦造成基线模型错误率普遍上升,凸显了多声部OMR在数据与算法上的双重挑战。
常用场景
经典使用场景
OSSQ-OMR数据集作为首个专为多声部乐谱光学音乐识别(OMR)设计的基准资源,其经典使用场景聚焦于弦乐四重奏乐谱的系统级与声部级图像识别任务。该数据集提供了24,544张系统图像和98,172张声部图像,涵盖合成与扫描两种来源,并配套三种符号编码格式(LMXE、**kern、ABC),为研究者提供了统一的实验平台。通过标准化的基准协议,研究者可在四个随机划分的乐谱级子集上评估模型性能,从而系统性地比较不同编码策略、分割级别以及模型架构(如LSTM与Transformer)在复杂多声部文本上的识别效果,推动了OMR从单声部向多声部场景的跨越。
解决学术问题
在OSSQ-OMR出现之前,光学音乐识别领域的研究主要局限于单声部或钢琴曲谱,多声部乐谱因缺乏合适的公开数据集而鲜有探索,这导致现有OMR模型在面对包含多个独立声部的复杂乐谱时性能急剧下降,且无法评估编码格式和分割粒度对识别精度的具体影响。OSSQ-OMR的发布填补了这一空白,它系统性地解决了多声部OMR的基准缺失问题,通过精细的视觉对齐和多种编码格式的转换,使得研究人员能够量化分析编码选择(如LMXE vs. ABC)和分割层级(系统级 vs. 声部级)对识别误差的贡献,为多声部OMR的算法设计提供了可靠的理论依据和实证基础。
衍生相关工作
OSSQ-OMR的发布催生了多项后续研究工作,尤其在多声部OMR的模型与编码优化方面。例如,基于该基准,研究者可进一步探索端到端的全页识别模型,以应对更大规模的器乐合奏乐谱;同时,该数据集也促进了针对扫描图像域适应技术的研究,以减少合成到扫描的域偏移影响。此外,其多格式编码的对比分析启发了更紧凑的符号表征设计,如改进的线性化MusicXML变体,并被后续工作引用为评估协议的标准之一。这些衍生工作不仅深化了OMR在复杂乐谱上的理论基础,也为音乐信息检索领域提供了更鲁棒的工具。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务