遇见数据集

Sony-TAu Realistic Spatial Soundscapes 2022 (STARS22)

收藏
arXiv2022-09-02 更新2024-06-21 收录
数据链接:
官方服务:

资源简介:

STARS22数据集由坦佩雷大学和索尼集团合作创建,包含真实场景的空间录音,旨在用于声音事件定位和检测。数据集通过高分辨率球形麦克风阵列捕捉,包含13个目标声音类别的时空标注。数据集内容丰富,包括4小时52分钟的录音,涵盖多种室内环境。创建过程中,结合人工标注和光学跟踪技术确保了标注的准确性。该数据集主要应用于机器听觉、机器人听觉、声学监测等领域,为解决复杂环境下的声音事件定位问题提供了重要资源。

The STARS22 dataset was developed in collaboration between Tampere University and Sony Group Corporation. It contains spatial recordings of real-world scenes, and is designed for sound event localization and detection tasks. Captured using a high-resolution spherical microphone array, the dataset includes spatio-temporal annotations for 13 target sound event categories. It boasts a rich collection of 4 hours and 52 minutes of audio recordings spanning diverse indoor environments. During its development, manual annotation and optical tracking technologies were combined to ensure the accuracy of the annotations. This dataset is primarily applied in the fields of machine hearing, robotic audition, acoustic monitoring, and other related domains, serving as a critical resource for solving sound event localization problems in complex environments.

创建时间:
2022-06-04
搜集汇总
数据集介绍
Sony-TAu Realistic Spatial Soundscapes 2022 (STARS22) 数据集图片
构建方式
在声学事件定位与检测领域,真实场景的录音数据对于模型评估至关重要。STARSS22数据集的构建采用多模态传感器融合策略,通过高分辨率球形麦克风阵列(Eigenmike em32)在芬兰坦佩雷大学和日本索尼设施的不同室内环境中采集空间音频。录音过程结合了360度摄像头、光学运动捕捉系统和无线领夹麦克风,以同步记录视觉信息、声源运动轨迹和近场音频。时空标注通过人工监听无线麦克风录音确定事件类别与时间边界,并利用运动捕捉数据映射声源位置,最终转换为到达方向信息,确保了标注的精确性与场景的自然性。
使用方法
STARSS22数据集作为DCASE2022挑战赛Task3的开发与评估基准,为SELD研究提供了标准化测试平台。使用者可基于开发集(包含训练与测试划分)进行模型训练与验证,并利用允许的外部数据(如合成空间混合声景)增强模型泛化能力。数据集中提供的多ACCDOA输出表示支持处理同类声事件的并发实例,而输入特征则兼容FOA格式的声强向量与MIC格式的广义互相关序列。评估采用宏平均F1分数、定位误差等指标,确保对检测与定位性能的综合考量,推动真实场景下机器听觉系统的进步。
背景与挑战
背景概述
在机器听觉与声学场景分析领域,声音事件定位与检测(SELD)任务旨在同时识别声音事件的类别并追踪其空间方位,为机器人听觉、环境监测等应用提供关键技术支撑。索尼与坦佩雷大学于2022年联合发布的STARSS22数据集,作为DCASE2022挑战赛的任务三基准,标志着该领域从合成数据向真实场景录音的重要转变。该数据集通过高分辨率球形麦克风阵列,在芬兰与日本的多处室内环境中采集了自然演绎的声景,涵盖13类目标声音事件,并借助光学追踪与人工标注相结合的方式,实现了时间与空间维度的精细标注。其核心研究问题聚焦于在复杂真实声学条件下提升SELD系统的泛化能力与鲁棒性,为学术界提供了首个大规模真实场景空间录音标注资源,显著推动了SELD方法在现实应用中的评估与优化进程。
当前挑战
STARSS22数据集所应对的领域挑战在于,传统基于合成空间混响的SELD数据集难以模拟真实声景中事件间的时空关联性与自然分布规律,导致模型在现实场景中表现受限。构建过程中的挑战则体现在多模态数据同步与标注的复杂性上:需协调球形麦克风阵列、360度摄像机、运动捕捉系统与无线麦克风等多类传感器,确保时空数据精确对齐;同时,针对人类活动产生的声音事件,如语音或脚步声,其空间位置需通过头部追踪数据间接推算,增加了标注的不确定性。此外,真实场景中事件类别的自然共现与动态轨迹,要求标注流程兼顾听觉判断与视觉验证,以保障时空标注的准确性与一致性。
常用场景
经典使用场景
在声学事件定位与检测领域,STARSS22数据集作为DCASE2022挑战赛任务三的核心评估基准,为研究者提供了首个基于真实场景空间录音的标准化测试平台。该数据集通过高分辨率球形麦克风阵列采集多室内环境下的自然声景,包含13类目标声音事件的时空标注,有效模拟了现实世界中声音事件的因果关联与空间分布。其经典应用场景聚焦于推动SELD算法从合成数据向真实复杂环境的过渡,为评估模型在自然声学条件下的鲁棒性提供了关键实验数据。
解决学术问题
该数据集主要解决了合成数据在声学事件建模中的固有局限,如声音事件的随机组合与空间分布脱离现实物理约束等问题。通过提供真实场景中自然发生的声学事件序列及其时空标注,STARSS22使得研究者能够探究声音事件的因果关联、共现模式以及运动轨迹等深层场景信息。这不仅提升了SELD任务在复杂声学环境下的评估信度,更为机器听觉系统理解动态声学场景的语义与空间结构奠定了数据基础,推动了声学场景分析向认知层次的发展。
实际应用
在智能机器人与环境感知系统中,STARSS22数据集为基于音频的态势感知提供了关键训练资源。其真实场景录音可应用于服务机器人的声源追踪、智能家居的异常声音监测以及增强现实系统的空间音频注册等领域。通过利用该数据集训练的模型,系统能够更准确地识别特定声学事件的发生位置与类型,例如在嘈杂环境中定位敲门声或识别器械操作声,从而提升人机交互的自然性与环境感知的完整性。
数据集最近研究
最新研究方向
在声学事件定位与检测领域,STARSS22数据集作为首个基于真实场景空间录音的标注数据集,推动了该领域从合成数据向真实复杂环境的过渡。其前沿研究方向聚焦于利用多模态传感器融合技术,结合光学追踪与人工标注,实现高精度的时空联合标注,以克服传统合成数据在事件时序与空间分布上的局限性。该数据集作为DCASE2022挑战赛的核心资源,促进了多ACCDOA表示等新型输出架构的发展,以处理同类事件同时发生的复杂场景。相关研究热点包括利用外部合成数据增强模型泛化能力,以及探索SALSA-lite等鲁棒空间特征在真实噪声环境下的性能优化。这一进展对机器人听觉、智能监控等应用具有深远意义,标志着声学场景分析向更贴近实际应用场景的范式转变。
相关研究论文
  • 1
    STARSS22: A dataset of spatial recordings of real scenes with spatiotemporal annotations of sound events音频研究组,坦佩雷大学,坦佩雷,芬兰 索尼集团,东京,日本 · 2022年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务