CASTELLA
收藏资源简介:
CASTELLA是一个用于音频时刻检索任务的人工标注音频基准数据集,包含长音频、局部音频事件的字幕描述和时间边界标注。数据集包含1,862个音频记录,总计3,925个局部字幕和11,308个时间戳标注,分为训练集(1,009个音频)、验证集(213个音频)和测试集(640个音频)。
CASTELLA is a manually annotated audio benchmark dataset for the task of audio moment retrieval. It contains long-form audios, subtitle descriptions of local audio events, and temporal boundary annotations. The dataset consists of 1,862 audio recordings, totaling 3,925 local subtitles and 11,308 timestamp annotations. It is split into a training set (1,009 audio recordings), a validation set (213 audio recordings), and a test set (640 audio recordings).
CASTELLA数据集概述
数据集简介
CASTELLA是一个用于音频时刻检索任务的人工标注音频基准数据集,包含长音频、局部音频事件描述和时间边界信息。
数据集规模
- 训练集:1,009个音频,2,208个局部描述,6,160个时间戳
- 验证集:213个音频,357个局部描述,973个时间戳
- 测试集:640个音频,1,360个局部描述,4,175个时间戳
- 总计:1,862个音频,3,925个局部描述,11,308个时间戳
数据格式
标注文件结构
JSON文件包含以下字段:
yid:视频标识符global_caption:全局描述duration:音频时长(秒)num_moments:时刻数量moments:时刻列表local_caption:局部音频事件描述timestamps:时间边界(秒)
标注语言
提供英文和日文两种语言的标注文件。
数据获取
- 原始音频数据需要通过专用脚本下载
- 音频和文本特征可在Zenodo获取
基准模型
Lighthouse框架支持使用CASTELLA进行音频时刻检索任务。
许可证
采用CC BY 4.0许可证。
引用信息
bibtex @misc{munakata2025castella, authors={Hokuto Munakata, Takehiro Imamura, Taichi Nishimura, Tatsuya Komatsu}, title={CASTELLA: Long Audio Dataset with Captions and Temporal Boundaries}, journal={arXiv preprint arXiv:2511.15131}, year={2025} }




