mir-datasets
收藏资源简介:
这是一个专门用于跟踪音乐信息检索(MIR)数据集及其相关元数据的仓库,通过标准化和结构化的方式管理数据集信息。
This is a repository specifically designed for tracking music information retrieval (MIR) datasets and their associated metadata, managing dataset information in a standardized and structured manner.
数据集概述
数据集名称: MIR-datasets
目的: 该数据集用于标准化和结构化地追踪音乐信息检索(MIR)领域的数据集及其元数据。
核心文件: mir-datasets.yaml 是数据集元数据的“真理之源”,所有其他格式的数据展示(如Markdown, HTML, LaTeX表格等)均应从此文件派生。
数据集结构
每个数据集记录遵循以下格式之一:
-
单个元数据字段: yaml key1: url: http://path/to/website metadata: tempo contents: 123 songs audio: no
-
多个元数据字段: yaml key2: url: http://path/to/something.html metadata: - tempo - lyrics: http://my/lyrics/page contents: 10s snippets audio: yes
贡献指南
- 保持列表顺序:虽然技术上不必要,但有助于理解。
- 提供尽可能多的信息:确保数据集描述详尽。
- 确保YAML格式正确:未来将通过Travis CI进行测试。
数据集输出格式
数据集信息可以通过脚本渲染为Markdown或JavaScript格式:
bash $ ./render_datasets.py mir-datasets.yaml outputs/mir-datasets.md $ ./render_datasets.py mir-datasets.yaml outputs/mir-datasets.js
生成的文件应通过更新源YAML文件来维护,而非直接修改输出文件。




