Zarakun/youtube_ua_subtitles_test
收藏资源简介:
--- task_categories: - automatic-speech-recognition pretty_name: MangoSpeech configs: - config_name: rozdympodcast data_files: "data/rozdympodcast.parquet" - config_name: opodcast data_files: "data/opodcast.parquet" - config_name: test data_files: "data/test.parquet" --- # The list of all subsets in the dataset Each subset is generated splitting videos from given particular ukrainiam YouTube channel All subsets are in test split - "opodcast" subset is from channel "О! ПОДКАСТ" - "rozdympodcast" subset is from channel "Роздум | Подкаст" - "test" subset is just a small subset of samples # Loading a particular subset ``` >>> data_files = {"train": "data/<your_subset>.parquet"} >>> data = load_dataset("Zarakun/youtube_ua_subtitles_test", data_files=data_files) >>> data DatasetDict({ train: Dataset({ features: ['audio', 'rate', 'duration', 'sentence'], num_rows: <some_number> }) }) ```
任务类别: - 自动语音识别(automatic-speech-recognition) 易读名称:MangoSpeech 配置项: - 配置名称:rozdympodcast,数据文件路径:"data/rozdympodcast.parquet" - 配置名称:opodcast,数据文件路径:"data/opodcast.parquet" - 配置名称:test,数据文件路径:"data/test.parquet" --- # 数据集全部子集列表 本数据集的所有子集均由指定乌克兰YouTube频道的视频拆分生成,全部子集均划分至测试集。 - "opodcast" 子集来源于频道「О! ПОДКАСТ」 - "rozdympodcast" 子集来源于频道「Роздум | Подкаст」 - "test" 子集仅为少量样本子集 # 加载指定子集 >>> data_files = {"train": "data/<your_subset>.parquet"} >>> data = load_dataset("Zarakun/youtube_ua_subtitles_test", data_files=data_files) >>> data DatasetDict({ train: Dataset({ features: ['audio', 'rate', 'duration', 'sentence'], num_rows: <some_number> }) })
数据集概述
任务类别
- 自动语音识别(automatic-speech-recognition)
数据集名称
- MangoSpeech
配置信息
- config_name: rozdympodcast
- 数据文件:
data/rozdympodcast.parquet
- 数据文件:
- config_name: opodcast
- 数据文件:
data/opodcast.parquet
- 数据文件:
- config_name: test
- 数据文件:
data/test.parquet
- 数据文件:
子集信息
- opodcast 子集来自频道 "О! ПОДКАСТ"
- rozdympodcast 子集来自频道 "Роздум | Подкаст"
- test 子集是一个小样本子集
数据加载
-
数据文件路径:
data/<your_subset>.parquet -
加载命令: python data_files = {"train": "data/<your_subset>.parquet"} data = load_dataset("Zarakun/youtube_ua_subtitles_test", data_files=data_files)
-
数据结构: python DatasetDict({ train: Dataset({ features: [audio, rate, duration, sentence], num_rows: <some_number> }) })




