twi-speech-text-parallel-synthetic-1m-part001
收藏资源简介:
Twi语音-文本平行数据集是迄今为止最大的Twi语言语音数据集,包含了100万对合成的语音到文本的数据,分为5个部分发布。这个数据集通过先进的合成数据生成技术创建,旨在为自动语音识别、文本到语音、语音到语音翻译、关键词定位等任务提供支持。
The Twi speech-text parallel dataset is the largest speech dataset for the Twi language to date, containing 1 million synthesized speech-text pairs and released in five parts. Developed using advanced synthetic data generation techniques, this dataset is designed to support tasks including automatic speech recognition (ASR), text-to-speech (TTS), speech-to-speech translation, and keyword spotting.
Twi Speech-Text Parallel Dataset - Part 1 of 5 数据集概述
基本描述
- 语言:Twi/Akan (ISO 639-3代码:
aka) - 许可证:CC BY 4.0
- 模态:音频+文本
- 规模:100K<n<1M样本量级
- 单语性:单语(阿坎语)
- 任务:自动语音识别(ASR)、文本转语音(TTS)、关键词识别
数据集构成
核心特征
audio:WAV格式音频文件(合成生成)text:对应的Twi语文本转录
数据划分
- 仅包含训练集(trainset),样本量: {len(data)}个(过滤后>1KB的有效样本)
技术规格
音频特性
- 格式:WAV
- 声道:单声道
- 采样率:16kHz
- 位深:16-bit
- 时长:各样本不等
质量保证
- 过滤小于1KB的文件
- 验证音频-文本对齐
- UTF-8编码验证
- 跨分区的重复数据删除
数据集系列
| 分区 | 样本量 | 状态 |
|---|---|---|
| Part 1 | ~200,000 | 当前分区 |
| Part 2-5 | 各~200,000 | 可用 |
创建方法
- 合成生成技术:
- 生成Twi语句
- 通过TTS模型合成语音
- 质量过滤(>1KB)
- 对齐验证
- 格式标准化
应用场景
- 语音识别模型训练
- 语音合成系统开发
- 语音转语音翻译
- 关键词识别
- 语音学研究
- 语言模型预训练
使用限制
- 合成数据可能无法完全反映自然语音特征
- 方言覆盖可能不均衡
- 受限于合成模型的说话人特征
- 需遵循CC BY 4.0署名要求
引用格式
bibtex @dataset{twi_speech_parallel_1m_2025, title={Twi Speech-Text Parallel Dataset: The Largest Speech Dataset for Twi Language}, author={Owusu, Michael Seth}, year={2025}, publisher={Hugging Face}, note={1 Million synthetic speech-text pairs across 5 parts}, url={https://huggingface.co/datasets/michsethowusu/twi-speech-text-parallel-synthetic-1m-part001} }




