相关数据集
古吉拉特口语化语音数据
印度古吉拉特语口语化语音数据,反映了真实世界的互动情境。此数据集标注了文本内容、说话人身份性别等多种属性,由多名来自不同地域和文化背景的印度人录制,准确性高,易用性强,为语音识别相关研究及应用提供了丰富的资源,有助于模型面对真实世界的多样性时能够表现出色。我们严格遵循数据保护法规和隐私规定,确保数据采集、存储和使用的过程中维护用户的隐私和合法权益,所有数据均遵循GDPR, CCPA, PIPL。
数据堂150
175小时泰语语音数据_对话(手机)
泰语语音数据_对话(手机),基于约二十个常见主题来模拟录制。此数据集标注了文本内容、句时间戳、说话人身份、性别等多种属性,由322名来自不同地域和文化背景的泰国本土人录制,准确性高,为语音识别相关研究及应用提供了丰富的资源,经多家AI公司验证:有助于模型面对真实世界的多样性时能够表现出色。我们严格遵循数据保护法规和隐私规定,确保数据采集、存储和使用的过程中维护用户的隐私和合法权益,所有数据均遵循G
数据堂120
104小时巴西葡萄牙语语音数据_对话(电话)
巴西葡萄牙语语音数据_对话(电话),基于约三十个常见主题来模拟录制。此数据集标注了文本内容、句时间戳、说话人身份、性别等多种属性,由118名来自不同地域和文化背景的巴西本土人录制,准确性高,为语音识别相关研究及应用提供了丰富的资源,经多家AI公司验证:有助于模型面对真实世界的多样性时能够表现出色。我们严格遵循数据保护法规和隐私规定,确保数据采集、存储和使用的过程中维护用户的隐私和合法权益,所有数据
数据堂150
261小时日语手机采集语音数据
日本日语语音数据_朗读(手机),基于给定的脚本朗读并模拟录制,涵盖通用领域。此数据集标注了文本内容等多种属性,由1006名日本母语发音人参与录制,覆盖东部、西部、九州地区,其中东部地区占比最多,口音正宗,文本经过人工校对,准确率高,为语音识别相关研究及应用提供了丰富的资源,经多家AI公司验证:有助于模型面对真实世界的多样性时能够表现出色。我们严格遵循数据保护法规和隐私规定,确保数据采集、存储和使用
数据堂120



