遇见数据集

东盟语料-高质量数据集

收藏
北部湾大数据交易中心2026-03-16 更新2026-03-17 收录
官方服务:

资源简介:

数据集模态涵盖语音和文本,内容覆盖老挝、泰国对应的中英文平行语料;老挝语ASR数据;老挝SFT、强化学习数据;柬埔寨试题数据

This dataset covers both speech and text modalities, with content including Chinese-English parallel corpora for Lao and Thai languages, Lao ASR data, Lao SFT and reinforcement learning data, and Cambodian test question datasets.

创建时间:
2026-03-16
搜集汇总
数据集介绍
东盟语料-高质量数据集 数据集图片
背景与挑战
背景概述
该数据集是一个高质量的多模态语言资源库,主要涵盖东盟国家语言,包括老挝和泰国的中英文平行语料、老挝语语音识别数据,以及老挝语和柬埔寨语的特定应用数据。其特点在于结合语音和文本模态,支持多语言处理任务,并针对机器翻译、语音识别和自然语言处理优化提供了专门数据集。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务