MultiSpider 2.0
收藏资源简介:
MultiSpider 2.0是一个多语言文本到SQL的数据集,扩展了Spider 2.0,支持八种语言,包括英语、德语、法语、西班牙语、葡萄牙语、日语、中文和越南语。该数据集包含来自云市场的大型真实数据库,并具有跨域模式和组合SQL的难度。数据集由5056个NL-SQL对组成,涵盖200个企业数据库,覆盖8种语言。数据集旨在评估语言模型在多语言环境下的性能,并为文本到SQL任务提供基准。
MultiSpider 2.0 is a multilingual text-to-SQL dataset derived from Spider 2.0, supporting eight languages including English, German, French, Spanish, Portuguese, Japanese, Chinese, and Vietnamese. This dataset contains large-scale real-world databases sourced from cloud marketplaces, and features cross-domain schemas and compositional SQL query difficulty. It comprises 5,056 NL-SQL pairs, covering 200 enterprise-level databases across the eight supported languages. The dataset is designed to evaluate the performance of language models in multilingual settings, and serves as a benchmark for the text-to-SQL task.
Multilingual_Text_to_SQL 数据集概述
数据集简介
- 小型多语言自然语言转SQL(text-to-SQL)问题数据集集合
- 包含用于实验和评估的BigQuery数据库模式
- 数据集状态标记为待更新(TO BE UPDATED)
数据集结构
数据库模式目录
- 位置:
https://github.com/phkhanhtrinh23/Multilingual_Text_to_SQL/databases/ - 包含导出的BigQuery、Snowflake和SQLite模式
- 提供多个公共数据集的JSON/DDL元数据
- 包含描述性JSON元数据和可能的DDL.csv文件
- 帮助识别表和列名称以进行SQL生成
问题文件目录
- 位置:
https://github.com/phkhanhtrinh23/Multilingual_Text_to_SQL/questions/ - 采用JSONL格式的多语言问题文件
- 每行包含单个JSON对象,描述自然语言查询和目标数据库
- 包含实例ID和目标数据库名称
语言支持
- 支持八种语言:英语(en)、德语(de)、西班牙语(es)、法语(fr)、日语(ja)、葡萄牙语(pt)、越南语(vi)、中文(zh)
主要用途
- 聚合数据库表定义和样本,帮助将自然语言问题映射到模式元素
- 提供用于训练/评估text-to-SQL系统的多语言问题集
- 用于生成SQL模板或为解析器构建映射层
使用示例
- 问题文件示例:
https://github.com/phkhanhtrinh23/Multilingual_Text_to_SQL/questions/spider2-lite_vi.jsonl




