maidalun1020/CrosslingualRetrievalLawEn2Zh
收藏资源简介:
--- license: apache-2.0 configs: - config_name: default data_files: - split: queries path: data/queries-* - split: corpus path: data/corpus-* dataset_info: features: - name: id dtype: string - name: text dtype: string splits: - name: queries num_bytes: 5832742 num_examples: 26642 - name: corpus num_bytes: 4789805 num_examples: 4899 download_size: 6283345 dataset_size: 10622547 ---
许可证: Apache-2.0 配置方案: - 配置名称: default(默认) 数据文件: - 数据拆分: 查询集(queries) 路径: data/queries-* - 数据拆分: 语料库(corpus) 路径: data/corpus-* 数据集信息(dataset_info): 特征字段(features): - 名称: id 数据类型: 字符串 - 名称: text 数据类型: 字符串 数据拆分(splits): - 拆分名称: queries 字节大小: 5832742 样本数量: 26642 - 拆分名称: corpus 字节大小: 4789805 样本数量: 4899 下载大小(download_size): 6283345 数据集总大小(dataset_size): 10622547
数据集概述
许可证
- Apache 2.0
配置
- 默认配置
- 数据文件
- 查询集(queries):
data/queries-* - 语料库(corpus):
data/corpus-*
- 查询集(queries):
- 数据文件
数据集信息
-
特征
- id: 字符串类型
- text: 字符串类型
-
分片
- 查询集(queries)
- 字节数: 5832742
- 样本数: 26642
- 语料库(corpus)
- 字节数: 4789805
- 样本数: 4899
- 查询集(queries)
-
下载大小: 6283345 字节
-
数据集大小: 10622547 字节



