遇见数据集

maidalun1020/CrosslingualRetrievalLawEn2Zh

收藏
Hugging Face2023-12-04 更新2024-03-04 收录
官方服务:

资源简介:

--- license: apache-2.0 configs: - config_name: default data_files: - split: queries path: data/queries-* - split: corpus path: data/corpus-* dataset_info: features: - name: id dtype: string - name: text dtype: string splits: - name: queries num_bytes: 5832742 num_examples: 26642 - name: corpus num_bytes: 4789805 num_examples: 4899 download_size: 6283345 dataset_size: 10622547 ---

许可证: Apache-2.0 配置方案: - 配置名称: default(默认) 数据文件: - 数据拆分: 查询集(queries) 路径: data/queries-* - 数据拆分: 语料库(corpus) 路径: data/corpus-* 数据集信息(dataset_info): 特征字段(features): - 名称: id 数据类型: 字符串 - 名称: text 数据类型: 字符串 数据拆分(splits): - 拆分名称: queries 字节大小: 5832742 样本数量: 26642 - 拆分名称: corpus 字节大小: 4789805 样本数量: 4899 下载大小(download_size): 6283345 数据集总大小(dataset_size): 10622547

提供机构:
maidalun1020
原始信息汇总

数据集概述

许可证

  • Apache 2.0

配置

  • 默认配置
    • 数据文件
      • 查询集(queries): data/queries-*
      • 语料库(corpus): data/corpus-*

数据集信息

  • 特征

    • id: 字符串类型
    • text: 字符串类型
  • 分片

    • 查询集(queries)
      • 字节数: 5832742
      • 样本数: 26642
    • 语料库(corpus)
      • 字节数: 4789805
      • 样本数: 4899
  • 下载大小: 6283345 字节

  • 数据集大小: 10622547 字节

二维码
社区交流群
二维码
科研交流群
商业服务