mteb/MIRACLRetrieval_ko_top_250_only_w_correct-v2
收藏资源简介:
--- dataset_info: - config_name: corpus features: - name: _id dtype: string - name: text dtype: string - name: title dtype: string splits: - name: test num_bytes: 18438464.158354588 num_examples: 43293 download_size: 16674804 dataset_size: 18438464.158354588 - config_name: default features: - name: query-id dtype: string - name: corpus-id dtype: string - name: score dtype: int64 splits: - name: test num_bytes: 83188.0 num_examples: 3057 download_size: 31571 dataset_size: 83188.0 - config_name: queries features: - name: _id dtype: string - name: text dtype: string splits: - name: test num_bytes: 13875.0 num_examples: 213 download_size: 10034 dataset_size: 13875.0 configs: - config_name: corpus data_files: - split: test path: corpus/test-* - config_name: default data_files: - split: test path: data/test-* - config_name: queries data_files: - split: test path: queries/test-* ---
The dataset consists of three parts: corpus, default configuration, and queries. The corpus part includes document titles and text, the default configuration part includes query ID, corpus ID, and score, and the queries part contains only the query text. Each part provides a test set with information on the number and size of examples.



