sentence-transformers/wikianswers-duplicates
收藏资源简介:
--- language: - en multilinguality: - monolingual size_categories: - 100M<n<1B task_categories: - feature-extraction - sentence-similarity pretty_name: WikiAnswers Duplicate Questions tags: - sentence-transformers dataset_info: config_name: pair features: - name: anchor dtype: string - name: positive dtype: string splits: - name: train num_bytes: 78825722188 num_examples: 761379586 download_size: 33891162136 dataset_size: 78825722188 configs: - config_name: pair data_files: - split: train path: pair/train-* --- # Dataset Card for WikiAnswers Duplicate Questions This dataset contains duplicate questions from the [WikiAnswers Corpus](https://github.com/afader/oqa#wikianswers-corpus), formatted to be easily used with Sentence Transformers to train embedding models. ## Dataset Subsets ### `pair` subset * Columns: "anchor", "positive" * Column types: `str`, `str` * Examples: ```python { 'anchor': 'How many calories is in a handful of strawberries?', 'positive': 'How many calories are in a strawberry popsickles?', } ``` * Collection strategy: Reading the WikiAnswers dataset from [embedding-training-data](https://huggingface.co/datasets/sentence-transformers/embedding-training-data), which has lists of duplicate questions. I've considered all adjacent questions as a positive pair, plus the last and first caption. So, e.g. 5 duplicate questions results in 5 duplicate pairs. * Deduplified: No
--- language: - 英语 multilinguality: - 单语言 size_categories: - 1亿 < 样本数 < 10亿 task_categories: - 特征提取 - 句子相似度 pretty_name: WikiAnswers重复问句数据集 tags: - 句子变换器(Sentence Transformers) dataset_info: 配置名称: pair 特征: - 名称: anchor 数据类型: 字符串类型 - 名称: positive 数据类型: 字符串类型 拆分方式: - 名称: 训练集 字节数: 78825722188 样本数: 761379586 下载大小: 33891162136 数据集总大小: 78825722188 configs: - 配置名称: pair 数据文件: - 拆分: 训练集 路径: pair/train-* --- # WikiAnswers重复问句数据集卡片 本数据集源自[WikiAnswers语料库(WikiAnswers Corpus)](https://github.com/afader/oqa#wikianswers-corpus)中的重复问句,经标准化格式化后可直接用于句子变换器(Sentence Transformers)训练文本嵌入模型。 ## 数据集子集 ### `pair` 子集 * 列名:"anchor"、"positive" * 列数据类型:字符串类型、字符串类型 * 示例: python { 'anchor': '一小把草莓含有多少卡路里?', 'positive': '一根草莓味冰棒含有多少卡路里?', } * 数据集构建策略:从[嵌入训练数据集](https://huggingface.co/datasets/sentence-transformers/embedding-training-data)中读取WikiAnswers数据集,该数据集包含多组重复问句列表。本数据集将所有相邻的问句视为正样本对,同时将首尾问句也纳入配对范畴。例如,若存在5组重复问句,则生成5组重复样本对。 * 去重处理:否
WikiAnswers Duplicate Questions 数据集概述
基本信息
- 语言: 英语
- 多语言性: 单语种
- 数据集大小: 100M<n<1B
- 任务类别: 特征提取, 句子相似度
- 标签: sentence-transformers
数据集详情
- 配置名称: pair
- 特征:
- anchor: 字符串类型
- positive: 字符串类型
- 分割:
- 训练集:
- 字节数: 78825722188
- 样本数: 761379586
- 训练集:
- 下载大小: 33891162136
- 数据集大小: 78825722188
数据集子集
pair 子集
-
列: "anchor", "positive"
-
列类型: 字符串, 字符串
-
示例: python { anchor: How many calories is in a handful of strawberries?, positive: How many calories are in a strawberry popsickles?, }
-
收集策略: 从 embedding-training-data 读取 WikiAnswers 数据集,该数据集包含重复问题列表。将所有相邻问题视为正样本对,加上最后一个和第一个标题。例如,5个重复问题形成5个重复对。
-
去重: 否




