MR, SST-1, SST-2, Subj, TREC, CR
收藏资源简介:
MR:电影评论,每条评论包含一个句子,任务是检测正面/负面评论。SST-1:斯坦福情感树库,是MR的扩展,提供训练/开发/测试分割和细粒度标签。SST-2:与SST-1相同,但移除了中性评论并使用二元标签。Subj:主观性数据集,任务是分类句子为主观或客观。TREC:TREC问题数据集,任务是将问题分类为6种问题类型。CR:客户对各种产品的评论,任务是预测正面/负面评论。
MR: Movie reviews, each containing a single sentence, with the task of detecting positive/negative reviews. SST-1: Stanford Sentiment Treebank, an extension of MR, providing training/development/test splits and fine-grained labels. SST-2: Similar to SST-1, but with neutral reviews removed and using binary labels. Subj: Subjectivity dataset, with the task of classifying sentences as subjective or objective. TREC: TREC question dataset, with the task of classifying questions into 6 question types. CR: Customer reviews of various products, with the task of predicting positive/negative reviews.
数据集概述
数据集列表及特性
| 数据集 | 类别数 | 平均句子长度 | 数据集大小 | 词汇量 | 在word2vec中出现的单词数 | 测试集大小 |
|---|---|---|---|---|---|---|
| MR | 2 | 20 | 10662 | 18765 | 16448 | CV |
| SST1 | 5 | 18 | 11855 | 17836 | 16262 | 2210 |
| SST2 | 2 | 19 | 9613 | 16185 | 14838 | 1821 |
| Subj | 2 | 23 | 10000 | 21323 | 17913 | CV |
| TREC | 6 | 10 | 5952 | 9592 | 9125 | 500 |
| CR | 2 | 19 | 3775 | 5340 | 5046 | CV |
| MPQA | 2 | 3 | 10606 | 6246 | 6083 | CV |
数据集详细描述
- MR: 电影评论数据集,每条评论包含一个句子,任务是检测评论的正负面情绪。
- SST-1: 斯坦福情感树库,是MR的扩展,提供细粒度标签(非常正面,正面,中性,负面,非常负面),数据实际以短语级别提供,训练模型同时处理短语和句子,测试时仅评估句子。
- SST-2: 与SST-1相同,但移除了中性评论,仅保留二元标签。
- Subj: 主观性数据集,任务是分类句子为主观或客观。
- TREC: TREC问题数据集,任务是将问题分类为6种类型。
- CR: 客户对各种产品的评论,任务是预测评论的正负面情绪。
- MPQA: 多视角问题回答数据集,任务是分类句子。




