OA-STM-Corpus
收藏资源简介:
这是一个包含科学、技术和医学领域开放获取文章的语料库,涵盖农业、天文学、生物学、化学、计算机科学、地球科学、工程、材料科学、数学和医学10个领域。数据集提供了每篇文章的XML源文件、简单文本版本以及多种自动和手动标注的版本,旨在为NLP、语言学和文本挖掘研究提供资源。
This is a corpus comprising open-access articles in the fields of science, technology, and medicine, spanning ten disciplines including agriculture, astronomy, biology, chemistry, computer science, earth sciences, engineering, materials science, mathematics, and medicine. The dataset provides XML source files for each article, a plain text version, and multiple versions with both automated and manual annotations, designed to serve as a resource for NLP, linguistics, and text mining research.
数据集概述
数据集名称
An Open Access Corpus of Scientific, Technical, and Medical Content
数据集目的
提供一个包含多个科学、技术和医学领域的开放访问语料库,以支持自然语言处理(NLP)、语言学和文本挖掘的研究、开发和应用。
数据集内容
- 领域范围:农业、天文学、生物学、化学、计算机科学、地球科学、工程、材料科学、数学、医学。
- 文章数量:每个领域11篇文章,共110篇文章。
- 文章来源:Elsevier的开放访问内容,具有Creative Commons CC-BY许可证。
数据集结构
- SourceXML:110个稍微修改过的XML源文件。
- SourceText:110个可读文本提取,便于文本挖掘。
- CoreSC:110个CoreSC话语模型注释。
- Treebank:10个手动创建的树库文件。
- Stanford:110个来自Stanford Core NLP的自动注释。
- GENIA:110个来自GENIA工具的自动注释。
- Wikification:10个来自Spotlight和类似工具的注释。
数据集特色
- 提供多种类型的注释,包括词性标签、句子断点、NP和VP块、词形、句法成分解析、维基百科概念识别和话语分析。
- 包含一个默认测试集,由10篇文章组成,用于手动审查和纠正测试数据。
数据集使用
- 数据集旨在用于NLP、语言学和文本挖掘的研究和开发,特别是针对科学、技术和医学领域的文本处理。
- 鼓励用户对数据集进行注释,以比较不同注释算法的性能,并自动选择特征以创建更高级别的注释。




