Early Novels Dataset
收藏资源简介:
Early Novels Dataset包含早期小说作品的丰富书目元数据,这些作品收藏于宾夕法尼亚大学的Collection of British and American Fiction, 1660-1830 (CBAF)及其他地区藏书机构。该数据集由高质量的人工生成元数据组成,捕捉了比传统图书馆目录记录更全面的版本和副本特定信息。
The Early Novels Dataset encompasses a rich collection of bibliographic metadata for early novelistic works, housed within the University of Pennsylvania's Collection of British and American Fiction, 1660-1830 (CBAF), as well as other regional library collections. This dataset is composed of high-quality, manually generated metadata that captures more comprehensive edition and copy-specific information than traditional library catalog records.
数据集概述
数据集名称
Early Novels Dataset (END)
数据集内容
该数据集包含早期英语小说的书目元数据,这些小说主要收藏于宾夕法尼亚大学的Collection of British and American Fiction, 1660-1830 (CBAF),并包括其他区域藏书。数据集中的MARC目录记录通过定制子字段进行了丰富,旨在提供关于早期英语小说的结构化数据。
数据集特点
- 元数据质量:数据集中的元数据由人工生成,捕捉了比传统图书馆目录记录更全面的版本和副本特定信息。
- 定制子字段:基于标准的MARC记录,增加了定制设计的子字段,使用受控和叙述性词汇来描述传统编目范围之外的多种书目特征。
- 数据量:截至2018年11月,完整的数据集总计2,002条记录,核心十八世纪子集包含1,440条记录。
数据集格式
- MARCXML:最完整的数据格式,用于图书馆目录。
- Tabular Subsets:提供简化的数据子集,便于深入探索特定特征。
数据集使用
- 探索方式:可通过Google Sheets或Microsoft Excel等工具打开和查看.tsv文件。
- 数据分析:提供教程和可视化演示,指导用户如何使用Excel Pivot Tables等工具探索数据。
数据集结构
- MARCXML结构:基于标准MARC记录,增加了非标准的定制子字段,以收集新的信息类型。
- 子字段说明:详细描述了包括000至596字段在内的多个字段及其子字段,用于捕捉各种书目和副本特定信息。
数据集附加资源
- 全文本数据:正在初步阶段的全文本倡议,提供通过OCR创建的全文本文件,用于与END元数据结合进行主题建模。
数据集访问
数据集可通过提供的链接访问,包括完整数据和简化的表格子集,支持多种探索和分析需求。




