HUPD/hupd
收藏资源简介:
哈佛USPTO专利数据集(HUPD)是一个大规模、结构良好且多用途的英文实用专利申请语料库,涵盖了2004年至2018年间向美国专利商标局(USPTO)提交的申请。数据集包含每个专利申请的详细信息,如申请号、标题、决定状态、分类代码、发明人信息、摘要、权利要求等,共34个数据字段。数据集的主要用途包括专利接受预测、自动主题分类、语言建模和摘要生成。数据集仅包含英文文本,领域为专利(知识产权)。
哈佛USPTO专利数据集(HUPD)是一个大规模、结构良好且多用途的英文实用专利申请语料库,涵盖了2004年至2018年间向美国专利商标局(USPTO)提交的申请。数据集包含每个专利申请的详细信息,如申请号、标题、决定状态、分类代码、发明人信息、摘要、权利要求等,共34个数据字段。数据集的主要用途包括专利接受预测、自动主题分类、语言建模和摘要生成。数据集仅包含英文文本,领域为专利(知识产权)。
数据集概述
数据集名称
- 名称:The Harvard USPTO Patent Dataset (HUPD)
- 别名:HUPD
数据集描述
- 概述:HUPD是一个大规模、结构良好的多用途英语专利申请语料库,涵盖了2004年1月至2018年12月期间向美国专利商标局(USPTO)提交的实用专利申请。
- 领域:专利(知识产权)
数据集内容
- 语言:仅包含英语文本
- 数据结构:每个专利申请由一个独立的JSON文件定义,文件名基于其申请号,包含34个数据字段,如申请和出版号、标题、决策状态、提交和出版日期、主要和次要分类代码、发明者、审查员、律师、摘要、声明、背景、总结和完整发明描述等。
数据集使用
- 任务类别:
- 填充掩码
- 摘要生成
- 文本分类
- 令牌分类
- 具体任务:
- 专利接受预测
- 自动主题(IPC/CPC)分类
- 语言建模
- 摘要生成
数据集创建
- 来源数据:数据来源于USPTO的Bulk Data Storage System和Patent Examination Research Dataset。
- 注释:数据集不包含任何人为或计算机生成的注释,除了由专利申请人或USPTO产生的信息。
- 数据偏移:数据集展示了随着时间概念的演变,特别是在专利接受标准上的变化。
数据集影响
- 社会影响:旨在对ML/NLP和Econ/IP社区产生积极影响。
- 潜在偏见:数据集存在性别、实体大小和地域分布的偏见,这些偏见在专利申请和接受率中有所体现。
许可证信息
- 许可证:CreativeCommons Attribution-NonCommercial-ShareAlike 4.0 International
引用信息
@article{suzgun2022hupd, title={The Harvard USPTO Patent Dataset: A Large-Scale, Well-Structured, and Multi-Purpose Corpus of Patent Applications}, author={Suzgun, Mirac and Melas-Kyriazi, Luke and Sarkar, Suproteem K. and Kominers, Scott Duke and Shieber, Stuart M.}, year={2022}, publisher={arXiv preprint arXiv:2207.04043}, url={https://arxiv.org/abs/2207.04043},




