PEDANTIC
收藏资源简介:
PEDANTIC(专利明确性审查语料库)是一个新颖的数据集,包含14k个美国专利申请中与自然语言处理(NLP)相关的专利权利要求,标注了不明确的原因。该数据集通过一个全自动的流程构建,该流程从USPTO检索办公室行动文件,并使用大型语言模型(LLMs)提取不明确的原因。人类验证研究证实了该流程在生成高质量注释方面的准确性。PEDANTIC为专利AI研究人员提供了宝贵的资源,支持开发高级审查模型。
PEDANTIC (Patent Explicitness Disambiguation Corpus) is an innovative dataset that encompasses 14k patent applications from the United States with related patent claims in natural language processing (NLP), annotated with the reasons for ambiguity. The dataset is constructed through an automated process that retrieves office action documents from the USPTO and employs large language models (LLMs) to extract the reasons for ambiguity. Human validation studies have confirmed the accuracy of this process in generating high-quality annotations. PEDANTIC provides a valuable resource for patent AI researchers, supporting the development of advanced review models.
PEDANTIC: 专利权利要求明确性自动检查数据集
数据集概述
- 名称: PEDANTIC (Patent Definiteness Examination Corpus)
- 用途: 用于专利权利要求明确性自动检查研究
- 领域: 自然语言处理(NLP)相关专利
- 数据量: 14,000条美国专利权利要求
- 标注内容: 专利权利要求中的不明确性原因
数据来源与构建
- 来源: 美国专利商标局(USPTO)的审查意见文件
- 构建方法: 全自动流程
- 使用大型语言模型(LLMs)提取不明确性原因
- 质量验证: 人工验证研究确认标注质量
研究价值
- 填补空白: 首个针对专利明确性检查的公开标注数据集
- 应用潜力: 可提高专利起草和审查效率
- 评估方法: 实现了LLM-as-Judge评估框架
- 比较模型与审查员提出的不明确性原因
技术验证
- 基准测试:
- Qwen 2.5 32B和72B模型表现
- 与逻辑回归基线的比较结果
- 发现: 尽管LLM能正确识别原因,但难以超越基线模型
许可信息
- 代码许可: MIT许可证
- 数据许可: CC-BY 4.0
状态说明
- 当前状态: 数据集和实验代码即将发布




