tasksource/leandojo
收藏官方服务:
资源简介:
LeanDojo数据集是一个用于定理证明的数据集,结合了检索增强语言模型,旨在通过检索相关信息和语言模型的能力来辅助定理的证明过程。
The LeanDojo dataset is a dataset for theorem proving that integrates retrieval-augmented language models, aiming to assist the theorem proving process by retrieving relevant information and leveraging the capabilities of language models.
提供机构:
tasksource原始信息汇总
数据集概述
数据集名称
- LeanDojo
数据集描述
- LeanDojo 是一个用于定理证明的数据集,它结合了检索增强的语言模型。
数据集创建者
- 创建者包括:Kaiyu Yang, Aidan Swope, Alex Gu, Rahul Chalamala, Peiyang Song, Shixing Yu, Saad Godil, Ryan Prenger, Anima Anandkumar。
数据集发布年份
- 发布于2023年。
数据集许可证
- 许可证类型为 CC-BY-2.0。
搜集汇总
数据集介绍

构建方式
在定理证明与人工智能的交叉领域中,LeanDojo数据集应运而生,旨在推动基于检索增强语言模型的自动定理证明研究。该数据集通过系统性地收集并整理Lean交互式定理证明器中的大量证明脚本与策略调用,构建了一个包含证明状态、战术应用及环境信息的结构化语料库。具体而言,研究者从开源数学库及项目中提取了丰富的证明示例,并利用Lean的API记录每一步推理过程中的上下文,最终形成了可用于训练和评估语言模型的高质量数据。
特点
LeanDojo数据集的核心特点在于其深度结合了形式化数学证明与自然语言处理技术。它不仅提供了海量的证明步骤序列,还标注了每个步骤所依赖的假设、定义及已证明定理,从而支持模型学习复杂的推理链。此外,数据集内嵌了检索增强的机制,允许模型在推理时动态访问相关定理和引理,显著提升了证明搜索的效率与准确性。这种结构化的标注与可检索性,使其成为评估和训练神经符号推理系统的理想基准。
使用方法
使用LeanDojo数据集时,研究者可将其作为训练数据,输入到基于Transformer的序列到序列模型中,以学习从证明状态到战术动作的映射。具体实践中,用户需通过HuggingFace的datasets库加载数据,并配合Lean环境进行环境交互。数据集中的每个样本包含前提、目标和动作,适合用于监督学习;同时,其检索组件可通过向量数据库集成,实现动态知识召回。推荐在配备GPU的计算集群上运行,并参考官方GitHub仓库中的示例代码完成模型微调与评估。
背景与挑战
背景概述
在人工智能与形式化数学交叉的前沿领域,定理证明的自动化一直是极具挑战性的核心问题。LeanDojo数据集由加州理工学院、卡内基梅隆大学及英伟达等机构的研究人员于2023年共同创建,旨在利用检索增强的语言模型推动交互式定理证明的进步。该数据集基于Lean证明助手,包含了大量形式化数学定理及其证明过程,核心研究问题在于如何通过外部知识检索与语言模型结合,提升定理证明的准确性与效率。LeanDojo的发布为机器学习驱动的数学推理提供了标准化基准,显著促进了相关领域的发展,成为连接自然语言处理与形式化验证的关键桥梁。
当前挑战
LeanDojo所应对的领域挑战集中于形式化定理证明中复杂推理与知识整合的难题,传统方法难以处理大规模数学库中的长链逻辑推导。在构建过程中,研究人员面临双重挑战:一方面,需要从Lean社区海量、异构的证明脚本中提取结构化数据,确保证明步骤的完整性与一致性;另一方面,设计高效的检索机制以匹配语言模型对上下文敏感的需求,平衡检索速度与证明质量。此外,数据集覆盖的数学领域广度和证明深度的不均衡性,也对模型的泛化能力提出了严峻考验,这些挑战共同构成了当前自动化定理证明研究的核心瓶颈。
常用场景
经典使用场景
在人工智能与形式化验证的交叉领域,LeanDojo数据集作为首个大规模、可交互的数学定理证明基准,为神经符号推理提供了关键实验平台。该数据集包含超过10万条从Lean数学库中提取的定理证明轨迹,每个证明步骤均附带完整的状态信息和可执行的策略操作。研究者可利用该数据集训练语言模型学习从证明状态到策略动作的映射,或构建检索增强的证明搜索系统。其经典应用场景包括评估模型在Coq风格依赖类型理论下的泛化能力,以及验证基于注意力机制的定理证明器在复杂数学命题上的表现。通过提供标准化的训练-验证-测试划分,LeanDojo使得不同架构的神经定理证明方法得以公平比较,成为形式化数学与机器学习交叉学科研究的基准测试床。
实际应用
在工业级数学软件验证与安全关键系统测试中,LeanDojo数据集展现出独特的实用价值。基于该数据集训练的模型可辅助工程师自动生成形式化证明脚本,显著降低在密码学协议、区块链智能合约及航天器控制软件等领域的验证成本。例如,在编译器正确性验证任务中,模型能够从LeanDojo学习到的证明模式中迁移知识,自动补全缺失的定理推导步骤。此外,该数据集还支撑了交互式证明助手(如Lean 4)的智能补全功能开发,通过预测用户下一步策略操作来提升证明开发效率。金融领域的高频交易算法验证、医疗设备固件的形式化审查等场景同样受益于其提供的可复用证明策略库,使得非专业用户也能借助AI辅助完成复杂的逻辑论证。
衍生相关工作
LeanDojo的问世催生了一系列具有里程碑意义的衍生工作。其中最具代表性的是基于检索增强的证明器Prover-Generator架构,该工作利用LeanDojo中的证明状态编码器构建稠密检索索引,在测试集上将定理证明成功率提升了15%以上。后续研究进一步将其与蒙特卡洛树搜索结合,提出了Lean-STaR框架,通过强化学习从错误证明路径中学习修正策略。在表示学习方面,ProofNet工作借鉴了LeanDojo的证明轨迹标注方式,构建了针对数学竞赛题目的跨领域验证基准。此外,多模态定理证明研究开始利用该数据集中的策略-状态对训练视觉语言模型,探索将数学公式图像直接映射为证明动作的可能性。这些工作共同构成了形式化推理从符号主义到连接主义演进的关键技术脉络。
以上内容由遇见数据集搜集并总结生成



