PaperArena
收藏资源简介:
PaperArena 是一个用于评估基于大型语言模型的智能体在科学文献上的工具增强推理能力的基准测试平台。数据集包含从顶级开放获取AI会议中抽取的数万篇论文,并使用多模态大语言模型自动生成了初始的问题-答案对,最终形成了784个高质量的问题-答案对。该数据集旨在模拟真实研究场景,要求智能体在跨多篇论文和协调多种工具的基础上回答复杂的研究问题。
PaperArena is a benchmark platform for evaluating the tool-augmented reasoning capabilities of large language model-based AI Agents on scientific literature. The dataset includes tens of thousands of papers sampled from top-tier open-access AI conferences. Initial question-answer pairs were automatically generated from these papers via multimodal large language models, eventually yielding 784 high-quality question-answer pairs. This dataset is designed to simulate real-world research scenarios, requiring AI Agents to answer complex research questions by cross-referencing multiple papers and coordinating multiple tools.
PaperArena 数据集概述
数据集基本信息
- 名称:PaperArena
- 类型:评估基准数据集
- 领域:科学文献处理与智能体推理
- 状态:数据集即将发布
核心目标
PaperArena是一个专门针对科学文献的工具增强智能体推理评估基准,旨在测试大型语言模型智能体在真实科学研究场景中的表现。
关键特性
多步骤推理
- 评估智能体在模拟科学工作流程中的多步骤推理能力
- 要求智能体顺序使用工具(如PDF解析器、网络搜索)来追踪声明和验证结果
多模态理解
- 评估智能体对文本、图表、表格和公式的多模态理解能力
- 任务涉及将视觉数据与文本声明对齐或比较图表趋势与表格指标
跨文档整合
- 评估智能体从多篇论文中整合信息的能力
- 任务包括根据引用工作验证声明或从其他文档检索实现细节
数据库接口
- 测试智能体与结构化论文数据库交互的能力
- 智能体必须制定精确的元数据查询,解释返回结果,并将检索到的证据整合到推理步骤中
数据集构造
采用以工具为中心的流水线生成问答对:
- 使用工具库和预定义工具链经验指导大语言模型从科学论文创建初始问答对
- 通过半自动问答验证(包括问题混淆、答案标准化和人工审查)确保高质量和高难度
性能表现
- 最先进的智能体平均准确率仅为38.78%
- 在困难子集上,准确率下降至仅18.47%
- 所有测试的智能体都表现出低效的工具使用模式
获取方式
- Hugging Face:https://example.com
- Google Drive:https://example.com
相关资源
- 论文地址:https://arxiv.org/abs/2510.10909
- 代码仓库:https://github.com/Melmaphother/PaperArena




