BeyondSWE
收藏资源简介:
BeyondSWE是一个综合基准测试,评估代码代理在两个关键维度上的表现:解决范围(局部→全局)和知识范围(仓库内→跨仓库/领域/网络)。它包含500个真实世界的实例,跨越246个GitHub仓库,覆盖四种不同的任务设置。
BeyondSWE is a comprehensive benchmark that evaluates the performance of code agents across two core dimensions: problem-solving scope (local → global) and knowledge scope (within-repository → cross-repository/domain/network). It comprises 500 real-world instances spanning 246 GitHub repositories, covering four distinct task settings.
BeyondSWE 数据集概述
数据集简介
BeyondSWE 是一个用于评估代码智能体在真实世界软件工程挑战中性能的基准测试数据集。它旨在超越单仓库错误修复任务,从解决范围和知识范围两个维度对代码智能体进行全面评估。
核心亮点
- 规模与复杂性:包含 500 个真实世界实例,覆盖 246 个 GitHub 仓库。平均每个实例涉及 5.6 个文件和 209.9 行代码,其复杂性是 SWE-bench Verified 基准的 18 倍。
- 二维评估框架:同时扩展解决范围(从局部到全局)和知识范围(从仓库内到跨仓库/领域/网络)。
- 关键发现:前沿模型在 BeyondSWE 上的表现普遍低于 45%,尽管它们在 SWE-bench Verified 上能达到 80% 以上。
- 配套框架:引入了 SearchSWE 框架,该框架为评估编码中的深度研究能力提供了首个标准化基准,并包含严格的反作弊机制。
任务设置
数据集涵盖四种任务设置,代表了全谱系的软件工程挑战:
| 任务名称 | 解决范围 | 知识范围 | 仓库数 | 实例数 | 描述 |
|---|---|---|---|---|---|
| CrossRepo | 局部函数 | 跨仓库 | 67 | 200 | 修复需要参考外部仓库、Stack Overflow 和上游库的问题 |
| DomainFix | 局部函数 | 领域特定 | 12 | 72 | 解决需要专家知识的特定科学领域(量子物理、生物信息学等)中的错误 |
| DepMigrate | 全局仓库 | 官方文档 | 120 | 178 | 执行由破坏性依赖升级(如 NumPy 1.x → 2.0)触发的全代码库迁移 |
| Doc2Repo | 全局仓库 | 人类规范 | 50 | 50 | 根据自然语言规范构建一个完整的功能性仓库 |
主要结果与发现
- 45% 的性能天花板:前沿模型(如 Gemini 3 Pro, GPT-5.2, DeepSeek-V3.2 等)在 BeyondSWE 上的总体表现未能超过 45%。
- 无单一优胜者:不同模型在不同任务上领先,表明四种任务测试了根本不同的能力。
- 搜索有帮助,但整合仍是挑战:9 个模型中有 6 个在使用 SearchSWE 后性能提升,但提升并不一致。
- 质量优于数量:搜索次数与性能提升并非正相关。
数据获取与使用
-
数据地址:https://huggingface.co/datasets/AweAI-Team/BeyondSWE
-
加载方式: python from datasets import load_dataset dataset = load_dataset("AweAI-Team/BeyondSWE")
-
评估框架:完整的评估流程(包括 SearchSWE 设置和运行说明)请参考 AweAgent 项目(https://github.com/AweAI-Team/AweAgent)。
许可信息
本项目采用 CC BY 4.0 许可协议。



