遇见数据集

VmaxRL/bugpilot-bugintro-lm-modify-gpt55-1k

收藏
Hugging Face2026-04-30 更新2026-05-03 收录
官方服务:

资源简介:

BugPilot BugIntro LM_modify GPT-5.5 1k数据集是一个关于BugPilot LM_modify任务的语料库,来源于Demiurge LM_modify恢复工件。数据集包含1000行数据,列包括实例ID、补丁、从失败到通过的序列、从通过到通过的序列、图像名称、代码仓库和问题陈述。问题陈述使用azure/gpt-5.5-1重新生成。此外,数据集还提供了补丁统计信息作为辅助元数据,包括行级和仓库级的统计数据,如添加的行数、删除的行数、总更改行数、更改的文件数等。

The BugPilot BugIntro LM_modify GPT-5.5 1k dataset is a corpus for the BugPilot LM_modify task, exported from the Demiurge LM_modify recovery artifacts. It contains 1000 rows with columns including instance_id, patch, FAIL_TO_PASS, PASS_TO_PASS, image_name, repo, and problem_statement. Problem statements were regenerated for all rows using azure/gpt-5.5-1. Additionally, the dataset includes patch statistics as sidecar metadata, such as row-level and repo-level aggregates, including lines of code added, lines removed, total changed lines, files changed, etc.

提供机构:
VmaxRL
搜集汇总
数据集介绍
VmaxRL/bugpilot-bugintro-lm-modify-gpt55-1k 数据集图片
构建方式
该数据集源自Demiurge框架下的LM_modify恢复工件,通过配额均衡策略从BugPilot BugIntro语料库中精心筛选而成。构建过程中,采用azure/gpt-5.5-1模型对所有条目的问题陈述进行重新生成,以确保语义的准确性与一致性。最终数据集以Parquet格式存储,包含1000条训练样本,每条样本涵盖instance_id、patch、FAIL_TO_PASS、PASS_TO_PASS、image_name、repo及problem_statement七个核心字段。
特点
数据集的核心特色在于其丰富的补丁统计元数据,以侧车文件形式发布,包括行级、仓库级与总体聚合三种粒度的统计信息。补丁统计涵盖新增行数、删除行数、总更改行数、涉及文件数、hunk数及文件状态计数等关键指标,使得研究者能够深入分析补丁的结构特征。此外,保持SWE-Smith风格训练划分不变的前提下,提供了可扩展的辅助信息,增强了数据集的实用性与研究价值。
使用方法
用户可直接加载data/train.parquet文件中的1000条训练数据,使用pandas等库读取为DataFrame格式进行下游任务。补丁统计元数据存放于metadata目录下,支持通过instance_id键值与主数据集进行关联分析。对于需要仓库级聚合分析的研究,可加载patch_stats_by_repo.parquet文件;整体概览则可通过patch_stats_summary.json获取。推荐结合problem_statement与patch字段开展软件缺陷修复相关的文本生成或理解任务。
背景与挑战
背景概述
BugPilot-BugIntro-LM-Modify-GPT55-1k数据集由Demiurge团队于近期构建,旨在为软件缺陷修复领域提供高质量的训练与评估基准。该数据集聚焦于通过语言模型对代码补丁进行修改与恢复的任务,核心研究问题是如何利用大语言模型(如GPT-5.5)自动生成问题描述并辅助修复真实软件缺陷。数据集包含1000个实例,涵盖了实例ID、补丁、测试用例状态、仓库信息及问题陈述等关键字段,其中问题陈述均通过Azure GPT-5.5模型重新生成,确保了文本质量与多样性。该数据集对软件工程与人工智能交叉领域具有重要意义,为自动化缺陷定位与修复研究提供了标准化的数据支持,推动了代码智能与程序修复技术的发展。
当前挑战
该数据集所解决的领域问题主要在于软件缺陷自动修复中的补丁生成与问题描述匹配挑战,即如何利用语言模型准确理解缺陷上下文并生成有效的修复补丁。构建过程中面临多项挑战:首先,从Demiurge恢复工件的LM_modify任务中提取平衡配额的任务实例,需要确保样本的多样性与代表性,避免偏差;其次,使用GPT-5.5重新生成问题陈述时需保证句子的连贯性与问题描述的一致性,同时控制生成质量以避免噪声;此外,补丁统计信息的发布需维护原始SWE-Smith风格训练集的不变性,通过侧边元数据(如增加行数、修改文件数等)提供细粒度特征,这对数据管理提出了高要求。
常用场景
经典使用场景
在软件工程与自动化编程的交叉领域,BugPilot BugIntro LM_modify GPT-5.5 1k数据集常被用于训练和评估基于大语言模型的程序修复系统。该数据集包含1000个经精心构造的任务实例,每个实例均提供详细的缺陷描述、修复补丁及测试用例转换信息,使得研究者能够以标准化的方式训练模型学习从问题陈述到代码补丁的映射关系。其经典使用场景聚焦于自动化缺陷定位与修复的端到端学习,尤其适用于验证语言模型在理解复杂编程问题后生成精确代码修改的能力。
解决学术问题
该数据集有效解决了自动化程序修复研究中缺乏高质量、规模适中的训练语料的问题。传统数据集往往补丁粒度粗糙或缺乏标准化的测试验证框架,而BugPilot通过引入FAIL_TO_PASS和PASS_TO_PASS字段,精确刻画了修复前后测试行为的动态变化,为学术研究提供了可量化、可复现的评估基础。它推动了从统计机器修复向基于深度语义理解的范式转变,显著提升了模型在跨仓库、跨语言场景下的泛化能力,其意义在于为缺陷修复的自动化水平树立了新的学术标杆。
衍生相关工作
基于BugPilot数据集,衍生出若干经典研究工作,例如SWE-bench风格的基准测试构建,通过统一的任务格式评估语言模型在真实仓库上的修复成功率。研究者还利用该数据集的补丁统计元数据(如修改行数、文件数),提出了修复复杂度感知的模型架构,并发展了基于对比学习的缺陷定位方法。另一方向是利用其测试状态转换信息设计奖励函数,强化学习框架得以在模拟环境中优化修复策略,这些工作共同推动了从静态补丁生成到动态程序行为理解的学术进步。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务