遇见数据集

LilyZZZ/RobustAPI

收藏
Hugging Face2024-02-27 更新2024-03-04 收录
官方服务:

资源简介:

RobustAPI数据集包含来自StackOverflow的1208个编程问题,涉及24个Java API。该数据集还包括API使用模式的总结以及对多个大型语言模型(如GPT-3.5、GPT-4、Llama、PolyCoder和Vicuna)的评估。数据集由Li Zhong和Zilong Wang整理,采用MIT许可证。

RobustAPI数据集包含来自StackOverflow的1208个编程问题,涉及24个Java API。该数据集还包括API使用模式的总结以及对多个大型语言模型(如GPT-3.5、GPT-4、Llama、PolyCoder和Vicuna)的评估。数据集由Li Zhong和Zilong Wang整理,采用MIT许可证。

提供机构:
LilyZZZ
原始信息汇总

数据集卡片:RobustAPI

数据集详情

数据集描述

RobustAPI 包含来自 StackOverflow 的编程问题,重点关注 24 个 Java API。它还包括 API 使用模式的总结和在多种大型语言模型上的评估。

  • 创建者: Li Zhong 和 Zilong Wang
  • 许可证: MIT 许可证

数据集来源

用途

直接用途

RobustAPI 可用于评估大型语言模型在代码生成任务中的性能,并分析 API 使用模式。

非预期用途

不鼓励将数据集用于非预期目的或恶意活动。

数据集结构

RobustAPI 以 JSONL 格式提供。每个数据点包含一个编程问题以及相应的 API 使用模式和来自多种大型语言模型的评估。

数据集创建

创建理由

该数据集是为了研究使用大型语言模型进行代码生成任务的可行性,并研究这些模型与传统来源(如 StackOverflow)相比的鲁棒性和可靠性。

源数据

数据收集和处理

数据收集过程涉及从 StackOverflow 收集与 24 个 Java API 相关的编程问题。API 使用模式和评估是通过多种大型语言模型进行的。

引用

引用该数据集时,请使用以下格式:

BibTeX:

@misc{zhong2023chatgpt, title={Can ChatGPT replace StackOverflow? A Study on Robustness and Reliability of Large Language Model Code Generation}, author={Li Zhong and Zilong Wang}, year={2023}, eprint={2308.10335}, archivePrefix={arXiv}, primaryClass={cs.CL} }

APA:

Zhong, L., & Wang, Z. (2023). Can ChatGPT replace StackOverflow? A Study on Robustness and Reliability of Large Language Model Code Generation. arXiv preprint arXiv:2308.10335.

搜集汇总
数据集介绍
LilyZZZ/RobustAPI 数据集图片
构建方式
在软件工程与自然语言处理交叉领域,代码生成模型的可信度评估日益成为关键议题。RobustAPI数据集由研究者Li Zhong与Zilong Wang构建,旨在系统探究大型语言模型在代码生成任务中的鲁棒性与可靠性。其构建过程始于从StackOverflow平台系统性地收集与24个代表性Java API相关的编程问题,总计1208个样本。随后,研究者利用GPT-3.5、GPT-4、Llama、PolyCoder及Vicuna等多种主流大型语言模型对这些查询进行代码生成,并记录相应的API使用模式与模型输出评估结果。整个数据集以JSONL格式存储,确保每条数据包含原始问题、API模式及多模型评估信息,为后续分析提供结构化基础。
特点
该数据集的核心特点在于其多维度的评估视角与精细化的数据标注。它不仅涵盖了来自真实开发者社区的StackOverflow编程问题,还整合了五种不同架构与规模的大型语言模型的生成结果,从而支持跨模型的鲁棒性对比分析。每个数据点均附带API使用模式的摘要,揭示了模型在特定API调用上的行为倾向与潜在缺陷。此外,1208个问题的规模虽非庞大,但聚焦于24个Java API的深度覆盖,确保了领域内的代表性。这种设计使RobustAPI成为评估代码生成模型在真实场景下可靠性的独特基准,尤其适用于研究模型对API语义理解的准确性与稳定性。
使用方法
研究人员与开发者可直接通过HuggingFace数据集库加载RobustAPI,使用JSONL格式的便利性简化了数据解析流程。典型应用场景包括:通过对比不同模型在同一编程问题上的输出,量化其代码生成质量与API使用正确性;或利用API模式标注,训练或微调模型以提升对特定Java库的调用能力。使用时需注意数据集的英语语言属性及MIT开源许可,确保合规性。建议结合论文《Can ChatGPT replace StackOverflow?》中的评估指标,如代码编译成功率与功能正确性,进行系统性分析。此外,该数据集也可作为教学资源,用于演示大型语言模型在软件工程任务中的优势与局限。
背景与挑战
背景概述
随着大规模语言模型在代码生成领域的迅猛发展,如何评估其在实际编程任务中的鲁棒性与可靠性成为学界与工业界共同关注的焦点。RobustAPI数据集由Li Zhong与Zilong Wang于2023年创建,旨在系统性地探究ChatGPT等模型能否替代StackOverflow等传统编程社区。该数据集从StackOverflow中精选了1208个与24个代表性Java API相关的编程问题,并整合了GPT-3.5、GPT-4、Llama、PolyCoder及Vicuna等多种模型对这些问题的生成结果与评估信息。RobustAPI的出现为代码生成模型的公平对比与可靠性分析提供了标准化的测试基准,推动了该领域从单一性能指标向鲁棒性与实用性并重的评估范式转变。
当前挑战
RobustAPI所应对的核心挑战在于,现有代码生成模型在真实API使用场景中常暴露出对输入扰动敏感、生成结果不可复用等鲁棒性缺陷,而传统评估指标如BLEU或准确率无法全面反映模型在复杂编程语境下的表现。数据集构建过程中,研究者需从海量StackOverflow问答中筛选出涵盖多种API调用模式的代表性题目,并确保每道题目的答案具有明确的正确性标准。此外,跨模型评估的公平性也是一大难题,不同模型对同一问题的输出格式、代码风格及错误类型差异显著,需要设计统一的评价体系以量化鲁棒性与可靠性,从而为后续研究提供可复现的对比基础。
常用场景
经典使用场景
RobustAPI数据集以其独特的聚焦视角,成为评估大型语言模型在代码生成任务中鲁棒性与可靠性的基准标杆。该数据集精心收集了来自StackOverflow的1208道编码问题,涵盖24个具有代表性的Java API,并整合了GPT-3.5、GPT-4、Llama、PolyCoder及Vicuna等多种主流模型的生成结果与评估信息。研究者通过对比模型输出与人类专家解答,系统性地考察模型在不同API使用场景下的表现差异,从而揭示模型在代码理解与生成中的优势与局限。这一场景为自然语言处理与软件工程交叉领域提供了标准化的测试平台。
衍生相关工作
RobustAPI的发布催生了多项衍生研究工作。其核心论文《Can ChatGPT replace StackOverflow?》发表于AAAI 2024,首次系统性地对比了大模型与社区知识在API使用上的差异,引发了对模型鲁棒性评估指标的重新审视。后续工作包括基于该数据集开发的鲁棒性增强训练策略(如对抗性API示例生成)、针对特定API的微调方法,以及跨模型一致性分析工具。这些工作共同构建了从基准测试到模型优化的闭环研究链,推动了代码生成领域从性能竞赛向可靠性评估的范式转变。
数据集最近研究
最新研究方向
在大型语言模型(LLM)代码生成的鲁棒性与可靠性评估领域,RobustAPI数据集的出现标志着从单一性能比较向多维度、细粒度验证的范式转变。该数据集精心挑选了StackOverflow上24个代表性Java API的1208个编程问题,并系统性地评估了GPT-3.5、GPT-4、Llama、PolyCoder和Vicuna等前沿模型在真实API使用场景下的表现。这一研究方向紧扣当前AI辅助编程的热点争议——ChatGPT能否替代StackOverflow这类传统知识库,通过量化模型在API调用正确性、异常处理及上下文适应性上的鲁棒性,揭示了LLM在复杂工程任务中的可靠性边界。其意义在于为开发者选择模型、优化提示策略提供了实证基础,同时推动了代码生成领域从“能生成”向“可靠生成”的演进,对构建可信赖的AI编程助手具有深远影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务