相关数据集
LeetCodeDataset
LeetCodeDataset是一个高质量的评价和训练代码生成模型的基准数据集,解决了大型语言模型研究中缺乏针对推理-focused编码基准和自包含训练测试床的问题。该数据集通过整理LeetCode平台上丰富的元数据、广泛的覆盖面、每个问题100+测试用例以及基于时间划分的训练测试集,使得模型可以在无污染的环境中评估和高效训练。数据集适用于代码生成任务,特别是在竞争级别的编程问题解决方面表现突出。
arXiv2025-04-20 更新3110
coderm-ef-trajectories-o4-mini-qwen3-30b
该数据集包含LLM法官验证编程问题代码解决方案的轨迹。每个轨迹都记录了完整的评估过程:问题、候选解决方案、法官推理、预测的正确性分数和实际执行结果。数据集适用于训练结果奖励模型、最佳选择、校准分析、错误分析和验证器集成等多种用途。数据集结构详细,包含任务ID、解决方案代码、法官响应等多个字段。数据集统计信息显示总轨迹数为2620,法官模型为Qwen/Qwen3-Coder-30B-A3B-Inst
Hugging Face2025-12-20 更新210
CodeContests
https://github.com/google-deepmind/code_contests?tab=readme-ov-file CodeContests 是一个有竞争力的机器学习编程数据集
极市2025-04-11 更新310
evanellis/evanellis_Codeforces-Python-Submissions_correct_with_h_a_k_prob_0.5_with_null_and_rejected_f_z_f
该数据集包含编程竞赛题目信息,每个题目有唯一的ID、名称、类型、评分、标签等属性。题目还包括时间限制、内存限制、问题描述、输入输出规范、示例输入输出、备注、分数、状态等详细信息。此外,数据集还包含了题目的代码、提示、响应等信息,以及一些编码相关的特征。数据集分为训练集和测试集两部分。
Hugging Face2025-02-13 更新130



