AstralMath-v1
收藏资源简介:
AstralMath-v1是一个大规模的多模型工具集成推理(TIR)数据集,专为针对竞争性数学的语言模型的监督微调(SFT)和强化学习(RL)训练而设计。该数据集通过两种互补的管道构建:一是从多个高质量数学数据集中精选并去重的问题,二是通过重写精选的数字或证明问题生成的新问题,这些问题与AIMO3竞赛风格对齐。所有转换后的答案均为[0, 99999]范围内的非负整数。数据集经过多阶段过滤,以确保仅保留需要高级推理和工具使用的挑战性问题。AstralBench是AstralMath-v1的一个精心挑选的子集,包含50个高质量问题,用于模型性能基准测试。数据集涵盖了多种数学主题和难度级别,当前模型性能准确率在5%至30%之间。数据来源包括Nemotron-Math-v2、AI-MO/NuminaMath-1.5、ScaleQuest-Math等多个高质量数学数据集,总计约1.5M原始问题,经过筛选和转换后保留136,151个问题。
AstralMath-v1 数据集概述
数据集基本信息
- 名称: AstralMath-v1
- 语言: 英语 (en)
- 规模: 10万至100万条数据之间 (100K<n<1M)
- 许可证: cc-by-4.0, cc-by-sa-4.0, mit, apache-2.0
- 标签: 数学推理 (math-reasoning), 工具使用 (tool-use), 长上下文 (long-context)
- 任务类别: 文本生成 (text-generation)
数据集描述
AstralMath-v1 是一个用于数学问题求解的大规模多模型工具集成推理数据集,旨在用于针对竞赛数学的语言模型的监督微调和强化学习训练。
数据集构成
数据集通过两个互补的流程构建:
- 精选问题:来自多个高质量数学数据集的混合,经过去重以移除不同来源间的重叠问题。
- 合成转换问题:通过重写精选的数字或证明问题,生成符合AIMO3竞赛风格的新问题表述(例如,模运算转换、答案幂转换)。这些转换产生需要根本不同解决方法的新问题,而非表面改写。所有转换后的答案均为[0, 99999]范围内的非负整数。
数据筛选流程
采用多阶段过滤流程来选择困难但可解的问题:
- 问题长度:仅选择字符数大于100且行数小于50的问题。
- 包含图像:移除同时包含"![]"和"figure"的问题。
- 简单答案:移除答案在[0, 1]区间内的问题。
- 多项选择题:移除包含特定模式(如" A. ", " B. ")的问题。
- 双重问题:移除包含两个不相关问题的题目。
- 预过滤1:根据可用的LLM解决方案元数据(如解决方案长度或通过率)进行过滤。
- 去重:使用短文本哈希对所有来源进行去重。
- 预过滤2:使用gpt-oss-120b生成无需工具的解决方案,移除该模型一次尝试即可解决的简单问题。
数据来源与分布
| 来源 | 原始数量 | 精选数量 | 转换数量 | 百分比 |
|---|---|---|---|---|
| Nemotron-Math-v2 | ~347k | 89,344 | 70,596 | 65.6% |
| AI-MO/NuminaMath-1.5 | ~896k | 28,363 | 0 | 20.8% |
| ScaleQuest-Math | ~146k | 10,139 | 0 | 7.4% |
| DeepScaleR-Preview-Dataset | ~40k | 7,580 | 7,580 | 5% |
| DeepMath-103K | ~103k | 540 | 540 | 0.4% |
| Project Euler | 981 | 199 | 0 | 0.2% |
| IMO AnswerBench | 400 | 24 | 0 | - |
| 总计 | ~1.5M | 136,151 | 100% | 100% |
AstralBench 基准子集
AstralBench 是一个包含50个高质量问题的精选子集,用于基准测试模型性能。它涵盖了多样化的数学主题和难度级别,当前模型性能的准确率在5%到30%之间。
AstralBench 来源与转换
| 来源 | 数量 | 转换数量 |
|---|---|---|
| IMOBench | 46 | 20 |
| Project Euler | 4 | 4 |
| 总计 | 50 | 24 |
AstralBench 问题选自 IMOBench 和 Project Euler。对于具有非整数和符号答案的问题,通过更改参数、应用模运算(例如,要求模素数)以及重新表述最终问题句子,手动将其转换为新的数字答案问题。这确保了所有 AstralBench 问题都可以用数字答案解决,同时保持其原始复杂性。
数据文件
- 训练集 (train): stage1.jsonl
- 训练集 2 (train_2): stage2.jsonl
致谢
- 模型: DeepSeek-V3.2 (https://huggingface.co/deepseek-ai/DeepSeek-V3.2), GPT-OSS-120B (https://huggingface.co/openai/gpt-oss-120b), Step-3.5-Flash (https://huggingface.co/stepfun-ai/Step-3.5-Flash)
- 种子数据集: Nemotron-Math-v2 (https://huggingface.co/datasets/nvidia/Nemotron-Math-v2), NuminaMath-1.5 (https://huggingface.co/datasets/AI-MO/NuminaMath-1.5), ScaleQuest-Math (https://huggingface.co/datasets/dyyyyyyyy/ScaleQuest-Math), DeepScaleR-Preview-Dataset (https://huggingface.co/datasets/agentica-org/DeepScaleR-Preview-Dataset), DeepMath-103K (https://huggingface.co/datasets/zwhe99/DeepMath-103K), Project Euler (https://projecteuler.net/), IMO AnswerBench (https://github.com/google-deepmind/superhuman)
引用
@misc{nguyen2026astralmath, title={AstralMath-v1: A Large-Scale Multi-Model Tool-Integrated Reasoning Dataset for Mathematical Problem Solving}, author={Nguyen Nguyen}, year={2026}, url={https://huggingface.co/datasets/nguyen599/AstralMath-v1}, }




