UltraData-Math
收藏资源简介:
UltraData-Math 是一个大规模、高质量的数学预训练数据集,总计包含超过 2900 亿标记,分为三个渐进层级:L1(1705 亿标记的网页语料)、L2(337 亿标记的质量筛选数据)和 L3(880 亿标记的多格式精炼数据)。该数据集旨在系统性地提升大型语言模型(LLM)的数学推理能力,并已应用于 MiniCPM 系列模型的数学预训练。数据集采用 L0-L4 分层数据管理框架,通过标准化解析、启发式清洗、质量模型筛选和精炼生成等步骤,确保数据的高质量和多样性。UltraData-Math 包含多种数据格式,如问答对、多轮对话、多风格改写和教科书式练习,适用于数学推理任务的预训练和微调。实验表明,该数据集在 MiniCPM-1.2B 架构上显著提升了模型在 MATH500 和 GSM8K 等数学基准上的表现。
UltraData-Math is a large-scale, high-quality mathematical pre-training dataset. It contains a total of over 290 billion tokens, divided into three progressive tiers: L1 (170.5 billion tokens of web corpus), L2 (33.7 billion tokens of quality-filtered data), and L3 (88 billion tokens of multi-format refined data). This dataset is designed to systematically enhance the mathematical reasoning capabilities of Large Language Models (LLMs), and has been applied to the mathematical pre-training of the MiniCPM series of models. The dataset adopts a tiered data management framework spanning L0 to L4, ensuring high quality and diversity through standardized parsing, heuristic cleaning, quality model filtering, and refinement generation. UltraData-Math encompasses diverse data formats, including question-answer pairs, multi-turn dialogues, multi-style rewritings, and textbook-style exercises, making it suitable for pre-training and fine-tuning of mathematical reasoning tasks. Experimental results show that this dataset significantly improves the performance of models on mathematical benchmarks such as MATH500 and GSM8K when deployed on the MiniCPM-1.2B architecture.
UltraData-Math 数据集概述
数据集基本信息
- 名称: UltraData-Math
- 发布者: UltraData Team
- 发布日期: 2026年2月9日
- 许可证: Apache 2.0
- 语言: 英语(en)、中文(zh)、阿拉伯语(ar)
- 任务类别: 文本生成(text-generation)
- 规模类别: 100B < n < 1T
- 相关标签: llm, pretraining, math, data-synthesis, data-filtering, high-quality, mathematical-reasoning
- arXiv标识: xxxx.xxxxx
数据集规模与层级
UltraData-Math 是一个大规模、高质量的数学预训练数据集,总规模超过 290B tokens,包含三个渐进层级:
- L1(过滤数据): 170.5B tokens,包含经过启发式清洗和文档级去重后的网络数学语料。
- L2(精选数据): 33.7B tokens,通过质量模型筛选出的高质量网络数学语料。
- L3(精炼数据): 88B tokens,包含多种格式(如问答、多轮对话、多风格改写、知识教科书)精炼后的数据。
数据集配置
数据集包含以下配置,可通过 Hugging Face datasets 库加载:
UltraData-Math-L3-Conversation-Synthetic(默认配置)UltraData-Math-L3-Multi-Style-SyntheticUltraData-Math-L3-QA-SyntheticUltraData-Math-L3-Textbook-Exercise-SyntheticUltraData-Math-L2-previewUltraData-Math-L1
设计目标与创新点
该数据集旨在解决现有数学预训练数据构建方案的以下不足:
- HTML解析: 通用解析器对数学公式支持不佳,易导致公式结构破坏或丢失。
- 数据质量: 缺乏系统的质量分级机制,高价值数学内容与低质量噪声混杂。
- 数据多样性: 主流数据集多源于教科书或竞赛题库,缺乏真实网页中的数学讨论和应用场景;合成数据格式单一。
数据处理流程(L0-L4分层管理框架)
L0: 原始数据解析与标准化
- 目标: 解决通用HTML解析器对数学公式支持差的问题,最大化保留网页中的数学语义。
- 方法: 开发基于 magic-html 的数学解析器,结合 w3m 布局保留渲染和多级回退策略,将 MathML、KaTeX 和 AsciiMath 统一标准化为 LaTeX 格式。
L1: 启发式清洗与过滤
- 目标: 去除格式噪声,提高数据的可读性和标准化程度。
- 方法:
- 格式修复:清理不可见字符、乱码、不自然的连续换行;移除导航栏、页脚、广告弹窗等无关网络噪声。
- 内容过滤:长度过滤、语言识别(确保主要为高质量中英文数学内容)、文档级去重。
L2: 基于质量模型的选择
- 目标: 从海量数据中识别出具有高价值的核心语料。
- 方法:
- 使用专有大模型对种子数据进行多维度评分标注。
- 基于标注数据训练轻量级嵌入分类器。
- 使用训练好的分类器对L1数据进行全量评分和筛选。
L3: 精炼数据
- 目标: 通过改写、合成生成和精炼,产出推理清晰、教育意图明确的结构化内容,达到教科书质量标准,确保最大可学习性。
- 方法:
- 问答对生成:将陈述性文档改写成“问题-答案”对。
- 多轮对话合成:模拟“教师-学生”辅导场景生成包含追问、纠错和引导的多轮对话数据。
- 多风格改写:将单源数据改写成多种风格(如严谨的教科书风格、竞赛解题风格、直观的科普风格)。
- 知识点教科书生成:基于特定知识点生成系统性的教科书式内容。
- 格式修复与增强:修复源数据中的格式问题(如破损的LaTeX公式、符号不一致),增强内容连贯性。
实验效果
在 MiniCPM-1.2B 架构上进行评估:
- 在 MATH500 基准测试上达到 37.02pp,相比 Nemotron-CC 4plus 提升 +3.62pp。
- 在 GSM8K 上达到 61.79pp,提升 +3.34pp,同时保持了代码生成和通用知识能力。
- 实验验证了 L0 解析策略的有效性,以及 L1、L2、L3 分层框架的渐进提升效果。
应用
该数据集已应用于 MiniCPM 系列模型 的数学预训练。
引用
bibtex @misc{ultradata-math, title={UltraData-Math}, author={UltraData Team}, year={2026}, url={https://huggingface.co/datasets/openbmb/UltraData-Math}, publisher={Hugging Face} }




