SimpleThoughts
收藏资源简介:
SimpleThoughts 是一个完整的合成训练语料库,涵盖大型语言模型(LLM)训练的四个阶段:预训练(pretraining)、监督微调(SFT)、偏好对齐(DPO)和推理(reasoning)。该数据集围绕日常现象中的简单思想实验构建,旨在训练语言模型清晰思考而非仅记忆事实。数据集包含 391,474 个样本,分为四个配置:预训练(352,214 个自由文本样本)、SFT(25,788 个多轮对话样本)、对齐(7,172 个偏好对样本)和推理(6,300 个逐步推理样本)。每个样本均标注了主题、子主题、模型来源和阶段特定元数据。数据集覆盖了物理学、生物学、逻辑推理、经济学等多个领域的思想实验,适用于端到端 LLM 训练、特定阶段微调、推理研究和对齐研究等场景。数据集采用 CC-BY-4.0 许可。
SimpleThoughts 数据集概述
基本描述
SimpleThoughts 是一个完整的合成训练语料库,涵盖大型语言模型(LLM)训练的所有四个阶段:预训练、监督微调(SFT)、偏好对齐(DPO)和推理。所有数据样本均围绕简单的思想实验构建,旨在训练语言模型清晰思考日常现象,而非仅回忆事实。数据集包含 STEM 和概念性主题,如直观物理学、因果推理、生物学、经济学、空间推理等。
数据集构成
数据集包含四个独立的配置(config),总计 391,474 个样本。
1. 预训练配置 (pretrain)
- 阶段:预训练
- 样本数量:352,214
- 数据格式:自由形式的说明性文本。
- 关键字段:
text:文本内容。topic:主题。subtopic:子主题。concept:概念。model:生成模型。provider:模型提供方。token_count:令牌数量。timestamp:时间戳。
- 主题覆盖:涵盖 44 个主题,包括直观物理学、生物学、化学、能量热力学、经济学、人工智能、几何空间、人体、地球科学、电磁学等。
- 生成模型组合:DeepSeek V3 (70%) + Llama-3.3-70B (30%)。
2. 监督微调配置 (sft)
- 阶段:监督微调
- 样本数量:25,788
- 数据格式:多轮对话格式(ChatML 风格的消息列表)。
- 关键字段:
messages:包含role和content的消息列表。topic:主题。subtopic:子主题。query_type:查询类型。model:生成模型。provider:模型提供方。timestamp:时间戳。
- 查询类型:反事实、解释性、预测性。
- 主题覆盖:涵盖 18 个概念领域,包括直观物理学、逻辑因果推理、心理理论、空间推理、生物学、化学、经济学、人体等。
- 生成模型组合:Qwen3 32B (50%) + Mistral Small 3.2 24B (50%)。
3. 对齐配置 (alignment)
- 阶段:偏好对齐(DPO/RLHF)
- 样本数量:7,172
- 数据格式:偏好对(选中/拒绝)。
- 关键字段:
prompt:提示。chosen:被选中的回答。rejected:被拒绝的回答。topic:主题。subtopic:子主题。error_type:错误类型。judge_score:评判分数。judge_reasoning:评判推理过程。model_chosen:生成选中回答的模型。model_rejected:生成拒绝回答的模型。timestamp:时间戳。
- 错误类型:
correlation_causation:混淆相关性与因果关系。teleological:将目的或意图归因于自然过程。imprecise_metaphor:使用具有微妙误导性的类比。
4. 推理配置 (reasoning)
- 阶段:推理
- 样本数量:6,300
- 数据格式:输入 + 思维链 + 输出。
- 关键字段:
input:输入问题。thought_trace:思维链。output:最终答案。topic:主题。subtopic:子主题。has_misconception:是否包含常见误解。model:生成模型。provider:模型提供方。timestamp:时间戳。thought_trace_compressed:压缩版思维链。output_compressed:压缩版输出。compression_model:压缩模型。
- 主题覆盖:涵盖 8 个主题,包括逻辑因果推理、直观物理学、空间推理、心理理论、经济学、生物逻辑、材料科学、系统理论。
数据集特点
- 全流程覆盖:一个数据集覆盖 LLM 训练的所有四个阶段。
- 概念一致性:所有数据基于同一思想实验分类法,使端到端训练的模型形成一致的推理风格。
- 丰富标注:每个样本都带有主题、子主题、模型来源和阶段特定的元数据。
- 高质量:由前沿模型(DeepSeek V3, Qwen3 32B, Llama 3.3 70B, Mistral Small 3.2)生成,对齐配对带有评判评分。
- 实验性:相对较小的数据集,旨在帮助早期研究人员学习端到端的 LLM 训练流程。
预期用途
- 全流程 LLM 训练。
- 阶段特定的微调。
- 推理研究(思维链蒸馏)。
- 对齐研究(偏好学习失败模式)。
- 基准测试(思想实验问题)。
许可证
知识共享署名 4.0 国际许可证 (CC BY 4.0)。许可证链接:https://creativecommons.org/licenses/by/4.0/
引用信息
@dataset{simplethoughts2026, author = {Shanmukh}, title = {SimpleThoughts: A Full-Pipeline Thought Experiment Training Corpus}, year = {2026}, publisher = {Hugging Face}, url = {https://huggingface.co/datasets/tensorfiend/SimpleThoughts} }




