TuringEnterprises/Rubric-Graded-Reasoning
收藏资源简介:
Rubrics-Graded Reasoning 是一个多领域推理数据集,涵盖计算机科学、数据科学和化学三个领域,旨在通过揭示前沿模型的失败并将专家评分转化为训练信号来改进模型。数据集包含150个任务(每个领域50个),每个任务由博士级专家编写和评审,并配有原子加权评分标准,用于机器可验证地评估最终答案和中间推理步骤。数据集强调推理可见性(如推导、机制、计算和单位),提供高难度任务(通过率0%–50%),并支持强化学习奖励建模和过程级评估。配置包括:Rubric-CS(计算机科学,覆盖算法、系统、数据库等子领域)、Rubric-DS(数据科学,基于真实数据集的分析任务)和Rubric-Chem(化学,涵盖有机、无机、物理化学等子领域)。数据集适用于模型训练、评估和失败分析。
Rubrics-Graded Reasoning is a multi-domain reasoning dataset covering three fields: computer science, data science, and chemistry. It aims to improve model performance by uncovering the failure modes of state-of-the-art models and converting expert ratings into actionable training signals. The dataset contains 150 tasks (50 per domain), with each task written and reviewed by doctoral-level experts, and is equipped with atomic weighted grading rubrics for machine-verifiable evaluation of both final answers and intermediate reasoning steps. This dataset emphasizes reasoning visibility (such as derivations, mechanisms, calculations, and units), provides high-difficulty tasks with a pass rate ranging from 0% to 50%, and supports reinforcement learning reward modeling and process-level evaluation. Its configurations include Rubric-CS (computer science, covering subfields such as algorithms, systems, databases, etc.), Rubric-DS (data science, featuring analysis tasks based on real-world datasets), and Rubric-Chem (chemistry, covering subfields such as organic, inorganic, physical chemistry, etc.). The dataset is suitable for model training, evaluation, and failure analysis.




