遇见数据集

gimmy256/adaption-primary-six-curriculum-samples

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

--- annotations_creators: [] language: - en - multilingual language_creators: [] license: [] multilinguality: - multilingual pretty_name: 'adaption-primary_six_curriculum_samples' size_categories: - n<1K source_datasets: - 'original' tags: - adaption - instruction-tuning - other - academic-education - religion task_categories: [] task_ids: [] --- ![banner](https://proteus-prod-public.s3.us-east-1.amazonaws.com/temp/bd6b242f-e4b5-444f-ae58-55bddbdadd7b.png) This dataset is a remastered version prepared using [Adaption's](https://adaptionlabs.ai/app/auth) Adaptive Data platform. # adaption-primary_six_curriculum_samples This dataset contains excerpts from a Primary Six curriculum guide, featuring instructional prompts and structured tables detailing competences, content, and suggested activities. The samples cover diverse subjects including language arts, science, religious education, and vocational skills like carpentry. Data entries often pair teaching guidelines with specific learning outcomes or indicate missing completions with 'None'. ### Dataset size There are 462 data points in this dataset. This is an instruction tuning dataset. ### Quality of Remastered Dataset The final quality is B, with a relative quality improvement of 170.0%. ### Domain - Other (50%) - Academic-education (42%) - Religion (4%) ### Language - English (66%) - Unknown (34%) ### Tone - Educational (42%) - Clear (24%) - Helpful (14%) ### Evaluation Results - **Quality Gains:** <img src="https://proteus-prod-public.s3.us-east-1.amazonaws.com/temp/86fef5b1-f05f-486a-9fac-0b86f7131653.png" alt="QualityGains" style="max-width: 50%; display: block; margin-left: auto; margin-right: auto;" /> - **Grade Improvement:** <img src="https://proteus-prod-public.s3.us-east-1.amazonaws.com/temp/2ad24252-487d-48f5-a3ac-13c83f3524d2.png" alt="Grade" style="max-width: 50%; display: block; margin-left: auto; margin-right: auto;" /> - **Percentile Chart:** <img src="https://proteus-prod-public.s3.us-east-1.amazonaws.com/temp/ac362d8b-894c-488c-bdf7-9530b6e5f113.png" alt="Percentile Chart" style="max-width: 50%; display: block; margin-left: auto; margin-right: auto;" />

This dataset is a remastered version prepared using Adaptions Adaptive Data platform. It contains excerpts from a Primary Six curriculum guide, featuring instructional prompts and structured tables detailing competences, content, and suggested activities. The samples cover diverse subjects including language arts, science, religious education, and vocational skills like carpentry. Data entries often pair teaching guidelines with specific learning outcomes or indicate missing completions with None. There are 462 data points in this dataset, and it is an instruction tuning dataset. The final quality is B, with a relative quality improvement of 170.0%. Domain distribution: Other (50%), Academic-education (42%), Religion (4%). Language distribution: English (66%), Unknown (34%). Tone distribution: Educational (42%), Clear (24%), Helpful (14%).

提供机构:
gimmy256
搜集汇总
数据集介绍
gimmy256/adaption-primary-six-curriculum-samples 数据集图片
构建方式
该数据集系借助Adaption实验室的自适应数据平台对小学六年级课程指南进行再加工而构建,原始素材囊括语言艺术、科学、宗教教育及木工等职业技能领域的教学指引与结构化表格。构建过程以教学提示与结构化条目为核心,将能力要求、内容纲要与建议活动相互关联,并对缺失的完成项以‘None’标识,从而形成462条指令微调样本,最终质量评级为B,相对质量提升达170.0%。
特点
数据集规模不足一千条,涵盖英语与多语言内容,兼具学术教育与宗教等多元领域分布。其显著特点在于将课程指南中的教学指导与具体学习成果配对,并以表格形式呈现能力、内容与活动之间的对应关系。文本语气以教育性、清晰性和帮助性为主,语言分布中英语占比66%,未知语言占34%,领域则集中于其他类与学术教育类,宗教类占比较小。
使用方法
该数据集适用于指令微调任务,可服务于教育内容生成、课程设计辅助及教学问答系统等场景。使用者可通过HuggingFace平台直接加载数据,利用其中结构化的教学提示与学习成果配对样本训练或评估模型,尤其适合需要遵循课程逻辑与教育语气的应用。鉴于数据规模有限,建议结合其他教育类语料进行联合训练,以提升模型的泛化能力与领域适应性。
背景与挑战
背景概述
在教育信息化与个性化学习需求日益增长的背景下,教学资源的智能化改造成为关键议题。adaption-primary-six-curriculum-samples数据集由Adaption团队借助其自适应数据平台构建,收录了小学六年级课程指南的462条指令样本,覆盖语言艺术、科学、宗教教育及木工等职业技能科目。该数据集作为指令微调资源,旨在将传统课程内容转化为可计算、可适配的教学指令,从而支持教育领域大模型对结构化教学场景的理解与生成。其核心研究问题在于如何将非结构化的课程指南高效转化为高质量指令数据,并评估改造前后的质量跃升。该数据集为教育内容自动化处理与自适应学习系统的开发提供了实证基础,推动了教育数据工程与指令微调技术的交叉融合。
当前挑战
该数据集所应对的领域问题在于,教育内容通常以非结构化文本或表格形式存在,缺乏统一格式与明确指令,难以直接用于模型训练。构建过程中,原始课程指南的异质性、多语言混杂以及部分条目缺失(以'None'标注)对数据清洗与标注一致性构成显著挑战。样本规模有限(仅462条),且语言分布中约34%为未知语言,进一步增加了模型泛化难度。此外,如何在保留教学意图的同时实现指令的标准化与质量提升,并确保改造后数据在学术教育、宗教等多元领域中的适用性,是该数据集持续面临的核心挑战。
常用场景
经典使用场景
在课程设计与教学资源开发领域,该数据集常被用于指令微调任务,通过提供小学六年级课程指南的摘录,包括教学提示和结构化表格,涵盖语言艺术、科学、宗教教育及木工等职业技能。其经典使用场景在于训练语言模型理解并生成与教学目标、能力及活动建议相关的内容,从而辅助教师备课或自动生成教学计划。
实际应用
在实际应用中,该数据集可支撑智能教学助手开发,帮助教师快速检索课程能力与活动建议;亦可集成至学习管理系统,自动生成个性化学习路径或评估任务。其涵盖的宗教与职业技能内容,尤其适用于多元文化或职业教育环境,为课程规划、教学资源推荐及教育公平性研究提供数据支持。
衍生相关工作
基于该数据集,研究者已开展多项衍生工作,如构建课程知识图谱以关联能力与内容、开发学科特定的指令微调模型,以及探索跨语言教育数据的迁移学习。这些工作进一步拓展了数据集在自动课程生成、教学对话系统及教育评估工具中的应用,彰显了其在教育人工智能领域的基石作用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务