fzmnm/TinyBooks-QA-Chinese
收藏资源简介:
TinyBooks-QA-Chinese数据集受到TinyStories论文的启发,旨在为幼儿园和小学水平的孩子提供适合的AI生成百科全书。该数据集将经典文学作品转换为问答形式的课程,使用简单直接的语言。每个条目包含AI转换的故事、AI提取的关键词、AI生成的问答对以及反事实思维练习。设计动机包括简化语言以减少复杂长文本的噪音,并提供比TinyStories更高质量和多样性的替代品。警告部分提到关键词提取的保真度低,不适合用于训练摘要模型,且内容需要人工事实检查和安全检查。数据分布不平衡,可能需要手动减少某些书籍的样本。故事长度约为700字符,但需要2k+的内容窗口来查看整个课程。
Inspired by the TinyStories paper, the TinyBooks-QA-Chinese dataset aims to provide an AI-generated encyclopedia suitable for kindergarten and grade school levels. This dataset converts classical literature into a question-answer style curriculum using simple and straightforward language. Each entry includes an AI-converted story, AI-extracted keywords, AI-generated question-answer pairs, and counterfactual thinking exercises. The design motivation includes simplifying language to reduce noise from complex long texts and providing a higher quality and more diverse alternative to TinyStories. Warnings mention the low fidelity of keyword extraction, unsuitability for training summarization models, and the need for human fact-checking and safety checks. The data distribution is unbalanced, and manual reduction of samples from certain books may be necessary. The story length is around 700 characters, but a 2k+ content window is needed to view the entire curriculum.
TinyBooks-QA-Chinese
数据集概述
TinyBooks-QA-Chinese 是一个由 AI 生成的数据集,旨在将经典文学作品转换为适合幼儿园和小学水平的问答式课程。数据集使用简单直白的语言,适合年轻儿童阅读。
数据集内容
每个数据集条目包含以下内容:
- AI 转换的经典文学故事
- AI 提取的故事关键词
- AI 生成的问答对,用于简单的阅读理解任务
- AI 生成的反事实思维练习,包括一个“如果”问题和一个故事的替代结局
设计动机
- 将阅读理解和下一个词预测所需的所有关键信息打包到一个小的上下文窗口中,使用简化的语言,减少复杂长篇语料中缺乏上下文的噪音。
- 提供一个高质量和更多样化的替代方案,同时保持语言的简洁性。
警告
- 从故事中提取的关键词保真度较低,仅用于生成故事提示,不应用于训练摘要模型。
- 该内容不适合儿童使用,除非经过人工事实核查和安全检查。由于历史文学的性质,可能包含不适合工作场所的内容和偏见。
- 数据分布不平衡,可能需要手动减少“世说新语”(Shishuo Xinyu)的样本。
- 故事长度约为700字符,但需要2k+的内容窗口才能看到包括故事、问答和反事实练习在内的完整课程。
生成方法
生成方法包括以下步骤:
- 将文本转述成适合幼儿园小朋友阅读的700字以内的中文小故事。
- 从故事中提取五个关键词。
- 根据故事生成5个问答练习。
- 设计一个反事实思维的小练习,包括一个“如果”问题和一个新故事。
示例
示例展示了一个关于孙悟空的故事,包括故事内容、问答练习和反事实思维练习。




