遇见数据集

N8Programs/CreativeHuman

收藏
Hugging Face2024-06-01 更新2024-06-12 收录
官方服务:

资源简介:

--- license: apache-2.0 --- A dataset of 660 public domain, human-generated short stories w/ AI-generated prompts to go along with them. The dataset is marked as unsafe due to having the words 'KREATIVITY FOR KATS' in it. This is a false positive - it is completely safe to download. Most of these works are from the 1800s-1950s, and as a result, reflect the attitudes & biases of their time. Models trained off these works may learn such problematic attitudes. Something to keep in mind & watch for.

许可证:Apache-2.0 本数据集收录660篇公有领域的人类原创短篇故事,以及与之配套的人工智能生成提示词(Prompt)。该数据集曾被标记为不安全内容,缘由是其中包含文本“KREATIVITY FOR KATS”,但此为误报,下载该数据集完全安全。 本数据集的绝大多数作品创作于19世纪至20世纪50年代,因此会反映出当时的社会态度与固有偏见。基于此类作品训练的模型可能会习得此类存在问题的态度倾向,对此需加以留意并保持警惕。

提供机构:
N8Programs
原始信息汇总

数据集概述

数据集描述

  • 内容: 包含660篇公共领域的短篇小说,这些小说是由人类创作的,并配有AI生成的提示。
  • 时间范围: 大部分作品来自19世纪至20世纪50年代。
  • 注意事项: 这些作品反映了当时的态度和偏见,使用这些作品训练的模型可能会学习到这些有问题的态度。

安全性

  • 标记: 数据集被标记为不安全,原因是含有“KREATIVITY FOR KATS”字样,但这实际上是一个误报。
  • 安全性声明: 完全安全,可以下载。

许可证

  • 许可证类型: Apache-2.0许可证。
搜集汇总
数据集介绍
构建方式
CreativeHuman数据集由660篇属于公共领域的人类创作短篇小说构成,并辅以人工智能生成的提示词。这些作品主要源自19世纪至20世纪中叶,涵盖了该时期丰富的文学表达。数据集在构建时特别标注了潜在的风险,即部分作品可能反映了其所处时代的社会态度与偏见,这为使用者提供了重要的伦理参考信息。
特点
该数据集的核心特色在于其纯人类创作的本质与AI生成提示词的结合,为研究自然语言生成与人类创意之间的交互提供了独特的资源。所有故事均处于公共领域,确保了使用的合法性与开放性。尽管因包含特定词汇而被误标为不安全,但实际内容完全安全,适合学术研究与模型训练。数据集明确揭示了历史文本中可能存在的偏见问题,体现了构建者对数据伦理的审慎考量。
使用方法
CreativeHuman数据集适用于训练和评估文本生成模型,特别是需要理解人类叙事风格与创意表达的场景。用户可直接通过HuggingFace平台加载该数据集,利用其提供的短篇小说与对应提示词进行监督学习或微调。使用时需注意过滤或处理作品中可能存在的时代偏见,以确保模型输出的公平性与安全性。数据集以Apache-2.0许可证发布,支持广泛的研究与应用开发。
背景与挑战
背景概述
在人工智能与自然语言处理交叉领域,创造性文本生成始终是衡量模型理解与模仿人类叙事能力的重要标杆。N8Programs/CreativeHuman数据集应运而生,由独立研究者于近年创建,收录了660篇源自19世纪至20世纪中叶的公共领域人类短篇故事,并为其配以AI生成的提示词。这些作品跨越数十年,承载了不同时代的文化语境与叙事风格,核心研究问题在于如何利用人类创作的真实文本激发AI的创造力,同时评估模型在继承历史文本时的表现。该数据集虽规模有限,却为探索机器叙事与人类文化遗产的融合提供了独特视角,尤其对少样本学习、风格迁移及历史语境建模等领域产生了潜在影响力。
当前挑战
该数据集所解决的领域问题聚焦于创造性文本生成中的历史文本适配与偏见传播。具体挑战包括:其一,这些源自1800至1950年代的作品内嵌了特定时代的社会态度与偏见,训练模型时可能无意识习得并放大这些有问题的观念,构成伦理风险;其二,数据集构建过程中,如何为每篇人类故事自动生成与之匹配的AI提示词,需平衡提示的启发性与对原作的忠实度,避免过度引导或偏离主题;其三,660篇的规模限制了模型泛化能力,需防范过拟合于特定历史时期的叙事模式,同时应对公共领域文本中语言风格与词汇的陈旧性,确保模型输出不脱离现代语境。
常用场景
经典使用场景
CreativeHuman数据集汇聚了660篇源自19世纪至20世纪中期的公共领域人类短篇小说,并辅以AI生成的提示词,为文学与人工智能交叉领域的研究提供了独特的语料资源。在自然语言处理中,它常被用于训练和评估文本生成模型,尤其是那些旨在模仿特定历史时期文学风格或叙事结构的生成式模型。研究者借助该数据集,能够探索AI如何理解并复现人类故事中的情节逻辑、角色塑造及情感表达,从而推动创意写作自动化与文学风格迁移技术的发展。
实际应用
在实际应用中,CreativeHuman数据集可用于开发面向文学爱好者的智能写作辅助工具,例如根据用户输入的主题或风格生成符合特定历史时期韵味的短篇故事雏形。教育领域可借助其构建互动式文学学习平台,帮助学生通过AI生成的提示词激发创作灵感。出版行业则能利用该数据集训练模型,快速生成符合市场需求的多样化故事梗概,降低内容创作的人力成本。
衍生相关工作
基于CreativeHuman数据集,衍生出了一系列探索人机协作创作范式的研究工作。例如,有工作利用其提示词与故事的配对关系,训练了可控文本生成模型,实现了对故事主题、情感基调或叙事视角的精准调控。另一些研究则聚焦于检测AI生成内容与人类创作之间的风格差异,开发了基于跨时代语言特征的鉴别算法。此外,该数据集还被用于评估大语言模型在历史语境理解与偏见消减方面的表现,推动了负责任AI在创意领域的应用边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务