alpindale/visual-novels
收藏资源简介:
该数据集包含解析后的视觉小说脚本,用于训练语言模型。数据集由大约6000万个解析后的脚本标记组成。数据集结构包括对话行、动作和叙述,对话行格式为说话者名称后跟冒号和引号内的对话内容,动作和叙述通常用星号括起来。数据集内容包括解析后的文本文件、VNDB目录和未解析的存档文件。该数据集可用于训练语言模型,特别是自然语言处理和文本生成任务。
This dataset comprises parsed visual novel scripts intended for language model training. It contains approximately 60 million parsed script tokens. The dataset structure includes dialogue lines, actions and narration. Dialogue lines follow the format of speaker name followed by a colon and dialogue content enclosed in quotation marks, while actions and narration are typically wrapped in asterisks. The dataset content includes parsed text files, VNDB directories and unparsed archive files. This dataset can be used for training language models, especially for natural language processing and text generation tasks.
Visual Novel Dataset 概述
数据集基本信息
- 许可协议:Apache-2.0
- 任务类别:
- 对话式
- 文本生成
- 语言:英语
- 数据集名称:Visual Novels
数据集描述
- 内容:包含约6000万条解析过的视觉小说脚本,用于训练语言模型。
- 结构:
- 对话行:格式为说话者名称后跟冒号,对话内容用引号括起来。
- 动作和叙述:通常用星号括起来,描述角色动作、背景设置或其他叙述元素。
数据集内容
visual-novels.txt:包含所有解析过的视觉小说脚本,每个条目之间用特定字符串分隔。VNDB/:包含.json文件,记录了对应视觉小说角色的VNDB ID。Archives/:visual-novels-parsed.tar.zst:包含解析过的视觉小说脚本,每个脚本单独存为一个文本文件。visual-novels-unparsed.tar.zst:包含所有未解析的视觉小说脚本及原始脚本。
使用目的
- 用于训练语言模型,特别是在自然语言处理和文本生成任务中,通过解析的视觉小说脚本训练模型理解和生成连贯的对话。
贡献者
- 数据集由PygmalionAI数据处理团队收集和解析。
注意事项
- 数据集包含的视觉小说脚本主要为版权内容,使用时应遵守版权法和相关许可限制。




