遇见数据集

CyberHarem/viviana_arknights

收藏
Hugging Face2024-03-21 更新2024-03-04 收录
官方服务:

资源简介:

这是名为viviana/薇薇安娜 (Arknights)的数据集,包含206张图片及其标签。图片来源于多个网站,如danbooru、pixiv、zerochan等,并由DeepGHS团队的自动爬虫系统收集。数据集的核心标签包括blonde_hair, long_hair, animal_ears, horns, deer_ears, deer_girl, breasts, blue_eyes, hair_between_eyes, ears_through_headwear, very_long_hair, large_breasts。此外,README还提供了数据集的下载链接和加载方法,以及标签聚类结果的列表。

这是名为viviana/薇薇安娜 (Arknights)的数据集,包含206张图片及其标签。图片来源于多个网站,如danbooru、pixiv、zerochan等,并由DeepGHS团队的自动爬虫系统收集。数据集的核心标签包括blonde_hair, long_hair, animal_ears, horns, deer_ears, deer_girl, breasts, blue_eyes, hair_between_eyes, ears_through_headwear, very_long_hair, large_breasts。此外,README还提供了数据集的下载链接和加载方法,以及标签聚类结果的列表。

提供机构:
CyberHarem
原始信息汇总

数据集概述:viviana/薇薇安娜 (Arknights)

数据集基本信息

  • 许可证: MIT
  • 任务类别: 文本到图像
  • 标签: 艺术, 非全年龄适用
  • 大小类别: 小于1K

数据集内容

  • 包含: 206张图像及其标签
  • 核心标签: 金发, 长发, 动物耳朵, 角, 鹿耳, 鹿女孩, 胸部, 蓝眼睛, 额发, 头饰中的耳朵, 非常长的头发, 大胸部

数据集来源

  • 图像来源: 多个网站(如danbooru, pixiv, zerochan等)
  • 自动爬虫系统: 由DeepGHS Team提供技术支持

数据集包列表

名称 图像数量 大小 下载链接 类型 描述
raw 206 430.63 MiB 下载链接 Waifuc-Raw 原始数据,包含元信息(最小边对齐到1400像素,如果更大)
1200 206 360.37 MiB 下载链接 IMG+TXT 数据集,短边不超过1200像素
stage3-p480-1200 510 675.51 MiB 下载链接 IMG+TXT 三阶段裁剪数据集,区域不小于480x480像素

数据集加载

  • 加载工具: waifuc
  • 加载方法: 提供Python代码示例,用于下载和解压数据集,并通过waifuc加载数据集。

标签聚类结果

  • 示例: 提供两个版本的标签聚类结果展示,包括原始文本版本和表格版本,展示了不同图像的共同标签。

原始文本版本

# 样本数 图像示例 共同标签
0 6 1girl, black_dress, deer_antlers, fire, gauntlets, hood_up, hooded_cape, solo, white_cape, black_gloves, cowboy_shot, belt, holding_sword, candlestand, looking_at_viewer, smile, white_pantyhose
1 7 1girl, black_gloves, candle, deer_antlers, holding, hood_up, hooded_cape, looking_at_viewer, solo, upper_body, white_cape, smile, black_dress, closed_mouth, fire, black_background, gauntlets, partially_fingerless_gloves, white_hood, simple_background

表格版本

# 样本数 图像示例 1girl black_dress deer_antlers fire gauntlets hood_up hooded_cape solo white_cape black_gloves cowboy_shot belt holding_sword candlestand looking_at_viewer smile white_pantyhose candle holding upper_body closed_mouth black_background partially_fingerless_gloves white_hood simple_background
0 6 X X X X X X X X X X X X X X X X X
1 7 X X X X X X X X X X X X X X X X X X X X
搜集汇总
数据集介绍
CyberHarem/viviana_arknights 数据集图片
构建方式
在二次元图像生成领域,高质量的角色数据集是模型训练的关键基石。该数据集聚焦于游戏《明日方舟》中的角色薇薇安娜,通过自动化爬取系统从Danbooru、Pixiv、Zerochan等多个知名图像社区采集原始图像,最终收录了206张高质量图片及其对应的标签信息。数据集由DeepGHS团队开发的自动化工具驱动,确保了采集的广度与效率。原始图像经过最小边对齐至1400像素的预处理,并提供了多种规格的打包版本,包括短边不超过1200像素的标准化版本,以及经过三阶段裁剪、确保每块区域不小于480×480像素的增强版本,以满足不同训练需求。
特点
该数据集的核心特色在于其精细化的标签体系与层次化的结构设计。角色核心标签如金发、长发、兽耳、鹿角等被明确提炼并保留,便于下游模型精准捕捉角色特征。数据集不仅提供了原始图像与标签的捆绑包,还创新性地引入了标签聚类结果,通过可视化样本与标签列表展示了不同服装搭配与场景的分布,例如黑裙、兜帽披风、火焰等元素的组合,为风格迁移与角色变体学习提供了丰富素材。此外,数据集的规模虽小(n<1K),但图像分辨率多样,且通过裁剪策略生成了510个样本的增强版本,有效扩充了训练数据的多样性。
使用方法
数据集的使用方式灵活且适配主流工具链。用户可直接通过HuggingFace Hub下载原始压缩包,并借助waifuc库的LocalSource接口加载图像与元数据,实现便捷的迭代与标签访问。对于追求效率的开发者,1200像素版本提供了即用的图像-文本对,可直接输入至扩散模型进行微调。而三阶段裁剪版本则适用于需要局部特征学习的场景,如面部或服饰细节的精细化生成。此外,提供的标签聚类表格可作为先验知识,辅助设计针对性的数据增强策略或评估模型在不同风格下的泛化能力。
背景与挑战
背景概述
在生成式人工智能领域,文本到图像(Text-to-Image)模型的发展日新月异,其核心驱动力之一在于高质量、精细标注的数据集。CyberHarem/viviana_arknights数据集正是这一趋势下的产物,专注于收录游戏《明日方舟》中人气角色“薇薇安娜”的视觉资料。该数据集由DeepGHS团队于近期创建并维护,旨在为角色定制化图像生成提供标准化训练资源。数据集包含206张经过严格筛选与标注的高清图像,核心标签如“blonde_hair”、“deer_ears”等精准刻画了角色特征,不仅服务于二次元风格扩散模型的微调,也为虚拟角色在跨模态生成任务中的一致性表现提供了关键支撑。其影响力体现在为小众角色数据集构建树立了自动化采集与精细化处理的范例,推动了特定领域图像生成技术的发展。
当前挑战
该数据集面临的核心挑战首先源于领域问题的复杂性:在文本到图像生成任务中,确保模型能够稳定再现特定角色的独特外观(如“薇薇安娜”的鹿角、长发与服饰组合)是一项艰巨任务,易出现特征混淆或风格漂移。其次,构建过程本身充满技术难点:从Danbooru、Pixiv等多源异构平台自动爬取图像时,需应对版权合规、图像质量参差不齐及标签噪声等问题。此外,数据集规模较小(仅206张),如何在有限样本下通过数据增强(如多尺度裁剪)保持角色细节的完整性,同时避免过拟合,是模型训练中必须跨越的障碍。最终,标签的语义一致性维护与跨平台元数据对齐,也对数据治理提出了持续挑战。
常用场景
经典使用场景
在文本到图像生成领域,CyberHarem/viviana_arknights 数据集常被用于训练和微调面向特定动漫角色的扩散模型。其包含 206 张经精细标注的高质量图像,并提供了原始图像、缩放版本及裁剪版本等多种数据形态,尤其适合用于学习角色核心属性(如金发、鹿角、蓝眼等)与视觉表现之间的映射关系。研究者可基于此数据集开展主题驱动的图像生成任务,例如通过 LoRA、DreamBooth 等技术,使模型精准生成符合角色设定的全新图像,同时保持风格一致性。该数据集也为多模态提示学习、角色概念解耦等前沿课题提供了理想的实验基准。
实际应用
在实际应用中,该数据集广泛服务于二次元内容创作与数字娱乐产业。基于其训练的生成模型可辅助插画师快速生成角色立绘、表情包或同人作品,大幅提升创作效率。游戏与动画公司可利用该数据集微调内部工具,实现角色概念设计的自动化迭代,降低前期美术成本。此外,该数据集还支持个性化定制服务,例如根据用户提供的角色关键词生成专属头像或壁纸,在虚拟主播、粉丝经济等场景中具有显著商业价值。其标准化数据格式也便于集成到现有图像生成管线中,实现从数据到产品的快速落地。
衍生相关工作
基于该数据集衍生出一系列经典工作,包括角色驱动的文本到图像生成方法(如 Custom Diffusion 在动漫领域的适配版本)、面向角色一致性的微调策略(如基于 LoRA 的角色概念学习),以及多模态语义对齐技术(如通过对比学习强化角色标签与图像特征的关联)。此外,数据集内嵌的聚类标签被用于探索角色服饰与场景的语义分解,催生了诸如解耦式角色生成、属性编辑等研究方向。在社区实践中,该数据集已成为评估动漫生成模型角色保真度的常用基准,并被集成到 Waifuc 等开源工具链中,推动了二次元 AI 生成技术的标准化与普及。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务