LICA Dataset
收藏资源简介:
LICA数据集是一个图形设计布局的集合,旨在促进AI在设计领域的研究。每个布局捕获了设计的完整渲染规范,包括组件位置、排版、图像和背景,以及布局和模板级别的丰富自然语言注释。布局按模板组织,每个模板文件夹包含其所有布局、渲染图像和每个布局的注释。
The LICA Dataset is a collection of graphic design layouts designed to advance AI research in the design domain. Each layout captures the complete rendering specifications of a design, including component positions, typography, images, and backgrounds, as well as rich natural language annotations at both layout and template levels. The layouts are organized by templates, with each template folder containing all its associated layouts, rendered images, and annotations for every individual layout within the folder.
LICA 数据集概述
数据集简介
LICA 数据集是一个平面设计布局的集合,旨在促进“AI for Design”领域的研究。每个布局都捕获了一个设计的完整渲染规范,包括组件位置、排版、图像和背景,并附有布局层面和模板层面的丰富自然语言标注。
数据集内容与规模
- 布局总数:1183个。
- 组织方式:布局按模板组织。一个模板是一个设计主题,可以生成多个布局变体(幻灯片)。
- 设计类别:包含“Business Cards”、“Cards & Invitations”、“Education”、“Flyers”、“Presentations”、“Videos”等。
数据集结构
数据集根目录为 lica-data,包含以下主要部分:
1. 元数据文件 (metadata.csv)
包含每个布局的元信息,字段如下:
layout_id:唯一布局ID。category:设计类别。template_id:所属模板的UUID。n_template_layouts:模板组中的布局总数。template_layout_index:布局在其模板组中的零基索引位置。width:画布宽度(像素)。height:画布高度(像素)。
2. 布局文件 (layouts/<template_id>/<layout_id>.json)
每个布局文件是一个JSON对象,包含画布规格和组件列表。
- 核心字段:
components(组件列表)、width、height、background(可选)、duration(可选)。 - 组件类型:
TEXT:定位文本元素,包含文本内容、位置、颜色、字体等样式属性。IMAGE:定位图像元素,包含图像源URL、位置、尺寸等属性。GROUP:容器/形状元素,包含位置、尺寸、背景色、裁剪路径等属性。
3. 图像文件 (images/<template_id>/<layout_id>.png 或 .mp4)
布局的渲染结果,格式为PNG图像或MP4视频。
4. 标注文件 (annotations/)
- 布局级标注 (
annotations/<template_id>/<layout_id>.json):描述特定布局,包含description、aesthetics、tags、user_intent、raw字段。 - 模板级标注 (
annotations/template_annotations.json):描述模板的整体设计主题,结构与布局级标注相同,按模板UUID索引。
数据访问与使用
提供了Python库 lica_dataset 用于便捷加载和操作数据集。
主要功能
- 加载数据集:
LicaDataset("lica-data")或load_dataset("lica-data")。 - 数据筛选:支持按类别、模板、画布尺寸、宽高比进行筛选,方法链式调用。
- 数据访问:
- 获取布局JSON:
get_layout(layout_id)。 - 获取布局级标注:
get_annotation(layout_id)。 - 获取模板级标注:
get_template_annotation(template_id)。 - 获取渲染文件路径:
get_render_path(layout_id)。 - 获取元数据:
get_metadata(layout_id)。
- 获取布局JSON:
- 迭代访问:可迭代获取每个布局的完整信息字典,包含布局ID、模板ID、元数据、布局JSON、标注和渲染路径。
- 统计分析:可通过
.summary()获取按类别分组的数据摘要。
模块级便捷函数
load_layouts_by_template:加载指定模板的所有布局JSON,并按索引排序。load_layouts_by_category:加载指定类别的所有布局JSON(仅限磁盘上存在的文件)。iter_template_groups:迭代每个模板组,返回模板ID及其对应的LicaDataset视图。
获取与依赖
- 数据下载:数据集文件可通过 https://storage.googleapis.com/lica-assets/websites/blog/lica-data.zip 下载。
- 环境要求:Python 3.9 或更高版本。
- 依赖安装:
pip install -r requirements.txt。
许可信息
本项目采用知识共享署名 4.0 国际许可协议进行许可。




