Inditex Hackathon Dataset
收藏资源简介:
Inditex黑客松数据集包含用户数据、产品数据以及训练和测试数据,用于个性化推荐系统。用户数据包括用户标识、国家、购买频率、消费金额等信息。产品数据包括折扣信息、产品图片的嵌入表示、产品标识、颜色标识、产品类别等。训练和测试数据记录了用户与产品的交互信息,如会话标识、日期、时间戳、用户标识、产品标识等。
The Inditex Hackathon Dataset encompasses user data, product data, as well as training and test data, which is tailored for personalized recommendation systems. The user data includes information such as user ID, country, purchase frequency, and consumption amount. The product data covers discount information, embedding representations of product images, product ID, color ID, product category and other relevant attributes. The training and test data record the interaction information between users and products, including session ID, date, timestamp, user ID, product ID and other related details.
Recommender System Data Overview
数据集背景
- 随着电子商务和数字零售的增长,个性化购物体验成为提高客户满意度和增加销量的关键。推荐系统是达成此目的的有效方式,通过分析浏览历史、过往购买记录、人口统计信息和产品属性等数据,为用户提供个性化的产品推荐。
数据集组成
-
Users: 用户数据,包含以下变量:
user_id: 用户标识符。country: 国家标识符。R: 用户的最近活跃度。F: 用户的购买频率。M: 用户在购买上花费的金额。
-
Products: 产品数据,包含以下变量:
discount: 产品是否打折的布尔值。embedding: 通过计算机视觉技术获得的产品的平面图像嵌入。partnumber: 产品标识符。color_id: 产品颜色标识符。cod_section: 产品所属区域。family: 产品所属家族。
-
Train, Test: 训练和测试数据,包含以下变量:
session_id: 会话标识符。date: 交互日期。timestamp_local: 交互时间戳。user_id: 用户标识符。country: 国家标识符。partnumber: 交互发生的产品标识符。device_type: 使用的设备类型。pagetype: 电子商务网站内交互发生的页面类型。add_to_cart: 交互是否为添加到购物车。测试数据中不提供此变量。
数据处理
- 需要对用户和项目数据进行清洗、过滤和归一化,移除噪声和无关信息。将原始输入(如设备类型、产品嵌入和购买历史)转换为能够突出模式和关系的结构化格式,并聚合和缩放这些特征以供机器学习模型使用。
模型要求
- 开发一个能够向用户推荐5个产品(
partnumber)的推荐系统。需要考虑用户可能登录或未登录,以及他们可能在平台上进行的任何之前的交互。
任务概述
- Task 1: 回答关于训练集、用户和产品数据集的问题,并开发两个函数。
- Task 2: 开发一个函数,给定一个与训练数据集格式相同的DataFrame,返回用户标识符、会话标识符、总会话时长和添加到购物车的产品比例。
- Task 3: 构建一个推荐系统,为每个会话ID推荐五个产品。
提交要求
- 提交一个
predictions_1.json文件用于Task 1的问题,以及一个包含模型推荐的predictions_3.json文件用于Task 3。
评估标准
- Task 1: 通过JSON文件评估问题的答案。
- Task 2: 通过单元测试评估函数。
- Task 3: 使用归一化折扣累积增益(NDCG)指标评估系统性能。




