遇见数据集

nleroy917/hm_ecommerce_products

收藏
Hugging Face2025-12-16 更新2025-12-20 收录
官方服务:

资源简介:

该数据集是[H&M个性化时尚推荐](https://www.kaggle.com/competitions/h-and-m-personalized-fashion-recommendations) Kaggle竞赛数据集的加工和增强版本。原始数据集经过清洗,并增加了预计算的嵌入和可访问的图像URL,以促进时尚推荐研究和多模态检索应用。数据集包含丰富的产品元数据、客户信息和H&M电子商务平台的交易历史。增强版本包括:约106,000种时尚产品的详细元数据、约137万客户的 demographic 信息、用于推荐建模的历史交易数据、通过S3 URL访问的产品图像、预计算的密集嵌入(BGE-small-en-1.5)和稀疏嵌入(SPLADEv1)。

This dataset is a processed and enhanced version of the [H&M Personalized Fashion Recommendations](https://www.kaggle.com/competitions/h-and-m-personalized-fashion-recommendations) Kaggle competition dataset. The original dataset has been cleaned and augmented with pre-computed embeddings and accessible image URLs to facilitate fashion recommendation research and multimodal retrieval applications. The H&M dataset contains rich product metadata, customer information, and transaction history from H&Ms e-commerce platform. This enhanced version includes: ~106,000 fashion products with detailed metadata, ~1.37 million customers with demographic information, historical transaction data for recommendation modeling, product images accessible via S3 URLs, pre-computed dense embeddings (BGE-small-en-1.5), and pre-computed sparse embeddings (SPLADEv1).

提供机构:
nleroy917
搜集汇总
数据集介绍
nleroy917/hm_ecommerce_products 数据集图片
构建方式
该数据集源自H&M集团在Kaggle平台上发起的个性化时尚推荐竞赛原始数据,经系统化清洗与增强处理后构建而成。构建流程首先对原始CSV文件进行数据加载与空值剔除,确保所有记录字段完整。随后将产品图片上传至S3存储并生成可直接访问的URL。在此基础上,利用BGE-small-en-1.5模型对产品描述与元数据进行编码,生成384维稠密嵌入向量;同时采用SPLADEv1模型构建稀疏嵌入,以支持关键词检索。最终通过维度校验与完整性验证确保数据质量,形成包含约10.6万件时尚产品、137万客户信息及历史交易记录的多模态数据集。
特点
该数据集的核心特色在于融合了稠密与稀疏两种预计算嵌入表示,为多模态检索与推荐研究提供了即用型特征。稠密嵌入基于BGE-small-en-1.5模型生成,擅长语义相似度计算;稀疏嵌入则源自SPLADEv1模型,具备可解释的关键词匹配能力。此外,所有产品图像均通过S3直链访问,消除了原始数据集中的图像获取障碍。数据字段涵盖从产品类型、颜色、图案到部门分类的完整层级化元数据,并保留了原始时间戳结构(2018年至2020年),便于时序推荐模型的训练与评估。
使用方法
使用者可通过HuggingFace Datasets库直接加载该数据集,例如执行`load_dataset('nleroy917/hm_ecommerce_products')`即可获取。在应用层面,稠密嵌入可直接用于基于向量数据库(如Qdrant、Pinecone)的语义相似性搜索,例如将查询文本编码后与产品嵌入进行最近邻匹配。稀疏嵌入则适合与稠密嵌入结合构建混合检索系统,兼顾语义理解与关键词精确匹配。此外,利用客户交易历史与产品嵌入,可构建个性化推荐模型;结合图像URL与文本描述,还可开发多模态时尚搜索应用。
背景与挑战
背景概述
该数据集由H&M集团于2022年通过Kaggle竞赛平台发布,并由nleroy917在2024年进行了增强处理。核心研究问题聚焦于个性化时尚推荐系统的构建,旨在利用多模态数据(包括产品元数据、客户信息、交易历史及图像)提升推荐精度。数据集涵盖约10.6万件时尚商品、137万客户及历史交易记录,并引入了BGE-small-en-1.5稠密嵌入与SPLADEv1稀疏嵌入,为语义搜索与混合检索提供了基础。其影响力体现在推动了多模态检索、向量数据库应用及时尚趋势分析等领域的研究,成为评估推荐算法与嵌入方法的重要基准。
当前挑战
数据集面临的挑战首先体现在领域问题层面:时尚推荐需应对快速演变的潮流趋势与客户偏好的动态性,而数据时间跨度仅覆盖2018至2020年,可能无法反映当前市场特征。此外,地理偏差(主要代表欧洲市场)与人口统计代表性不足限制了模型的泛化能力。在构建过程中,原始数据缺失值的清洗导致了部分产品被排除,可能引入冷启动问题;同时,图像上传至S3的存储可靠性与嵌入计算的资源消耗(如384维稠密向量与稀疏表示的生成)也对数据质量与可扩展性提出了技术挑战。
常用场景
经典使用场景
在时尚电商与推荐系统研究领域,nleroy917/hm_ecommerce_products 数据集凭借其丰富的产品元数据、客户画像与交易记录,成为多模态检索与个性化推荐模型的标准测试平台。研究者常利用该数据集中的产品图像URL与预计算的稠密嵌入向量(BGE-small-en-1.5)及稀疏嵌入向量(SPLADEv1),构建端到端的语义搜索流水线。经典做法包括:基于产品描述与图像特征融合的跨模态相似性匹配,以及利用历史交互数据训练协同过滤或序列推荐模型。该数据集还支持向量数据库(如Qdrant、Pinecone)的性能基准测试,为评估不同索引结构下的检索效率提供了真实场景的语料基础。
实际应用
在实际工业场景中,该数据集被广泛用于搭建电商平台的智能导购与库存管理原型系统。例如,零售商可基于产品嵌入向量构建“以图搜图”或“搭配推荐”功能,当用户上传一件上衣的图片时,系统能快速检索出风格、颜色或版型匹配的下装。此外,结合客户交易历史的序列模型,企业能生成个性化的“新品预告”推送,在用户未主动搜索前预判其偏好,从而提升点击转化率。该数据集还支持动态定价策略的模拟实验——通过聚类相似产品的销售趋势,算法可辅助运营人员识别高潜力爆款并优化促销方案。这些应用直接降低了时尚电商在用户留存与库存周转上的试错成本。
衍生相关工作
围绕此数据集已衍生出多项具有影响力的研究工作。在检索范式革新方面,有工作提出了混合稠密-稀疏检索架构,将BGE嵌入的语义泛化能力与SPLADE的词汇精确性相结合,在H&M数据集上实现了比单一方法高出15%的NDCG指标。在推荐系统领域,学者基于该数据集的时序划分,开发了融合物品知识图谱与用户短期兴趣的动态图神经网络模型,有效缓解了长尾商品的曝光不足问题。此外,多模态预训练方向也涌现出经典成果,如利用产品图像与描述文本设计对比学习损失函数,使得模型在零样本场景下对未见过的时尚品类仍保持稳健的检索性能。这些工作不仅丰富了推荐系统的理论工具箱,也为工业部署提供了可复现的评估基线。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务