TaoBao-MM/Taobao-MM
收藏资源简介:
TAOBAO-MM是一个基于淘宝用户交互日志的大规模推荐数据集,包含长达1000次交互的用户行为序列和高质量的多模态物品嵌入。该数据集旨在支持长序列推荐和多模态内容建模的研究。数据集包含8.79百万用户、35.4百万物品和99百万样本,分为76M训练集和23M测试集。由于隐私和版权限制,所有基于ID的特征均已匿名化,且未发布原始多模态内容(如图片),但提供了预计算的128维多模态嵌入。数据集以Parquet文件形式分发,包括训练样本、测试样本、用户特征、物品特征和多模态嵌入表。
TAOBAO-MM is a large-scale recommendation dataset derived from user interaction logs on Taobao, featuring historical behavior sequences of up to 1,000 interactions per user and high-quality multimodal embeddings for items. The dataset aims to support research in long-sequence recommendation and multimodal content modeling. It includes interaction logs from 8.79 million users, 35.4 million distinct items, and 99 million labeled samples, partitioned into a training set of 76M and a test set of 23M instances. Due to privacy and copyright restrictions, all ID-based features are anonymized, and raw multimodal content (e.g., item images) is not released, but pre-computed 128-dimensional multimodal embeddings are provided. The dataset is distributed as a collection of Parquet files, including training samples, test samples, user features, item features, and multimodal embedding tables.




