遇见数据集

TAAC2026/data_sample_1000

收藏
Hugging Face2026-04-10 更新2026-04-05 收录
官方服务:

资源简介:

--- license: cc-by-nc-4.0 tags: - TAAC2026 - recommendation --- # TAAC2026 Demo Dataset (1000 Samples) > [!WARNING] ⚠️**Update[2026.04.10]:** > This demo dataset has been updated to newest version with the following changes: > - The parquet file is now a **flat column layout**, with all features as top-level columns. > - Add a sequence feature, rename feature names and update some features. > Participants should refer to the updated `demo_1000.parquet` and this `README.md` for the latest schema and data details. A sample dataset containing 1000 user-item interaction records for the [TAAC2026 competition](https://algo.qq.com/). This dataset uses a **flat column layout** — all features are stored as individual top-level columns instead of nested structs/arrays. ## Dataset Overview | Property | Value | |---|---| | **File** | `demo_1000.parquet` | | **Rows** | 1,000 | | **Columns** | 120 | | **File Size** | ~39 MB | ## Columns The 120 columns fall into **6 categories**: | Category | Count | Data Type | Description | |---|---|---|---| | **ID & Label** | 5 | `int64` / `int32` | Core identifiers, label, and timestamp | | **User Int Features** | 46 | `int64` / `list<int64>` | Integer-valued user features (scalar or array) | | **User Dense Features** | 10 | `list<float>` | Float-array user features | | **Item Int Features** | 14 | `int64` / `list<int64>` | Integer-valued item features (scalar or array) | | **Domain Sequence Features** | 45 | `list<int64>` | Behavioral sequence features from 4 domains | --- ## Detailed Column Schema ### ID & Label Columns (5 columns) All these 5 columns have no `null` value. | Column | Data Type | |---|---| | `user_id` | `int64` | | `item_id` | `int64` | | `label_type` | `int32` | | `label_time` | `int64` | | `timestamp` | `int64` | > [!NOTE] **Note:** > When `user_int_feats_{fid}` and `user_dense_feats_{fid}` share the same `{fid}`, they are aligned and jointly describe the same entity or signal. ### User Int Features (46 columns) - `user_int_feats_{1,3,4,48-59,82,86,92-109}`: Scalar `int64`, total 35 columns. - `user_int_feats_{15, 60, 62-66, 80, 89-91}`: Array `list<int64>`, total 11 columns. ### User Dense Features (10 columns) - `user_dense_feats_{61-66, 87, 89-91}`: Array `list<float>`, total 10 columns. ### Item Int Features (14 columns) - `item_int_feats_{5-10, 12-13, 16, 81, 83-85}`: Scalar `int64`, total 13 columns. - `item_int_feats_{11}`: Array `list<int64>`, total 1 column. ### Domain Sequence Features (45 columns) `list<int64>` sequences from 4 behavioral domains: - `domain_a_seq_{38-46}`: 9 columns - `domain_b_seq_{67-79, 88}`: 14 columns - `domain_c_seq_{27-37, 47}`: 12 columns - `domain_d_seq_{17-26}`: 10 columns --- ## Usage ```python import pyarrow.parquet as pq import pandas as pd # Read the parquet file df = pd.read_parquet("demo_1000.parquet") print(df.shape) # (1000, 120) print(df.columns) # ['user_id', 'item_id', 'label_type', ...] ``` With Hugging Face `datasets`: ```python from datasets import load_dataset ds = load_dataset("TAAC2026/data_sample_1000") print(ds) ```

license: cc-by-nc-4.0 tags: - TAAC2026 - 推荐(recommendation) # TAAC2026 演示数据集(1000条样本) > [!警告] ⚠️**更新[2026.04.10]:** > 本演示数据集已更新至最新版本,变更如下: > - Parquet文件现已采用**扁平化列布局(flat column layout)**,所有特征均作为顶层列存储。 > - 新增序列特征,重命名特征名称并更新部分特征。 > 参赛选手请参阅更新后的`demo_1000.parquet`与本`README.md`以获取最新的数据模式(schema)与数据详情。 本示例数据集包含1000条用户-物品交互记录,用于[TAAC2026竞赛](https://algo.qq.com/)。该数据集采用**扁平化列布局(flat column layout)**——所有特征均以独立顶层列形式存储,而非嵌套结构体与数组(nested structs/arrays)。 ## 数据集概览 | 属性 | 取值 | |---|---| | **文件** | `demo_1000.parquet` | | **行数** | 1,000 | | **列数** | 120 | | **文件大小** | ~39 MB | ## 列分类 120个列分为**6大类**: | 类别 | 数量 | 数据类型 | 描述 | |---|---|---|---| | **ID与标签** | 5 | `int64` / `int32` | 核心标识符、标签与时间戳 | | **用户整型特征** | 46 | `int64` / `list<int64>` | 整型用户特征(标量或数组) | | **用户稠密特征** | 10 | `list<float>` | 浮点数组型用户特征 | | **物品整型特征** | 14 | `int64` / `list<int64>` | 整型物品特征(标量或数组) | | **领域序列特征** | 45 | `list<int64>` | 来自4个领域的行为序列特征 | --- ## 详细列数据模式(schema) ### ID与标签列(5列) 此5列均无空值。 | 列名 | 数据类型 | |---|---| | `user_id` | `int64` | | `item_id` | `int64` | | `label_type` | `int32` | | `label_time` | `int64` | | `timestamp` | `int64` | > [!提示] **注意:** > 当`user_int_feats_{fid}`与`user_dense_feats_{fid}`共享相同的`{fid}`时,二者为对齐特征,共同描述同一实体或信号。 ### 用户整型特征(46列) - `user_int_feats_{1,3,4,48-59,82,86,92-109}`:标量`int64`,共35列。 - `user_int_feats_{15, 60, 62-66, 80, 89-91}`:数组`list<int64>`,共11列。 ### 用户稠密特征(10列) - `user_dense_feats_{61-66, 87, 89-91}`:数组`list<float>`,共10列。 ### 物品整型特征(14列) - `item_int_feats_{5-10, 12-13, 16, 81, 83-85}`:标量`int64`,共13列。 - `item_int_feats_{11}`:数组`list<int64>`,共1列。 ### 领域序列特征(45列) `list<int64>`序列来自4个行为领域: - `domain_a_seq_{38-46}`:9列 - `domain_b_seq_{67-79, 88}`:14列 - `domain_c_seq_{27-37, 47}`:12列 - `domain_d_seq_{17-26}`:10列 --- ## 使用方法 python import pyarrow.parquet as pq import pandas as pd # 读取Parquet文件 df = pd.read_parquet("demo_1000.parquet") print(df.shape) # (1000, 120) print(df.columns) # ['user_id', 'item_id', 'label_type', ...] 使用Hugging Face `datasets`库时: python from datasets import load_dataset ds = load_dataset("TAAC2026/data_sample_1000") print(ds)

提供机构:
TAAC2026
搜集汇总
数据集介绍
TAAC2026/data_sample_1000 数据集图片
构建方式
该数据集源自TAAC2026竞赛,旨在为推荐系统研究提供用户-物品交互样本。它采用扁平列布局(flat column layout),所有特征均作为独立顶层列存储,摒弃嵌套结构,以提升数据访问效率。数据集包含1000条记录和120个特征列,覆盖六大类别:ID与标签、用户整数特征、用户稠密特征、物品整数特征、域序列特征。用户整数特征涵盖35个标量列和11个数组列,用户稠密特征均为浮点数组,物品整数特征以标量为主,域序列特征则来自四个行为域的列表数据。
使用方法
使用该数据集时,可通过Pandas或PyArrow直接读取Parquet文件,例如调用pd.read_parquet('demo_1000.parquet')获取DataFrame,其形状为(1000, 120)。也可借助Hugging Face的datasets库,通过load_dataset('TAAC2026/data_sample_1000')加载,便于集成到深度学习工作流。数据集适合用于推荐系统的特征工程、模型训练与评估,研究人员可基于其扁平结构快速提取用户、物品及序列特征,构建或验证推荐算法。
背景与挑战
背景概述
TAAC2026/data_sample_1000数据集由腾讯算法大赛(TAAC2026)官方团队于2026年创建,旨在为推荐系统领域的研究者与参赛者提供标准化、可复现的评测基准。该数据集聚焦于用户-物品交互预测的核心研究问题,涵盖1000条样本及120维特征,包括用户整数与稠密特征、物品整数特征以及跨四个行为域的序列特征。其发布不仅为大赛提供了统一的训练与验证数据,更推动了推荐系统中多模态特征融合与序列建模的实证研究。作为竞赛基准,该数据集对评估新型推荐算法在稀疏交互场景下的泛化能力具有重要影响,成为领域内验证模型性能的关键参考。
当前挑战
当前数据集面临的核心挑战包括:其一,领域问题层面,推荐系统需应对用户行为稀疏性与动态演化带来的冷启动与时效性预测难题,而本数据集仅含1000条样本,难以覆盖长尾分布与实时变化模式;其二,构建过程中,120维特征虽丰富但存在异构性——整数、浮点数组与序列特征需精细对齐,且用户稠密特征与整数特征共享相同标识符,增加了特征融合与预处理的复杂度;其三,域序列特征来自四个行为域,其跨域迁移与噪声控制对模型泛化构成额外考验,同时标签类型与时间戳的引入要求模型具备时间敏感性与多任务学习能力。
常用场景
经典使用场景
该数据集作为TAAC2026竞赛的官方样本,其经典使用场景聚焦于推荐系统领域的用户-物品交互建模。凭借其平坦列布局的120维特征空间,涵盖用户整数与稠密特征、物品整数特征及跨域行为序列特征,研究者可基于这1000条记录构建并验证多模态融合的推荐算法。数据集特别适用于探索如何将稀疏的交互信号与丰富的用户画像、物品属性及领域序列信息相结合,从而提升点击率预测或个性化排序任务的性能,为后续在完整竞赛数据上开展大规模实验提供方法论验证基础。
解决学术问题
该数据集直面推荐系统学术研究中长期存在的两大核心挑战:特征异构融合与冷启动稀疏性问题。通过提供包含标量、向量及序列等多类型特征的标准化数据格式,它使得研究者能够系统性地比较不同特征编码策略与融合架构的效果。同时,数据集所蕴含的领域序列特征为探索跨域迁移学习、用户行为演化建模等前沿方向提供了实验载体,推动了从传统协同过滤向深度学习驱动的知识表征范式的演进,其学术意义在于建立了一个可复现的基准平台以衡量推荐模型的泛化能力与鲁棒性。
实际应用
在实际应用层面,该数据集的设计紧密贴合互联网平台(如电商、短视频与社交网络)的推荐业务需求。其包含的标签类型与时间戳信息使得研究者能够模拟在线广告投放中的实时竞价环境,优化广告点击率预估模型。此外,跨领域序列特征可直接用于构建用户长短期兴趣网络,实现动态内容推送策略的迭代。数据集所采用的平坦列布局极大简化了生产环境中特征管道的对接成本,使得从学术原型到工业级系统的迁移更为顺畅,尤其适用于需要处理海量用户行为日志的大规模推荐引擎开发。
数据集最近研究
最新研究方向
TAAC2026/data_sample_1000数据集聚焦于推荐系统领域的前沿研究,特别是面向大规模、多模态用户行为建模的挑战。该数据集以扁平列布局设计,整合了120维特征,涵盖用户整数与稠密特征、物品整数特征及来自四个行为领域的序列特征,为探索用户意图捕捉、跨域序列建模与多任务学习提供了高维稀疏与稠密混合的实验基准。近期研究热点包括利用该数据集验证基于Transformer的序列推荐模型在长程行为依赖上的表现,以及结合对比学习缓解特征稀疏性问题。作为TAAC2026竞赛的官方样本,该数据集推动了推荐系统在工业级数据分布下的可解释性与鲁棒性研究,其公开的标准化特征架构亦为跨模型对比与可复现性评估奠定了重要基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务