遇见数据集

stream-archive

收藏
Hugging Face2026-07-07 更新2026-07-08 收录
官方服务:

资源简介:

Stream Archive 是一个包含来自 Kick 和 Twitch 直播平台聊天记录的数据集。数据按平台和主播进行组织,每个直播录像(VOD)文件夹包含一个 JSONL 格式的聊天消息文件(chat.jsonl)和一个元数据文件(vod_info.json)。数据集记录了直播聊天室中的实时互动,每条消息包含时间戳(以秒和格式化字符串表示)、用户名、用户颜色代码、消息文本内容,以及平台特定的属性:对于 Twitch,包含用户是否为订阅者(is_subscriber)和是否为版主(is_moderator)的布尔标识;对于 Kick,包含回复对象(reply_to)的字段。该数据集适用于自然语言处理、社交互动分析、用户行为研究以及跨平台聊天内容比较等任务。

Stream Archive is a dataset containing chat logs from the Kick and Twitch live streaming platforms. The data is organized by platform and streamer, with each live stream (VOD) folder containing a JSONL-formatted chat message file (chat.jsonl) and a metadata file (vod_info.json). The dataset records real-time interactions in live chat rooms, with each message including a timestamp (in seconds and formatted string), username, user color code, message text content, and platform-specific attributes: for Twitch, boolean flags indicating whether the user is a subscriber (is_subscriber) and a moderator (is_moderator); for Kick, a field for reply target (reply_to). This dataset is suitable for tasks such as natural language processing, social interaction analysis, user behavior research, and cross-platform chat content comparison.

创建时间:
2026-07-07
原始信息汇总

数据集概述:Stream Archive

数据集地址:https://huggingface.co/datasets/deplana/stream-archive

该数据集包含来自 KickTwitch 两大直播平台的聊天记录,按平台和主播进行组织。

数据结构

  • 数据按以下路径格式存储:

    kick/{streamer}/{date}{title}/chat.jsonl twitch/{streamer}/{date}{title}/chat.jsonl

  • 每个VOD(视频点播)文件夹包含两个文件:

    • chat.jsonl:聊天消息,JSONL格式,每行一条记录。
    • vod_info.json:元数据(平台、主播、标题、日期)。

数据字段(Schema)

每条聊天记录包含以下字段:

字段名 类型 描述
time_sec int 从VOD开始的秒数
time_str string 格式化时间戳(HH:MM:SS)
user_name string 发送者的用户名
user_color string 用户在聊天中的颜色(十六进制)
message string 聊天消息内容
is_subscriber bool 用户是否为订阅者(仅限Twitch)
is_moderator bool 用户是否为版主(仅限Twitch)
reply_to string 被回复的用户名(仅限Kick)

配置信息

  • 配置名称:default
  • 数据文件:匹配路径下的所有 chat.jsonl 文件
  • 特征(features):包含上述所有字段,字段类型与描述一致(is_subscriberis_moderator 为布尔型,time_sec 为整型,其余为字符串型)。
搜集汇总
数据集介绍
stream-archive 数据集图片
构建方式
该数据集名为Stream Archive,旨在捕获并整理来自Kick与Twitch两大流媒体平台的聊天记录,按平台与主播进行精细化组织。每条聊天记录存储于嵌套目录结构的JSONL文件中,路径格式为“{平台}/{主播}/{日期}_{主题}/chat.jsonl”。每个视频点播(VOD)文件夹内除chat.jsonl外,还包含vod_info.json元数据文件,记录平台、主播、标题与日期等关键信息。数据字段涵盖时间戳(以秒计与格式化字符串)、用户名称与颜色、消息内容,以及Twitch特有的订阅者与管理员身份标识、Kick特有的回复目标信息,构建了一套结构化、跨平台兼容的聊天日志体系。
特点
Stream Archive数据集的显著特点在于其跨平台整合性与细粒度结构化。它统一纳入了Kick与Twitch两大生态的实时聊天数据,支持按主播与时间维度检索。字段设计兼顾通用性与平台特异性,例如is_subscriber与is_moderator仅适用于Twitch,reply_to则专属Kick,确保了数据语义的精确性。每条记录均附带VOD内相对时间(time_sec)与格式化时间戳,便于时序分析。此外,数据以JSONL格式逐行存储,易于流式处理与分布式加载,兼顾可读性与计算效率,为直播生态研究提供了高质量的基础语料。
使用方法
使用Stream Archive数据集时,研究者可通过Hugging Face Datasets库加载,默认配置将扫描目录下所有匹配“**/chat.jsonl”的文件。加载后的数据包含int64类型的time_sec、string类型的time_str、user_name、user_color、message及reply_to,以及bool类型的is_subscriber与is_moderator。适用于直播互动分析、用户行为建模、社区舆情挖掘等任务。建议利用time_sec字段进行会话时间线重构,或依据is_subscriber与is_moderator区分用户层级。对于多平台对比研究,可结合vod_info.json中的元数据过滤特定平台或主播的数据子集,实现灵活定向分析。
背景与挑战
背景概述
随着直播平台如Kick和Twitch的迅猛发展,实时弹幕数据成为研究社交互动、用户行为及内容推荐的重要资源。stream-archive数据集由相关研究团队创建,旨在系统性地采集和组织来自两大主流平台的聊天记录,以支持自然语言处理、社区分析和行为建模等领域的深入研究。该数据集按平台和主播进行分类,每条记录包含时间戳、用户信息、消息内容及权限标识,为探究直播中即时反馈机制、社群结构演变及用户参与度提供了结构化基础。自发布以来,它已成为直播言论分析、情感计算及多平台对比研究的关键数据源,推动了人机交互与计算社会科学的前沿探索。
当前挑战
stream-archive数据集面临的核心挑战聚焦于弹幕数据的独特属性:其一,直播弹幕具有高噪声、短文本及密集信息流的特性,传统自然语言处理模型难以有效提取语义和上下文关联。其二,跨平台数据格式不统一,如Twitch提供订阅者与管理员标识,而Kick包含回复机制,这种异构性增加了多平台联合分析的难度。数据采集过程中,流式数据的实时记录与存储对系统可靠性提出高要求,同时需处理用户隐私保护与合规性问题,例如匿名化处理用户名及过滤敏感内容。此外,弹幕语言常包含表情、缩写和网络用语,对预训练模型的适应性和跨语言泛化能力构成显著挑战。
常用场景
经典使用场景
在直播生态研究领域,Stream Archive数据集为分析实时聊天互动提供了宝贵的资源。该数据集收录了来自Kick和Twitch两大平台的直播聊天日志,每条消息均包含时间戳、用户身份、消息内容及权限标识等元信息。最经典的使用场景是研究直播聊天中的用户行为模式与社群动力学,例如通过时间序列分析揭示观众参与度的波动规律,或利用用户属性(如订阅者、管理员)探讨不同身份群体的发言差异。研究可深入挖掘弹幕文化中的实时反馈机制,为理解数字社交的即时交互特征奠定基础。
解决学术问题
该数据集有效解决了直播聊天室中大规模异构数据难以获取与标准化的学术痛点。传统研究多依赖小规模人工标注或单一平台数据,难以全面揭示跨平台聊天行为的共性与差异。通过提供结构化的多平台聊天记录,研究者得以系统性地对比Kick与Twitch的社区规范、用户互动策略及言论监管模式。例如,可量化分析不同平台中管理员与普通用户在话题引导或情绪表达上的异同,从而深化对平台治理机制与用户话语权分配的理解。这一贡献显著推动了直播社会学与计算传播学在数字对话领域的实证研究。
衍生相关工作
基于Stream Archive数据集,已衍生出多项经典研究脉络。在计算语言学领域,研究者利用其中结构化的实时对话数据探索直播聊天中的语言演化与情绪动态,开发了适应流式场景的文本情感分析模型。在社交网络分析方向,回复关系(reply_to字段)被用于构建观众间的影响力图谱,揭示了意见领袖在直播场景中的涌现规律。此外,数据集中的时间戳与消息密度信息催生了预测直播热度的时序模型,以及识别刷屏事件的关键帧检测方法。这些工作共同拓展了数据驱动的直播行为分析范式,为后续人机交互与数字媒体研究提供了可复用的基准与灵感。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务