ThinkStream dataset
收藏资源简介:
实时理解连续视频流对于在动态环境中运行的交互式助手和多模态代理至关重要。然而,大多数现有的视频推理方法遵循批处理范式,推迟推理直到观察到完整的视频上下文,导致高延迟和不断增长的计算成本,这与流式场景不兼容。为了解决这个问题,我们引入了**ThinkStream**,一个基于Watch-Think-Speak范式的流式视频推理框架,使模型能够随着新视频观察的到来逐步更新其理解。
Real-time understanding of continuous video streams is critical for interactive assistants and multimodal agents operating in dynamic environments. However, most existing video inference methods follow the batch processing paradigm, deferring inference until the full video context is observed, resulting in high latency and escalating computational costs, which are incompatible with streaming scenarios. To address this issue, we introduce **ThinkStream**, a streaming video inference framework based on the Watch-Think-Speak paradigm, which enables the model to incrementally update its understanding as new video observations arrive.
ThinkStream 数据集概述
数据集基本信息
- 数据集名称: ThinkStream
- 发布方: CASIA-IVA-Lab
- 官方存储库: https://github.com/CASIA-IVA-Lab/ThinkStream
- 数据集地址: https://huggingface.co/datasets/CASIA-IVA-Lab/ThinkStream
- 关联论文: Thinking in Streaming Video (arXiv:2603.12938v1)
数据集背景与目的
该数据集为支持“流式视频推理”研究而构建。旨在解决现有视频理解方法通常采用的批处理范式所导致的高延迟和不断增长的计算成本问题,这些方法与流式场景不兼容。数据集用于训练和评估能够在新的视频观测到达时增量更新其理解的模型。
核心关联框架
数据集与ThinkStream框架紧密关联,该框架基于Watch-Think-Speak范式,并包含以下关键技术:
- Streaming RLVR (Reinforcement Learning with Verifiable Rewards): 用于优化推理更新和响应时序。
- Reasoning-Compressed Streaming Memory (RCSM): 用紧凑的中间推理痕迹替换过时的视觉标记,以保持基本上下文并大幅降低推理成本。
- 高效的流式推理后端: 支持动态KV缓存处理,集成FlashAttention和FlashInfer以实现高速推理。
数据集内容与用途
- 主要用途: 用于训练和评估流式视频理解模型。
- 训练数据构成: 包含LLaVA-Video 178K,以及来自Tarsier2的Charades、Kinetics-700、ActivityNet子集。
- 评估基准: 用于在OVO-Bench和StreamingBench等流式视频基准上进行模型性能测试。
使用方式
- 数据准备:
- 从Hugging Face下载ThinkStream数据集。
- 准备视频源数据。
- 数据集路径配置位于
thinkstream/data/__init__.py。
- 训练:
- 运行监督微调脚本:
./scripts/sft.sh - 运行强化学习训练脚本:
./scripts/rl.sh
- 运行监督微调脚本:
- 评估:
- 准备OVO-Bench和StreamingBench官方数据集。
- 运行格式转换脚本 (
thinkstream/eval/目录下)。 - 运行评估脚本:
bash ./scripts/eval/eval.sh
- 推理演示:
- 修改
scripts/demo.py中的模型路径、视频路径及查询内容。 - 运行:
python scripts/demo.py
- 修改
性能表现
基于该数据集训练的ThinkStream框架在多个基准测试中表现出色:
- OVO-Bench: 平均得分显著超越其基础模型和其他开源在线模型。
- StreamingBench Real-Time: 性能与专有模型具有高度竞争力,并远超其他开源在线MLLM。
- 效率: 框架成功将延迟控制在处理视频长度增加时,始终低于所需的实时阈值。




