遇见数据集

Traders-Lab/TroveLedger

收藏
Hugging Face2026-05-30 更新2026-01-03 收录
官方服务:

资源简介:

TroveLedger是一个公开的金融时间序列数据集,专注于长期积累高质量的日内数据。该数据集提供多个时间分辨率的OHLC(开盘价、最高价、最低价、收盘价)和交易量数据,主要用于机器学习、量化研究和系统性交易实验。与许多免费数据源不同,TroveLedger强调时间连续性,尤其是分钟级数据。数据集包含超过40万行数据,涵盖不同符号和分辨率,适合单符号训练和大规模多市场模型。数据通过yfinance从Yahoo Finance获取,经过质量检查后以Parquet格式存储。数据集定期更新以扩展历史数据并添加新指数。

TroveLedger is a public financial time series dataset focused on long-term accumulation of high-quality intraday data. The dataset provides OHLC and volume data at multiple time resolutions and is designed primarily for machine learning, quantitative research, and systematic trading experiments. Unlike many freely available data sources, TroveLedger emphasizes continuity over time, especially for minute-level data. The dataset contains over 40 million rows across all symbols and resolutions, making it suitable for both focused single-symbol training and large-scale multi-market models. Data is sourced from Yahoo Finance via the yfinance library, validated for completeness, and stored in Parquet format. The dataset is updated periodically to extend histories and add new indices based on community input.

提供机构:
Traders-Lab
搜集汇总
数据集介绍
Traders-Lab/TroveLedger 数据集图片
构建方式
TroveLedger数据集旨在为人工智能驱动的交易研究提供可靠且不断拓展的历史OHLCV数据源,以弥补金融时间序列数据在连续性和国际覆盖面方面的不足。其数据全部源自雅虎财经,通过yfinance Python库获取,指数成分股则利用基于维基百科API的定制化流水线自动抽取,以确保可持续性。数据采集覆盖日线、小时线和分钟线三个时间分辨率,经过完整性校验与异常值清洗后,仅保留通过质量验证的'.valid'文件,并以高效的Parquet格式存储。数据集通过不间断的累积策略持续扩展,使分钟级数据形成数月无间断的历史序列,而非像常规免费接口那样仅提供碎片化的短窗口数据。
特点
TroveLedger最显著的特征在于其对数据连续性的执着追求,尤其在分钟级高分辨率数据上实现了同类免费数据集难以企及的累积深度。与传统数据源仅能提供近期7天分钟数据不同,该数据集通过连续追加而非替换的方式,为每个标的构建了长达数月的无缺口分钟级时间序列。其覆盖范围涵盖全球主要指数与个股,从S&P 500到BEL 20,横跨美洲、欧洲、亚洲及大洋洲。数据结构统一,每条记录包含symbol、time、open、high、low、close及volume字段,时间以Unix时间戳表示,价格为原生货币计价。所有数据均经过质量校验,并以'状态标记'文件命名方式(如.valid)便于用户进行机器学习工作流中的训练/测试集划分。
使用方法
TroveLedger数据集以Parquet格式按'data/{category}/{symbol}/{symbol}.{interval}.valid.parquet'路径组织,用户可通过Hugging Face Datasets库或直接加载Parquet文件使用。该数据集适用于多种金融时间序列分析场景,包括机器学习模型训练、量化策略回测、技术指标特征工程以及日内与波段交易研究。加载时可按symbol和interval字段筛选所需标的与时间分辨率,利用time字段(Unix时间戳)进行时序处理。需要注意的是,分钟级与小时级数据目前存在拆股和股息调整不完全的问题(日线数据已正确调整),官方正在修复中,建议在进行精确回测前关注更新。数据集仅限非商业研究与教育用途,用户需自行验证数据是否适用于特定场景并遵守原始数据提供方的条款。
背景与挑战
背景概述
TroveLedger 是一个面向金融时间序列分析的公开数据集,由 Traders-Lab 研究团队创建,旨在为机器学习和量化交易研究提供高质量、多分辨率的 OHLCV(开盘价、最高价、最低价、收盘价、成交量)数据。该数据集自 2025 年起逐步积累,覆盖全球主要股票指数(如 S&P 500、DAX、FTSE 100 等)及个股,时间粒度涵盖分钟、小时和日频。其核心研究问题在于解决金融时序数据中高频分钟级历史数据难以长期获取的困境,通过持续累积而非滚动回填的方式,构建无间断的日内行情档案。TroveLedger 的出现为训练人工智能交易系统、进行回测与市场微观结构分析提供了宝贵的标准化数据基础,在金融科技与计算金融领域具有显著的推动作用。
当前挑战
TroveLedger 所面临的挑战首先体现在领域问题上:金融时间序列数据固有的非平稳性、噪声干扰与市场事件(如拆股、分红)带来的价格失真,使得模型训练需处理复杂的调整逻辑,尤其是日内高频数据,若未能正确处理将严重误导回测与策略评估。此外,数据构建过程亦充满技术挑战,包括:从公开源(如 Yahoo Finance)获取的数据在分钟级分辨率上天然缺失长期历史记录,需通过持续增量采集来突破短期窗口限制;对海量品种进行质量校验、填补间隙与异常检测的自动化管线设计;以及不同市场、不同时间区间下交易规则差异的适配。当前,TroveLedger 团队正致力于修复日内数据中针对拆股与分红的调整逻辑,以减少误报并确保数据的可靠性与连续性。
常用场景
经典使用场景
TroveLedger数据集的核心价值在于为金融时间序列分析提供了跨越日、小时、分钟三个粒度的连续OHLCV数据。其最经典的使用场景是训练和评估面向股票与指数的高频交易策略,尤其是需要分钟级连续历史数据的日内交易模型。由于该数据集强调分钟数据的连续性积累,而非七日内滚动窗口的碎片化片段,研究者能够基于长达数月、无间断的逐笔价格与成交信息,构建更具鲁棒性的特征工程与回测框架,从而检验策略在真实市场微观结构中的表现。
衍生相关工作
TroveLedger的积累式数据生成策略催生了一系列围绕数据质量与连续性改进的衍生工作。其中,基于其分钟级序列,研究者开发了校正股票拆分与分红的自动调整算法,通过检测异常价格跳跃来重建一致性历史价格。此算法随后被整合进统一的数据清洗管线,提升了跨分辨率数据集的可靠性。此外,该数据集启发了社区构建可扩展的指数成分股自动抓取框架,利用维基百科API定期更新全球主要指数的标的列表,实现了从S&P 500到BEL 20的多市场覆盖,为后续大规模多资产联合训练模型的落地奠定了工程基础。
数据集最近研究
最新研究方向
TroveLedger数据集的问世,为金融时间序列分析领域开辟了新的研究维度,尤其是在高频数据驱动的量化交易与AI模型训练方面。该数据集通过持续累积分钟级交易数据,突破了传统公共数据源(如yfinance)仅能提供短期历史记录的局限,为日内交易策略的深度回测与机器学习模型的长期记忆训练提供了前所未有的数据基石。其近期纳入BEL 20、DAX等全球主要指数的举措,标志着研究焦点正从单一市场向多市场、跨资产类别的全球微观结构分析演进。同时,针对分裂与股息事件的精密调整工作,反映出该领域对数据质量的高度重视,这直接关乎算法交易的稳健性与市场异常检测模型的可靠性,推动着量化金融研究向更严谨、更可复现的方向发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务