FNSPID
收藏资源简介:
FNSPID(金融新闻与股票价格整合数据集)是一个综合金融数据集,旨在通过结合定量和定性数据来增强股票市场预测。它包含1999年至2023年间4,775家S&P500公司的29.7百万股票价格和15.7百万金融新闻记录,数据来自四个股票市场新闻网站。该数据集因其规模、多样性以及独特的金融新闻情感信息整合而突出。使用FNSPID的研究表明,其广泛的大小和质量可以显著提高市场预测的准确性。此外,将情感分数整合到分析中适度提升了基于变压器模型的性能。FNSPID还引入了一种可重复的数据集更新方法,为金融研究提供了宝贵的资源,包括完整的工作、代码、文档和在线示例。
The FNSPID (Financial News and Stock Price Integration Dataset) is a comprehensive financial dataset designed to enhance stock market predictions by integrating quantitative and qualitative data. It encompasses 29.7 million stock prices and 15.7 million financial news records from 4,775 S&P 500 companies between 1999 and 2023, sourced from four stock market news websites. This dataset stands out for its scale, diversity, and the unique integration of sentiment information from financial news. Research utilizing FNSPID has demonstrated that its extensive size and quality can significantly improve the accuracy of market forecasts. Moreover, incorporating sentiment scores into the analysis moderately enhances the performance of Transformer-based models. FNSPID also introduces a reproducible method for dataset updates, offering a valuable resource for financial research, including complete workflows, code, documentation, and online examples.
数据集概述
名称: FNSPID (Financial News and Stock Price Integration Dataset)
描述: FNSPID是一个综合金融数据集,旨在通过结合定量和定性数据来增强股票市场预测。该数据集包含29.7百万条股票价格和15.7百万条金融新闻记录,涵盖了1999年至2023年间4,775家S&P500公司的数据,数据来源于四个股票市场新闻网站。
特点:
- 大规模和高多样性
- 包含金融新闻的情感信息
- 研究表明,其规模和质量能显著提高市场预测的准确性
- 情感分数的整合可适度提升基于transformer模型的性能
更新方法: 提供可重复的数据集更新方法
资源: 提供完整的工作、代码、文档和在线示例
数据集位置
数据集由于体积庞大,可在Hugging Face获取。
数据集功能
- 提供全面的金融数据,包括股票价格和新闻记录
- 展示数据集对预测准确性的影响
- 包含用于更新数据集的新金融新闻收集工具
数据集处理
- 数据收集: 在
data_scraper文件夹中提供工具,用于从Nasdaq收集新闻数据。 - 数据处理: 在
data_processor文件夹中解释如何将数据整合为可操作的数据。 - 数据集实验: 在
dataset_test文件夹中提供使用深度学习模型测试数据集的方法。
使用说明
详细的使用说明可在以下文件中找到:
data_scraper.mddata_processor.mddataset_test.md




