遇见数据集

koen430/random_selected_stock_mix

收藏
Hugging Face2024-05-20 更新2024-06-12 收录
官方服务:

资源简介:

--- dataset_info: features: - name: ticker dtype: string - name: prompt dtype: string - name: text dtype: string - name: url dtype: string - name: result_1 dtype: string - name: result_1_bin dtype: int64 - name: relevance dtype: string - name: token_count dtype: int64 - name: __index_level_0__ dtype: int64 splits: - name: train num_bytes: 12167785 num_examples: 3600 - name: val num_bytes: 708256 num_examples: 200 - name: test num_bytes: 698513 num_examples: 200 download_size: 7170454 dataset_size: 13574554 configs: - config_name: default data_files: - split: train path: data/train-* - split: val path: data/val-* - split: test path: data/test-* --- ## INFO A random selection of news articles and tweets for the purpose of fine-tuning a LLM to predict stock price movement the day after the news publications/tweets. Source koen430/preprocessed_stock_news and koen430/preprocessed_stock_twitter More info will follow soon

数据集信息: 特征字段: - 字段名:ticker(股票代码),数据类型:字符串 - 字段名:prompt(提示词),数据类型:字符串 - 字段名:text(文本内容),数据类型:字符串 - 字段名:url(链接地址),数据类型:字符串 - 字段名:result_1,数据类型:字符串 - 字段名:result_1_bin(结果1二进制标签),数据类型:64位整数 - 字段名:relevance(相关性),数据类型:字符串 - 字段名:token_count(Token计数),数据类型:64位整数 - 字段名:__index_level_0__(索引层级0),数据类型:64位整数 数据集划分: - 划分名称:train(训练集),字节数:12167785,样本数量:3600 - 划分名称:val(验证集),字节数:708256,样本数量:200 - 划分名称:test(测试集),字节数:698513,样本数量:200 下载大小:7170454,数据集总大小:13574554 配置项: - 配置名称:default(默认配置),数据文件: - 训练集划分:路径为data/train-* - 验证集划分:路径为data/val-* - 测试集划分:路径为data/test-* 信息说明: 本数据集随机选取新闻文章与推文,用于微调大语言模型(LLM)以预测新闻或推文发布次日的股价波动。 数据集来源:koen430/preprocessed_stock_news 与 koen430/preprocessed_stock_twitter。 更多信息将在后续公布。

提供机构:
koen430
原始信息汇总

数据集概述

数据集特征

  • ticker: 字符串类型
  • prompt: 字符串类型
  • text: 字符串类型
  • url: 字符串类型
  • result_1: 字符串类型
  • result_1_bin: 整数类型(int64)
  • relevance: 字符串类型
  • token_count: 整数类型(int64)
  • index_level_0: 整数类型(int64)

数据集分割

  • train: 3600个样本,占用12167785字节
  • val: 200个样本,占用708256字节
  • test: 200个样本,占用698513字节

数据集大小

  • 下载大小: 7170454字节
  • 数据集总大小: 13574554字节

配置文件

  • config_name: default
  • data_files:
    • train: 路径为data/train-*
    • val: 路径为data/val-*
    • test: 路径为data/test-*
搜集汇总
数据集介绍
koen430/random_selected_stock_mix 数据集图片
构建方式
该数据集名为koen430/random_selected_stock_mix,旨在为大型语言模型提供微调数据,以预测新闻或推文发布次日股票价格的变动。构建方式上,数据集从两个预处理源——koen430/preprocessed_stock_news和koen430/preprocessed_stock_twitter中随机抽取新闻文章和推文,确保样本的多样性与代表性。数据包含train、val和test三个划分,分别含3600、200和200条样本,每条记录涵盖股票代码(ticker)、提示文本(prompt)、正文内容(text)、来源URL、二元结果(result_1_bin)及关联性(relevance)等特征,为模型训练提供结构化输入。
特点
数据集的核心特点在于其针对金融领域时间序列预测的专有设计。通过整合新闻与社交媒体两种异质数据源,它捕获了影响股价变动的多元信息流,从而增强模型对市场情绪的感知能力。特征中result_1_bin以整数形式标记次日涨跌方向,简化了分类任务;token_count字段则便于控制输入长度,适应不同模型架构。此外,数据集规模虽小但划分明确,适合快速迭代验证,同时随机抽样策略减少了时序偏差,提升了泛化潜力。
使用方法
使用方法上,用户可直接通过HuggingFace Datasets库加载该数据集,指定config_name为'default'并选择train、val或test分割。每条样本中的prompt字段可作为模型输入前缀,text字段提供上下文,result_1_bin作为监督信号用于二分类训练。建议在微调前对token_count进行统计分析,以优化批处理大小和序列截断策略。对于评估,可基于val和test分割计算准确率或F1分数,验证模型对次日股价方向的预测能力。
背景与挑战
背景概述
在金融预测领域,将非结构化文本数据与市场动态相结合的研究日益受到关注。koen430/random_selected_stock_mix数据集由研究人员koen430于近期创建,旨在为大型语言模型的微调提供高质量的新闻与推文样本。该数据集的核心研究问题在于探索文本信息对次日股票价格走势的预测能力,通过整合来自koen430/preprocessed_stock_news和koen430/preprocessed_stock_twitter的随机选取样本,构建了包含3600条训练样本、200条验证样本和200条测试样本的混合语料库。这一资源为自然语言处理与量化金融的交叉领域提供了基础性数据支持,有望推动情感分析、事件驱动交易等方向的研究进展。
当前挑战
当前数据集面临多重挑战。首先,金融文本预测的核心难题在于市场噪声与信号的有效分离,新闻和推文中混杂的冗余信息、主观情绪及滞后性内容可能干扰模型对真实市场影响的判断。其次,构建过程中,从原始预清洗数据中随机选取样本的策略虽保证了多样性,却可能导致关键事件(如财报发布、政策变动)的覆盖不足,影响模型对突发性市场波动的泛化能力。此外,数据集的标签仅基于次日价格涨跌进行二元分类,未考虑成交量、波动率等辅助因子,限制了预测维度的丰富性。时间跨度与地域分布的局限性亦可能削弱模型在不同市场周期下的鲁棒性。
常用场景
经典使用场景
该数据集融合了随机选取的新闻文章与推文,专为微调大型语言模型而构建,旨在预测新闻或推文发布后次日股票价格的走势。其经典使用场景在于利用自然语言处理技术,从海量的金融文本中提取市场情绪与关键信息,从而建模股价的短期波动。研究者通常将其作为监督学习任务的基准,通过模型学习文本特征与价格涨跌之间的映射关系,验证语言模型在金融时间序列预测中的有效性。
解决学术问题
该数据集有效解决了金融文本信息与市场动态之间关联性难以量化的学术难题。传统方法多依赖结构化财务数据,而忽视了非结构化文本中蕴含的预期差与噪声信号。通过提供标注了次日股价涨跌的文本样本,该数据集支持研究者探索语言模型在弱信号提取、事件驱动交易策略及市场异常检测等方向的应用,推动了计算金融学与自然语言处理的交叉发展,为理解信息传导机制提供了实证基础。
衍生相关工作
该数据集衍生了一系列经典工作,包括基于预训练语言模型的金融情绪分析、结合注意力机制的股价预测框架以及多模态信息融合的时序模型。研究者常以此为基础,对比不同模型架构(如LSTM、Transformer)在金融文本上的表现,并探索领域自适应与数据增强技术。此外,该数据集还催生了关于信息时效性与市场反应速度的实证研究,推动了事件驱动交易策略从规则驱动向数据驱动范式的转变。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务