mteb/fiqa
收藏数据链接:
官方服务:
资源简介:
该数据集主要用于文本检索任务,包含三个配置:default、corpus和queries。default配置包含query-id、corpus-id和score特征,corpus配置包含_id、title和text特征,queries配置包含_id和text特征。数据集的分割包括train、dev、test、corpus和queries,每个分割都有相应的字节大小和示例数量。
该数据集主要用于文本检索任务,包含三个配置:default、corpus和queries。default配置包含query-id、corpus-id和score特征,corpus配置包含_id、title和text特征,queries配置包含_id和text特征。数据集的分割包括train、dev、test、corpus和queries,每个分割都有相应的字节大小和示例数量。
提供机构:
mteb原始信息汇总
数据集概述
语言和多语言性
- 语言: 英语
- 多语言性: 单语种
任务类别和任务ID
- 任务类别: 文本检索
- 任务ID: 文档检索
配置名称和特征
-
配置名称: default
- 特征:
- query-id: 字符串
- corpus-id: 字符串
- score: 浮点数 (float64)
- 分割:
- train: 365642 字节, 14166 样本
- dev: 31919 字节, 1238 样本
- test: 43996 字节, 1706 样本
- 特征:
-
配置名称: corpus
- 特征:
- _id: 字符串
- title: 字符串
- text: 字符串
- 分割:
- corpus: 45303212 字节, 57638 样本
- 特征:
-
配置名称: queries
- 特征:
- _id: 字符串
- text: 字符串
- 分割:
- queries: 491278 字节, 6648 样本
- 特征:
配置和数据文件
-
配置名称: default
- 数据文件:
- train: qrels/train.jsonl
- dev: qrels/dev.jsonl
- test: qrels/test.jsonl
- 数据文件:
-
配置名称: corpus
- 数据文件:
- corpus: corpus.jsonl
- 数据文件:
-
配置名称: queries
- 数据文件:
- queries: queries.jsonl
- 数据文件:
搜集汇总
数据集介绍
构建方式
在金融文本信息检索领域,精准匹配用户查询与相关文档是核心挑战。FiQA2018数据集正是为应对这一挑战而构建的,它源自金融领域的意见挖掘与问答任务。该数据集采用人工标注的方式构建,确保了标注质量。其结构包含三个核心配置:corpus(语料库)、queries(查询)以及default(包含查询-文档相关性评分)。corpus配置存储了57638篇金融文本,每篇包含标题与正文。queries配置则收录了6648条用户查询。default配置通过train、dev、test三个划分,分别提供14166、1238和1706条查询-文档对及其相关性评分,为模型训练、验证与测试提供了完整的数据基础。
特点
该数据集的突出特点在于其聚焦金融领域的专业性与标注的精细度。语料库中的文档平均长度约为768个字符,最长可达16991个字符,覆盖了从短文本到长文的丰富信息粒度。查询的平均长度约为62个字符,简洁而精准地反映了金融信息需求。每个查询平均关联约2.6个相关文档,最多可达23个,体现了金融领域信息关联的复杂性。作为MTEB(大规模文本嵌入基准)的重要组成部分,该数据集专为评估文本嵌入模型在检索任务上的表现而设计,其单语言、英文的属性确保了评估的专注性与可比性。
使用方法
研究人员可通过MTEB框架便捷地使用该数据集评估嵌入模型。利用`mteb.get_tasks(["FiQA2018"])`加载任务,随后通过`mteb.get_model(YOUR_MODEL)`指定待评估模型,最后调用`evaluator.run(model)`即可完成评估流程。数据集以JSONL格式存储,包含corpus.jsonl、queries.jsonl以及qrels/目录下的训练、验证和测试划分文件,便于直接加载或集成到自定义评估流水线中。这种标准化的接口设计,极大简化了金融领域文本检索任务的模型性能比较与复现工作。
背景与挑战
背景概述
金融领域的信息检索与问答系统是自然语言处理研究的重要分支,其核心在于从海量非结构化文本中精准定位与用户意图匹配的答案。FiQA2018数据集应运而生,由学术界与工业界合作创建,旨在聚焦金融文本的情感分析与问答任务。该数据集于2018年首次发布,作为金融领域信息检索的标杆,其构建基于来自金融论坛与新闻的语料,包含逾5.7万篇文档与超过1.4万条查询-文档关联,为评估模型在专业术语密集、语境复杂的金融文本中的检索能力提供了标准化测试平台。FiQA2018的推出显著推动了金融NLP研究,尤其在零样本跨领域检索与嵌入模型评估方面,成为MTEB(大规模文本嵌入基准)的重要组成部分,其影响力延伸至量化投资、风险管理等实际应用场景。
当前挑战
FiQA2018数据集所解决的领域问题集中于金融文本检索中的语义匹配与情感分析,挑战在于金融语言的高度专业性与动态性,如术语歧义、语境依赖的金融概念(如‘杠杆’在不同场景下的含义差异)以及情感极性对答案相关性的影响。构建过程中,数据采集面临多源异构文本(论坛帖文与新闻报道)的整合难题,需确保标注一致性与跨领域泛化性;人工标注的查询-文档对需克服主观偏差,且仅约2.6个相关文档的平均标注密度凸显了稀疏监督信号的挑战。此外,金融领域时效性强的特性使得静态数据集难以覆盖市场演变,模型在零样本场景下的鲁棒性评估成为持续难点。
常用场景
经典使用场景
在金融文本挖掘与信息检索的交叉领域,FiQA2018数据集作为一项里程碑式资源,被广泛用于评估和训练面向金融领域的文本嵌入模型。其核心应用场景聚焦于金融问答与意见挖掘中的检索任务,通过将用户提出的金融相关查询与海量文档库进行精准匹配,验证模型在专业术语密集、语义高度复杂的金融语料上的检索性能。该数据集包含逾5.7万篇金融文档、近6千条查询及对应的相关性标注,为研究者在零样本或微调场景下比较不同嵌入架构(如BERT、Sentence-BERT及其变体)的检索精度提供了标准化评测平台。
衍生相关工作
围绕FiQA2018数据集,学术界与工业界衍生出一系列具有影响力的研究工作。该数据集被整合至BEIR基准中,成为评估检索模型零样本泛化能力的关键一环,催生了如Contriever、GTR等高效稠密检索架构的对比分析。在MTEB大规模文本嵌入评测框架内,FiQA2018作为金融领域的代表任务,被用于验证新一代嵌入模型(如E5、BGE系列)在专业垂直场景下的鲁棒性。此外,部分研究基于该数据集探索了查询重写、文档扩展等预处理策略对检索精度的增益效果,以及结合金融领域预训练模型(如FinBERT)的微调范式,形成了从数据构建到模型优化的完整研究链条。
数据集最近研究
最新研究方向
FiQA2018数据集作为金融领域文本嵌入与检索的基准测试,当前研究前沿聚焦于利用大规模多语言文本嵌入基准(MMTEB)框架,评估和提升模型在金融舆情分析与问答任务上的零样本泛化能力。随着金融文本数据量激增,研究者致力于优化嵌入模型以捕捉财经语境下的语义关联与情感倾向,该数据集在推动金融信息检索系统从传统关键词匹配向语义理解转型中扮演关键角色。其与MTEB生态的深度整合,为评估跨领域、多语言场景下的检索性能提供了标准化平台,对构建更精准的金融智能问答与风险分析工具有着深远影响。
以上内容由遇见数据集搜集并总结生成



