wikifragments
收藏资源简介:
WikiFragments是一个多模态数据集,由Wikipedia的英文版构建而成,包含清理后的文本段落及其相关图片。每个文本段落都配有一组图片,形成了一个多模态片段,适合用于信息检索和多模态研究。
WikiFragments is a multimodal dataset constructed from the English-language edition of Wikipedia, containing cleaned text passages and their associated images. Each text passage is paired with a set of images to form a multimodal fragment, which is suitable for information retrieval and multimodal research.
WikiFragments数据集概述
数据集基本信息
- 名称: WikiFragments
- 类型: 多模态数据集
- 语言: 英语
- 数据来源: 英文维基百科
- 许可协议:
- 代码: MIT License
- 文本数据: CC BY-SA 4.0
- 图像: 遵循各自原始页面的许可协议
- 数据集大小: 58,037,298,060.96字节
- 下载大小: 47,531,941,595字节
- 样本数量: 42,482,460
数据集结构
特征
id: 段落唯一标识符 (int32)title: 维基百科页面标题 (string)text: 清理后的段落文本 (string)url: 维基百科页面URL (string)wiki_id: 维基百科页面ID (int32)paragraph_id: 段落在该页面中的序号 (int32)images: 图像序列,包含:caption: 图像标题 (string)image: PIL图像对象 (image)type: 图像类型 ("infobox"或"thumb") (string)url: 图像内部URL (string)
数据划分
- 仅包含训练集(train):
- 样本数: 42,482,460
- 字节数: 58,037,298,060.96
数据集描述
内容
- 从维基百科提取的清理后文本段落
- 每个段落与其相关的图像(来自同一页面的infobox和缩略图)配对
- 每个段落-图像对构成一个多模态片段
统计信息
- 总段落数: 42,482,460
- 包含至少一张图像的段落数: 2,254,123
- 图像总数: 2,499,977
- 每个段落的平均图像数: 1.109
- 单个段落的最大图像数: 125
数据集用途
适用场景
- 多模态检索
- 检索增强生成(RAG)
- 多模态预训练与评估
- 文档理解(如问答系统)
- 多模态上下文学习基准测试
不适用场景
- 需要实时更新的系统
- 法律、医疗或金融等对事实准确性要求高的应用
- 未经许可的商业用途
数据集创建
数据来源
- 文本和图像内容来自英文维基百科和Wikimedia Commons
- 通过Kiwix ZIM dump获取(2024年1月)
处理过程
- 使用修改版的wikiextractor工具提取文本
- 保留超链接和段落顺序
- 从HTML infobox和缩略图引用中解析图像
- 图像与下方段落关联
- 从HTML元数据中提取标题
限制与注意事项
- 继承维基百科的潜在偏见
- 图像许可协议各不相同,需单独遵守
- 仅反映特定时间点的数据快照
- 不适用于安全关键或事实敏感的应用
引用信息
BibTeX:
@article{fanelli2025artseek, title={ArtSeek: Deep artwork understanding via multimodal in-context reasoning and late interaction retrieval}, author={Fanelli, Nicola and Vessio, Gennaro and Castellano, Giovanna}, journal={arXiv preprint arXiv:2507.21917}, year={2025} }
APA: Fanelli, N., Vessio, G., & Castellano, G. (2025). ArtSeek: Deep artwork understanding via multimodal in-context reasoning and late interaction retrieval. arXiv preprint arXiv:2507.21917.
联系方式
- 作者: Nicola Fanelli
- 邮箱: nicola.fanelli@uniba.it




