登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Multimodal-C4 (mmc4)
Multimodal-C4 (mmc4)
收藏
OpenXLab
2026-04-18 收录
多模态预训练
语言模型训练
数据链接:
https://openxlab.org.cn/datasets/OpenDataLab/Multimodal-C4_mmc4
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
多模态 C4 (MMC4) 是流行的纯文本 c4 语料库的增强,图像交错。 语料库包含 103M 文档,其中包含 585M 图像与 43B 英文标记交错。
应用场景:
提供机构:
OpenDataLab
创建时间:
2023-05-09
相关数据集
CPCXR (COVID-19 Posteroanterior Chest X-Ray fused)
医学影像分析
机器学习
COVID-19 后前部胸部 X 射线融合 (CPCXR) 数据集是通过融合三个公开可用的数据集生成的:COVID-19 cxr 图像、北美放射学会 (RSNA) 和美国国家医学图书馆 (USNLM) 收集蒙哥马利国家 - NLM(MC)。该数据集由标记为 COVID-19、结核病、其他肺炎(SARS、MERS 等)和正常的疾病样本组成。该数据集可用于训练评估深度学习和机器学习模型作为二元和多类分
OpenDataLab
2026-07-12 更新
16
0
MIL(multi-instance learning)
示例学习
机器学习
MIL算法在71 mil基准数据集上进行了测试。这是最大的实验MIL存储库,用于算法比较。数据集的应用领域是分子活性预测,图像注释,文本分类,网页分类和音频记录分类 (n miproblems.org提供数据集的mat文件)。 每个数据集文件都是一个逗号分隔值 (CSV) 格式的文件,它具有实例数许多行和特征数许多列以及两个附加列。第一个附加列对应于传播到实例的bag类标签。第二列是bag ID列
OpenXLab
6
0
TextSeg
场景语义分割
文档图像分析
现实世界中的文本极其多样化,但当前的文本数据集并不能很好地反映这种多样性。为了弥合这一差距,我们提出了 TextSeg,这是一个大规模的精细注释和多用途文本数据集,收集具有六种类型注释的场景和设计文本:单词和字符边界多边形、掩码和转录。我们还介绍了文本细化网络 (TexRNet),这是一种新颖的文本分割方法,可适应文本的独特属性,例如非凸边界、多样纹理等,往往会给传统分割模型带来负担。 TexRN
OpenXLab
2
0
RefCOCO+
计算机视觉
视觉指代
RefCOCO在19,992图像中具有49,856对象的141,564表达式。
OpenXLab
9
0
FGADR
糖尿病视网膜病变
眼底病变分割与分级
大规模的细粒度注释的糖尿病性视网膜病 (FGADR) 数据集由两个子集组成: Seg集 (1842图像) 和Grade集 (1000图像)。 糖尿病患者有患糖尿病视网膜病变 (DR) 的风险。这种疾病是当高血糖水平导致视网膜血管受损时。由于深度学习的巨大成功,计算机辅助DR诊断是早期检测DR和严重程度分级的有希望的选择。但是,由于缺乏具有一致且细粒度注释的训练数据,以前的大多数工作都提出了DR诊断
OpenXLab
4
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广