遇见数据集

agyaatcoder/plant-doc-paligemma

收藏
Hugging Face2024-06-02 更新2024-06-12 收录
官方服务:

资源简介:

--- license: cc-by-4.0 dataset_info: features: - name: image_id dtype: int64 - name: image dtype: image - name: width dtype: int64 - name: height dtype: int64 - name: objects struct: - name: id sequence: int64 - name: area sequence: int64 - name: bbox sequence: sequence: float32 - name: category sequence: string - name: label_for_paligemma dtype: string splits: - name: train num_bytes: 923933097.966 num_examples: 2342 - name: test num_bytes: 73530064.0 num_examples: 236 download_size: 992078922 dataset_size: 997463161.966 configs: - config_name: default data_files: - split: train path: data/train-* - split: test path: data/test-* ---

许可证:CC BY 4.0(知识共享署名4.0许可协议) 数据集信息: 特征字段: - 名称:image_id(图像ID),数据类型:int64(64位整数) - 名称:image(图像数据),数据类型:图像类型 - 名称:width(图像宽度),数据类型:int64(64位整数) - 名称:height(图像高度),数据类型:int64(64位整数) - 名称:objects(目标对象结构体),数据类型为结构体,包含以下子字段: - 名称:id,类型:int64序列 - 名称:area(目标面积),类型:int64序列 - 名称:bbox(边界框),类型:float32(32位浮点数)二维序列 - 名称:category(类别名称),类型:字符串序列 - 名称:label_for_paligemma(适配Paligemma的标注文本),数据类型:string(字符串) 数据集分割: - 分割名称:train(训练集),字节占用量:923933097.966,样本数量:2342 - 分割名称:test(测试集),字节占用量:73530064.0,样本数量:236 下载总大小:992078922字节,数据集总存储大小:997463161.966字节 数据集配置: - 配置名称:default(默认配置),数据文件映射: - 训练集对应路径:data/train-* - 测试集对应路径:data/test-*

提供机构:
agyaatcoder
原始信息汇总

数据集概述

数据集特征

  • image_id: 数据类型为 int64
  • image: 数据类型为 image
  • width: 数据类型为 int64
  • height: 数据类型为 int64
  • objects: 结构化数据,包含以下子特征:
    • id: 数据类型为 int64
    • area: 数据类型为 int64
    • bbox: 数据类型为 float32,包含多个坐标值
    • category: 数据类型为 string
  • label_for_paligemma: 数据类型为 string

数据集分割

  • train: 包含 2342 个样本,占用 923933097.966 字节
  • test: 包含 236 个样本,占用 73530064.0 字节

数据集大小

  • 下载大小: 992078922 字节
  • 数据集总大小: 997463161.966 字节

数据文件配置

  • default 配置下的数据文件路径:
    • 训练集: data/train-*
    • 测试集: data/test-*
搜集汇总
数据集介绍
agyaatcoder/plant-doc-paligemma 数据集图片
构建方式
在植物科学领域,高质量的标注图像数据集对于训练视觉语言模型至关重要。agyaatcoder/plant-doc-paligemma数据集以植物文档图像为核心,通过精细的结构化标注构建而成。每个样本包含唯一的图像标识符、图像本身的像素信息、尺寸数据,以及以对象序列形式存储的详细标注,涵盖目标编号、面积、边界框坐标和类别标签。特别地,数据集为每张图像生成了专用于PaliGemma模型的指令式文本描述(label_for_paligemma),将视觉信息转化为模型可理解的语义格式。数据集被划分为训练集(2342例)和测试集(236例),以支持模型的训练与评估。
特点
该数据集展现出显著的领域专精与结构严谨性。其图像均来源于植物文档,聚焦于植物表型或病害等特定场景,确保了数据在植物科学应用中的高度相关性。标注体系不仅包含常规的目标检测信息(边界框、类别),还创新性地整合了面向PaliGemma模型的文本指令,实现了视觉特征与语言描述的深度对齐。数据集规模虽相对精简,但每个样本的标注密度高,涵盖多个目标对象及其属性,为少样本学习或微调视觉语言模型提供了高质量的基础资源。
使用方法
使用者可通过HuggingFace Datasets库便捷加载该数据集。加载时需指定配置名称为'default',并选择相应的数据分片(如train或test)。数据加载后,每条记录包含图像、标注框及类别信息,可直接用于目标检测任务。对于PaliGemma模型的微调,应重点利用'label_for_paligemma'字段,该字段提供了模型所需的文本指令,可将图像输入与描述性输出配对,形成标准的视觉问答或图像描述训练格式。此外,用户也可将边界框和类别数据用于传统计算机视觉模型的训练,实现多用途开发。
背景与挑战
背景概述
在植物病理学领域,精准识别与定位植物病害是保障粮食安全与生态平衡的关键技术之一。agyaatcoder/plant-doc-paligemma数据集应运而生,由研究团队于近期构建,旨在推动视觉语言模型在植物病害检测中的应用。该数据集包含2342张训练图像与236张测试图像,每张图像均标注了病害区域的边界框、类别标签以及适用于Paligemma模型的文本描述。其核心研究问题在于如何利用多模态数据提升模型对复杂植物病害的理解与泛化能力。该数据集的发布为农业智能化诊断提供了宝贵的基准资源,有望促进计算机视觉与自然语言处理在农业领域的交叉融合。
当前挑战
该数据集所面临的挑战主要体现在两个层面。在领域问题层面,植物病害的视觉表现高度多样,受光照、生长阶段及拍摄角度影响,导致类别间差异模糊,传统分类模型难以鲁棒区分。此外,病害区域的尺度变化剧烈,小目标检测精度不足是核心瓶颈。在构建过程中,数据标注的精准性面临严峻考验,尤其是边界框的边界界定需专家知识,而类别标签的文本描述需兼顾语义准确性与模型兼容性。同时,训练样本规模有限(仅2342例),易引发过拟合,且测试集与训练集的分布差异可能影响模型的泛化评估。
常用场景
经典使用场景
在农业植物病理学与计算机视觉交叉研究领域,plant-doc-paligemma数据集为植物病害的精细化检测与分割任务提供了高质量的标注资源。该数据集包含超过两千余张高分辨率植物叶片图像,每张图像均附带精确的目标边界框与区域掩码,使得研究者能够基于其构建面向多类别植物病害的定位与识别模型。尤其是其与PaliGemma多模态架构的深度耦合设计,使得该数据集成为探索视觉-语言联合表征在农业智能诊断中应用的经典范例,广泛应用于弱监督学习与细粒度分类等前沿课题。
解决学术问题
该数据集直面植物病害自动诊断中标注数据匮乏与类别不均衡的学术瓶颈。通过提供涵盖多种病害类型的结构化标注信息,它有效支撑了基于深度学习的病害早期检测研究,解决了传统农业专家目视判别效率低、主观性强的问题。其内置的标准化标签格式降低了跨模态模型训练的门槛,推动了迁移学习与少样本学习在农业视觉任务中的理论验证,为构建鲁棒性更强的泛化诊断框架奠定了数据基础。
衍生相关工作
该数据集衍生了一系列具有影响力的学术工作,例如基于其构建的PaliGemma微调模型在植物病害问答任务中展现了卓越的跨模态推理能力,相关方法被后续研究引用为基准。此外,针对其标注格式优化的目标检测框架如YOLOv8-PD和实例分割网络Mask R-CNN-PD,均在公开评测中取得了领先性能。这些工作不仅深化了视觉语言模型在垂直农业领域的适配性研究,也催生了植物病害数据集构建标准的规范化讨论。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务