遇见数据集

NutritionVerse-3D

收藏
arXiv2023-04-12 更新2024-06-21 收录
官方服务:

资源简介:

NutritionVerse-3D是一个大规模、高质量、高分辨率的数据集,包含105个3D食品模型,由滑铁卢大学视觉与图像处理实验室和加拿大国家研究委员会共同创建。数据集不仅提供了食品的重量、名称和营养值,还支持通过视图合成生成无限数量的2D图像,适用于任何视角和相机角度。创建过程中,研究团队特别注重速度和一致性,使用iPhone和Polycam应用收集高质量的3D模型。该数据集主要应用于老年人的营养摄入追踪,旨在解决老年人营养不良问题,提高生活质量。

NutritionVerse-3D is a large-scale, high-quality, high-resolution dataset comprising 105 3D food models, jointly created by the Vision and Image Processing Lab at the University of Waterloo and the National Research Council Canada. This dataset not only provides the weight, name and nutritional information of each food item, but also supports generating an unlimited number of 2D images via view synthesis for arbitrary viewpoints and camera angles. During the dataset creation process, the research team prioritized speed and consistency, collecting high-quality 3D models using iPhones and the Polycam application. This dataset is primarily applied to nutritional intake tracking for elderly populations, aiming to address malnutrition among the elderly and improve their quality of life.

创建时间:
2023-04-12
搜集汇总
数据集介绍
NutritionVerse-3D 数据集图片
构建方式
在全球人口老龄化趋势日益显著的背景下,保障老年人居家养老中的营养摄入成为关键挑战。NutritionVerse-3D数据集应运而生,旨在通过三维建模技术突破传统二维图像在营养评估中的视角局限性。该数据集采用iPhone设备与Polycam应用协同采集,通过电动转台与定制化脚本实现标准化图像获取。为覆盖多角度信息,研究团队设置两台iPhone以不同角度同步拍摄,并在四组食物六维位姿与两组相机视角的组合下,每组合采集约30张图像,最终生成240张照片用于三维重建。针对背景干扰,采用白色低反射餐盘与黑色桌布优化掩膜效果,并借助Polycam的物体遮罩功能去除无关背景。最终成功构建了包含105个高分辨率三维食物模型的数据库,每个模型均以OBJ和PLY格式存储,并附带精确称量的重量、食物名称及从包装或加拿大营养数据库中获取的详细营养信息。
特点
NutritionVerse-3D数据集的核心优势在于其三维模型驱动的无限视角合成能力。与现有二维图像数据集不同,每个食物模型可生成任意视角、光照与相机设置下的逼真二维图像,从根本上消除了固定视角引入的采样偏差。数据集涵盖20种独特食物类型,包括蛋白质、碳水化合物等混合类别,特别关注了纹理丰富的大体积食物(如鸡腿)与高脆弱性食物(如金枪鱼饭团)的建模挑战。所有模型均集成重量与多维营养参数(如热量、脂肪、蛋白质、钙、铁等),形成完整的营养元数据体系。这种设计使得研究者能够通过Nvidia Omniverse平台自动构建多模态合成场景,同步生成RGB图像、深度图、目标检测边界框与语义分割标注,为营养感知机器学习提供了高度灵活且可扩展的训练数据源。
使用方法
NutritionVerse-3D数据集的使用方法围绕其三维模型的合成潜力展开。研究者可首先从105个模型中随机选取所需食物类别与数量,在Nvidia Omniverse数字孪生环境中将三维模型程序化地放置于虚拟餐盘上。通过调整随机相机视角、光照条件及景深效果,系统可自动生成大量多模态二维图像,包括RGB与深度数据,并同步输出精确的目标检测与语义分割标注。最后,利用数据集内置的营养元数据,为每个合成场景中的食物分配营养信息并计算餐食总营养值。这种流程使得用户能够高效创建多样化、无偏见的训练集,特别适用于开发面向老年人营养摄入追踪的计算机视觉模型,同时避免了传统数据采集中繁琐的实物拍摄与人工标注过程。
背景与挑战
背景概述
随着全球人口老龄化趋势的加剧,超过77%的50岁以上成年人倾向于在家中养老,这一现象对确保老年人充分营养摄入提出了严峻挑战。针对约四分之一65岁以上老年人存在营养不良的现状,滑铁卢大学视觉与图像处理实验室联合加拿大国家研究委员会于2023年发布了NutritionVerse-3D数据集。该数据集聚焦于通过计算机视觉实现自动化营养摄入追踪这一核心研究问题,创新性地构建了105个高分辨率三维食物模型,并配套提供了每件食物的重量、名称及详尽营养信息。相较于传统二维图像数据集存在的视角偏差与采样局限性,该三维数据集通过视图合成技术可生成任意角度的无限二维图像,显著提升了营养评估模型的泛化能力与准确性,为居家养老场景下的智能营养监测开辟了新路径。
当前挑战
NutritionVerse-3D数据集面临的核心挑战在于解决食物营养感知领域的数据表征局限。传统二维图像数据集因固定采样视角难以模拟老年人实际拍摄场景中的角度与画质多样性,导致模型训练存在固有偏差。而三维模型构建过程中遭遇的技术挑战更为复杂:首先,纹理匮乏的食物(如奶酪)、薄片状食品(如薯片)及微小物品(如葡萄)在三维重建时极易出现渲染失败或模型变形;其次,高脆弱性食物(如金枪鱼饭团)在数据采集过程中因形态变化导致重建质量低下;此外,多角度拍摄时需精确控制相机位姿与光照条件以避免阴影干扰,同时需在250张图像限制内平衡食物姿态与相机角度的组合优化。这些挑战要求数据采集流程在速度与一致性之间取得精妙平衡。
常用场景
经典使用场景
在计算机视觉与营养感知交叉领域,NutritionVerse-3D数据集以其高保真三维食物模型为核心,开创性地支持从任意视角、光照与布局条件下合成海量二维图像。研究者可借助该数据集模拟老年人居家饮食场景中复杂多变的拍摄角度与图像质量,从而构建更具泛化能力的营养摄入自动估算模型。其经典使用场景聚焦于多模态数据生成,如RGB图像、深度图、目标检测边界框与语义分割标注的联合产出,为深度学习模型提供丰富且无偏的训练素材。
实际应用
在实际应用中,NutritionVerse-3D赋能移动端营养追踪应用,通过合成多样化的餐食场景图像,提升自动识别与营养估算系统在真实环境中的鲁棒性。老年用户只需用手机拍摄餐盘,即可获得基于三维模型视角合成的精准营养分析,避免传统手动记录的低效与误差。此外,该数据集可集成至智能厨房设备或健康管理平台,实现膳食摄入的实时监测与个性化建议,助力居家养老场景下的营养健康维护,具有显著的社会价值与市场潜力。
衍生相关工作
基于NutritionVerse-3D,学界已衍生出多项经典工作,包括利用Nvidia Omniverse平台自动生成合成餐食多模态数据集的研究,以及面向视角不变性食物识别算法的开发。后续工作进一步探索了三维食物模型在场景布局自动组装与侧菜替换中的应用,通过约束条件确保渲染真实性,从而扩展至大规模餐食组合的生成。这些衍生研究不仅深化了三维模型在营养感知中的理论框架,还催生了如FoodSeg与Nutrition5k等数据集的改进版本,形成以三维模型驱动二维数据生成的创新范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务