遇见数据集

camlab-ethz/FNS-KF

收藏
Hugging Face2024-05-30 更新2024-06-12 收录
官方服务:

资源简介:

该数据集基于不可压缩的Navier-Stokes方程,包含了从分段恒定涡度初始条件开始的轨迹。数据集中的NetCDF文件包含一个名为*solution*的变量,其维度为20000(轨迹数量)、21(时间步长)、2(水平速度和垂直速度)、128(x维度)和128(y维度)。数据在单位正方形上模拟到T=1,并在空间和时间上均匀保存。强迫场由0.1sin(2pi(x+y))给出,且与时间和样本无关。数据集分为训练、验证和测试集,分别为19640、120和240条轨迹。

该数据集基于不可压缩的Navier-Stokes方程,包含了从分段恒定涡度初始条件开始的轨迹。数据集中的NetCDF文件包含一个名为*solution*的变量,其维度为20000(轨迹数量)、21(时间步长)、2(水平速度和垂直速度)、128(x维度)和128(y维度)。数据在单位正方形上模拟到T=1,并在空间和时间上均匀保存。强迫场由0.1sin(2pi(x+y))给出,且与时间和样本无关。数据集分为训练、验证和测试集,分别为19640、120和240条轨迹。

提供机构:
camlab-ethz
原始信息汇总

数据集概述

简短描述

基于不可压缩Navier-Stokes方程,该数据集包含从具有分段常数涡度的初始条件开始的轨迹,详见arXiv论文。

维度

数据集的NetCDF文件包含一个名为solution的变量,其维度如下:

  • 20000(轨迹数量)
  • 21(时间步长)
  • 2(水平速度,垂直速度)
  • 128(x维度)
  • 128(y维度)

该数据集在单位正方形上模拟至T=1,并以均匀的空间和时间间隔保存。强迫场为0.1sin(2π(x+y)),时间和样本独立。

训练/验证/测试分割

数据集分为:

  • 19640个训练轨迹
  • 120个验证轨迹
  • 240个测试轨迹

下载与组装

数据集可通过huggingface-cli download下载。下载后,使用提供的assemble_data.py脚本将分块数据组装成单个NetCDF文件,命令如下: bash python assemble_data.py --input_dir . --output_file FNS-KF.nc

搜集汇总
数据集介绍
camlab-ethz/FNS-KF 数据集图片
构建方式
该数据集基于强迫不可压缩纳维-斯托克斯方程构建,模拟了单位正方形区域内的流体动力学过程,时间跨度至T=1。初始条件采用分段恒定涡量场,通过数值积分生成20000条轨迹,每条轨迹包含21个均匀时间步长,空间分辨率为128×128网格点。数据变量包括水平与垂直速度分量,并施加了与时间和样本无关的强迫场,其形式为0.1sin(2π(x+y))。数据集以NetCDF格式存储,可通过HuggingFace CLI工具下载,并利用提供的assemble_data.py脚本将分块数据合并为单一文件。
使用方法
用户可通过HuggingFace CLI命令`huggingface-cli download`下载数据集分块文件,随后运行`assemble_data.py`脚本,指定输入目录与输出文件名(如`python assemble_data.py --input_dir . --output_file FNS-KF.nc`)即可合并为单一NetCDF文件。该文件包含维度为(20000, 21, 2, 128, 128)的solution变量,可直接用于流体动力学模拟、物理信息神经网络训练或时空序列预测任务。建议根据研究需求提取特定轨迹或时间片,并利用NetCDF库进行数据读取与预处理。
背景与挑战
背景概述
在计算流体力学与科学机器学习的交叉领域,基于偏微分方程的高保真数值模拟数据集已成为推动物理信息驱动模型发展的关键基石。camlab-ethz/FNS-KF数据集由瑞士苏黎世联邦理工学院(ETH Zurich)的计算与机器学习实验室(CAMLab)于2024年创建,其核心研究问题聚焦于利用强迫不可压缩Navier-Stokes方程生成高分辨率湍流轨迹数据。该数据集包含20,000条从分段常值涡度初始条件演化而来的轨迹,每条轨迹涵盖21个时间步长、两个速度分量以及128×128的空间网格,共计超过6.8亿个数据点。通过引入与时间和样本无关的强迫场(0.1sin(2π(x+y))),该数据集为研究湍流动力学、时空混沌系统以及算子学习等前沿课题提供了标准化基准,其开源发布显著推动了物理约束神经网络与神经算子等方法的验证与对比。
当前挑战
该数据集所解决的领域问题主要体现为高维非线性偏微分方程数值解的精确预测与泛化挑战,特别是传统数值方法在长期演化中面临的累积误差与计算成本瓶颈。构建过程中遭遇的核心挑战包括:首先,确保20,000条轨迹在单位正方形域内从分段常值涡度初始条件出发的物理一致性,需严格满足不可压缩约束并避免数值不稳定性;其次,在时间离散化(T=1内21个均匀步长)与空间分辨率(128×128)的平衡中,需保证频谱截断误差可控且不引入过度耗散;此外,大规模数据生成需协调计算资源分配与存储优化,例如通过分块存储与NetCDF格式的组装脚本实现高效I/O,同时维持19640/120/240的合理训练-验证-测试分割,以支持可复现的基准评估。
常用场景
经典使用场景
在计算流体力学与机器学习交叉研究领域,camlab-ethz/FNS-KF数据集为基于数据驱动的湍流模拟与偏微分方程求解提供了宝贵的基准资源。该数据集源自不可压缩Navier-Stokes方程受迫流动的数值模拟,包含了20,000条从分段常值涡度初始条件演化的轨迹,每条轨迹涵盖21个时间步长,空间分辨率为128×128网格点。研究者常将其用于训练物理信息神经网络、神经算子或卷积神经网络,以学习流体速度场的时空演化规律,进而实现高保真度的流场预测与重建。
解决学术问题
该数据集有效解决了传统数值模拟中计算成本高昂与实验数据难以获取的困境,为验证和比较不同数据驱动模型在求解偏微分方程上的泛化能力与精度提供了标准化的测试平台。学术研究中,它常被用于探讨如何从有限时空样本中学习Navier-Stokes方程的内在动力学特征,例如涡旋结构的演化与能量级联过程。通过该数据集,研究者能够量化模型在长期预测、湍流统计特性保持以及边界条件适应性等方面的表现,从而推动物理约束机器学习方法的发展。
实际应用
在实际工程应用中,FNS-KF数据集所驱动的模型可服务于气候模拟、海洋环流预测、航空器气动设计以及工业管道流动控制等领域。例如,基于该数据集训练的神经算子能够快速预测不同初始条件下的流场演化,大幅降低计算流体力学仿真中反复求解大规模线性系统的时间成本。此外,该数据集还可用于开发实时流场诊断与预警系统,辅助工程师在风能利用、污染物扩散分析等场景中做出更高效的决策。
数据集最近研究
最新研究方向
该数据集基于强迫不可压缩Navier-Stokes方程构建,聚焦于分段恒定涡量初始条件下的湍流演化模拟,为计算流体力学领域提供了高保真度的基准数据。前沿研究利用其20,000条轨迹、128×128空间分辨率及21个时间步的精细结构,深入探索数据驱动湍流建模、物理信息神经网络(PINNs)的泛化能力以及涡旋动力学特征的机器学习预测。该数据集与近期人工智能驱动的流体仿真热潮紧密相关,特别是其在训练神经算子(如FNO、DeepONet)以加速偏微分方程求解方面的潜力,显著推动了从传统数值模拟向混合物理-数据范式的转变。其公开可用性为验证新一代湍流模型和评估模型外推性能提供了标准平台,对航空航天、气候预测等领域的数字孪生技术发展具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务