遇见数据集

ear-eeg-fm-benchmark-data

收藏
Hugging Face2026-06-04 更新2026-06-05 收录
官方服务:

资源简介:

该数据集是“Ear-EEG FM Benchmark”的预处理版本,以HDF5格式提供,旨在支持耳-EEG(耳周脑电图)与头皮EEG(脑电图)的基准测试和比较研究。数据集包含两个主要任务:听觉注意检测(AAD)和睡眠阶段分类。对于AAD任务,提供二元分类(左 vs 右)数据,包括头皮EEG变体(saad-eeg.h5)和耳-EEG变体(saad-ear-eeg.h5),分别包含27个和14个通道,采样频率为1000 Hz,试验次数分别为13,500次(头皮)和未明确次数(耳,但形状一致)。对于睡眠分类任务,提供5类睡眠阶段数据,包括头皮PSG变体(eesm23-eeg.h5)和耳-EEG变体(eesm23-ear-eeg.h5),分别包含8个和4个通道,采样频率为250 Hz,试验次数分别为未明确次数(头皮)和56,967次(耳)。每个HDF5文件遵循统一架构:data字段为形状(N, C, T)的float32数组,表示以微伏(µV)为单位的EEG信号;labels字段为int64类别标签;subject和session字段标识受试者和会话;trial_id字段为试验标识符;ch_names字段列出标准10-20系统的通道名称;attrs字段包含元数据如采样频率、类别数、类别名称、单位和预处理配置。数据集适用于脑机接口、听觉神经科学、睡眠研究和机器学习模型开发,特别侧重于耳-EEG的便携式应用与传统头皮EEG的性能对比。

This dataset is a preprocessed version of the Ear-EEG FM Benchmark provided in HDF5 format, designed to support benchmarking and comparative studies between ear-EEG (ear-electroencephalography) and scalp EEG (electroencephalography). It includes two main tasks: auditory attention detection (AAD) and sleep stage classification. For the AAD task, binary classification (left vs. right) data is provided, including scalp EEG variants (saad-eeg.h5) and ear-EEG variants (saad-ear-eeg.h5), with 27 and 14 channels respectively, a sampling frequency of 1000 Hz, and trial counts of 13,500 (scalp) and an unspecified number (ear, but consistent in shape). For the sleep classification task, 5-class sleep stage data is provided, including scalp PSG variants (eesm23-eeg.h5) and ear-EEG variants (eesm23-ear-eeg.h5), with 8 and 4 channels respectively, a sampling frequency of 250 Hz, and trial counts of an unspecified number (scalp) and 56,967 (ear). Each HDF5 file follows a unified structure: the data field is a float32 array of shape (N, C, T) representing EEG signals in microvolts (µV); the labels field contains int64 category labels; subject and session fields identify the subject and session; trial_id field serves as a trial identifier; ch_names field lists channel names from the standard 10-20 system; and attrs field includes metadata such as sampling frequency, number of classes, class names, units, and preprocessing configurations. The dataset is suitable for brain-computer interfaces, auditory neuroscience, sleep research, and machine learning model development, with a particular focus on comparing the performance of portable ear-EEG applications with traditional scalp EEG.

创建时间:
2026-06-03
原始信息汇总

数据集概述

该数据集为 Ear-EEG FM Benchmark 预处理后的 HDF5 文件,源自 Ear-EEG-FM-Benchmark 项目。所有 .h5 文件遵循统一数据模式,包含 EEG 数据、标签、受试者信息、会话信息、试验 ID、通道名称及采样率等属性。

数据模式

每个 .h5 文件包含以下字段:

  • data:形状为 (N, C, T),数据类型 float32,单位 µV
  • labels:形状为 (N,),数据类型 int64,取值范围 0 到 n_class-1
  • subject:形状为 (N,),数据类型 object,格式 sub-NN
  • session:形状为 (N,),数据类型 object,格式 ses-NN
  • trial_id:形状为 (N,),数据类型 int64
  • ch_names:形状为 (C,),数据类型 object,为标准 10-20 电极名称
  • attrs:包含 sfreqn_classclass_namesunitpreprocess_config_json 等属性

文件命名规则

  • 文件名含 -eeg.h5:头皮 EEG 变体
  • 文件名含 -ear-eeg.h5:耳部 EEG 变体

数据集文件详情

文件 任务 试验数 数据形状 采样率 来源
saad-eeg.h5 二元 AAD(左 vs 右) 13,500 (N, 27, 4000) 1000 Hz https://zenodo.org/records/16536441
saad-ear-eeg.h5 二元 AAD(cEEGrid 耳周) - (N, 14, 4000) 1000 Hz https://zenodo.org/records/16536441
eesm23-eeg.h5 5 类睡眠(头皮 PSG) - (N, 8, 1000) 250 Hz https://openneuro.org/datasets/ds005178
eesm23-ear-eeg.h5 5 类睡眠(cEEGrid 耳部 EEG) 56,967 (N, 4, 1000) 250 Hz https://openneuro.org/datasets/ds005178

使用方式

该数据集配合基准测试流程使用,具体命令为:

bash git clone git@github.com:zhikaili1150/Ear-EEG-FM-Benchmark.git cd Ear-EEG-FM-Benchmark mkdir -p data huggingface-cli download <this repo> --repo-type dataset --local-dir data DATASET=saad-eeg bash scripts/run_benchmark.sh

搜集汇总
数据集介绍
ear-eeg-fm-benchmark-data 数据集图片
构建方式
Ear-EEG FM Benchmark数据集经过精心预处理,以HDF5格式存储脑电信号。每个文件遵循统一的结构,包含三个维度(样本数、通道数、时间点数)的原始信号数据,以及对应的标签、受试者标识、会话编号和实验试次编号。通道名称采用标准10-20系统命名,便于与头皮脑电数据对比。数据集包含两种变体:标准头皮脑电版本和耳部脑电版本,后者采用cEEGrid电极布局,适应佩戴式耳部采集场景。数据源自公开可获取的权威脑电数据库,经过严格预处理流程,保证信号质量与一致性。
特点
该数据集的核心特点在于提供多任务、多模态的脑电基准测试资源。涵盖听觉注意力定向(二分类)与睡眠阶段分类(五分类)两大经典范式,分别记录头皮和耳部脑电信号。时间维度长度统一(4000及1000采样点),采样率分别为1000 Hz和250 Hz,确保不同任务间可比性。每个样本附带详细元信息(受试者、会话、试次),便于进行跨受试者或跨会话分析。数据集规模较大,总计超过七万条样本,为深度学习模型训练提供充足数据支撑。
使用方法
使用者首先需克隆配套的基准测试代码仓库,并在本地创建数据目录。随后通过HuggingFace命令行工具下载本数据集至指定文件夹。数据加载时,可利用HDF5文件的层级结构直接读取数组,获取信号、标签及元数据。推荐结合基准测试管道运行,通过设置环境变量指定任务和数据集变体,一键执行模型训练与评估。也支持自行编写Python脚本,利用h5py库灵活访问任意试次的脑电片段,进行特征提取或迁移学习实验。
背景与挑战
背景概述
Ear-EEG FM Benchmark数据集诞生于脑机接口与可穿戴神经技术快速发展的时代背景下,由研究团队于近期构建并发布,旨在系统评估耳周脑电(ear-EEG)信号在听觉注意力解码与睡眠分期等任务中的性能。该数据集源自两项高质量公开研究:Saad等人提供的听觉注意检测(AAD)实验数据,涵盖传统头皮脑电与cEEGrid耳周脑电两种采集模式;以及EESM23睡眠分期数据集,包含多导睡眠图与耳周脑电记录。通过统一的数据预处理范式,该基准将原始数据转化为标准化HDF5格式,为可穿戴脑电技术的跨场景验证提供了关键资源,推动了耳周脑电从实验室走向实际应用的研究进程。
当前挑战
该数据集核心挑战在于解决可穿戴脑电系统面临的领域难题:耳周脑电信号信噪比极低,且电极通道数少(仅4-14通道),相比传统头皮脑电(27-8通道)在空间分辨率和信号质量上存在显著劣势。构建过程中面临数据异构性挑战,需将不同采样率(1000 Hz vs 250 Hz)、不同任务范式(AAD与睡眠分期)及不同电极配置(头皮与耳周)的数据统一为兼容格式;同时,需确保对大规模临床试验数据(如55967个睡眠试次)进行高效预处理和存储,维持时间序列信号的物理意义(以微伏为单位),并建立与基准管线无缝对接的标准化接口。
常用场景
经典使用场景
Ear-EEG FM Benchmark数据集专为耳戴式脑电图(ear-EEG)与常规头皮脑电图(scalp EEG)的对比研究而设计,其经典用途在于评估和验证从耳周电极采集的神经信号是否足以完成与传统多导联头皮脑电相似的任务。该数据集涵盖听觉注意检测(AAD)和睡眠分期两大典型范式,通过提供配对的双模态数据(如saad-ear-eeg.h5与saad-eeg.h5),研究者可直接比较耳戴式与头皮式脑电在同一受试者同一任务下的性能差异,从而论证耳戴式脑电在非侵入式、用户友好的脑机接口中的可行性。
实际应用
在实际应用层面,Ear-EEG FM Benchmark直接服务于可穿戴脑电设备的开发与部署。借助该数据集,工程师和临床研究者可训练出仅依赖耳周电极输入的轻量级模型,用于构建日常场景下的注意力状态监测系统(如虚拟会议中实时检测用户是否专注)或家用睡眠质量评估设备(如无需含多导睡眠图PSG的舒适化睡眠分期)。由于耳戴式传感器可集成于耳机、助听器或耳塞中,该数据集为消费电子产品融入神经生理感知功能提供了核心数据支撑,有望推动脑电技术从实验室迈向无感化、全天候的健康监护应用。
衍生相关工作
该数据集衍生了一系列关于耳戴式脑电信号处理和模型适配的经典工作,例如基于跨模态知识蒸馏的方法,利用高精度头皮脑电模型指导耳戴式模型的训练,显著提升了耳周信号在睡眠分期任务中的分类准确率。此外,研究者围绕该基准开发了专用的对比学习框架,在AAD任务上通过时序对齐策略解耦注视无关的神经表征,验证了耳戴式脑电在听觉注意力追踪中的潜力。这些后续工作在数据处理管线、特征工程及轻量化网络结构上进行了深入探索,共同将Ear-EEG FM Benchmark塑造为评估耳周脑电任务适应性的标准参考平台。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务