遇见数据集

emi429/human-sleep-rr-small-wake-n1

收藏
Hugging Face2023-10-17 更新2024-03-04 收录
官方服务:

资源简介:

--- dataset_info: features: - name: rr_intervals sequence: float64 - name: sleep_stage dtype: string - name: __index_level_0__ dtype: int64 splits: - name: train num_bytes: 37733508 num_examples: 28921 download_size: 6512955 dataset_size: 37733508 --- # Dataset Card for "human-sleep-rr-small-wake-n1" [More Information needed](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

--- 数据集信息: 特征字段: - 字段名:RR间期(rr_intervals) 序列类型:float64浮点数 - 字段名:睡眠阶段(sleep_stage) 数据类型:字符串 - 字段名:__index_level_0__ 数据类型:int64整数 数据集划分: - 划分名称:训练集(train) 字节大小:37733508 样本数量:28921 下载大小:6512955 数据集总大小:37733508 --- # 「human-sleep-rr-small-wake-n1」数据集卡片 [需补充更多信息](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

提供机构:
emi429
原始信息汇总

数据集概述

数据特征

  • rr_intervals: 序列类型,数据类型为float64。
  • sleep_stage: 字符串类型。
  • index_level_0: 整数类型,数据类型为int64。

数据分割

  • train:
    • 字节数: 37733508
    • 样本数: 28921

数据大小

  • 下载大小: 6512955
  • 数据集大小: 37733508
搜集汇总
数据集介绍
emi429/human-sleep-rr-small-wake-n1 数据集图片
构建方式
该数据集聚焦于人类睡眠阶段的生理信号分析,基于心电信号提取的RR间期序列构建而成。数据来源于多导睡眠监测记录,通过专业算法从原始心电数据中精确提取连续的RR间期,并同步标注对应的睡眠分期标签。构建过程中,特别筛选了清醒期(Wake)与非快速眼动睡眠一期(N1)的片段,形成小规模但高度专精的数据集。最终以结构化格式存储,包含RR间期序列、睡眠分期字符串及索引字段,共包含28,921个训练样本。
特点
该数据集的核心特点在于其针对睡眠分期中Wake与N1阶段的精细化设计。RR间期作为心率变异性的基础参数,能够有效反映自主神经系统在睡眠转换期的动态变化。数据集通过序列化的浮点数格式保存RR间期,保留了完整的时间序列特性,便于进行时域或频域分析。睡眠分期标签采用字符串格式,确保分类任务的直观性。小规模样本量虽限制了泛化能力,但降低了计算资源需求,特别适合用于睡眠分期算法的快速原型验证或迁移学习中的预训练阶段。
使用方法
使用该数据集时,可通过HuggingFace的datasets库直接加载,调用load_dataset('emi429/human-sleep-rr-small-wake-n1')即可获取训练集。每个样本包含rr_intervals字段(浮点数序列)和sleep_stage字段(字符串标签),适用于构建二分类模型以区分Wake与N1状态。建议将RR间期序列进行标准化或重采样后输入循环神经网络(如LSTM)或Transformer架构,利用其序列建模能力捕捉心率变异性的时间依赖模式。训练时可采用交叉熵损失函数,并监控准确率与F1分数以评估分类性能。
背景与挑战
背景概述
睡眠分期是睡眠医学研究中的核心问题,其准确性直接影响睡眠障碍诊断与治疗方案的制定。传统上,睡眠分期依赖于多导睡眠图(PSG)的人工判读,但该方法耗时耗力且主观性强。近年来,基于心率变异性(HRV)的自动睡眠分期方法因其非侵入性和便捷性而受到广泛关注。数据集“human-sleep-rr-small-wake-n1”由emi429团队创建,专注于从RR间期序列中区分清醒期(Wake)与N1期睡眠,旨在解决这两个易混淆阶段的自动识别难题。该数据集包含28921个训练样本,每个样本由RR间期序列和对应的睡眠阶段标签组成,为开发轻量级、高精度的睡眠分期模型提供了宝贵的资源。其发布推动了可穿戴设备在睡眠监测领域的应用,对睡眠健康管理具有重要价值。
当前挑战
该数据集面临的核心挑战在于N1期睡眠与清醒期在生理特征上的高度相似性。N1期作为浅睡眠的起始阶段,其心率变异性模式与清醒状态仅有细微差异,传统分类模型常难以准确区分,导致分期错误率居高不下。此外,数据集构建过程中也面临诸多困难:RR间期序列的采集易受运动伪迹、呼吸异常等因素干扰,数据清洗与质量控制的标准化流程尚不完善;样本量虽达28921例,但Wake与N1类别的分布可能不均衡,影响模型泛化能力。同时,个体间心率变异性差异显著,如何消除生理差异对分期结果的影响,仍是提升模型鲁棒性的关键瓶颈。
常用场景
经典使用场景
在睡眠医学与生理信号分析领域,该数据集以心电信号衍生出的RR间期序列为核心,专注于区分清醒期与N1期睡眠状态。研究者常将其作为二分类任务基准,通过提取时域、频域及非线性特征,构建机器学习或深度学习模型,探索自主神经系统在睡眠微结构中的动态变化规律。
解决学术问题
该数据集有效解决了N1期睡眠因持续时间短、特征模糊而难以与清醒状态区分的学术难题。它为开发高精度睡眠分期算法提供了标准化训练样本,推动了睡眠结构自动分析技术的发展,并助力揭示交感与副交感神经在睡眠起始阶段的调控机制,对理解失眠、睡眠障碍的病理生理学具有重要意义。
衍生相关工作
该数据集衍生出一系列经典工作,包括基于注意力机制的Transformer模型用于睡眠阶段分类、结合小波变换与卷积神经网络的RR间期特征提取方法,以及针对不平衡分类的代价敏感学习策略。这些研究不仅提升了N1期识别的灵敏度,还推动了跨数据集泛化性能的评估框架建立。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务