遇见数据集

Natasha222340/AAC_dataset_for_PREASM

收藏
Hugging Face2023-08-12 更新2024-03-04 收录
官方服务:

资源简介:

--- task_categories: - text-generation language: - en tags: - medical - code pretty_name: AutiVoice size_categories: - 100K<n<1M --- # Dataset Card for Dataset Name ## Dataset Description - **Homepage:** - **Repository:** - **Paper:** - **Leaderboard:** - **Point of Contact:** ### Dataset Summary This dataset card aims to be a base template for new datasets. It has been generated using [this raw template](https://github.com/huggingface/huggingface_hub/blob/main/src/huggingface_hub/templates/datasetcard_template.md?plain=1). ### Supported Tasks and Leaderboards [More Information Needed] ### Languages [More Information Needed] ## Dataset Structure ### Data Instances [More Information Needed] ### Data Fields [More Information Needed] ### Data Splits [More Information Needed] ## Dataset Creation ### Curation Rationale [More Information Needed] ### Source Data #### Initial Data Collection and Normalization [More Information Needed] #### Who are the source language producers? [More Information Needed] ### Annotations #### Annotation process [More Information Needed] #### Who are the annotators? [More Information Needed] ### Personal and Sensitive Information [More Information Needed] ## Considerations for Using the Data ### Social Impact of Dataset [More Information Needed] ### Discussion of Biases [More Information Needed] ### Other Known Limitations [More Information Needed] ## Additional Information ### Dataset Curators [More Information Needed] ### Licensing Information [More Information Needed] ### Citation Information [More Information Needed] ### Contributions [More Information Needed]

任务类别: - 文本生成 语言: - 英语 标签: - 医疗 - 代码 展示名称:AutiVoice 样本量范围: - 100K < n < 1M # 数据集卡片 ## 数据集说明 - **主页:** - **代码仓库:** - **相关论文:** - **排行榜:** - **联系方式:** ### 数据集概述 本数据集卡片旨在作为新建数据集的基础模板。其基于[此原始模板](https://github.com/huggingface/huggingface_hub/blob/main/src/huggingface_hub/templates/datasetcard_template.md?plain=1)生成。 ### 支持任务与排行榜 [需补充更多信息] ### 语言覆盖 [需补充更多信息] ## 数据集结构 ### 数据实例 [需补充更多信息] ### 数据字段 [需补充更多信息] ### 数据集划分 [需补充更多信息] ## 数据集构建 ### 构建依据 [需补充更多信息] #### 初始数据收集与归一化 [需补充更多信息] #### 源语言生成者是谁? [需补充更多信息] ### 标注信息 #### 标注流程 [需补充更多信息] #### 标注人员是谁? [需补充更多信息] ### 个人与敏感信息 [需补充更多信息] ## 数据使用注意事项 ### 数据集的社会影响 [需补充更多信息] ### 偏差问题讨论 [需补充更多信息] ### 其他已知局限性 [需补充更多信息] ## 补充信息 ### 数据集维护者 [需补充更多信息] ### 授权信息 [需补充更多信息] ### 引用信息 [需补充更多信息] ### 贡献说明 [需补充更多信息]

提供机构:
Natasha222340
原始信息汇总

数据集概述

基本信息

  • 名称: AutiVoice
  • 任务类别: 文本生成
  • 语言: 英语
  • 标签: 医疗, 代码
  • 大小: 10万至100万条记录

数据集详情

  • 描述: 该数据集卡片旨在作为新数据集的基础模板,使用此原始模板生成。

数据集结构

  • 数据实例: 信息待补充
  • 数据字段: 信息待补充
  • 数据分割: 信息待补充

数据集创建

  • 筛选理由: 信息待补充
  • 源数据:
    • 初始数据收集与标准化: 信息待补充
    • 源语言生产者: 信息待补充
  • 注释:
    • 注释过程: 信息待补充
    • 注释者: 信息待补充
  • 个人和敏感信息: 信息待补充

使用数据注意事项

  • 数据集的社会影响: 信息待补充
  • 讨论偏见: 信息待补充
  • 其他已知限制: 信息待补充

附加信息

  • 数据集管理者: 信息待补充
  • 许可信息: 信息待补充
  • 引用信息: 信息待补充
  • 贡献: 信息待补充
搜集汇总
数据集介绍
Natasha222340/AAC_dataset_for_PREASM 数据集图片
构建方式
在医疗与代码文本生成的交叉领域中,Natasha222340/AAC_dataset_for_PREASM 数据集应运而生。该数据集的构建源于对辅助沟通系统(AAC)与预训练语言模型结合的探索需求,通过收集来自医学文献、临床记录及编程相关文本的多源语料,经过清洗、标准化与标注流程,形成规模介于10万至100万条之间的英文文本生成数据集。其构建过程注重保留医学专业术语与代码逻辑结构的完整性,确保数据在跨模态任务中的适用性。
特点
数据集的核心特点在于其双重领域属性:一方面涵盖丰富的医学语言表达,包括诊断描述、治疗流程与患者沟通记录;另一方面融合了代码生成所需的语法结构与逻辑模式,为文本生成任务提供跨学科的训练素材。此外,数据集的规模适中,兼顾了模型训练的充分性与计算资源的效率,且标注信息简洁,便于下游任务适配。
使用方法
该数据集适用于文本生成任务的微调与评估,尤其在医学对话系统、辅助沟通工具及医疗代码自动补全等场景中具有应用潜力。使用时,可直接加载为HuggingFace Datasets格式,通过设置文本生成任务(text-generation)进行模型训练。建议结合预训练语言模型(如GPT、T5系列)进行领域适应,并根据具体需求划分训练集、验证集与测试集以优化性能。
背景与挑战
背景概述
自闭症谱系障碍(ASD)是一种复杂的神经发育疾病,其核心特征包括社交沟通障碍和重复刻板行为。近年来,基于人工智能的辅助沟通系统(AAC)成为改善自闭症患者生活质量的重要工具。Natasha222340/AAC_dataset_for_PREASM数据集由研究团队于2023年创建,专注于开发面向自闭症患者的预测性增强型辅助沟通模型(PREASM)。该数据集包含超过10万条英文文本生成样本,涵盖医疗和代码领域,旨在解决自闭症患者在日常沟通中面临的语言生成效率低下问题。通过提供大规模、多样化的训练数据,该数据集为构建个性化、智能化的AAC系统奠定了坚实基础,对推动人机交互在特殊教育领域的应用具有重要影响力。
当前挑战
该数据集面临的核心挑战包括领域问题的复杂性与构建过程的困难性。在领域问题层面,自闭症患者的语言模式高度异质,现有通用文本生成模型难以准确捕捉个体化的沟通意图和语境需求,导致预测结果缺乏针对性。此外,医疗领域对数据的隐私和伦理要求极为严格,限制了数据来源的多样性和规模。在构建过程中,数据采集面临标注一致性难题——不同标注者对自闭症患者的非典型语言表达(如重复短语、隐喻性用法)的解读存在显著差异。同时,数据清洗需谨慎处理敏感信息(如患者身份识别),确保符合医疗数据合规标准,这进一步增加了预处理流程的技术门槛。
常用场景
经典使用场景
该数据集名为Natasha222340/AAC_dataset_for_PREASM,定位于文本生成任务,涵盖英文医学与代码领域。其经典使用场景在于为增强型辅助与替代沟通(AAC)系统提供训练数据,尤其针对自闭症谱系障碍(ASD)患者的个性化语言生成模型。通过整合医学专业术语与代码化表达,该数据集支持从有限输入生成连贯、上下文相关的辅助语句,从而提升非言语个体的沟通效率。
实际应用
实际应用中,该数据集可部署于临床辅助沟通设备与移动健康应用,例如生成实时对话建议或社交故事。它支持医疗专业人士为患者定制化输出,减少沟通延迟。在远程医疗场景下,数据集驱动的模型能根据患者输入代码或关键词,自动生成医患互动中的标准询问或安慰语句,从而提升护理质量与患者自主性。
衍生相关工作
该数据集衍生了若干经典工作,包括基于Transformer的AAC语言模型预训练范式、以及将代码生成技术迁移至医疗对话系统的研究。后续工作探索了元学习与少样本策略,以适配个体用户习惯。此外,它催生了医学代码与自然语言对齐的基准测试,为跨模态AAC系统评估提供了标准化框架,并激励了隐私保护下的联邦学习在辅助沟通中的创新应用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务