遇见数据集

ViMQ

收藏
arXiv2023-04-28 更新2024-06-21 收录
数据链接:
官方服务:

资源简介:

ViMQ是一个专为越南医疗问答系统设计的医疗问题数据集,由VinBrain创建。该数据集包含从越南综合医院网站www.vinmec.com的咨询部分爬取的9000个医疗问题,涵盖了从常见疾病到专业领域的广泛健康问题。数据集通过句子级和实体级标注,支持意图分类和命名实体识别任务,旨在提高医疗对话系统对患者查询的理解能力。创建过程中采用了层次监督种子方法进行标注,确保标注质量。ViMQ数据集的应用领域主要集中在开发医疗对话系统,特别是自然语言理解模块,以减轻远程医疗医生的工作负担。

ViMQ is a medical question dataset specifically tailored for Vietnamese medical question answering systems, created by VinBrain. This dataset comprises 9,000 medical questions crawled from the consultation section of the Vietnamese general hospital website www.vinmec.com, covering a broad spectrum of health-related issues ranging from common diseases to specialized medical fields. Annotated at both sentence-level and entity-level, the dataset supports intent classification and named entity recognition tasks, with the goal of enhancing the comprehension capabilities of medical dialogue systems for patient queries. A hierarchical supervised seed annotation method was employed during the dataset construction to guarantee the quality of annotations. The primary application scope of the ViMQ dataset lies in developing medical dialogue systems, particularly their natural language understanding modules, to reduce the workload of physicians in telemedicine settings.

提供机构:
VinBrain
创建时间:
2023-04-28
搜集汇总
数据集介绍
ViMQ 数据集图片
构建方式
在医疗对话系统的自然语言理解研究中,高质量标注数据集的匮乏始终是制约模型性能的关键瓶颈,尤其对于越南语这一低资源语言而言。ViMQ数据集正是为了填补这一空白而构建,其语料源自越南Vinmec综合医院在线问诊平台,从医患咨询记录中筛选出9,000条关于常见疾病、心脏病学、肿瘤学等广泛健康议题的患者提问。每条问题均被同时标注用于意图分类和命名实体识别任务,其中实体标签涵盖症状与疾病、医疗程序及药物三类,意图标签则包括诊断、严重程度、治疗与病因四类。为了保障标注质量,研究团队创新性地提出了分层监督种子法:首先由标注指南作者作为初始监督者,指导两名标注员完成1000条样本的试点标注,通过重叠集F1评分确保一致性;随后将合格标注员晋升为下一阶段监督者,以层级扩展方式逐步完成全部数据的标注,有效降低了标注者主观差异带来的噪声。
特点
ViMQ数据集的核心特色在于其兼具句子级与实体级复合标注,能够同时支持意图分类与命名实体识别两大任务,这在现有越南语医疗数据集中尚属首创。其标签体系紧密围绕医疗问诊场景设计,实体标签中的症状与疾病、医疗程序、药物三类覆盖了患者提问的核心信息单元,而意图标签则精准对应诊断、严重程度、治疗与病因四种典型咨询目的。数据集的另一显著优势在于其构建过程中采用的分层监督种子法,通过监督者的层级迭代与共识讨论,系统性减少了标注噪声,尤其针对罕见疾病等困难样本的标注一致性进行了强化。此外,数据集还提供了明确的训练、验证与测试集划分,实体标注中症状与疾病类达13,253个,为模型训练提供了充足的数据基础。
使用方法
ViMQ数据集可直接用于开发医疗对话系统的自然语言理解模块。具体而言,研究者可基于PhoBERT等预训练语言模型,在意图分类任务中提取句子级特征,利用特殊标记[CLS]的隐层状态通过softmax分类器进行四类意图判别;在命名实体识别任务中,则采用BIO标注方案结合条件随机场层进行序列标注。针对标注过程中可能存在的边界噪声,论文提出了一种在线自监督训练策略,通过注入跨度噪声和伪标签迭代修正,显著提升了实体识别的F1分数。模型训练完成后,系统可将用户提问分解为意图与实体组件,从预装数据库中检索对应医疗答案,若无法匹配则转接至在线医生,从而实现高效的医疗咨询辅助功能。
背景与挑战
背景概述
在自然语言处理领域,面向医疗场景的对话系统研究日益受到关注,其中意图分类与命名实体识别作为核心模块,对理解患者查询意图及提取关键医学信息至关重要。然而,现有医疗对话数据集多集中于英语、德语及中文,越南语资源极为匮乏。为此,VinBrain研究团队于2023年发布了ViMQ数据集,由Ta Duc Huy等人构建,旨在填补越南语医疗问答数据的空白。该数据集从越南综合医院在线咨询平台采集了9,000条患者问题,涵盖常见疾病、心脏病学、肿瘤学等多类健康议题,并首次为越南语医疗问题提供了包含症状与疾病、医疗程序、药物三类实体标签及诊断、严重程度、治疗、原因四类意图标签的细粒度标注。ViMQ数据集的问世,为开发面向越南语医疗场景的任务导向型聊天机器人奠定了重要基础,推动了低资源语言在医疗自然语言理解领域的研究进展。
当前挑战
ViMQ数据集所面临的挑战体现在多个层面。首先,在领域问题层面,医疗对话系统需精准识别患者问题中的症状、疾病等实体及深层意图,但医学表述的多样性与歧义性使得模型在区分诊断与治疗等相似意图时易产生混淆,同时实体边界识别(如症状描述是否包含身体部位)成为性能瓶颈。其次,在数据集构建过程中,命名实体标注的主观性导致标注者间一致性难以保证,尤其是实体跨度界定易引发争议;此外,标注工具的人机工学缺陷可能引入跨度噪声,即实体起止索引偏离真实标注。为缓解这些问题,研究团队设计了分层监督播种法以提升标注质量,并提出了结合跨度噪声建模与在线自监督训练的策略,通过伪标签迭代优化模型对噪声标签的鲁棒性,最终在越南语COVID-19 NER数据集上也验证了方法的有效性。
常用场景
经典使用场景
在自然语言处理与医疗信息学交叉领域,ViMQ数据集被广泛用于构建面向医疗对话系统的自然语言理解模块。该数据集收录了源自越南综合医院在线咨询板块的九千条患者提问,每条语句均标注了意图类别(诊断、严重程度、治疗、病因)与命名实体(症状与疾病、医疗程序、药物),从而支持意图识别与命名实体识别两大经典任务的联合训练。研究者通常采用PhoBERT等预训练语言模型作为基础编码器,结合条件随机场层进行序列标注,以解析患者查询中的语义成分与关键医学概念。
实际应用
在实际应用中,ViMQ数据集驱动的模型可嵌入智能医疗聊天机器人,用于自动解析患者主诉中的核心医学实体与咨询意图,进而从预置知识库中检索针对性诊疗建议。当系统无法匹配合适答案时,查询可被路由至在线医生,从而减轻远程医疗平台的人力负担。该数据集支持构建的NLU模块能精准识别症状、药物及医疗程序等关键信息,并区分诊断、严重性评估等不同意图,显著提升了越南语医疗对话系统的响应效率与准确性,在资源有限的基层医疗场景中具有重要部署价值。
衍生相关工作
ViMQ数据集的发布催生了一系列衍生工作,包括基于该数据集训练的基线模型成为越南语医疗NER与IC任务的标杆。研究者在此基础上探索了跨度噪声建模与在线自监督训练策略,通过向实体边界注入随机偏移并聚合多轮预测伪标签,显著提升了模型对标注噪声的容忍度。该策略不仅在ViMQ上取得3%的F1增益,还被成功迁移至COVID-19越南语NER数据集,验证了其泛化能力。此外,数据集的注释框架与分层监督方法为后续越南语医疗对话系统的NLU组件设计提供了可复用的范式,推动了低资源语言医疗NLP领域的发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务