遇见数据集

Remex23/counselchat-llama2

收藏
Hugging Face2024-05-17 更新2024-06-12 收录
官方服务:

资源简介:

--- dataset_info: features: - name: questionID dtype: string - name: questionTitle dtype: string - name: questionText dtype: string - name: questionUrl dtype: string - name: topics dtype: string - name: therapistName dtype: string - name: therapistUrl dtype: string - name: answerText dtype: string - name: upvotes dtype: int64 - name: text dtype: string splits: - name: train num_bytes: 5791592 num_examples: 1482 download_size: 3346530 dataset_size: 5791592 configs: - config_name: default data_files: - split: train path: data/train-* ---

This dataset is primarily used for question and answer analysis in the field of mental health, containing detailed information about questions and answers, such as question ID, title, text, link, as well as the therapists name and link. Additionally, it includes the number of upvotes and text content for the answers. The dataset is divided into a training set with 1482 samples, totaling 5791592 bytes.

提供机构:
Remex23
原始信息汇总

数据集概述

数据集特征

  • questionID: 字符串类型
  • questionTitle: 字符串类型
  • questionText: 字符串类型
  • questionUrl: 字符串类型
  • topics: 字符串类型
  • therapistName: 字符串类型
  • therapistUrl: 字符串类型
  • answerText: 字符串类型
  • upvotes: 整数类型(int64)
  • text: 字符串类型

数据集划分

  • 训练集(train):
    • 数据量: 5791592 字节
    • 示例数量: 1482

数据集大小

  • 下载大小: 3346530 字节
  • 数据集总大小: 5791592 字节
搜集汇总
数据集介绍
Remex23/counselchat-llama2 数据集图片
构建方式
CounselChat-Llama2数据集源自CounselChat平台上的真实心理咨询对话记录,旨在为心理咨询领域的对话生成与情感支持研究提供高质量数据资源。该数据集通过系统化地爬取与筛选,保留了用户提出的心理问题(含标题与详细描述)、治疗师的专业回复、问题所属主题标签以及互动热度(如点赞数)等关键字段。数据经过清洗与格式化处理,最终形成包含1482条训练样本的结构化语料库,每条样本均整合了对话上下文与元信息,便于模型理解咨询场景的复杂性与专业性。
特点
该数据集的核心特点在于其真实性与多维信息融合。所有对话均源自真实咨询场景,治疗师回复具有临床指导价值,而用户问题的多样性覆盖焦虑、抑郁、人际关系等常见心理主题。数据不仅包含对话文本,还附加了问题ID、URL、治疗师身份标识及点赞数等元数据,支持对咨询效果与用户反馈的关联分析。此外,数据集以单一训练集形式提供,规模适中但质量精良,特别适合用于微调对话式语言模型(如Llama2),使其在心理咨询领域生成更具同理心与专业性的回应。
使用方法
该数据集可直接用于监督微调(Supervised Fine-Tuning)以增强大语言模型的心理咨询能力。使用时,可加载Hugging Face的datasets库,通过load_dataset函数指定数据集名称‘Remex23/counselchat-llama2’获取训练数据。建议将‘text’字段作为模型输入(包含用户问题与治疗师回答的拼接文本),并结合‘topics’字段进行领域特定训练。由于数据集仅提供训练集划分,用户需自行划分验证集或采用交叉验证策略。此外,可基于‘upvotes’字段对样本加权,以强化高质量回答的学习效果。
背景与挑战
背景概述
在自然语言处理与心理健康交叉领域,对话系统正逐步成为辅助心理咨询的重要工具。Remex23/counselchat-llama2数据集由研究人员于近期构建,旨在为基于大语言模型的心理咨询对话生成提供高质量训练资源。该数据集源自CounselChat平台,包含1482条经过脱敏处理的真实咨询对话,每条样本涵盖问题标题、详细描述、咨询师回答及用户点赞数等结构化信息。核心研究问题聚焦于如何利用领域特定对话数据微调Llama2等开源大模型,使其能够模拟专业咨询师的共情表达与问题解决策略。该数据集的出现填补了中文心理咨询对话语料的稀缺性,为情感计算、对话生成及AI辅助心理健康干预研究提供了标准化基准,推动了大语言模型在敏感领域应用的可信度与安全性探索。
当前挑战
该数据集面临多重挑战。首先,在领域问题层面,心理咨询对话生成需准确理解用户情感状态并提供建设性指导,但现有模型常因缺乏真实咨询场景的上下文敏感性而生成机械或不当回应,难以平衡共情表达与专业建议的深度。其次,构建过程中,数据来源于匿名化网络平台,存在噪声标签(如低质量回答或非专业内容)、话题分布不均衡(如焦虑、抑郁类问题占比过高),以及隐私保护与数据可用性之间的张力——脱敏处理可能削弱语义连贯性。此外,仅1482条样本的规模限制了模型泛化能力,微调时易过拟合,且缺乏多轮对话结构,难以应对复杂咨询场景中的动态交互需求。
常用场景
经典使用场景
CounselChat-Llama2数据集汇聚了来自CounselChat平台的心理健康咨询对话,涵盖焦虑、抑郁、人际关系等多元主题,每条样本包含用户提问与治疗师回应,并附带点赞数作为质量信号。在心理语言学和计算社会科学领域,该数据集被广泛用于训练和评估大语言模型在心理咨询场景下的共情能力、对话连贯性与专业回应生成。研究者常将其作为基准,检验模型能否在开放域对话中准确识别用户情绪状态并提供建设性建议,从而推动人机心理支持系统的智能化发展。
衍生相关工作
基于该数据集,研究者衍生出多项经典工作,包括针对心理咨询对话的共情强度量化评估框架、基于强化学习的治疗式回应优化策略,以及多任务学习模型同时进行情绪分类与回应生成。此外,有工作将其与通用对话数据集对比,分析领域微调对模型安全性的影响,并推动了面向低资源语言的跨文化心理咨询对话生成研究。这些衍生工作共同拓展了人机心理交互的技术边界,促进了AI在临床心理学中的负责任应用。
数据集最近研究
最新研究方向
在心理健康领域,基于大型语言模型的对话系统正成为前沿研究方向,而CounselChat-Llama2数据集则为这一探索提供了关键资源。该数据集整合了来自在线咨询平台的专业问答对,涵盖抑郁、焦虑等常见心理议题,其结构化的治疗师-来访者互动记录,为训练具备共情与临床推理能力的对话代理奠定了数据基础。当前研究热点聚焦于利用此类数据集微调Llama2等开源模型,以构建可扩展、低成本的数字心理健康干预工具,旨在弥合专业咨询资源短缺的鸿沟。这一方向不仅推动了自然语言处理在情感支持中的应用边界,更引发了关于AI辅助心理治疗伦理与效度的深入讨论,对提升全球心理健康的可及性具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务