遇见数据集

Azure99/blossom-chat-v2

收藏
Hugging Face2023-12-25 更新2024-03-04 收录
官方服务:

资源简介:

Blossom Chat V2是基于ShareGPT 90K衍生而来的中英双语对话数据集,适用于多轮对话微调。相比于前一版本,进一步优化了数据处理流程,并配平了中英语料。本数据集抽取了ShareGPT的多轮对话指令,仅将指令进行翻译,随后使用多轮指令迭代调用gpt-3.5-turbo-0613。相比原始的ShareGPT数据,主要解决了中文对话数据量较少,以及由ChatGPT生成长度限制而导致的输出截断问题。本次发布了全量数据的20%,包含30K记录。数据集以中文和英文为主,中英文数据按照约1:1的比例混合。每条数据代表一个完整的多轮对话,包含id和conversations两个字段。数据集存在一些限制,如多轮对话可能不连贯,以及响应可能包含不准确甚至严重错误的回答。

Blossom Chat V2是基于ShareGPT 90K衍生而来的中英双语对话数据集,适用于多轮对话微调。相比于前一版本,进一步优化了数据处理流程,并配平了中英语料。本数据集抽取了ShareGPT的多轮对话指令,仅将指令进行翻译,随后使用多轮指令迭代调用gpt-3.5-turbo-0613。相比原始的ShareGPT数据,主要解决了中文对话数据量较少,以及由ChatGPT生成长度限制而导致的输出截断问题。本次发布了全量数据的20%,包含30K记录。数据集以中文和英文为主,中英文数据按照约1:1的比例混合。每条数据代表一个完整的多轮对话,包含id和conversations两个字段。数据集存在一些限制,如多轮对话可能不连贯,以及响应可能包含不准确甚至严重错误的回答。

提供机构:
Azure99
原始信息汇总

BLOSSOM CHAT V2 数据集概述

介绍

Blossom Chat V2 是一个基于 ShareGPT 90K 衍生而来的中英双语对话数据集,专门用于多轮对话微调。与之前的版本 blossom-chat-v1 相比,本数据集进一步优化了数据处理流程,并平衡了中英语料。数据集抽取了 ShareGPT 的多轮对话指令,仅将指令进行翻译,随后使用多轮指令迭代调用 gpt-3.5-turbo-0613。主要解决了中文对话数据量较少,以及由 ChatGPT 生成长度限制导致的输出截断问题。本次发布了全量数据的 20%,包含 30K 记录。

语言

数据集以中文和英文为主,中英文数据按照约 1:1 的比例混合。

数据集结构

每条数据代表一个完整的多轮对话,包含以下字段:

  • id:字符串,代表原始 ShareGPT 的对话 id。
  • conversations:对象数组,每个对象包含 rolecontent 两个字段。role 的取值为 userassistant,分别代表用户输入和助手输出,content 则为对应的内容。

数据集限制

  • 由于仅抽取了原始多轮对话的输入,对于一些涉及随机性的对话,例如猜随机数,可能会出现多轮对话不连贯的情况。
  • 本数据集的所有响应均由 gpt-3.5-turbo-0613 生成,并未经过严格的数据校验,可能包含不准确甚至严重错误的回答。
搜集汇总
数据集介绍
Azure99/blossom-chat-v2 数据集图片
构建方式
Blossom Chat V2数据集基于ShareGPT 90K语料衍生而来,专注于构建中英双语的对话微调资源。其构建过程首先从原始数据中抽取多轮对话的指令部分,仅对指令进行翻译,随后利用gpt-3.5-turbo-0613模型通过多轮指令迭代生成完整的回复。相较于前一版本,数据处理流程得到优化,中英语料被精心配平,以约1:1的比例混合。本次发布的数据集包含全量数据的20%,共计30K条记录,有效解决了原始ShareGPT数据中中文对话数量稀少及因模型输出长度限制导致的截断问题。
使用方法
该数据集适用于文本生成和文本到文本生成任务,尤其适合进行多轮对话微调。使用时,可直接加载JSON格式的数据,通过解析id和conversations字段获取对话结构。每条对话中,role为'user'或'assistant'的条目分别对应输入和输出,可用于构建训练样本。建议在微调过程中注意数据集中潜在的不连贯对话和模型生成的不准确回复,可结合其他数据源进行清洗或过滤,以提升模型性能。数据集遵循Apache-2.0许可证,支持中文和英文场景下的模型优化。
背景与挑战
背景概述
在自然语言处理领域,多轮对话系统的研究近年来取得了显著进展,其中高质量对话数据集的构建成为推动模型性能提升的关键因素。Blossom Chat V2数据集由Azure99团队于近期开发,基于ShareGPT 90K原始数据衍生而来,旨在解决中文对话数据稀缺及长文本生成截断等核心问题。该数据集以中英双语多轮对话微调为主要应用场景,通过优化数据处理流程并配平中英语料,为对话系统的跨语言能力研究提供了重要支撑。其发布不仅丰富了开源对话数据资源,还通过迭代调用gpt-3.5-turbo-0613生成响应,为后续模型训练奠定了数据基础,对推动多轮对话技术发展具有积极影响。
当前挑战
Blossom Chat V2数据集所面临的挑战主要体现在两个层面。在领域问题层面,多轮对话系统需处理上下文连贯性与逻辑一致性,而该数据集由于仅抽取原始对话的输入部分,对于涉及随机性(如猜数字)的交互,可能导致多轮对话不连贯,影响模型对复杂对话结构的建模能力。在构建过程层面,所有响应均由gpt-3.5-turbo-0613生成,缺乏严格的数据校验机制,可能引入不准确甚至严重错误的回答,从而降低数据集的可靠性与实用性。此外,中英语料的配平虽提升了语言覆盖度,但翻译质量与语义保真度仍需进一步验证,以确保跨语言对话的流畅性。
常用场景
经典使用场景
Blossom Chat V2数据集专为多轮对话场景下的语言模型微调而设计,尤其适用于构建中英双语对话系统。其核心用途在于利用高质量的指令-响应对,增强模型在连续交互中的上下文理解与生成能力。研究者常将其作为基础训练资源,以提升模型在复杂对话任务中的流畅性与准确性,例如客服咨询、智能助手交互等。
解决学术问题
该数据集有效缓解了中文对话语料匮乏及长对话输出截断的学术难题。通过翻译ShareGPT的英文指令并迭代调用GPT-3.5生成完整回复,它提供了配平的中英双语多轮对话样本,为跨语言对话模型研究奠定数据基础。其贡献在于解决了原始数据中由生成长度限制导致的语义不完整问题,推动了多轮对话系统的鲁棒性研究。
实际应用
在实际应用中,Blossom Chat V2可用于训练企业级智能客服、教育辅导机器人或虚拟社交助手。其双语特性使得模型能够无缝切换中英文交互,满足全球化服务需求。例如,在电商平台中,微调后的模型可处理用户咨询、订单查询等连续对话,显著提升响应效率与用户体验,同时降低人工干预成本。
数据集最近研究
最新研究方向
在当前大语言模型(LLM)领域,多轮对话能力的提升是微调优化的核心挑战之一。Blossom Chat V2作为基于ShareGPT 90K衍生的中英双语对话数据集,其前沿研究方向聚焦于解决跨语言对话数据稀缺性与模型输出截断问题。通过与gpt-3.5-turbo-0613的迭代调用,该数据集不仅配平了中英语料比例,还显著增强了多轮指令的连贯性,为构建更流畅的交互式AI系统提供了关键资源。这一工作直接呼应了业界对高质量、长上下文对话数据的需求,尤其在中英双语场景下,有助于推动模型在复杂对话任务中的泛化能力与鲁棒性,对提升智能客服、虚拟助手等应用的实用价值具有深远影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务