flammenai/Phoenix-SFT-v1
收藏资源简介:
Phoenix v1 — 记忆提取数据集是一个用于生成结构化记忆数据的合成数据集,旨在支持AI角色(称为“Flame”)在异步对话中的长期连续性。数据集包含多种语言的对话转录,任务是将这些对话转换为结构化的JSON记忆列表。记忆分为多个类别,如事实、偏好、关系、事件和情感。数据集分为训练集(1728个示例)和评估集(170个示例),并详细描述了数据的生成流程、质量控制机制和局限性。
Phoenix v1 — Memory Extraction Dataset is a synthetic dataset designed for generating structured memory data to support long-term continuity in asynchronous conversations with an AI character ("Flame"). The dataset includes conversation transcripts in multiple languages, and the task is to convert these transcripts into structured JSON memory lists. Memories are categorized into types such as factual, preference, relation, event, and emotion. The dataset is divided into a training set (1728 examples) and an evaluation set (170 examples), with detailed descriptions of the generation pipeline, quality control mechanisms, and limitations.
数据集名称
Phoenix-SFT-v1
数据集概述
该数据集是由 flammmen.ai 发布的 Phoenix v1 内存提取数据集,用于训练小规模语言模型(如 Qwen2.5)从用户与 AI 角色("Flame")的聊天窗口中提取结构化的、可持久化的记忆信息。
任务与目标
- 任务类型:文本生成、摘要
- 具体目标:模型读取一组用户与 AI 角色的对话消息,输出一个 JSON 对象,列出 AI 角色需要记住的关于用户的可持久化事实。
数据格式与规模
- 格式:JSON(数据集展示为 Parquet 格式)
- 大小:1K - 10K 条数据,具体展示中为 1.9k 行
- 拆分:
- 训练集:1.73k 行
- 测试集:170 行
数据模式(Schema)
每条数据包含以下字段:
- seed_id:字符串,36 个字符的唯一标识符
- stratum:字典,包含对话的元信息:
- length:对话长度(short/medium/long)
- density:信息密度(dense/sparse/mixed/null)
- register:语气(casual/flirty/vulnerable/intimate/conflict/mundane)
- phase:关系阶段(first_contact/getting_to_know/established/reconnect)
- topic_mix:主题混合度(single_topic/drifting/scattered)
- language:语言(en/es/fr/zh 等)
- messages:列表,包含系统提示和用户与 AI 的对话内容。
输出结构(记忆提取)
模型需输出一个 JSON 对象,包含一个 memories 列表,每个记忆对象包含:
- content:第三人称句子,3-30 词,以用户为隐含主语
- category:记忆类别(枚举值):
- factual:具体数据(工作、地点、家庭结构、物品)
- preference:喜好/厌恶/价值观/习惯
- relation:用户生活中其他命名人物
- event:用户经历的事件(近期或持续)
- emotion:情绪状态、当前关注点
注意:空的 memories 数组是有效输出,表示“该窗口中无值得注意的内容”,目的是训练模型在无信息时不编造记忆。
语言
数据集包含多种语言:英语、西班牙语、法语、中文等。
标签与许可
- 标签:chat, memory-extraction, conversational-ai, flammen, phoenix
- 许可协议:apache-2.0
适用库
Datasets, pandas, Polars 等。
限制与联系
- 数据集中提及了失败模式分类(Failure-mode taxonomy)和局限性(Limitations)等内容(页面中未展开细节)。
- 可通过 flammen.ai 联系。




