MemTraceBench
收藏资源简介:
MemTraceBench是一个用于追踪和归因大语言模型(LLM)内存系统中错误的基准测试数据集,与论文《MemTrace: Tracing and Attributing Errors in Large Language Model Memory Systems》一同发布。该数据集的核心是将内存管道转化为执行图,从而精细追踪内存系统内部的信息流,包括信息的提取、更新、删除、检索以及最终在响应中的使用。数据集包含了这些执行图以及精心整理的失败标注,用于系统研究内存故障模式。每个失败的查询都被标注了根本原因错误类型和执行图中的决定性错误操作。数据集根据生成轨迹的内存系统分为四个部分(或称配置):rag(Naive RAG)、mem0(Mem0)、evermemos(EverMemOS)和long_context(Long-Context)。每个部分包含多个JSON文件,每个文件代表从一个代表性内存系统收集的一个序列化执行图。数据来源于三个多会话内存数据集:LoCoMo、LongMemEval和RealMem。总计,数据集包含103个执行图和238个失败标注。每个执行图遵循特定的JSON架构,包含图ID、用户ID、元数据以及核心数据部分。核心数据部分包括变量节点、信息流边、操作(如提取、更新、检索、判断)、会话以及关键的失败案例标注列表。每个失败标注详细记录了查询ID、查询文本、参考答案、模型预测、所需证据、最终错误类型、决定性操作ID以及由GPT-5.5聚合和润色的人工标注原因。除了内存系统相关错误外,标注还包括标注错误和LLM-as-a-Judge错误,这些通常在研究内存相关错误时被过滤掉。该数据集适用于问答、内存系统分析、错误诊断、代理行为追踪和归因等任务。
数据集概述
MemTraceBench 是一个专用于研究大语言模型(LLM)记忆系统错误追踪与归因的基准测试集,伴随论文 MemTrace: Tracing and Attributing Errors in Large Language Model Memory Systems(arXiv:2605.28732)发布。
核心目标
- 将记忆管道转换为执行图(execution graph),以细粒度追踪系统内部的信息流。
- 为每个失败查询提供根因错误类型和关键故障操作的标注,支持系统性研究记忆系统故障模式。
数据集结构
数据集按生成轨迹的记忆系统分为四个子集,每个子集为一个JSON文件目录:
| 子集(Split) | 记忆系统(Memory System) | 执行图数量 | 失败标注数量 |
|---|---|---|---|
rag |
Naive RAG | 30 | 56 |
mem0 |
Mem0 | 19 | 66 |
evermemos |
EverMemOS | 20 | 54 |
long_context |
Long-Context | 34 | 62 |
轨迹数据来源于三个多会话记忆数据集:LoCoMo、LongMemEval、RealMem(文件名中可见,如 locomo_locomo-1.json、longmemeval_*.json)。
文件格式(JSON Schema)
每个JSON文件是一个序列化的 smartcomment 执行图,顶层结构如下:
jsonc { "graph_id": "...", "user_id": "...", "project_id": "...", "driver_type": "in_memory", "created_at": "...", "metadata": { ... }, "data": { "nodes": [ ... ], // 变量节点(记忆单元、查询、预测等) "edges": [ ... ], // 变量间的信息流边 "operations": [ ... ], // 操作(提取、更新、检索、判断等) "sessions": [ ... ], // 对话会话 "annotations":[ ... ] // 精心选择的失败案例 } }
data.annotations 中的每条记录描述一个被判定为错误的查询,字段如下:
| 字段 (Field) | 描述 (Description) |
|---|---|
query_id |
图中查询节点的完整标识符。 |
query |
问题文本。 |
golden_answers |
参考答案。 |
golden_answers_id |
图中参考答案节点的完整标识符。 |
prediction |
问答模型的预测结果。 |
prediction_id |
图中预测节点的完整标识符。 |
source_evidence |
回答查询所需的证据。 |
source_evidence_ids |
图中证据节点的完整标识符。 |
final_error_type |
归因的根因错误类型。 |
final_op_id |
图中决定性故障操作的标识符。 |
reason |
归因的根因解释(由GPT-5.5聚合并润色人工标注者的理由)。 |
注意:除与记忆系统相关的错误外,还包含标注错误和LLM作为判断者的错误,研究记忆相关错误时通常过滤掉这些。
数据构建
- 使用 smartcomment 工具对四种代表性记忆系统(Mem0、EverMemOS、Naive RAG、Long-Context)进行代码插桩,记录记忆构建、检索、利用和评估中的操作,并组织成执行图。
- 选择失败案例后,通过人工标注定位错误位置(具体操作标识符)、错误类型及错误原因。最终标签通过多数投票与第二轮标注确定,再由GPT-5.5聚合润色。
- 完整的可运行生成代码见:https://github.com/zjunlp/MemBase/tree/main/examples/trace_memory_lifecycle_with_membase
许可证
该数据集采用 MIT License 发布。
引用
若在研究中使用了MemTraceBench,请引用:
bibtex @misc{deng2026memtracetracingattributingerrors, title={MemTrace: Tracing and Attributing Errors in Large Language Model Memory Systems}, author={Xinle Deng and Ruobin Zhong and Hujin Peng and Xiaoben Lu and Yanzhe Wu and Guang Li and Buqiang Xu and Yunzhi Yao and Jizhan Fang and Haoliang Cao and Junjie Guo and Yuan Yuan and Ziqing Ma and Yuanqiang Yu and Rui Hu and Baohua Dong and Hangcheng Zhu and Ningyu Zhang}, year={2026}, eprint={2605.28732}, archivePrefix={arXiv}, primaryClass={cs.CL}, url={https://arxiv.org/abs/2605.28732}, }




