FACTS-grounding-public
收藏资源简介:
FACTS Grounding数据集由Google DeepMind和Google Research开发,旨在评估AI模型在事实性和基础性方面的表现。数据集包含860个由人工制作的示例,用于评估AI系统如何基于给定的上下文生成答案。每个示例包括系统提示、任务和长文档。此外,数据集还包含用于评估模型生成响应的评估提示。数据集的限制包括依赖可能存在噪声的自动化LLM判断模型,以及仅专注于评估长文本输入的基础响应。
The FACTS Grounding dataset was developed by Google DeepMind and Google Research, aiming to evaluate the factual and foundational performance of AI models. It consists of 860 manually crafted examples for assessing how AI systems generate answers based on given contexts. Each example includes a system prompt, a task, and a long document. Additionally, the dataset contains evaluation prompts for assessing model-generated responses. The limitations of the dataset include reliance on potentially noisy automated LLM-based judgment models, as well as an exclusive focus on evaluating foundational responses to long-text inputs.
FACTS Grounding 1.0 Public Examples
数据集概述
- 数据集名称: FACTS Grounding Public Examples
- 数据集来源: Google DeepMind 和 Google Research
- 数据集类型: 问答数据集
- 语言: 英语
- 标签: 事实性, 接地性, 基准测试, Google DeepMind, Google Research
- 数据集大小: 小于1K
数据集配置
- 配置名称: examples
- 默认: 是
- 数据文件:
- 分割: public
- 路径: examples.csv
- 配置名称: evaluation_prompts
- 数据文件:
- 分割: prompts
- 路径: evaluation_prompts.csv
- 数据文件:
数据集描述
- 数据集内容: 包含860个由人工制作的示例,用于评估AI系统在给定上下文中回答问题的能力。
- 示例组成:
- 系统提示 (
system_instruction): 提供给模型的通用指令,要求模型仅根据给定的上下文回答问题。 - 任务 (
user_request): 包含系统需要回答的具体问题。 - 长文档 (
context_document): 包含回答问题所需的信息。
- 系统提示 (
- 评估提示: 包含用于评估模型生成响应的提示 (
evaluation_prompts.csv)。
数据集用途
- 用途: 评估大型语言模型(LLMs)在生成基于长文档的准确响应方面的能力。
- 目标: 通过提供标准化的评估框架,促进开发既知识渊博又值得信赖的LLMs,以便在实际应用中负责任地部署。
数据集限制
- 限制:
- 依赖于可能存在噪声的自动化LLM评判模型进行评估。
- 仅关注评估基于长文本输入的接地响应,可能需要进一步扩展。
引用
- 引用: 如果使用此数据集进行研究,请引用技术报告。




