遇见数据集

GBAG-Bench

收藏
github2026-07-21 更新2026-07-22 收录
官方服务:

资源简介:

GBAG-Bench(Grounded BI Answer Generation Benchmark)是首个公开的基准测试,用于衡量大型语言模型(LLM)将SQL结果忠实解释为自然语言答案的能力。该数据集包含35个问题,覆盖3个公共SQLite数据库(Sakila、Chinook、Northwind),涉及聚合、趋势、派生、连接和排名等类别,并设有难度等级(1-10)。它专注于评估模型在生成忠实、完整和具有洞察力的自然语言答案方面的表现,以弥补现有基准测试(如Spider、BIRD、WikiSQL)仅关注SQL生成而忽略答案生成质量的不足。

GBAG-Bench (Grounded BI Answer Generation Benchmark) is the first publicly available benchmark for evaluating the ability of Large Language Models (LLMs) to faithfully interpret SQL results into natural language answers. This dataset contains 35 questions spanning 3 public SQLite databases (Sakila, Chinook, Northwind), covering categories such as aggregation, trend analysis, derivation, join operations, and ranking, with difficulty levels ranging from 1 to 10. It focuses on assessing models' performance in generating faithful, complete and insightful natural language answers, addressing the limitations of existing benchmarks including Spider, BIRD and WikiSQL that solely prioritize SQL generation while overlooking the quality of answer generation.

创建时间:
2026-07-01
原始信息汇总

数据集概述

GBAG-Bench(Grounded BI Answer Generation) 是一个公开基准测试,用于衡量大语言模型(LLM)将 SQL 查询结果忠实转换为自然语言答案的能力。它聚焦于 NL2SQL 之后的关键环节——答案生成,而非仅评估 SQL 的正确性。

核心评估目标

该基准测试评估模型能否基于给定输入(自然语言问题、已执行的 SQL、完整的结果集)生成忠实完整有洞察力的自然语言答案。评估由一个 LLM 评判器根据人工撰写的黄金答案和预期原子洞察点列表执行,最终输出 GBAG 分数,计算公式如下:

GBAG Score = 0.50 × Faithfulness + 0.30 × Completeness + 0.20 × Insight

其中“忠实度”权重最高,因为在商业智能(BI)场景中,幻觉数字可能导致错误的现实决策。

数据集构成

数据集包含 35 个问题,覆盖 3 个公开的 SQLite 数据库,具体如下:

数据库 领域 问题数量 难度范围
Sakila DVD 租赁 15 1–10
Chinook 数字音乐商店 10 1–8
Northwind 交易/订单管理 10 1–8

每个数据库的前 10 个问题构成核心阶梯(每个难度级别 1-8 各1-2题),Sakila 额外包含 5 个高难度问题(9-10级),其最大结果集可达 16,049 行。

按问题类别统计:聚合(11 个)、趋势(11 个)、派生(7 个)、联接(3 个)、排序(3 个)。

问题 ID 编码包含数据库和难度信息,例如 sakila-l6-02 表示 Sakila 数据库、难度 6、该级别第二个问题。

v0.2 排行榜(统一使用 Grok-4.3 评判器)

所有模型结果均由同一评判器重新评判,以确保可比性。排行榜显示,应用特定上下文工程管道的本地模型能够显著提升性能:

模型 提供商 配置 覆盖问题数 GBAG 分数
qwen3.5:9b Ollama (本地, RTX 3060) + DeskInsight 管道 35/35 76.8
nvidia/llama-3.3-nemotron-super-49b-v1 NVIDIA NIM 中性提示 35/35 67.7
qwen/qwen3-coder-480b-a35b-instruct NVIDIA NIM 中性提示 35/35 64.6
qwen/qwen3-next-80b-a3b-thinking NVIDIA NIM 中性提示 35/35 61.4
qwen3.5:9b Ollama (本地, RTX 3060) 中性提示 32/35 59.6
qwen/qwen3-next-80b-a3b-instruct NVIDIA NIM 中性提示 28/35 58.9

五个关键发现

  1. 上下文工程优于模型规模:相同 9B 模型使用不同提示,分数差距可达 17.2 分(59.6 vs 76.8),显示提高 BI 答案质量的关键在于模型输入内容,而非模型大小
  2. 更大的模型并非显著更优:在统一强评判器下,9B 模型(59.6)与 480B 模型(62.8,仅共有问题)差距仅约 3 分,参数规模相差约 50 倍。
  3. 评判器选择与模型选择同等重要:对相同模型答案使用不同评判器,分数可相差 13 分(72.7 vs 59.6),表明单评判器基准测试不可靠。GBAG 采用双评判器协议并计算 Cohens kappa。
  4. 思考模式可能损害接地任务:在相同评判器下,思考型模型(61.4)仅略超中性基线(59.6),且落后于非思考型 480B 模型(64.6)。
  5. 特定失败模式集中而非普遍:本地模型在大表查询时可能出现“后 SQL 聚合缺陷”(Post-SQL Aggregation Deficit),即从样本行捏造聚合值。使用 Pre-Aggregated Context Injection 可缓解多数情况。

局限性

  • 数据集较小:仅 35 个问题,统计上不足以做出确定性结论,计划在 v0.3 扩展。
  • 数据库仅 3 个:均为公开样本,可能已包含在部分模型训练数据中,考虑在 v0.3 引入未公开数据库。
  • LLM 评判器局限:即使使用统一强评判器,仍存在约 11 分的评判器诱导方差。
  • 仅支持英语:问答及黄金答案均为英文,计划将来扩展多语言。
  • 忠实度权重高于洞察力:当前 50/30/20 的权重侧重反映了对幻觉数字的规避,替代权重在 METRIC.md 中说明。

负面结果

基准测试也发布了一个不成功的管道变更实验。该实验尝试抑制预计算聚合(PACI)中的元聚合,平均分数提升 1.3 分,但掩盖了在一个特定问题类别上的三次近乎完全的崩溃(分数从 86/86/92 降至 11/11/17)。该变更因潜藏安全风险而被回滚。该案例证明了:在任何抗幻觉变更验证中,需至少测试两种模型规模,并检查每个问题的分数分布,而非仅依赖平均值

资源与使用

  • 数据与代码:完整数据集、数据库、提示词和评判器规则均在 GitHub 仓库中,无需外部资源。
  • 快速开始:提供克隆仓库、安装依赖、运行模型及评判器的三步骤命令。
  • 提交结果:欢迎提交新模型结果,遵循 CONTRIBUTING.md 中的 Pull Request 流程即可。
  • 存储库布局:README 文件说明了各主要路径和文件(如 data/questions.jsonldatabases/judge/runs/ 等)的用途。

引用

bibtex @misc{gbag-bench-2026, title = {GBAG-Bench: Grounded BI Answer Generation}, author = {Zerga, Fouad and Zakarya, R.}, year = {2026}, url = {https://github.com/softisight/gbag-bench} }

许可

采用 MIT 许可协议,详见 https://github.com/softisight/gbag-bench/blob/main/LICENSE。捆绑的示例数据库保留其原始许可,详见 https://github.com/softisight/gbag-bench/blob/main/databases/NOTICE.md

搜集汇总
数据集介绍
GBAG-Bench 数据集图片
构建方式
GBAG-Bench是首个专注于评估大语言模型将SQL执行结果转化为自然语言回答忠实度的公开基准。其构建基于三个广泛使用的公共SQLite数据库——Sakila(DVD租赁)、Chinook(数字音乐商店)和Northwind(贸易订单管理),总计涵盖35个精心设计的问题。每个数据库贡献一个核心阶梯式问题集,难度从1到10逐级递增,其中Sakila额外包含5个极端难度问题,其结果集可达16,049行。问题类型覆盖聚合(11个)、趋势(11个)、衍生(7个)、连接(3个)和排序(3个),确保对模型能力的全面评估。数据集为每个问题提供了自然语言问题、对应的可执行SQL、完整的执行结果集、人工撰写的标准答案以及预期的原子化洞察点列表,形成了结构化的评估基础。
特点
该数据集的核心特点在于其独特的评估视角——不再止步于SQL生成正确性,而是深入挖掘从数据到语言转换这一被广泛忽视的关键环节。其评价体系采用加权GBAG分数:忠实度占50%、完整性占30%、洞察力占20%,强调了在商业智能场景中数值准确性优先于其他维度的设计哲学。基准配套了统一的大语言模型裁判协议(目前采用Grok-4.3),并公开了详细的评判标准和评分配置。数据集还揭示了若干重要发现:上下文工程对性能的提升远超模型规模扩大带来的收益,相同模型通过合理提示工程可获得17分以上的提升;裁判模型的选择对结果影响显著,不同裁判间可产生13分的评分差异。这些特性使GBAG-Bench成为诊断和改进语言模型在数据解释任务中表现的精准工具。
使用方法
使用GBAG-Bench进行模型评估遵循标准化的三步骤流程。首先,通过克隆仓库并安装依赖后,使用baseline_runner.py脚本在固定SQL执行模式下运行目标模型,生成包含模型回答的JSONL文件。随后,通过run_judge.py脚本调用指定的裁判模型(推荐使用Grok-4.3)对生成的回答进行评分,该过程需设置OpenRouter API密钥。最终,可通过update_leaderboard.py脚本自动更新排行榜。整个过程一次完整的35个问题评估约需0.40美元的裁判API费用。数据集特别鼓励采用双裁判协议,即除Grok-4.3外再使用来自不同供应商的第二个裁判模型,并通过Cohen's kappa系数评估裁判间一致性。提交新的模型结果时,只需fork仓库、运行评估脚本,并通过Pull Request提交评分后的结果文件即可。
背景与挑战
背景概述
在大语言模型(LLM)驱动的商业智能(BI)产品中,将结构化查询语言(SQL)的执行结果忠实且富有洞察地转化为自然语言答案,是确保用户体验与决策可靠性的关键环节。然而,现有的NL2SQL基准测试(如Spider、BIRD)仅关注SQL生成正确性,忽视了答案生成阶段的错误。为弥合这一评估空白,GBAG-Bench(Grounded BI Answer Generation Benchmark)于2026年由Fouad Zerga与R. Zakarya团队创建。该基准聚焦于衡量LLM在给定自然语言问题、已执行SQL及完整结果集后,产出忠实、完整且富有洞察的自然语言答案的能力。通过引入加权评分体系(忠实度50%、完整性30%、洞察力20%),GBAG-Bench精准定位了BI场景中数值幻觉、趋势反转等关键风险,为领域内模型评估开辟了全新维度,对推动可信AI在BI领域的应用具有重要意义。
当前挑战
GBAG-Bench所应对的核心挑战在于,传统NL2SQL评估体系不完整,忽视了从SQL结果到自然语言答案的生成环节,导致模型生成的答案常包含虚构数值、趋势误判或缺失关键洞察,在BI场景中引发严重决策失误。构建过程中亦面临诸多考验:其一,创建高质量、涵盖多种分析类型(聚合、趋势等)的专家标注问题集(仅35题),确保问题能有效触发答案忠实的评估;其二,设计并验证LLM作为评判者的可靠性,需消除单一模型评判带来的约11分偏差,并建立双评判者协议与Cohen's kappa系数以量化分歧;其三,处理模型规模与上下文工程间的权衡,发现小型模型在特定问题上的近灾难性失败(如逐组平均问题),揭示了去幻觉优化中遗留的数值锚定缺陷,凸显了跨模型规模验证的重要性。
常用场景
经典使用场景
在商业智能(BI)与大语言模型交叉融合的前沿领域,GBAG-Bench作为首个公开的基准测试,专为度量LLM将SQL查询结果忠实转化为自然语言答案的能力而设计。其经典使用场景聚焦于评估模型在获得确切SQL执行结果后,能否生成忠实、完整且富有洞察力的文本响应,通过Faithfulness、Completeness和Insight三个维度的加权评分(GBAG Score),系统性地捕捉传统NL2SQL基准所忽视的答案生成环节,从而弥补了从数据到叙述之间至关重要的语义鸿沟。
实际应用
在实际产业应用层面,GBAG-Bench直接服务于商业智能报告自动化、数据洞察问答系统与智能仪表盘等需要将结构化数据转化为自然语言叙述的关键场景。数据集揭示了上下文工程相较于模型规模对生成质量的决定性影响——同等参数量模型通过精心设计的提示工程即可实现高达17个百分点的性能飞跃,这一发现指导实际部署时更应关注输入信息的组织而非单纯追逐更大模型,从而在消费级硬件上实现低成本、高可靠性的BI对话系统,显著降低企业从数据到决策的信息损耗。
衍生相关工作
围绕GBAG-Bench已衍生出多项具有重要价值的学术与工程工作,包括对LLM作为评判者(LLM-as-Judge)可靠性的系统性剖析,揭示了不同评判模型间存在高达13个百分点的评分差异;提出双评判者协议与Cohen's kappa系数以量化评判误差;深入分析了反思模式(thinking mode)在定向生成任务中的潜在危害,以及特定失败模式(如Post-SQL Aggregation Deficit)的集中分布规律。这些发现不仅为改进BI生成模型提供了明确方向,更推动了关于评估方法论本身的深刻反思,促进了更严谨、更透明的基准设计范式的形成。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务