GBAG-Bench
收藏资源简介:
GBAG-Bench(Grounded BI Answer Generation Benchmark)是首个公开的基准测试,用于衡量大型语言模型(LLM)将SQL结果忠实解释为自然语言答案的能力。该数据集包含35个问题,覆盖3个公共SQLite数据库(Sakila、Chinook、Northwind),涉及聚合、趋势、派生、连接和排名等类别,并设有难度等级(1-10)。它专注于评估模型在生成忠实、完整和具有洞察力的自然语言答案方面的表现,以弥补现有基准测试(如Spider、BIRD、WikiSQL)仅关注SQL生成而忽略答案生成质量的不足。
GBAG-Bench (Grounded BI Answer Generation Benchmark) is the first publicly available benchmark for evaluating the ability of Large Language Models (LLMs) to faithfully interpret SQL results into natural language answers. This dataset contains 35 questions spanning 3 public SQLite databases (Sakila, Chinook, Northwind), covering categories such as aggregation, trend analysis, derivation, join operations, and ranking, with difficulty levels ranging from 1 to 10. It focuses on assessing models' performance in generating faithful, complete and insightful natural language answers, addressing the limitations of existing benchmarks including Spider, BIRD and WikiSQL that solely prioritize SQL generation while overlooking the quality of answer generation.
数据集概述
GBAG-Bench(Grounded BI Answer Generation) 是一个公开基准测试,用于衡量大语言模型(LLM)将 SQL 查询结果忠实转换为自然语言答案的能力。它聚焦于 NL2SQL 之后的关键环节——答案生成,而非仅评估 SQL 的正确性。
核心评估目标
该基准测试评估模型能否基于给定输入(自然语言问题、已执行的 SQL、完整的结果集)生成忠实、完整且有洞察力的自然语言答案。评估由一个 LLM 评判器根据人工撰写的黄金答案和预期原子洞察点列表执行,最终输出 GBAG 分数,计算公式如下:
GBAG Score = 0.50 × Faithfulness + 0.30 × Completeness + 0.20 × Insight
其中“忠实度”权重最高,因为在商业智能(BI)场景中,幻觉数字可能导致错误的现实决策。
数据集构成
数据集包含 35 个问题,覆盖 3 个公开的 SQLite 数据库,具体如下:
| 数据库 | 领域 | 问题数量 | 难度范围 |
|---|---|---|---|
| Sakila | DVD 租赁 | 15 | 1–10 |
| Chinook | 数字音乐商店 | 10 | 1–8 |
| Northwind | 交易/订单管理 | 10 | 1–8 |
每个数据库的前 10 个问题构成核心阶梯(每个难度级别 1-8 各1-2题),Sakila 额外包含 5 个高难度问题(9-10级),其最大结果集可达 16,049 行。
按问题类别统计:聚合(11 个)、趋势(11 个)、派生(7 个)、联接(3 个)、排序(3 个)。
问题 ID 编码包含数据库和难度信息,例如 sakila-l6-02 表示 Sakila 数据库、难度 6、该级别第二个问题。
v0.2 排行榜(统一使用 Grok-4.3 评判器)
所有模型结果均由同一评判器重新评判,以确保可比性。排行榜显示,应用特定上下文工程管道的本地模型能够显著提升性能:
| 模型 | 提供商 | 配置 | 覆盖问题数 | GBAG 分数 |
|---|---|---|---|---|
qwen3.5:9b |
Ollama (本地, RTX 3060) | + DeskInsight 管道 | 35/35 | 76.8 |
nvidia/llama-3.3-nemotron-super-49b-v1 |
NVIDIA NIM | 中性提示 | 35/35 | 67.7 |
qwen/qwen3-coder-480b-a35b-instruct |
NVIDIA NIM | 中性提示 | 35/35 | 64.6 |
qwen/qwen3-next-80b-a3b-thinking |
NVIDIA NIM | 中性提示 | 35/35 | 61.4 |
qwen3.5:9b |
Ollama (本地, RTX 3060) | 中性提示 | 32/35 | 59.6 |
qwen/qwen3-next-80b-a3b-instruct |
NVIDIA NIM | 中性提示 | 28/35 | 58.9 |
五个关键发现
- 上下文工程优于模型规模:相同 9B 模型使用不同提示,分数差距可达 17.2 分(59.6 vs 76.8),显示提高 BI 答案质量的关键在于模型输入内容,而非模型大小。
- 更大的模型并非显著更优:在统一强评判器下,9B 模型(59.6)与 480B 模型(62.8,仅共有问题)差距仅约 3 分,参数规模相差约 50 倍。
- 评判器选择与模型选择同等重要:对相同模型答案使用不同评判器,分数可相差 13 分(72.7 vs 59.6),表明单评判器基准测试不可靠。GBAG 采用双评判器协议并计算 Cohens kappa。
- 思考模式可能损害接地任务:在相同评判器下,思考型模型(61.4)仅略超中性基线(59.6),且落后于非思考型 480B 模型(64.6)。
- 特定失败模式集中而非普遍:本地模型在大表查询时可能出现“后 SQL 聚合缺陷”(Post-SQL Aggregation Deficit),即从样本行捏造聚合值。使用 Pre-Aggregated Context Injection 可缓解多数情况。
局限性
- 数据集较小:仅 35 个问题,统计上不足以做出确定性结论,计划在 v0.3 扩展。
- 数据库仅 3 个:均为公开样本,可能已包含在部分模型训练数据中,考虑在 v0.3 引入未公开数据库。
- LLM 评判器局限:即使使用统一强评判器,仍存在约 11 分的评判器诱导方差。
- 仅支持英语:问答及黄金答案均为英文,计划将来扩展多语言。
- 忠实度权重高于洞察力:当前 50/30/20 的权重侧重反映了对幻觉数字的规避,替代权重在 METRIC.md 中说明。
负面结果
基准测试也发布了一个不成功的管道变更实验。该实验尝试抑制预计算聚合(PACI)中的元聚合,平均分数提升 1.3 分,但掩盖了在一个特定问题类别上的三次近乎完全的崩溃(分数从 86/86/92 降至 11/11/17)。该变更因潜藏安全风险而被回滚。该案例证明了:在任何抗幻觉变更验证中,需至少测试两种模型规模,并检查每个问题的分数分布,而非仅依赖平均值。
资源与使用
- 数据与代码:完整数据集、数据库、提示词和评判器规则均在 GitHub 仓库中,无需外部资源。
- 快速开始:提供克隆仓库、安装依赖、运行模型及评判器的三步骤命令。
- 提交结果:欢迎提交新模型结果,遵循 CONTRIBUTING.md 中的 Pull Request 流程即可。
- 存储库布局:README 文件说明了各主要路径和文件(如
data/questions.jsonl、databases/、judge/、runs/等)的用途。
引用
bibtex @misc{gbag-bench-2026, title = {GBAG-Bench: Grounded BI Answer Generation}, author = {Zerga, Fouad and Zakarya, R.}, year = {2026}, url = {https://github.com/softisight/gbag-bench} }
许可
采用 MIT 许可协议,详见 https://github.com/softisight/gbag-bench/blob/main/LICENSE。捆绑的示例数据库保留其原始许可,详见 https://github.com/softisight/gbag-bench/blob/main/databases/NOTICE.md。




