CrossWordBench
收藏资源简介:
CrossWordBench是一个用于评估LLMs和LVLMs推理能力的基准测试,具有可控的谜题生成和评估策略。
CrossWordBench is a benchmark designed to evaluate the reasoning capabilities of Large Language Models (LLMs) and Large Vision-Language Models (LVLMs), featuring controllable puzzle generation and evaluation strategies.
CrossWordBench数据集概述
数据集简介
- 名称:CrossWordBench
- 目的:评估LLMs和LVLMs的推理能力,具有可控的谜题生成和评估策略
- 特点:支持生成可控制的填字游戏谜题
- 相关论文:CrossWordBench: Evaluating the Reasoning Capabilities of LLMs and LVLMs with Controllable Puzzle Generation
数据集内容
- 数据类型:填字游戏谜题
- 语言支持:英语、中文、简单英语、CommonsenseQA
- 网格尺寸:7x7和14x14
- 预填充比例:0.25、0.5、0.75以及留一选项(仅一个单词未填充)
数据生成
- 词-线索对:提供英语、中文、简单英语和CommonsenseQA的词-线索对
- 生成脚本:提供完整数据集生成脚本和示例生成脚本
- 示例命令: shell bash scripts/gen_full.sh -i word_lists/english_words.txt -m false -s 100 bash scripts/gen_puzzle.sh
评估
-
支持模型:API基础模型和可通过vLLM在线部署的模型
-
评估脚本:提供示例评估脚本
-
示例命令: shell bash scripts/run_eval.sh -m gpt-4o-2024-11-20 -s english -d 7x7 -t img_cot
-
提示模板:支持零样本思维链(CoT)、交互模式、网格解析等多种提示策略
评估结果
- 输出文件:
metric.json:汇总所有评估谜题的指标metric.txt:人类可读的指标版本raw_metrics.json:每个谜题的预聚合指标
工具与资源
- 绘图工具:提供生成论文中所有图形的工具
- 依赖项:需要安装vLLM、yq等工具
- 数据托管:Huggingface数据集
- 评估结果:Huggingface评估结果
引用
bibtex @misc{leng2025crosswordbenchevaluatingreasoningcapabilities, title={CrossWordBench: Evaluating the Reasoning Capabilities of LLMs and LVLMs with Controllable Puzzle Generation}, author={Jixuan Leng and Chengsong Huang and Langlin Huang and Bill Yuchen Lin and William W. Cohen and Haohan Wang and Jiaxin Huang}, year={2025}, eprint={2504.00043}, archivePrefix={arXiv}, primaryClass={cs.CL}, url={https://arxiv.org/abs/2504.00043}, }




