VivaBench
收藏资源简介:
VivaBench是一个医学问答数据集,包含来自PubMed的经过审核的数据和生成数据,大小在1K到10K条之间,遵循cc-by-sa-4.0许可。
VivaBench is a medical question answering dataset consisting of curated and generated data sourced from PubMed, with a scale ranging from 1,000 to 10,000 entries, and is licensed under CC BY-SA 4.0.
VivaBench数据集概述
数据集简介
- 名称:VivaBench
- 类型:多轮临床推理基准测试
- 规模:包含1,152个由医生策划的临床小案例
- 用途:模拟口头考试(viva voce),评估大型语言模型在临床推理中的表现
核心特点
- 模拟真实临床场景:要求代理逐步收集病史和体检结果,进行诊断
- 多轮交互设计:支持迭代式信息收集和推理过程
- 结构化评估:提供完整的评估指标和流程
技术配置
- 配置文件:
configs/evaluate.yaml:包含数据输入输出路径、批量大小、模型参数等configs/generate.yaml:包含流水线参数、嵌入映射、生成模型配置等
- 支持模型:
- 通过
init_chat_model、init_openrouter_chat_model或init_ollama_chat_model实例化
- 通过
使用方式
评估流程
bash vivabench evaluate --config configs/evaluate.yaml [--input /path/to/my_input.csv] [--output_dir /path/to/outdir] [--evaluation_id id_of_evaluation_run]
指标重计算
bash vivabench metrics --config configs/evaluate.yaml --output_csv /path/to/results/full_results.csv [--output_dir /path/to/metrics_out]
案例生成
bash vivabench generate --config configs/generate.yaml [--input /path/to/seed_vignettes.csv] [--output /path/to/generated.csv]
引用信息
bibtex @article{vivabench2025, title = {Simulating Viva Voce Examinations to Evaluate Clinical Reasoning in Large Language Models}, author = {Anonymous Author(s)}, journal = {}, year = {2025}, }
许可信息
- 许可证:CC-NA License
- 贡献:欢迎通过issue或pull request参与贡献




