contract-review
收藏资源简介:
参考数据集涵盖了合同审查/文档智能——最常见的企业AI用例。它包括50个测试用例,分为5个类别,基于10个真实的源合同构建。类别包括条款提取、单条款审查、多条款推理、风险分类和缺失条款检测。源合同包括相互和单向NDA、企业和初创公司SaaS协议、专业服务协议、雇佣合同、复杂的MSA和软件许可证。每个合同包含800-2,000字的真实但原创的法律文本。
This reference dataset covers contract review/document intelligence, one of the most common enterprise AI use cases. It comprises 50 test cases divided into 5 categories, constructed based on 10 real-world source contracts. The categories include clause extraction, single-clause review, multi-clause reasoning, risk classification, and missing clause detection. The source contracts cover mutual and unilateral NDAs, enterprise and startup SaaS agreements, professional services agreements, employment contracts, complex MSAs, and software licenses. Each contract contains authentic yet original legal text ranging from 800 to 2,000 words.
claude-evals 数据集概述
数据集基本信息
- 数据集名称: claude-evals
- 主要用途: 专为 Claude Agent SDK 工作流设计的原生评估工具套件。
- 核心目标: 解决企业团队在构建 Claude 驱动工作流时面临的模型升级影响评估与成本效益模型选择问题。
- 开发者: Tribe AI
数据集核心特点
- 原生集成: 深度集成 Claude Agent SDK,可钩入
PreToolUse、PostToolUse和SubagentStop生命周期事件。 - 评估维度: 专注于评估智能体行为,包括工具选择、多步骤任务完成、上下文保留和成本效率。
- 内置黄金数据集: 包含一个用于合同审查/文档智能的真实校准测试集。
- 方法论: 实现了 Anthropic 发布的评估模式,包括确定性评分器、LLM 作为评判员以及人工审核队列。
黄金数据集详情
- 领域: 合同审查 / 文档智能。
- 规模: 50 个测试用例。
- 来源: 基于 10 份真实的源合同构建。
- 合同特征: 每份合同为 800-2,000 词的原创法律文本,内容真实。
- 合同类型: 包括相互和单向保密协议、企业和初创公司 SaaS 协议、专业服务协议、雇佣合同、复杂的 MSA 以及软件许可证。
测试用例分类
| 类别 | 用例数量 | 评分器类型 | 测试内容 |
|---|---|---|---|
| 条款提取 | 20 | 确定性 | 查找并逐字提取特定条款 |
| 单项审查 | 15 | LLM 评判员 | 回答关于合同条款的解释性问题 |
| 多条款推理 | 10 | LLM 评判员 | 综合多个章节的信息 |
| 风险分类 | 5 | 确定性 | 将条款分类为标准/升高/高风险 |
| 缺失条款检测 | 5 | 确定性 | 识别哪些标准条款缺失 |
数据集扩展与验证
- 扩展方法: 通过在
datasets/contract-review/cases/目录下创建 JSON 文件来添加自定义测试用例。 - 验证命令:
claude-evals validate-dataset --dataset datasets/contract-review
评分器类型
-
确定性评分器
- 适用场景: 正确答案可通过编程方式验证时使用。
- 类型: 包括精确匹配、包含、条款存在性、分类、条款列表匹配、JSON 字段匹配、正则表达式匹配、不包含。
-
LLM 评判员
- 适用场景: 用于确定性检查无法捕捉质量的主观性任务。
- 实现: 使用 Claude Sonnet 作为评判员,采用带加权标准的结构化评分标准、基于参考的评分以及方差减少技术。
-
人工审核队列
- 功能: 当 LLM 评判员评分模糊或方差较高时,将不确定的案例导出为 JSONL 格式以供人工审核。
工具功能与集成
- CI/CD 集成: 提供 GitHub Actions 工作流示例,支持自动化评估和回归检查。
- 回归检测: 比较两次评估运行的结果,并根据回归严重程度(严重、高、中、低)提供部署建议。
- 成本护栏: 每个任务设有
max_budget_usd上限(默认 0.50 美元),防止评估运行期间成本失控。 - 退出代码:
0: 所有任务通过(或未发现回归)。1: 部分任务失败(或发现高/严重级别回归)。2: 套件错误(智能体崩溃、API 错误、预算超支)。3: 数据集验证错误。
限制说明
- 非实时监控: 此为离线评估工具,非生产环境可观测性工具。
- 无法检测隐蔽故障: 无法发现未在测试输出中显现的缺陷。
- 模型专一性: 该工具套件专为 Claude Agent SDK 构建,不支持非 Claude 模型。
- 非实时告警: 用于 CI 环境,而非作为监控守护进程。
许可证
- Apache 2.0 许可证。



