开始使用
核心概念
Oloproof 度量 AI 系统的方式,与一项研究度量任何事物的方式相同:同样的用例、同样的评判器、同样的随机种子,在每次变更时运行。它在测试套件之上增加的,是每个数字都附带其不确定性,而发布决策依据的是区间,而不是估计值。
证据链
共七个环节,每一个都是可以单独读取的记录。
| 环节 | 含义 |
|---|---|
| 观测 | 系统做了什么,以执行产物的形式捕获 |
| 度量 | 评估器对其做出的评判 |
| 推断 | 在明确的分母上、带区间的指标 |
| 诊断 | 聚类为若干因素的失败,附带计数和假设 |
| 决策 | PASS、FAIL、INSUFFICIENT_EVIDENCE 或 MANUAL_REVIEW |
| 建议 | 一个发布动作,它是一个字段,而不是第五种状态 |
| 证据 | 让其他人能够核查以上全部内容的溯源信息 |
每个环节都单独存储,并且可以独立复用。针对未变更的候选重新运行测试套件时,会复用已有的执行结果和评判结果,这就是为什么重复运行几乎没有成本。
四种决策状态
决策状态恰好有四种,其中一种正是这个产品存在的理由。
- PASS —— 区间下界达到最低阈值。
- FAIL —— 区间上界低于最低阈值。
- INSUFFICIENT_EVIDENCE —— 两者都不满足,因此证据不足以做出决策。
- MANUAL_REVIEW —— 需要询问人,因为方法拒绝给出答案。
对于最低阈值 T 和区间 [L, U]:当且仅当 L >= T 时通过,当且仅当 U < T 时失败,否则为证据不足。最高阈值规则与之完全对称。
INSUFFICIENT_EVIDENCE 不是一种软性失败。当测试套件太小,或效应太接近阈值而无法与噪声区分时,它是诚实的回答;把它当作通过,是评估误导运行它的团队最常见的一种方式。
什么不是决策状态
RUN_ERROR、PARTIAL 和 CANCELLED 描述的是一次运行发生了什么,而不是对一个系统做出了什么决策。出错的运行不带任何质量结果,把它呈现为失败,就等于告诉开发者他们的变更有问题,而实际情况是评测框架自己崩了。
这个区分在不方便的时候最为重要。一个把未评分用例计为零的指标,会把系统自身的服务中断当作质量失败算到模型头上——这是用该引擎评估一个线上助手时的真实发现。
分母
比率是一个数除以一个分母,而分母正是评估悄悄出错的地方。Oloproof 为每个指标记录四个计数——总数、符合条件数、已观测数和缺失数——无法度量的用例会被纳入界限,而不是被丢弃。
一个在系统开始出错时就缩小的分母,正是一个出错的系统报告分数上升的方式。
下一步
- 编写测试套件:什么是用例、系统和评估器,以及如何声明它们。
- CI 门控:把决策转化为退出码。
- 评判器:LLM 评判模型在获准为发布做门控之前必须达到的要求。
- 聚类用例:当用例彼此不独立时,会有什么不同。