Skip to content

开始使用

核心概念

Oloproof 度量 AI 系统的方式,与一项研究度量任何事物的方式相同:同样的用例、同样的评判器、同样的随机种子,在每次变更时运行。它在测试套件之上增加的,是每个数字都附带其不确定性,而发布决策依据的是区间,而不是估计值。

证据链

共七个环节,每一个都是可以单独读取的记录。

环节含义
观测系统做了什么,以执行产物的形式捕获
度量评估器对其做出的评判
推断在明确的分母上、带区间的指标
诊断聚类为若干因素的失败,附带计数和假设
决策PASS、FAIL、INSUFFICIENT_EVIDENCE 或 MANUAL_REVIEW
建议一个发布动作,它是一个字段,而不是第五种状态
证据让其他人能够核查以上全部内容的溯源信息

每个环节都单独存储,并且可以独立复用。针对未变更的候选重新运行测试套件时,会复用已有的执行结果和评判结果,这就是为什么重复运行几乎没有成本。

四种决策状态

决策状态恰好有四种,其中一种正是这个产品存在的理由。

  • PASS —— 区间下界达到最低阈值。
  • FAIL —— 区间上界低于最低阈值。
  • INSUFFICIENT_EVIDENCE —— 两者都不满足,因此证据不足以做出决策。
  • MANUAL_REVIEW —— 需要询问人,因为方法拒绝给出答案。

对于最低阈值 T 和区间 [L, U]:当且仅当 L >= T 时通过,当且仅当 U < T 时失败,否则为证据不足。最高阈值规则与之完全对称。

INSUFFICIENT_EVIDENCE 不是一种软性失败。当测试套件太小,或效应太接近阈值而无法与噪声区分时,它是诚实的回答;把它当作通过,是评估误导运行它的团队最常见的一种方式。

什么不是决策状态

RUN_ERROR、PARTIAL 和 CANCELLED 描述的是一次运行发生了什么,而不是对一个系统做出了什么决策。出错的运行不带任何质量结果,把它呈现为失败,就等于告诉开发者他们的变更有问题,而实际情况是评测框架自己崩了。

这个区分在不方便的时候最为重要。一个把未评分用例计为零的指标,会把系统自身的服务中断当作质量失败算到模型头上——这是用该引擎评估一个线上助手时的真实发现。

分母

比率是一个数除以一个分母,而分母正是评估悄悄出错的地方。Oloproof 为每个指标记录四个计数——总数、符合条件数、已观测数和缺失数——无法度量的用例会被纳入界限,而不是被丢弃。

一个在系统开始出错时就缩小的分母,正是一个出错的系统报告分数上升的方式。

下一步

  • 编写测试套件:什么是用例、系统和评估器,以及如何声明它们。
  • CI 门控:把决策转化为退出码。
  • 评判器:LLM 评判模型在获准为发布做门控之前必须达到的要求。
  • 聚类用例:当用例彼此不独立时,会有什么不同。