Skip to content

はじめる

基本概念

Oloproof は、研究が何かを測定するのと同じやり方で AI システムを測定します。同じケース、同じジャッジ、同じシードを、変更のたびに実行します。テストスイートに加わるのは、すべての数値がその不確かさとともに示され、リリースの判断が推定値ではなく区間に基づいて行われるという点です。

チェーン

7 つのつながりがあり、それぞれが単独で読めるレコードです。

つながり内容
観測システムが行ったこと。実行アーティファクトとして記録されます
測定それについて評価器が判定したこと
推論明示された分母にもとづく、区間付きのメトリクス
診断要因ごとにクラスタ化された失敗。件数と仮定を伴います
判断PASS、FAIL、INSUFFICIENT_EVIDENCE、MANUAL_REVIEW のいずれか
推奨リリースアクション。これはフィールドであり、5 つ目の状態ではありません
エビデンス他の誰かがそのすべてを確認できるようにする来歴

各つながりは別々に保存され、独立して再利用できます。変更のない候補に対してスイートを再実行すると、すでにある実行結果と判定が再利用されます。そのため、繰り返しの実行にはほとんどコストがかかりません。

4 つの判断状態

判断状態はちょうど 4 つあり、そのうちの 1 つがこの製品の存在理由です。

  • PASS: 区間の下限が最小しきい値以上である。
  • FAIL: 区間の上限がしきい値を下回っている。
  • INSUFFICIENT_EVIDENCE: そのどちらでもなく、エビデンスが判断を下さない。
  • MANUAL_REVIEW: 手法が回答を控えたため、人に判断が求められる。

最小しきい値 T と区間 [L, U] について、L >= T のときに限り合格、U < T のときに限り不合格、それ以外はエビデンス不十分です。最大しきい値のルールはその鏡像です。

INSUFFICIENT_EVIDENCE は緩やかな不合格ではありません。スイートが小さすぎる、あるいは効果がしきい値に近すぎてノイズと区別できないときの誠実な答えです。これを合格として扱うことは、評価がそれを実行するチームを誤らせる最もよくある道筋です。

判断状態ではないもの

RUN_ERROR、PARTIAL、CANCELLED は、実行に何が起きたかを表すものであり、システムについて何が判断されたかを表すものではありません。エラーになった実行は品質の結果をまったく持たず、それを不合格として示すと、実際にはハーネスが倒れただけなのに、開発者にその変更が悪いと伝えてしまいます。

この区別が最も重要になるのは、それが不都合なときです。採点されなかったケースをゼロとして数えるメトリクスは、システム自身の障害を品質の失敗としてモデルの責任にします。これは、このエンジンを稼働中のアシスタントに対して実行して得られた実際の知見です。

分母

比率とは分母の上に立つ数値であり、評価がひそかに誤るのは分母の部分です。Oloproof はすべてのメトリクスについて 4 つの件数(全体、対象、観測、欠測)を記録し、測定できなかったケースは除外されるのではなく、区間の範囲に織り込まれます。

システムが失敗し始めたときに縮む分母は、失敗しているシステムがスコアの上昇を報告する仕組みそのものです。

次に読むページ

  • スイートを書く: ケース、システム、評価器とは何か、そしてそれらをどう宣言するか。
  • CI のゲート: 判断を終了コードに変換する。
  • ジャッジ: LLM ジャッジがリリースをゲートする前に満たすべき条件。
  • クラスタ化されたケース: ケースが独立でないときに何が変わるか。