Skip to content

ドキュメント

スイートを書く。それでゲートする。

Oloproof は点推定値ではなく信頼区間に基づいてリリースを判断します。これらのページでは、何を測定するかの宣言、判断を終了コードに変換する方法、そして LLM ジャッジが何かをゲートする前に満たすべき条件を扱います。

クイックスタートエンジンをインストールし、プロジェクトの雛形を作成して、ご自身のマシン上で最初の実行とゲートの判断を得ます。push しない限り、何もそのマシンの外には出ません。基本概念Oloproof は、研究が何かを測定するのと同じやり方で AI システムを測定します。同じケース、同じジャッジ、同じシードを、変更のたびに実行します。テストスイートに加わるのは、すべての数値がその不確かさとともに示され、リリースの判断が推定値ではなく区間に基づいて行われるという点です。スイートを書くスイートは 2 つのファイルと 1 つのデータセットでできています。oloproof init は両方の雛形を作成し、その雛形にはコメントが付いています。最初のオンボーディングの検証で、機能の欠落ではなく文字列 1 つの欠落のために 4 回の試行が失われたからです。Python APICLI にできることは、すべてライブラリにもできます。評価を設定ファイルの横ではなく、スクリプト、ノートブック、テストスイートの中に置きたいときに使います。Recording what a system didA system's output is what an evaluator reads by default. Everything else it did — the prompt it built, the passages it retrieved, the tools it called, the tokens it spent — is recorded alongside the output as artifacts and usage, and every artifact is stored content-addressed with the execution that produced it.進捗と並行処理稼働中のモデルに対するスイートには数分かかり、その大半はモデルを待つ時間です。このページでは、Oloproof が同時に処理する呼び出しの数、呼び出しの実行中に表示されるもの、そして判断できなかったルールに決着をつけるにはあとどれだけ実行すればよいかを知る方法を扱います。Gating CIA gate compares measured evidence against a threshold you declared, and exits with a code your CI understands. The decision is made on the interval, not on the estimate.CI での実行CI のゲート では、リリースポリシーと各終了コードの意味を説明しています。このページで扱うのは CI ジョブの内部で起きる部分です。そこに Oloproof をインストールする方法、ジョブの実行中にエビデンスがどこに置かれるか、表をパースせずに結果を読む方法、そしてプルリクエストをその対象ブランチと比較する方法です。Comparing a candidate to a baselineThe workflow the rest of this product exists for: you changed something, and you want to know whether it helped. A comparison pairs two runs case by case and reports the difference with an interval, so a two-point move is never mistaken for a win.比較ルール候補をベースラインと比較する ではワークフローを紹介しています。このページは、比較の判定に使われるルールのリファレンスです。どの種類があるか、それぞれが何を問うか、マージンが何の単位で測られるか、そしてルールが読む区間を何が動かすかを説明します。クラスタ化されたケース区間の計算の多くは、すべてのケースが他のすべてのケースから独立していることを前提にしています。1 つの会話の 3 つのターンは独立ではありません。会話がうまくいかなくなると、3 つとも失敗しがちです。それらを独立として扱うスイートは、エビデンスが裏付けるよりも狭い区間を報告し、ゲートがそれにもとづいて合格してしまうことがあります。スライス全体の割合が安定しているあいだに、スイートの一部が崩れていることがあります。スライスとは、スイートのうち宣言された一部分を単独で測定するものであり、それによってその崩れが見えるようになります。スライスには 2 つの規律が伴います。スイートの多くの部分を眺めることこそ、評価がノイズを見つけてそれを発見と呼んでしまう経路だからです。JudgesAn LLM judge is one kind of evaluator, not all of them. Oloproof has three kinds — deterministic, LLM judge, and custom — and the rules on this page are about the second, because a model's verdict is the one that needs measuring against a human's.RAG の評価検索拡張 (retrieval-augmented) による回答が誤る理由は 4 つあります。正しいパッセージがそもそも取得されなかった、取得されたが順位が低すぎた、十分高い順位だったがコンテキストから落とされた、あるいはモデルに届いたのにモデルがそれでも誤った、のいずれかです。単一の正解率の数値では、これらを区別できません。Oloproof は RAG システムを、中身が見える 2 つのステージとして実行し、それぞれを測定し、失敗したケースを制御された変更のもとで再実行して、どの理由に当てはまるかを突き止めます。エージェントとツールOloproof はエージェントを動かしません。あなたのエージェントが自身のループを回し、自身のツールを呼び出し、起きたことを agent_trajectory/v1 アーティファクトとして記録します。エージェントのメトリクスはすべてその記録から読み取られるため、記録こそが統合のすべてです。分類器と回帰器予測モデルは他のシステムと同じように評価されます。呼び出し可能オブジェクトが各ケースに対して予測を返し、評価器がそれを読みます。変わるのは分母です。正解率 (accuracy)、再現率 (recall)、適合率 (precision) は、3 つの異なる行の集合に対する 3 つの割合であり、モデルはそのうちの 1 つでは良く見えても、ビジネスが問うている問いには答えられていないことがあります。通知合格した実行は誰にも通知しません。Oloproof が通知を送るとき、それは何かが判断を必要としているか、何かが間もなく機能しなくなることを意味します。ゲートがブロックしたリリース、終了したマネージド実行、残り少なくなった利用枠などです。エラーこのページが存在する理由となる区別があります。不合格になった実行とエラーになった実行は別のものであり、一方を他方として示すと、実際にはハーネスが倒れただけなのに、開発者にその変更が悪いと伝えてしまいます。CLI リファレンスOloproof が登録しているすべてのコマンドと、それぞれの動作です。どのコマンドも --help を受け付け、これらの要約の元になっている全文を表示します。