Skip to content
AI システムの評価

エビデンスに基づいて構築する。

Oloproof は、再現可能なテスト、診断、そして意思決定に使えるエビデンスによって、チームが AI システムを評価できるようにします。

お使いの CI で実行されます。エビデンスはお手元のマシンに残ります。

oloproof / compare · olotalk-docs-assistant
概要 比較 診断 エビデンス
ベースライン
olotalk docs assistant · リランク オフ
候補
olotalk docs assistant · リランク オン
データセット
olotalk golden panel · 58 ケース
メトリクス ベースライン 候補 対応あり Δ 95% 信頼区間 状態
page_hit_1 0.618 0.745 +6.2 [-36.3, +45.5] — 結論なし
page_hit_3 0.683 0.742 +3.7 [-73.9, +76.2] — 結論なし
answer_correct 0.685 0.760 +6.5 [-39.4, +48.4] — 結論なし
page_hit_1 観測値 55 / 58 51 / 58 −4 区間内 ! 範囲付き
page_hit_3 観測値 41 / 58 31 / 58 −10 区間内 ! 範囲付き
answer_correct 観測値 54 / 58 50 / 58 −4 区間内 ! 範囲付き
なぜ評価か

手作業のプロンプトテストは本番環境では通用しません。

チームはモデルやプロンプトの変更を毎週リリースします。プレイグラウンドで一握りの出力をスポットチェックしても、何が、誰にとって変わったのか、そしてリリースしても安全なのかについては、ほとんど何もわかりません。

Oloproof はそれを測定された記録に置き換えます。同じケース、同じジャッジ、同じシードを、変更のたびに実行します。

01
気づかれないリグレッション

プロンプトの修正が、ある種類の失敗を直し、別の種類をひそかに壊します。顧客が気づくまで誰も気づきません。

02
再現できない結果

稼働中の RAG システムでは、同一の測定を繰り返すあいだに、観測されたケースのおよそ 9 件に 1 件で判定が変わりました。

03
意味のないスコア

ある稼働中のハーネスは、全体の 13.8% を占める HTTP 500 をゼロとして採点し、障害をモデルの責任にしていました。平均値では意思決定を支えられません。

04
示せる記録がない

リスク管理部門、法務、あるいは顧客に何をテストしたのかと尋ねられたとき、スレッドに貼られたスクリーンショットは答えになりません。

主要機能

あらゆるリリース判断に必要な 4 つのこと。

測定
再現可能な評価

バージョン管理されたデータセット、固定されたシード、宣言的なジャッジ。どの実行も、数か月後でも正確に再現できます。

比較
ベースライン対候補

差分には信頼区間としきい値が付くため、2 ポイントの変動が改善と取り違えられることはありません。

診断
平均ではなく失敗モード

セグメント、意図、ツールパスごとにクラスタ化された失敗。それぞれが根拠となるトレースに正確にリンクされています。

判断
意思決定に使える記録

エビデンスを添えたリリース推奨。レビュー、監査、顧客向けにエクスポートできます。

診断失敗した 23 ケース、正解コンテキスト
未解決:正解コンテキストでも決着せず11 ケース
生成の失敗:コンテキストは正しく、回答が誤り7 ケース
検索の取りこぼし:回答は到達可能だが取得されず5 ケース
リランクありとなしの差95% 区間、ポイント
hit@1
hit@3
正答

どの区間も破線のゼロラインをまたいでいます。点推定値だけで読んでいたら、リランカーはリリースされていたでしょう。

プラットフォーム

リリースの根拠を示す必要があるチームのために。

コードとしての評価スイート

データセット、ジャッジ、しきい値をバージョン管理の中で定義します。評価の変更を、コードと同じようにレビューできます。

監査できるジャッジ

プログラムによるチェック、LLM ジャッジ、お手元のマシンでテキストを採点する学習済み分類器、そして人手のラベルを 1 つのパイプラインで扱えます。各ジャッジと人間との一致度は区間付きで測定され、基準を満たしていないジャッジはリリースを判断できません。

CI でのリグレッションゲート

メトリクスがしきい値を越えたらプルリクエストを失敗させます。ゲートは、どのケースがどれだけ動いたかを報告します。

トレース単位のエビデンス

すべてのスコアは、入力、出力、ツール呼び出し、取得されたコンテキスト、ジャッジの根拠にリンクされます。ブラックボックスはありません。

コストとレイテンシの予算

品質だけが軸ではありません。支出とテールレイテンシを、正確さと並べて同じしきい値のもとで追跡します。

判断を必要とする人のためのエビデンス

実行、診断、推奨を、そこに含まれる測定済みの判断を変えることなく共有できます。

仕組み

3 つのステップの後は、自動で動きます。

1
スイートを定義する

独自のケースを JSONL ファイルで用意します。ジャッジと、リリースが満たすべきしきい値を宣言します。

2
変更のたびに実行する

ローカルでは 1 つのコマンド、CI でも同じコマンド。プロンプト、モデル、検索、ツールの変更はすべて同じように扱われます。

3
エビデンスに基づいて判断する

差分を読み、失敗したトレースを開き、下した判断にエビデンスを添えたままにしておきます。

~/olodemo · oloproof init 実行後
 oloproof run
Run run_01M3B0CCPA0JFQQ7HWRKYNWFJC [DECIDED/COMPLETE]
Gate: ALLOW (exit 0)

  Rule         Metric       State  Reasons
  label-floor  exact_label  PASS   lower_bound_meets_minimum

  Metric       Estimate  Interval          N
  exact_label  100.0%    [88.4%, 100.0%]   30 / 30 observed · 0 missing

Cache: execution 0 hit/30 miss; judgment 0 hit/30 miss

 oloproof run
Run run_01M3B0CXTTVPTBXAFK3WNGFX42 [DECIDED/COMPLETE]
Gate: ALLOW (exit 0)
Cache: execution 30 hit/0 miss; judgment 0 hit/30 miss
引き渡せるエビデンス

すべての数値はケースまでさかのぼれます。

実行は不変で、日付が記録されます。データセット、プロンプト、ジャッジ、設定はまとめてバージョン管理されるため、どの結果も再現することも、異議を唱えて検証することもできます。

不変
実行、完全な来歴付き
セルフホスト
お客様のインフラ上で動作し、データはお客様のもとに残ります
範囲付き
欠測ケースは区間に織り込み、決して捨てません

点推定値で読めば、リランカーは hit@1 を +12.7 ポイント押し上げます。誠実に読めば、このパネルではそれが役立つのか害になるのか判断できません。

稼働中の RAG システムに対する Oloproof、2026年9月22日
Oloproof
エビデンスバンドル
oloproof export RUN_ID
run.json実行と、そのスイート、システム、評価器
cases.jsonl全ケース:入力、出力、判定、ダイジェスト
diagnoses.jsonl介入と、それによって回復したもの
signoffs.jsonlブロックされたゲートに反してリリースしたのは誰か、そしてその理由
エクスポートされたエビデンスバンドル:実行と、その数値の背後にあるすべてのケースを、手元に保管できるファイルとして。
同じ規律を、ここにも

まだできていないこと。

以下の内容はすべて、お読みになっている日の時点で事実です。

  1. 01

    登録して使えるホスト型のデプロイメントはありません。アクセスは招待制です。

  2. 02

    料金体系はありません。単位は評価されたケースですが、料率は決まっていません。

  3. 03

    セキュリティ監査も、SOC 2 報告書も、DPA もありません。顧客も導入事例もないため、引用しているものはありません。

  4. 04

    通知はメールのみです。Slack、ページャー、Webhook はありません。レポート文書はありません。実行はワークベンチで閲覧するか、バンドルとしてエクスポートします。

  5. 05

    本番評価は実装されていません。トレースは自分のマシンで受信され、本番トラフィックを採点するものはまだありません。

  6. 06

    エンドツーエンドで実行した対象は、稼働中のサードパーティシステムちょうど 1 つだけです。それが上に示したエビデンスであり、システムは 1 つです。

リリースする前に測定を。

システムを 1 つ、データセットを 1 つ用意してください。ローカルでの 1 回の実行から始め、エビデンスはお手元のマシンに保管します。