Skip to content
Evaluasi sistem AI

Bangun dengan bukti.

Oloproof membantu tim mengevaluasi sistem AI dengan pengujian yang dapat diulang, diagnostik, dan bukti yang layak untuk dasar keputusan.

Berjalan di CI Anda. Bukti Anda tetap berada di mesin Anda.

oloproof / compare · olotalk-docs-assistant
Ringkasan Bandingkan Diagnostik Bukti
BASELINE
olotalk docs assistant · rerank nonaktif
KANDIDAT
olotalk docs assistant · rerank aktif
DATASET
olotalk golden panel · 58 kasus
METRIK BASELINE KANDIDAT Δ BERPASANGAN IK 95% STATUS
page_hit_1 0.618 0.745 +6.2 [-36.3, +45.5] — Tidak konklusif
page_hit_3 0.683 0.742 +3.7 [-73.9, +76.2] — Tidak konklusif
answer_correct 0.685 0.760 +6.5 [-39.4, +48.4] — Tidak konklusif
page_hit_1 teramati 55 / 58 51 / 58 −4 dalam interval ! Dibatasi
page_hit_3 teramati 41 / 58 31 / 58 −10 dalam interval ! Dibatasi
answer_correct teramati 54 / 58 50 / 58 −4 dalam interval ! Dibatasi
MENGAPA EVALUASI

Menguji prompt secara manual tidak bertahan di produksi.

Tim merilis perubahan model dan prompt setiap minggu. Memeriksa sekilas segelintir output di playground hampir tidak memberi tahu Anda apa pun tentang apa yang berubah, bagi siapa, atau apakah aman untuk dirilis.

Oloproof menggantinya dengan catatan yang terukur: kasus yang sama, juri yang sama, seed yang sama, dijalankan pada setiap perubahan.

01
Regresi diam-diam

Satu suntingan prompt memperbaiki satu kelas kegagalan dan diam-diam merusak kelas lain. Tidak ada yang menyadarinya sampai seorang pelanggan menyadarinya.

02
Hasil yang tidak dapat diulang

Pada sistem RAG yang aktif, sekitar satu dari sembilan kasus teramati mengubah putusannya di antara pengukuran yang identik.

03
Skor tanpa makna

Sebuah harness aktif menilai 13,8% respons HTTP 500 miliknya sebagai nol, sehingga gangguan layanan dibebankan kepada model. Rata-rata tidak dapat menopang sebuah keputusan.

04
Tidak ada catatan untuk ditunjukkan

Ketika tim risiko, tim hukum, atau seorang pelanggan menanyakan apa yang Anda uji, tangkapan layar di sebuah utas bukanlah jawaban.

KEMAMPUAN INTI

Empat hal yang dibutuhkan setiap keputusan rilis.

UKUR
Evaluasi yang dapat diulang

Dataset berversi, seed yang dipatok, dan juri deklaratif. Setiap eksekusi dapat direproduksi persis, bahkan berbulan-bulan kemudian.

BANDINGKAN
Baseline vs kandidat

Delta dengan interval kepercayaan dan ambang batas, sehingga pergeseran dua poin tidak pernah disalahartikan sebagai kemenangan.

DIAGNOSIS
Mode kegagalan, bukan rata-rata

Kegagalan yang dikelompokkan menurut segmen, intent, dan jalur tool, masing-masing tertaut ke trace persis di baliknya.

PUTUSKAN
Catatan yang layak untuk dasar keputusan

Rekomendasi rilis dengan bukti terlampir — dapat diekspor untuk tinjauan, audit, dan pelanggan.

Diagnostik23 kasus gagal, konteks gold
Belum terselesaikan: konteks gold tidak menuntaskannya11 kasus
Kegagalan generasi: konteks benar, jawaban salah7 kasus
Retrieval meleset: jawaban dapat dijangkau, tetapi tidak diambil5 kasus
Rerank aktif dikurangi nonaktifinterval 95%, poin
hit@1
hit@3
benar

Setiap interval melewati garis nol putus-putus. Jika hanya membaca estimasi titik, reranker itu sudah akan dirilis.

PLATFORM

Dibangun untuk tim yang harus mempertanggungjawabkan rilisnya.

Suite evaluasi sebagai kode

Definisikan dataset, juri, dan ambang batas di version control. Tinjau perubahan evaluasi seperti Anda meninjau kode.

Juri yang dapat Anda audit

Pemeriksaan programatis, juri LLM, classifier terlatih yang menilai teks di mesin Anda sendiri, dan label manusia dalam satu pipeline. Kesepakatan setiap juri dengan manusia diukur dengan sebuah interval, dan juri yang belum melampaui ambangnya tidak dapat memutuskan rilis.

Gerbang regresi di CI

Gagalkan pull request ketika sebuah metrik melewati ambang batasnya. Gerbang melaporkan kasus mana yang bergeser dan seberapa besar.

Bukti tingkat trace

Setiap skor tertaut ke input, output, panggilan tool, konteks yang diambil, dan alasan juri. Tidak ada yang menjadi kotak hitam.

Anggaran biaya dan latensi

Kualitas tidak pernah menjadi satu-satunya sumbu. Pantau pengeluaran dan latensi ekor di samping ketepatan, di bawah ambang batas yang sama.

Bukti bagi orang yang membutuhkan keputusannya

Bagikan eksekusi, diagnostik, dan rekomendasi tanpa mengubah keputusan terukur yang dikandungnya.

CARA KERJA

Tiga langkah, lalu berjalan dengan sendirinya.

1
Definisikan suite

Bawa kasus Anda sendiri sebagai file JSONL. Deklarasikan juri dan ambang batas yang harus dilampaui sebuah rilis.

2
Jalankan pada setiap perubahan

Satu perintah secara lokal, perintah yang sama di CI. Perubahan prompt, model, retrieval, dan tool semuanya diperlakukan sama.

3
Putuskan dengan bukti

Baca delta-nya, buka trace yang gagal, dan pertahankan bukti tetap terlampir pada keputusan yang Anda buat.

~/olodemo · setelah oloproof init
 oloproof run
Run run_01M3B0CCPA0JFQQ7HWRKYNWFJC [DECIDED/COMPLETE]
Gate: ALLOW (exit 0)

  Rule         Metric       State  Reasons
  label-floor  exact_label  PASS   lower_bound_meets_minimum

  Metric       Estimate  Interval          N
  exact_label  100.0%    [88.4%, 100.0%]   30 / 30 observed · 0 missing

Cache: execution 0 hit/30 miss; judgment 0 hit/30 miss

 oloproof run
Run run_01M3B0CXTTVPTBXAFK3WNGFX42 [DECIDED/COMPLETE]
Gate: ALLOW (exit 0)
Cache: execution 30 hit/0 miss; judgment 0 hit/30 miss
BUKTI YANG DAPAT ANDA SERAHKAN

Setiap angka dapat ditelusuri kembali ke sebuah kasus.

Eksekusi bersifat imutabel dan bertanggal. Dataset, prompt, juri, dan konfigurasi diberi versi bersama-sama, sehingga hasil apa pun dapat direproduksi atau dipertanyakan.

Imutabel
eksekusi, dengan silsilah lengkap
Self-hosted
di infrastruktur Anda, data Anda tetap milik Anda
Dibatasi
kasus yang hilang diperhitungkan, tidak pernah dibuang

Jika membaca estimasi titik, reranker memberikan +12,7 poin hit@1. Jika dibaca dengan jujur, panel ini tidak dapat menyatakan apakah reranker membantu atau merugikan.

Oloproof terhadap sistem RAG yang aktif, 22 September 2026
Oloproof
Bundel bukti
oloproof export RUN_ID
run.jsoneksekusi, suite-nya, sistem, dan evaluatornya
cases.jsonlsetiap kasus: input, output, penilaian, digest
diagnoses.jsonlintervensi dan apa yang dipulihkannya
signoffs.jsonlsiapa yang merilis meskipun gerbangnya memblokir, dan alasannya
Bundel bukti yang diekspor: eksekusi dan setiap kasus di balik angka-angkanya, sebagai file yang Anda simpan.
DISIPLIN YANG SAMA, DITERAPKAN DI SINI

Yang belum ada, untuk saat ini.

Semua hal di bawah ini benar pada hari Anda membacanya.

  1. 01

    Tidak ada deployment terhosting yang dapat Anda daftari. Akses hanya melalui undangan.

  2. 02

    Tidak ada harga. Unitnya adalah kasus yang dievaluasi; tarifnya belum ditetapkan.

  3. 03

    Tidak ada audit keamanan, tidak ada laporan SOC 2, dan tidak ada DPA. Tidak ada pelanggan dan tidak ada studi kasus, sehingga tidak ada yang dikutip.

  4. 04

    Notifikasi hanya lewat email: tidak ada Slack, pager, atau webhook. Tidak ada dokumen laporan. Eksekusi dibaca di workbench atau diekspor sebagai bundel.

  5. 05

    Evaluasi produksi belum dibangun: trace diterima di mesin Anda sendiri, dan belum ada yang menilai lalu lintas produksi.

  6. 06

    Produk ini telah dijalankan secara end-to-end terhadap tepat satu sistem pihak ketiga yang aktif. Itulah bukti di atas, dan itu hanya satu sistem.

Ukur sebelum Anda merilis.

Bawa satu sistem dan satu dataset. Mulailah dengan satu eksekusi lokal dan simpan buktinya di mesin Anda.