Bangun dengan bukti.
Oloproof membantu tim mengevaluasi sistem AI dengan pengujian yang dapat diulang, diagnostik, dan bukti yang layak untuk dasar keputusan.
Berjalan di CI Anda. Bukti Anda tetap berada di mesin Anda.
Menguji prompt secara manual tidak bertahan di produksi.
Tim merilis perubahan model dan prompt setiap minggu. Memeriksa sekilas segelintir output di playground hampir tidak memberi tahu Anda apa pun tentang apa yang berubah, bagi siapa, atau apakah aman untuk dirilis.
Oloproof menggantinya dengan catatan yang terukur: kasus yang sama, juri yang sama, seed yang sama, dijalankan pada setiap perubahan.
Satu suntingan prompt memperbaiki satu kelas kegagalan dan diam-diam merusak kelas lain. Tidak ada yang menyadarinya sampai seorang pelanggan menyadarinya.
Pada sistem RAG yang aktif, sekitar satu dari sembilan kasus teramati mengubah putusannya di antara pengukuran yang identik.
Sebuah harness aktif menilai 13,8% respons HTTP 500 miliknya sebagai nol, sehingga gangguan layanan dibebankan kepada model. Rata-rata tidak dapat menopang sebuah keputusan.
Ketika tim risiko, tim hukum, atau seorang pelanggan menanyakan apa yang Anda uji, tangkapan layar di sebuah utas bukanlah jawaban.
Empat hal yang dibutuhkan setiap keputusan rilis.
Dataset berversi, seed yang dipatok, dan juri deklaratif. Setiap eksekusi dapat direproduksi persis, bahkan berbulan-bulan kemudian.
Delta dengan interval kepercayaan dan ambang batas, sehingga pergeseran dua poin tidak pernah disalahartikan sebagai kemenangan.
Kegagalan yang dikelompokkan menurut segmen, intent, dan jalur tool, masing-masing tertaut ke trace persis di baliknya.
Rekomendasi rilis dengan bukti terlampir — dapat diekspor untuk tinjauan, audit, dan pelanggan.
Setiap interval melewati garis nol putus-putus. Jika hanya membaca estimasi titik, reranker itu sudah akan dirilis.
Dibangun untuk tim yang harus mempertanggungjawabkan rilisnya.
Definisikan dataset, juri, dan ambang batas di version control. Tinjau perubahan evaluasi seperti Anda meninjau kode.
Pemeriksaan programatis, juri LLM, classifier terlatih yang menilai teks di mesin Anda sendiri, dan label manusia dalam satu pipeline. Kesepakatan setiap juri dengan manusia diukur dengan sebuah interval, dan juri yang belum melampaui ambangnya tidak dapat memutuskan rilis.
Gagalkan pull request ketika sebuah metrik melewati ambang batasnya. Gerbang melaporkan kasus mana yang bergeser dan seberapa besar.
Setiap skor tertaut ke input, output, panggilan tool, konteks yang diambil, dan alasan juri. Tidak ada yang menjadi kotak hitam.
Kualitas tidak pernah menjadi satu-satunya sumbu. Pantau pengeluaran dan latensi ekor di samping ketepatan, di bawah ambang batas yang sama.
Bagikan eksekusi, diagnostik, dan rekomendasi tanpa mengubah keputusan terukur yang dikandungnya.
Tiga langkah, lalu berjalan dengan sendirinya.
Bawa kasus Anda sendiri sebagai file JSONL. Deklarasikan juri dan ambang batas yang harus dilampaui sebuah rilis.
Satu perintah secara lokal, perintah yang sama di CI. Perubahan prompt, model, retrieval, dan tool semuanya diperlakukan sama.
Baca delta-nya, buka trace yang gagal, dan pertahankan bukti tetap terlampir pada keputusan yang Anda buat.
Setiap angka dapat ditelusuri kembali ke sebuah kasus.
Eksekusi bersifat imutabel dan bertanggal. Dataset, prompt, juri, dan konfigurasi diberi versi bersama-sama, sehingga hasil apa pun dapat direproduksi atau dipertanyakan.
Jika membaca estimasi titik, reranker memberikan +12,7 poin hit@1. Jika dibaca dengan jujur, panel ini tidak dapat menyatakan apakah reranker membantu atau merugikan.
Yang belum ada, untuk saat ini.
Semua hal di bawah ini benar pada hari Anda membacanya.
- 01
Tidak ada deployment terhosting yang dapat Anda daftari. Akses hanya melalui undangan.
- 02
Tidak ada harga. Unitnya adalah kasus yang dievaluasi; tarifnya belum ditetapkan.
- 03
Tidak ada audit keamanan, tidak ada laporan SOC 2, dan tidak ada DPA. Tidak ada pelanggan dan tidak ada studi kasus, sehingga tidak ada yang dikutip.
- 04
Notifikasi hanya lewat email: tidak ada Slack, pager, atau webhook. Tidak ada dokumen laporan. Eksekusi dibaca di workbench atau diekspor sebagai bundel.
- 05
Evaluasi produksi belum dibangun: trace diterima di mesin Anda sendiri, dan belum ada yang menilai lalu lintas produksi.
- 06
Produk ini telah dijalankan secara end-to-end terhadap tepat satu sistem pihak ketiga yang aktif. Itulah bukti di atas, dan itu hanya satu sistem.
Ukur sebelum Anda merilis.
Bawa satu sistem dan satu dataset. Mulailah dengan satu eksekusi lokal dan simpan buktinya di mesin Anda.