Mulai
Konsep inti
Oloproof mengukur sistem AI dengan cara sebuah studi mengukur apa pun: kasus yang sama, juri yang sama, seed yang sama, dijalankan pada setiap perubahan. Yang ditambahkannya pada suite pengujian adalah bahwa setiap angka datang bersama ketidakpastiannya, dan keputusan rilis diambil berdasarkan interval, bukan estimasi.
Rantainya
Tujuh mata rantai, dan masing-masing adalah rekaman yang dapat Anda baca secara terpisah.
| Mata rantai | Apa itu |
|---|---|
| Observasi | Apa yang dilakukan sistem, ditangkap sebagai artefak eksekusi |
| Pengukuran | Apa yang dinilai evaluator tentangnya |
| Inferensi | Metrik dengan interval, atas penyebut yang dinyatakan |
| Diagnosis | Kegagalan yang dikelompokkan menjadi faktor, dengan hitungan dan asumsi |
| Keputusan | PASS, FAIL, INSUFFICIENT_EVIDENCE atau MANUAL_REVIEW |
| Rekomendasi | Tindakan rilis, yang merupakan sebuah field dan bukan status kelima |
| Bukti | Provenans yang memungkinkan orang lain memeriksa semuanya |
Setiap mata rantai disimpan secara terpisah dan dapat digunakan ulang secara independen. Menjalankan ulang suite terhadap kandidat yang tidak berubah akan memakai kembali hasil eksekusi dan penilaian yang sudah ada, itulah sebabnya eksekusi yang diulang hampir tidak memakan biaya.
Empat status keputusan
Jumlahnya tepat empat, dan salah satunya adalah alasan produk ini ada.
- PASS — batas bawah interval melampaui ambang batas minimum.
- FAIL — batas atas interval berada di bawahnya.
- INSUFFICIENT_EVIDENCE — tidak keduanya, sehingga bukti tidak menghasilkan keputusan.
- MANUAL_REVIEW — seseorang diminta memutuskan, karena metodenya menolak memberi jawaban.
Untuk ambang batas minimum T dan interval [L, U]: lolos jika dan hanya jika L >= T, gagal jika dan hanya jika U < T, selain itu tidak cukup. Aturan ambang batas maksimum adalah cerminannya.
INSUFFICIENT_EVIDENCE bukanlah kegagalan ringan. Status ini adalah jawaban jujur ketika suite terlalu kecil atau efeknya terlalu dekat dengan ambang batas untuk dipisahkan dari noise, dan memperlakukannya sebagai lolos adalah satu-satunya cara paling umum sebuah evaluasi menyesatkan tim yang menjalankannya.
Apa yang bukan status keputusan
RUN_ERROR, PARTIAL dan CANCELLED menjelaskan apa yang terjadi pada sebuah eksekusi, bukan apa yang diputuskan tentang sebuah sistem. Eksekusi yang mengalami error sama sekali tidak membawa hasil kualitas, dan menyajikannya sebagai kegagalan memberi tahu pengembang bahwa perubahannya buruk, padahal kenyataannya harness-lah yang tumbang.
Perbedaan ini paling penting justru ketika merepotkan. Metrik yang menghitung kasus yang tidak dinilai sebagai nol membebankan gangguan layanan sistem itu sendiri kepada model sebagai kegagalan kualitas, dan ini adalah temuan nyata dari menjalankan mesin ini terhadap asisten yang aktif.
Penyebut
Sebuah rasio adalah angka atas sebuah penyebut, dan penyebut adalah tempat evaluasi keliru secara diam-diam. Oloproof merekam empat hitungan untuk setiap metrik — total, eligible, teramati, dan hilang — dan kasus yang tidak dapat diukur dibatasi, bukan dibuang.
Penyebut yang menyusut ketika sistem mulai gagal adalah cara sistem yang gagal melaporkan skor yang naik.
Langkah selanjutnya
- Menulis suite: apa itu kasus, sistem, dan evaluator, serta cara mendeklarasikannya.
- Gerbang CI: mengubah keputusan menjadi kode keluar.
- Juri: apa yang harus dilampaui juri LLM sebelum boleh menjadi gerbang rilis.
- Kasus berkelompok: apa yang berubah ketika kasus-kasus tidak independen.