Skip to content

Dokumentasi

Tulis suite. Jadikan gerbang.

Oloproof memutuskan rilis berdasarkan interval kepercayaan, bukan estimasi titik. Halaman-halaman ini membahas cara mendeklarasikan apa yang diukur, mengubah keputusan menjadi kode keluar (exit code), dan apa yang harus dilampaui juri LLM sebelum boleh menjadi gerbang bagi apa pun.

Mulai cepatPasang mesinnya, buat kerangka proyek, lalu dapatkan eksekusi pertama dan keputusan gerbang di mesin Anda sendiri. Tidak ada yang keluar dari mesin itu kecuali Anda melakukan push.Konsep intiOloproof mengukur sistem AI dengan cara sebuah studi mengukur apa pun: kasus yang sama, juri yang sama, seed yang sama, dijalankan pada setiap perubahan. Yang ditambahkannya pada suite pengujian adalah bahwa setiap angka datang bersama ketidakpastiannya, dan keputusan rilis diambil berdasarkan interval, bukan estimasi.Menulis suiteSuite terdiri dari dua file dan sebuah dataset. oloproof init membuat kerangka keduanya, dan kerangka itu diberi komentar karena uji coba onboarding pertama kehilangan empat percobaan akibat sebuah string yang hilang, bukan fitur yang hilang.API PythonSemua yang dilakukan CLI juga dapat dilakukan oleh library-nya. Gunakan library ini ketika evaluasi seharusnya berada di dalam skrip, notebook, atau suite pengujian, bukan di samping file konfigurasi.Recording what a system didA system's output is what an evaluator reads by default. Everything else it did — the prompt it built, the passages it retrieved, the tools it called, the tokens it spent — is recorded alongside the output as artifacts and usage, and every artifact is stored content-addressed with the execution that produced it.Progres dan konkurensiSuite yang dijalankan terhadap model aktif memakan waktu beberapa menit, dan sebagian besar waktu itu dihabiskan untuk menunggu model. Halaman ini membahas berapa banyak panggilan yang dijalankan Oloproof secara bersamaan, apa yang ditampilkannya kepada Anda selama panggilan itu berjalan, dan cara mengetahui berapa banyak eksekusi tambahan yang diperlukan untuk menuntaskan aturan yang belum menghasilkan keputusan.Gating CIA gate compares measured evidence against a threshold you declared, and exits with a code your CI understands. The decision is made on the interval, not on the estimate.Menjalankan di CIGerbang CI membahas kebijakan rilis dan arti setiap kode keluar. Halaman ini membahas bagian yang terjadi di dalam job CI: cara memasang Oloproof di sana, di mana bukti disimpan selama job berjalan, cara membaca hasil tanpa mengurai tabel, dan cara membandingkan pull request dengan branch yang ditujunya.Comparing a candidate to a baselineThe workflow the rest of this product exists for: you changed something, and you want to know whether it helped. A comparison pairs two runs case by case and reports the difference with an interval, so a two-point move is never mistaken for a win.Aturan perbandinganMembandingkan kandidat dengan baseline menunjukkan alur kerjanya. Halaman ini adalah referensi untuk aturan yang memutuskan sebuah perbandingan: jenis apa saja yang ada, apa yang ditanyakan masing-masing, dalam satuan apa margin diukur, dan apa yang menggeser interval yang menjadi dasar pembacaannya.Kasus berkelompokSebagian besar aritmetika interval mengasumsikan setiap kasus independen dari kasus lainnya. Tiga giliran dari satu percakapan tidaklah demikian: ketika percakapan itu kacau, ketiganya cenderung ikut kacau. Suite yang memperlakukannya sebagai independen melaporkan interval yang lebih sempit daripada yang didukung bukti, dan sebuah gerbang bisa lolos karenanya.Irisan (slice)Rasio global dapat tetap stabil sementara satu bagian suite runtuh. Irisan adalah bagian suite yang dinyatakan, diukur tersendiri, sehingga keruntuhan itu terlihat. Irisan disertai dua disiplin, karena melihat banyak bagian suite adalah cara sebuah evaluasi menemukan noise lalu menyebutnya temuan.JudgesAn LLM judge is one kind of evaluator, not all of them. Oloproof has three kinds — deterministic, LLM judge, and custom — and the rules on this page are about the second, because a model's verdict is the one that needs measuring against a human's.Evaluasi RAGJawaban retrieval-augmented bisa salah karena empat alasan berbeda: passage yang tepat tidak pernah diambil, passage itu diambil tetapi peringkatnya terlalu rendah, peringkatnya cukup tinggi tetapi kemudian dibuang dari konteks, atau passage itu sampai ke model dan model tetap salah. Satu angka accuracy tidak dapat membedakannya. Oloproof menjalankan sistem RAG sebagai dua tahap yang dapat dilihatnya, mengukur masing-masing, dan mengeksekusi ulang kasus yang gagal di bawah perubahan terkendali untuk mengetahui alasan mana yang berlaku.Agen dan toolOloproof tidak mengendalikan agen. Agen Anda menjalankan loop-nya sendiri, memanggil tool-nya sendiri, dan mencatat apa yang terjadi sebagai artefak agent_trajectory/v1. Setiap metrik agen dibaca dari record itu, sehingga record itulah keseluruhan integrasinya.Classifier dan regressorModel prediktif dievaluasi seperti sistem lain: sebuah callable mengembalikan prediksi untuk setiap kasus, dan evaluator membacanya. Yang berubah adalah penyebutnya. Accuracy, recall, dan precision adalah tiga rasio atas tiga himpunan baris yang berbeda, dan sebuah model bisa tampak baik pada salah satunya sambil gagal menjawab pertanyaan yang diajukan bisnis.NotifikasiEksekusi yang lolos tidak memberi tahu siapa pun. Ketika Oloproof mengirim notifikasi, itu berarti ada sesuatu yang memerlukan keputusan atau akan segera berhenti berfungsi: rilis yang diblokir gerbang, eksekusi terkelola yang telah berakhir, atau jatah yang hampir habis.ErrorPerbedaan yang menjadi alasan keberadaan halaman ini: eksekusi yang gagal dan eksekusi yang mengalami error adalah dua hal yang berbeda, dan menyajikan yang satu sebagai yang lain memberi tahu pengembang bahwa perubahannya buruk, padahal kenyataannya harness-lah yang tumbang.Referensi CLISetiap perintah yang didaftarkan Oloproof, beserta fungsinya. Masing-masing menerima --help, yang mencetak teks lengkap yang menjadi sumber ringkasan ini.