Mulai
Menulis suite
Suite terdiri dari dua file dan sebuah dataset. oloproof init membuat kerangka keduanya, dan kerangka itu diberi komentar karena uji coba onboarding pertama kehilangan empat percobaan akibat sebuah string yang hilang, bukan fitur yang hilang.
File proyek
oloproof.yaml mendeklarasikan apa yang diukur dan apa yang melakukan pengukuran.
version: 1
project: example
dataset: data/example.jsonl
system:
name: example-support-bot
version: "1"
callable: app:answer
config: {}
evaluators:
- type: exact_match
criterion: exact_label
field: labelsystem.callable adalah path impor ke hal yang diuji. criterion adalah nama yang akan dipakai oleh metrik, ambang batas, dan laporan untuk hasil evaluator ini, jadi sebaiknya pilih kata yang akan Anda kenali di sebuah gerbang.
Tipe evaluator
Setiap type: yang diterima file ini, menurut kelompoknya. Field yang ditolak dijawab dengan daftar field yang diterima evaluator itu, sehingga tebakan yang salah hanya berjarak satu eksekusi dari yang benar.
| Kelompok | Tipe |
|---|---|
| Deterministik | exact_match, contains, regex, json_schema |
| Juri LLM | rubric_judge, groundedness_judge, citation_support_judge, probability_judge, cascade |
| model | model_classifier |
| Retrieval | hit_rate, recall, mrr, ndcg, citation_validity |
| Agen | agent_max_steps, agent_tool_called, agent_no_tool_loop, agent_tool_sequence, agent_no_undeclared_tool, agent_constraints_satisfied |
| Multi-agen | agent_route, agent_tool_permissions, agent_max_handoffs |
| Prediktif | predictive_correct, predictive_precision, predictive_recall, predictive_ranking, predictive_brier, predictive_log_loss, predictive_absolute_error |
Juri LLM pada endpoint yang bukan milik OpenAI memerlukan dua field tambahan: base_url: dan api_key_env:. Kuncinya dibaca dari environment pada saat pemanggilan dan tidak pernah disimpan.
Menjalankannya
oloproof runSebuah eksekusi menjalankan setiap kasus, menilai masing-masing dengan setiap evaluator, dan menyimpan hasilnya sebagai rekaman yang dialamatkan menurut isinya (content-addressed). Menjalankannya lagi terhadap sistem dan dataset yang tidak berubah akan memakai kembali apa yang sudah ada, itulah sebabnya eksekusi yang diulang hampir tidak memakan biaya dan tidak diukur untuk penagihan.
oloproof plan RUN_ID --run melaporkan apa yang diperlukan untuk menuntaskan aturan yang belum terputuskan, dengan biaya yang dihitung dari apa yang benar-benar dihabiskan eksekusi tersebut. Jika diberi id perbandingan, perintah ini tidak memerlukan flag.
Replikasi
Kasus yang diukur satu kali memberi tahu Anda apa yang terjadi satu kali. replicates: mengukur setiap kasus lebih dari satu kali dan melaporkan berapa banyak yang mengubah putusannya di antara pengukuran yang identik.
Angka itu perlu diketahui sebelum Anda memercayai perbandingan apa pun: terhadap asisten yang aktif, sekitar satu dari sembilan kasus teramati mengubah putusannya di antara eksekusi yang identik.
Langkah selanjutnya
- Merekam apa yang dilakukan sistem membahas artefak, metrik penggunaan, dan
latensi.
- Evaluasi RAG, Agen dan tool, dan
Classifier dan regressor membahas tipe retrieval, agen, dan prediktif.
- Gerbang CI mengubah keputusan menjadi kode keluar.
- Juri membahas apa yang harus dilampaui juri LLM sebelum boleh menjadi gerbang
rilis.
- Konsep inti menjelaskan empat status keputusan dan mengapa penyebut penting.