Skip to content

Mulai

Menulis suite

Suite terdiri dari dua file dan sebuah dataset. oloproof init membuat kerangka keduanya, dan kerangka itu diberi komentar karena uji coba onboarding pertama kehilangan empat percobaan akibat sebuah string yang hilang, bukan fitur yang hilang.

File proyek

oloproof.yaml mendeklarasikan apa yang diukur dan apa yang melakukan pengukuran.

version: 1
project: example
dataset: data/example.jsonl
system:
  name: example-support-bot
  version: "1"
  callable: app:answer
  config: {}
evaluators:
  - type: exact_match
    criterion: exact_label
    field: label

system.callable adalah path impor ke hal yang diuji. criterion adalah nama yang akan dipakai oleh metrik, ambang batas, dan laporan untuk hasil evaluator ini, jadi sebaiknya pilih kata yang akan Anda kenali di sebuah gerbang.

Tipe evaluator

Setiap type: yang diterima file ini, menurut kelompoknya. Field yang ditolak dijawab dengan daftar field yang diterima evaluator itu, sehingga tebakan yang salah hanya berjarak satu eksekusi dari yang benar.

KelompokTipe
Deterministikexact_match, contains, regex, json_schema
Juri LLMrubric_judge, groundedness_judge, citation_support_judge, probability_judge, cascade
modelmodel_classifier
Retrievalhit_rate, recall, mrr, ndcg, citation_validity
Agenagent_max_steps, agent_tool_called, agent_no_tool_loop, agent_tool_sequence, agent_no_undeclared_tool, agent_constraints_satisfied
Multi-agenagent_route, agent_tool_permissions, agent_max_handoffs
Prediktifpredictive_correct, predictive_precision, predictive_recall, predictive_ranking, predictive_brier, predictive_log_loss, predictive_absolute_error

Juri LLM pada endpoint yang bukan milik OpenAI memerlukan dua field tambahan: base_url: dan api_key_env:. Kuncinya dibaca dari environment pada saat pemanggilan dan tidak pernah disimpan.

Menjalankannya

oloproof run

Sebuah eksekusi menjalankan setiap kasus, menilai masing-masing dengan setiap evaluator, dan menyimpan hasilnya sebagai rekaman yang dialamatkan menurut isinya (content-addressed). Menjalankannya lagi terhadap sistem dan dataset yang tidak berubah akan memakai kembali apa yang sudah ada, itulah sebabnya eksekusi yang diulang hampir tidak memakan biaya dan tidak diukur untuk penagihan.

oloproof plan RUN_ID --run melaporkan apa yang diperlukan untuk menuntaskan aturan yang belum terputuskan, dengan biaya yang dihitung dari apa yang benar-benar dihabiskan eksekusi tersebut. Jika diberi id perbandingan, perintah ini tidak memerlukan flag.

Replikasi

Kasus yang diukur satu kali memberi tahu Anda apa yang terjadi satu kali. replicates: mengukur setiap kasus lebih dari satu kali dan melaporkan berapa banyak yang mengubah putusannya di antara pengukuran yang identik.

Angka itu perlu diketahui sebelum Anda memercayai perbandingan apa pun: terhadap asisten yang aktif, sekitar satu dari sembilan kasus teramati mengubah putusannya di antara eksekusi yang identik.

Langkah selanjutnya

latensi.

Classifier dan regressor membahas tipe retrieval, agen, dan prediktif.

  • Gerbang CI mengubah keputusan menjadi kode keluar.
  • Juri membahas apa yang harus dilampaui juri LLM sebelum boleh menjadi gerbang

rilis.

  • Konsep inti menjelaskan empat status keputusan dan mengapa penyebut penting.