Panduan
Kasus berkelompok
Sebagian besar aritmetika interval mengasumsikan setiap kasus independen dari kasus lainnya. Tiga giliran dari satu percakapan tidaklah demikian: ketika percakapan itu kacau, ketiganya cenderung ikut kacau. Suite yang memperlakukannya sebagai independen melaporkan interval yang lebih sempit daripada yang didukung bukti, dan sebuah gerbang bisa lolos karenanya.
Mendeklarasikan kelompok
Sebuah kasus menyebutkan kelompoknya dengan group_id, di tingkat teratas baris, di samping id:
{"id": "conv00_t0", "group_id": "conv00", "input": {"question": "Conversation 0 turn 0: refund please (garbled)"}, "expected": {"label": "refund"}}
{"id": "conv00_t1", "group_id": "conv00", "input": {"question": "Conversation 0 turn 1: where is my order (garbled)"}, "expected": {"label": "other"}}
{"id": "conv00_t2", "group_id": "conv00", "input": {"question": "Conversation 0 turn 2: refund please (garbled)"}, "expected": {"label": "refund"}}Begitu ada satu kasus yang mendeklarasikannya, seluruh suite dianalisis per kelompok. Tidak ada sakelar per metrik untuk kembali: memperlakukan kasus yang dikelompokkan sebagai independen adalah arah yang tidak aman, sehingga opsi itu tidak disediakan.
Apa yang berubah
108 giliran yang sama dari 36 percakapan, satu dari enam percakapan kacau dari giliran pertama sampai terakhirnya. Tanpa group_id:
│ exact_label │ 83.3% │ [74.9%, 89.9%] │ 90 / 108 observed · 0 missing · 0 excluded │Dengan group_id:
│ exact_label │ 83.3% │ [65.2%, 94.6%] │ 90 / 108 observed · 0 missing · 0 excluded · 36 clusters · approximate │Estimasinya identik. Intervalnya kira-kira dua kali lebih lebar, karena suite itu memuat 36 observasi independen, bukan 108. Terhadap batas bawah 0.70, dengan opt-in yang dijelaskan di bawah, eksekusi pertama lolos dan yang kedua tidak:
label-floor: PASS (lower_bound_meets_minimum)label-floor: INSUFFICIENT_EVIDENCE (interval_overlaps_threshold)Jawaban kedua adalah jawaban yang benar untuk data ini.
Opt-in
Interval berkelompok adalah bootstrap kelompok terstudentisasi (studentized cluster bootstrap). Ini adalah metode aproksimasi, dan sebuah kebijakan harus menyatakan bahwa ia menerimanya sebelum sebuah aturan boleh memutuskan berdasarkan metode itu. Tanpa itu, eksekusi berkelompok yang sama terbaca:
label-floor: MANUAL_REVIEW (approximate_method_not_permitted)dan keluar dengan 4. Agar aturan dapat memutuskan, tambahkan ini ke release.yaml:
allow_approximate_methods: trueDua pengaturan lagi membatasi apa yang dipercayakan kepada metode ini.
| Pengaturan | Bawaan | Fungsinya |
|---|---|---|
| min_clusters | 20 | Jika jumlah kelompok lebih sedikit dari ini, aturan terbaca INSUFFICIENT_EVIDENCE dengan insufficient_clusters. Nilainya boleh diturunkan sampai 10 dan tidak lebih rendah lagi. |
| max_missing_fraction | tidak ada | Ditetapkan pada sebuah aturan. Interval berkelompok tidak dapat membatasi kasus yang hilang seperti interval independen, sehingga aturan berkelompok atas metrik yang memiliki kasus hilang terbaca missingness_unbounded sampai aturan itu menyatakan seberapa banyak data hilang yang diterimanya. |
Kebijakan yang menetapkan min_clusters: 5 ditolak sebelum apa pun diputuskan:
Configuration error: p5.yaml: min_clusters: Input should be greater than or equal to 10Percakapan yang sama, dengan salah satunya mengalami error di setiap giliran:
│ exact_label │ 82.9% │ [64.3%, 94.5%] │ 87 / 105 observed · 3 missing · 0 excluded · 35 clusters · approximate │label-floor: INSUFFICIENT_EVIDENCE (missingness_unbounded)Aturan yang menyatakan data hilang yang diterimanya:
rules:
- id: label-floor
metric: exact_label
min: 0.60
max_missing_fraction: 0.15label-floor: PASS (lower_bound_meets_minimum)Menyatakan sebuah fraksi berarti merekam sebuah asumsi: bahwa kasus yang hilang hilang secara acak. Keputusannya hanya sebaik asumsi itu, itulah sebabnya mesin tidak akan membuat asumsi itu untuk Anda.
Apa yang belum dapat dilakukan suite berkelompok
Hanya rasio lolos/gagal yang memiliki interval berkelompok. Pada suite yang mendeklarasikan group_id:
- rata-rata, kuantil, atau metrik peringkat tidak memiliki interval, dan aturan atas metrik tersebut
terbaca MANUAL_REVIEW dengan unsupported_dependence_structure;
- dengan replicates: di atas 1, tidak ada metrik yang memiliki interval, termasuk rasio
lolos/gagal, karena kedua struktur dependensi itu saling bertumpuk dan tidak ada yang memodelkan keduanya;
- perbandingan dua eksekusi tidak memiliki interval untuk metrik apa pun.
Kuantil latensi pada suite yang dikelompokkan:
│ latency_p50 │ 1.365 ms │ no interval: unsupported_dependence_structure │ p50 of 108 observed · 0 missing · 0 excluded │Keterbatasan terakhir itulah yang paling penting. Membandingkan dua eksekusi suite percakapan, dengan kandidat yang memperbaiki setiap percakapan yang kacau:
oloproof compare CANDIDATE_RUN_ID BASELINE_RUN_ID --policy compare.yamlComparison sha256:ed7820e6471f70ce2b5e16ba618fdd48ea92a5ed39d23cce0b719ab31fcb16af of run_01M3C43MWTH8127R7S5M4N9DQ9 against run_01M3C43J2DVM93EWWWRBMRW22E · 108 paired cases
exact_label: +16.7 points · 108 paired · 0 missing · 0 excluded
no interval: unsupported_dependence_structure
Decisions
no-regression exact_label non-inferiority, margin 5.0 points MANUAL_REVIEW unsupported_dependence_structure
Gate: BLOCK (exit 4)Belum ada prosedur berpasangan untuk suite berkelompok yang lolos grid validasinya, sehingga perbandingan melaporkan selisihnya dan meminta seseorang memutuskan alih-alih memutuskan secara aproksimatif. MANUAL_REVIEW, bukan INSUFFICIENT_EVIDENCE, karena lebih banyak kasus dengan jenis yang sama tidak akan memperbaikinya.
Langkah selanjutnya
- Aturan perbandingan membahas aturan yang digunakan untuk memutuskan sebuah
perbandingan.
- Konsep inti membahas empat status keputusan.