Hướng dẫn
Quy tắc so sánh
So sánh một ứng viên với một đường cơ sở trình bày quy trình làm việc. Trang này là tài liệu tham chiếu cho các quy tắc dùng để quyết định một so sánh: có những loại nào, mỗi loại hỏi gì, biên được đo bằng đơn vị nào, và điều gì làm thay đổi khoảng tin cậy mà các quy tắc dựa vào.
Ba loại
Một quy tắc so sánh nêu một kind và một chỉ số. Nó không bao giờ nhận min hoặc max: một chênh lệch không được suy ra từ một ngưỡng.
| Loại | Hỏi | Nhận |
|---|---|---|
| superiority | Ứng viên có tốt hơn đường cơ sở không? | không có biên |
| non_inferiority | Ứng viên có không kém đường cơ sở quá mức biên không? | margin, và tùy chọn direction |
| equivalence | Ứng viên có nằm trong biên so với đường cơ sở, theo cả hai chiều không? | margin |
Biên được tính theo đơn vị của chính chỉ số. Với một tỷ lệ, 0.05 là năm điểm phần trăm; với một phân vị độ trễ, 5 là năm mili giây.
version: 1
rules:
- id: not-worse
kind: non_inferiority
metric: exact_label
margin: 0.05
- id: same-quality
kind: equivalence
metric: exact_label
margin: 0.05
- id: better
kind: superiority
metric: exact_label
- id: not-slower
kind: non_inferiority
metric: latency_p50
direction: max
margin: 5Các quy tắc so sánh nằm trong tệp riêng, được truyền bằng --policy, vì release.yaml quyết định một lần chạy đơn lẻ, và một quy tắc ngưỡng với một quy tắc so sánh đọc những bằng chứng khác nhau.
oloproof compare CANDIDATE_RUN_ID BASELINE_RUN_ID --policy compare.yamlCùng các quy tắc áp lên hai ứng viên
Hai trăm câu hỏi có nhãn. Đường cơ sở gán nhãn sai hai mươi câu trong số đó. Mỗi ứng viên dưới đây được chạy trên cùng bộ kiểm thử và được so sánh với đường cơ sở đó bằng tệp ở trên.
Một ứng viên hoạt động giống hệt đường cơ sở:
Comparison sha256:7d2396c475b94028925930d4e52ae070d9a216a4558e22646169db492757c4de of run_01M3C44TVGT0X067W2H0BZ6GC9 against run_01M3C44SWMXMSQJE17SYHV87PW · 200 paired cases
exact_label: +0.0 points [-2.7, +2.7] · 200 paired · 0 missing · 0 excluded
latency_p50: -0.067 ms [-0.113, -0.001] ms · p50 of per-case differences · 200 paired · 0 missing
Decisions
not-worse exact_label non-inferiority, margin 5.0 points PASS lower_bound_above_margin
same-quality exact_label equivalence, margin ±5.0 points PASS interval_within_margins
better exact_label superiority INSUFFICIENT_EVIDENCE interval_overlaps_zero
not-slower latency_p50 maximum increase 5 ms PASS lower_bound_above_margin
Gate: BLOCK (exit 3)Một ứng viên sửa được hai mươi câu đó:
Comparison sha256:1e36f48662cbbc0af20217a2c69248f90b473bbf0873dc6dd222ccb1895bb33a of run_01M3C44VQ0TFFNW4FRM5Z2D12R against run_01M3C44SWMXMSQJE17SYHV87PW · 200 paired cases
exact_label: +10.0 points [+4.6, +17.9] · 200 paired · 0 missing · 0 excluded
latency_p50: -0.038 ms [-0.089, +0.009] ms · p50 of per-case differences · 200 paired · 0 missing
Decisions
not-worse exact_label non-inferiority, margin 5.0 points PASS lower_bound_above_margin
same-quality exact_label equivalence, margin ±5.0 points INSUFFICIENT_EVIDENCE interval_overlaps_margins
better exact_label superiority PASS difference_above_zero
not-slower latency_p50 maximum increase 5 ms PASS lower_bound_above_margin
Gate: BLOCK (exit 3)Hãy đọc hai cổng cùng nhau. Cả hai đều chặn, vì những lý do ngược nhau. Ứng viên thứ nhất được xác lập là tương đương và không được xác lập là tốt hơn; ứng viên thứ hai được xác lập là tốt hơn và do đó không được xác lập là tương đương. Một chính sách giữ cả ba loại cho cùng một chỉ số là đang hỏi hai câu hỏi không tương thích, và một trong hai sẽ luôn không được trả lời. Hãy chọn quy tắc phát biểu đúng tuyên bố mà bạn đang đưa ra.
Chiều
non_inferiority mặc định là direction: min: cao hơn là tốt hơn, và quy tắc yêu cầu ứng viên không thấp hơn đường cơ sở quá mức biên. direction: max dành cho các chỉ số mà thấp hơn là tốt hơn, như độ trễ, số token hay chi phí. Khi đó quy tắc được hiểu là một mức trần cho phần tăng, và terminal in nó đúng như vậy: maximum increase 5 ms.
superiority và equivalence không nhận chiều. Tương đương vốn đã giới hạn cả hai phía, và vượt trội hỏi liệu chênh lệch có lớn hơn không theo nghĩa của chính chỉ số hay không.
Điều gì làm thay đổi khoảng tin cậy
Một so sánh là ghép cặp: kết quả của ứng viên ở mỗi trường hợp được đặt cạnh kết quả đường cơ sở của chính trường hợp đó. Có hai điều làm khoảng tin cậy thu được rộng ra, và không điều nào là thay đổi mà bạn đã thực hiện.
Các trường hợp thiếu ở một trong hai phía
Một trường hợp gặp lỗi ở một trong hai lần chạy sẽ thiếu khỏi cặp, và nó được giới hạn thay vì bị bỏ đi: khoảng tin cậy cho phép mọi trường hợp thiếu có thể nghiêng về bất kỳ phía nào. Một bộ kiểm thử nhỏ hơn, với một tiêu chí tên là ok: cùng bốn trường hợp bất đồng trên ba mươi tư trường hợp ghép cặp, lần đầu không có trường hợp thiếu nào và sau đó với bốn trường hợp nữa gặp lỗi ở cả hai lần chạy:
ok: +11.8 points [-7.2, +34.3] · 34 paired · 0 missing · 0 excludedok: +11.8 points [-24.8, +44.7] · 34 paired · 4 missing · 0 excludedƯớc lượng là như nhau, vì nó được tính từ các trường hợp được quan sát ở cả hai phía. Khoảng tin cậy thì không, vì bốn trường hợp không ai thấy đều có thể làm chênh lệch dịch chuyển trọn một trường hợp. Hãy sửa lỗi trước khi thêm trường hợp: thêm trường hợp với cùng tỷ lệ lỗi không thu hẹp được khoảng cách.
Một chênh lệch xếp hạng ghép cặp, như ROC-AUC giữa hai phiên bản mô hình, không thể giới hạn các hàng thiếu theo cách này: nó so sánh các hàng mà cả hai phía đã chấm điểm. Một quy tắc trên chỉ số như vậy cho kết quả missingness_unbounded cho đến khi nó khai báo max_missing_fraction, tỷ lệ hàng thiếu mà nó chấp nhận coi là thiếu ngẫu nhiên.
Phương pháp
Khoảng tin cậy mặc định cho một chênh lệch tỷ lệ là khoảng trung bình bị chặn trên các chênh lệch theo từng trường hợp. Một chính sách có thể chỉ định phương pháp chính xác có điều kiện thay thế:
version: 1
difference_method: conditional_exact_paired_difference@1
rules:
- {id: not-worse, metric: exact_label, kind: non_inferiority, margin: 0.05}Ứng viên ở trên, tốt hơn mười điểm, cho kết quả [+4.6, +17.9] với phương pháp mặc định và như sau với phương pháp chính xác:
exact_label: +10.0 points [+3.5, +15.8] · 200 paired · 0 missing · 0 excludedKhông phương pháp nào hẹp hơn một cách đồng đều, đó là lý do phương pháp được chọn trong chính sách, trước khi đọc bất kỳ bằng chứng nào, và không bao giờ do engine chọn từ dữ liệu. Nó chỉ áp dụng cho chênh lệch tỷ lệ.
Khi một quy tắc không thể quyết định
Một quy tắc so sánh INSUFFICIENT_EVIDENCE có thể kèm một dòng bên dưới cho biết điều gì sẽ quyết định được nó. So sánh ba mươi tư trường hợp không có gì thiếu:
Decisions
not-worse ok non-inferiority, margin 5.0 points INSUFFICIENT_EVIDENCE interval_overlaps_margin
about 5 more paired cases would decide it, if the difference holds (39 in total at 12% discordance)
Gate: BLOCK (exit 3)Ước lượng đó giả định rằng chênh lệch và tỷ lệ trường hợp bất đồng đều giữ nguyên khi có thêm trường hợp. oloproof plan COMPARISON_ID in cùng dòng đó kèm thời gian mà các trường hợp bổ sung sẽ cần.
Khi có cặp bị thiếu, không có cỡ mẫu nào được đưa ra, vì các cặp thiếu được giới hạn ở mức xấu nhất và thêm trường hợp sẽ không giải quyết được chúng. Cùng so sánh đó với bốn cặp thiếu không in dòng gợi ý nào, và kế hoạch cho biết lý do:
oloproof plan COMPARISON_IDComparison sha256:22c1aa4fddc4e96ca77e0509ac9835c2a377ed237ca80556bbf1a54a172239bd: no sample size can be computed for a rule that did not decide.
not-worse: 4 missing pairs are bounded at their worst, and the advice does not size under missingness; resolve them and compare againVà khi bản thân chênh lệch nằm sai phía của biên, thêm trường hợp chỉ xác nhận điều đó, nên lời gợi ý nói điều đó thay vào:
overall ok non-inferiority, margin 5.0 points INSUFFICIENT_EVIDENCE interval_overlaps_margin
no sample size would make this PASS: the difference itself (-5.0 points) is outside the margin, so more cases would move it toward FAILTiếp theo
- So sánh một ứng viên với một đường cơ sở trình bày quy trình làm việc và cách đọc
một khoảng tin cậy lần đầu.
- Trường hợp theo cụm trình bày các bộ kiểm thử có trường hợp không độc lập, điều mà
một so sánh hiện chưa quyết định.
- Lát cắt trình bày các quy tắc có phạm vi giới hạn ở một phần của bộ kiểm thử.