Rozpocznij
Podstawowe pojęcia
Oloproof mierzy system AI tak, jak badanie mierzy cokolwiek: te same przypadki, ci sami sędziowie, te same ziarna losowości, uruchamiane przy każdej zmianie. Tym, co dodaje do zestawu testów, jest to, że każda liczba przychodzi wraz ze swoją niepewnością, a decyzja o wydaniu jest podejmowana na podstawie przedziału, a nie estymaty.
Łańcuch
Siedem ogniw, a każde z nich to rekord, który można odczytać osobno.
| Ogniwo | Czym jest |
|---|---|
| Obserwacja | Co zrobił system, uchwycone jako artefakt wykonania |
| Pomiar | Co ocenił na ten temat ewaluator |
| Wnioskowanie | Metryka z przedziałem, liczona względem określonego mianownika |
| Diagnoza | Niepowodzenia pogrupowane w czynniki, z licznościami i założeniami |
| Decyzja | PASS, FAIL, INSUFFICIENT_EVIDENCE lub MANUAL_REVIEW |
| Rekomendacja | Działanie dotyczące wydania, które jest polem, a nie piątym stanem |
| Dowody | Pochodzenie, które pozwala komuś innemu sprawdzić to wszystko |
Każde ogniwo jest przechowywane osobno i może być niezależnie ponownie użyte. Ponowne uruchomienie zestawu względem niezmienionego kandydata ponownie wykorzystuje wykonania i oceny, które już istnieją, dlatego powtórzony przebieg nie kosztuje prawie nic.
Cztery stany decyzji
Jest ich dokładnie cztery, a jeden z nich jest powodem, dla którego ten produkt istnieje.
- PASS — dolna granica przedziału przekracza próg minimalny.
- FAIL — górna granica przedziału jest poniżej niego.
- INSUFFICIENT_EVIDENCE — ani jedno, ani drugie, więc dowody nie rozstrzygają.
- MANUAL_REVIEW — pytana jest osoba, ponieważ metoda odmówiła odpowiedzi.
Dla progu minimalnego T i przedziału [L, U]: pass wtedy i tylko wtedy, gdy L >= T, fail wtedy i tylko wtedy, gdy U < T, w przeciwnym razie insufficient. Reguły z progiem maksymalnym są lustrzanym odbiciem.
INSUFFICIENT_EVIDENCE nie jest łagodnym niepowodzeniem. To uczciwa odpowiedź, gdy zestaw jest za mały albo efekt zbyt bliski progu, by odróżnić go od szumu, a traktowanie go jako pass to najczęstszy sposób, w jaki ewaluacja wprowadza w błąd zespół, który ją prowadzi.
Co nie jest stanem decyzji
RUN_ERROR, PARTIAL i CANCELLED opisują, co stało się z przebiegiem, a nie co zdecydowano o systemie. Przebieg zakończony błędem nie niesie żadnego wyniku jakościowego, a przedstawianie go jako niepowodzenia mówi deweloperowi, że jego zmiana jest zła, podczas gdy w rzeczywistości zawiodła infrastruktura testowa.
To rozróżnienie jest najważniejsze wtedy, gdy jest niewygodne. Metryka, która liczy nieoceniony przypadek jako zero, obciąża model awariami samego systemu jako niepowodzeniami jakościowymi — to realne ustalenie z uruchomienia tego silnika na działającym asystencie.
Mianowniki
Wskaźnik to liczba względem mianownika, a mianownik to miejsce, w którym ewaluacje po cichu się mylą. Oloproof zapisuje cztery liczności dla każdej metryki — łączną, kwalifikującą się, zaobserwowaną i brakującą — a przypadek, którego nie dało się zmierzyć, jest ograniczany, a nie pomijany.
Mianownik, który się kurczy, gdy system zaczyna zawodzić, to sposób, w jaki zawodzący system raportuje rosnący wynik.
Co dalej
- Pisanie zestawu: czym są przypadek, system i ewaluator oraz jak je zadeklarować.
- Bramkowanie CI: zamiana decyzji na kod wyjścia.
- Sędziowie: co musi spełnić sędzia LLM, zanim będzie mógł bramkować wydanie.
- Przypadki klastrowane: co się zmienia, gdy przypadki nie są niezależne.