Skip to content

Rozpocznij

Podstawowe pojęcia

Oloproof mierzy system AI tak, jak badanie mierzy cokolwiek: te same przypadki, ci sami sędziowie, te same ziarna losowości, uruchamiane przy każdej zmianie. Tym, co dodaje do zestawu testów, jest to, że każda liczba przychodzi wraz ze swoją niepewnością, a decyzja o wydaniu jest podejmowana na podstawie przedziału, a nie estymaty.

Łańcuch

Siedem ogniw, a każde z nich to rekord, który można odczytać osobno.

OgniwoCzym jest
ObserwacjaCo zrobił system, uchwycone jako artefakt wykonania
PomiarCo ocenił na ten temat ewaluator
WnioskowanieMetryka z przedziałem, liczona względem określonego mianownika
DiagnozaNiepowodzenia pogrupowane w czynniki, z licznościami i założeniami
DecyzjaPASS, FAIL, INSUFFICIENT_EVIDENCE lub MANUAL_REVIEW
RekomendacjaDziałanie dotyczące wydania, które jest polem, a nie piątym stanem
DowodyPochodzenie, które pozwala komuś innemu sprawdzić to wszystko

Każde ogniwo jest przechowywane osobno i może być niezależnie ponownie użyte. Ponowne uruchomienie zestawu względem niezmienionego kandydata ponownie wykorzystuje wykonania i oceny, które już istnieją, dlatego powtórzony przebieg nie kosztuje prawie nic.

Cztery stany decyzji

Jest ich dokładnie cztery, a jeden z nich jest powodem, dla którego ten produkt istnieje.

  • PASS — dolna granica przedziału przekracza próg minimalny.
  • FAIL — górna granica przedziału jest poniżej niego.
  • INSUFFICIENT_EVIDENCE — ani jedno, ani drugie, więc dowody nie rozstrzygają.
  • MANUAL_REVIEW — pytana jest osoba, ponieważ metoda odmówiła odpowiedzi.

Dla progu minimalnego T i przedziału [L, U]: pass wtedy i tylko wtedy, gdy L >= T, fail wtedy i tylko wtedy, gdy U < T, w przeciwnym razie insufficient. Reguły z progiem maksymalnym są lustrzanym odbiciem.

INSUFFICIENT_EVIDENCE nie jest łagodnym niepowodzeniem. To uczciwa odpowiedź, gdy zestaw jest za mały albo efekt zbyt bliski progu, by odróżnić go od szumu, a traktowanie go jako pass to najczęstszy sposób, w jaki ewaluacja wprowadza w błąd zespół, który ją prowadzi.

Co nie jest stanem decyzji

RUN_ERROR, PARTIAL i CANCELLED opisują, co stało się z przebiegiem, a nie co zdecydowano o systemie. Przebieg zakończony błędem nie niesie żadnego wyniku jakościowego, a przedstawianie go jako niepowodzenia mówi deweloperowi, że jego zmiana jest zła, podczas gdy w rzeczywistości zawiodła infrastruktura testowa.

To rozróżnienie jest najważniejsze wtedy, gdy jest niewygodne. Metryka, która liczy nieoceniony przypadek jako zero, obciąża model awariami samego systemu jako niepowodzeniami jakościowymi — to realne ustalenie z uruchomienia tego silnika na działającym asystencie.

Mianowniki

Wskaźnik to liczba względem mianownika, a mianownik to miejsce, w którym ewaluacje po cichu się mylą. Oloproof zapisuje cztery liczności dla każdej metryki — łączną, kwalifikującą się, zaobserwowaną i brakującą — a przypadek, którego nie dało się zmierzyć, jest ograniczany, a nie pomijany.

Mianownik, który się kurczy, gdy system zaczyna zawodzić, to sposób, w jaki zawodzący system raportuje rosnący wynik.

Co dalej

  • Pisanie zestawu: czym są przypadek, system i ewaluator oraz jak je zadeklarować.
  • Bramkowanie CI: zamiana decyzji na kod wyjścia.
  • Sędziowie: co musi spełnić sędzia LLM, zanim będzie mógł bramkować wydanie.
  • Przypadki klastrowane: co się zmienia, gdy przypadki nie są niezależne.