Skip to content
Ewaluacja systemów AI

Buduj w oparciu o dowody.

Oloproof pomaga zespołom oceniać systemy AI za pomocą powtarzalnych testów, diagnostyki i dowodów, na których można oprzeć decyzję.

Działa w Twoim CI. Dowody pozostają na Twojej maszynie.

oloproof / compare · olotalk-docs-assistant
Podsumowanie Porównanie Diagnostyka Dowody
PUNKT ODNIESIENIA
olotalk docs assistant · rerank wyłączony
KANDYDAT
olotalk docs assistant · rerank włączony
ZBIÓR DANYCH
olotalk golden panel · 58 przypadków
METRYKA PUNKT ODNIESIENIA KANDYDAT Δ SPAROWANA PU 95% STATUS
page_hit_1 0.618 0.745 +6.2 [-36.3, +45.5] — Nierozstrzygnięte
page_hit_3 0.683 0.742 +3.7 [-73.9, +76.2] — Nierozstrzygnięte
answer_correct 0.685 0.760 +6.5 [-39.4, +48.4] — Nierozstrzygnięte
page_hit_1 zaobserwowane 55 / 58 51 / 58 −4 w przedziale ! Ograniczone
page_hit_3 zaobserwowane 41 / 58 31 / 58 −10 w przedziale ! Ograniczone
answer_correct zaobserwowane 54 / 58 50 / 58 −4 w przedziale ! Ograniczone
DLACZEGO EWALUACJA

Ręczne testowanie promptów nie wytrzymuje zderzenia z produkcją.

Zespoły co tydzień wdrażają zmiany modeli i promptów. Wyrywkowe sprawdzenie kilku odpowiedzi w playgroundzie nie mówi prawie nic o tym, co się zmieniło, dla kogo ani czy wydanie jest bezpieczne.

Oloproof zastępuje to zmierzonym zapisem: te same przypadki, ci sami sędziowie, te same ziarna losowości, uruchamiane przy każdej zmianie.

01
Ciche regresje

Edycja promptu naprawia jedną klasę błędów i po cichu psuje inną. Nikt tego nie zauważa, dopóki nie zauważy klient.

02
Niepowtarzalne wyniki

W działającym systemie RAG mniej więcej jeden na dziewięć zaobserwowanych przypadków zmieniał werdykt między identycznymi pomiarami.

03
Wyniki bez znaczenia

Działający harness ocenił swoje 13,8% odpowiedzi HTTP 500 jako zera, obciążając awariami model. Średnia nie udźwignie decyzji.

04
Brak zapisu do pokazania

Gdy dział ryzyka, dział prawny lub klient pyta, co zostało przetestowane, zrzuty ekranu w wątku nie są odpowiedzią.

KLUCZOWE MOŻLIWOŚCI

Cztery rzeczy, których potrzebuje każda decyzja o wydaniu.

MIERZ
Powtarzalne ewaluacje

Wersjonowane zbiory danych, przypięte ziarna losowości i deklaratywni sędziowie. Każdy przebieg odtwarza się dokładnie, nawet po miesiącach.

PORÓWNUJ
Punkt odniesienia a kandydat

Różnice z przedziałami ufności i progami, aby przesunięcie o dwa punkty nigdy nie zostało wzięte za sukces.

DIAGNOZUJ
Tryby awarii, nie średnie

Błędy pogrupowane według segmentu, intencji i ścieżki narzędzi, każdy powiązany z dokładnymi śladami, które za nim stoją.

DECYDUJ
Zapisy, na których można oprzeć decyzję

Rekomendacja wydania z dołączonymi dowodami — do wyeksportowania na potrzeby przeglądu, audytu i klientów.

Diagnostyka23 nieudane przypadki, kontekst wzorcowy
Nierozstrzygnięte: kontekst wzorcowy tego nie przesądził11 przypadków
Błąd generowania: właściwy kontekst, zła odpowiedź7 przypadków
Chybione wyszukiwanie: odpowiedź osiągalna, ale nie pobrana5 przypadków
Rerank włączony minus wyłączonyPrzedział 95%, punkty
hit@1
hit@3
poprawna

Każdy przedział przecina przerywaną linię zera. Gdyby patrzeć tylko na estymacje punktowe, reranker trafiłby do wydania.

PLATFORMA

Stworzone dla zespołów, które muszą uzasadnić wydanie.

Zestawy ewaluacyjne jako kod

Definiuj zbiory danych, sędziów i progi w systemie kontroli wersji. Przeglądaj zmiany w ewaluacji tak, jak przegląda się kod.

Sędziowie, których można audytować

Kontrole programowe, sędziowie LLM, wytrenowane klasyfikatory oceniające tekst na Twojej własnej maszynie oraz etykiety ludzi w jednym pipeline. Zgodność każdego sędziego z ludźmi jest mierzona z przedziałem, a sędzia, który nie przekroczył swojego progu, nie może decydować o wydaniu.

Bramki regresji w CI

Oznacz pull request jako nieudany, gdy metryka przekroczy swój próg. Bramka raportuje, które przypadki się zmieniły i o ile.

Dowody na poziomie śladów

Każdy wynik prowadzi do wejść, wyjść, wywołań narzędzi, pobranego kontekstu i uzasadnienia sędziego. Nic nie jest czarną skrzynką.

Budżety kosztów i opóźnień

Jakość nigdy nie jest jedyną osią. Śledź wydatki i opóźnienia ogonowe obok poprawności, przy tych samych progach.

Dowody dla osób, które potrzebują decyzji

Udostępniaj przebieg, diagnostykę i rekomendację bez zmieniania zmierzonej decyzji, którą zawierają.

JAK TO DZIAŁA

Trzy kroki, a potem działa samo.

1
Zdefiniuj zestaw

Dostarcz własne przypadki jako plik JSONL. Zadeklaruj sędziów i progi, które wydanie musi przekroczyć.

2
Uruchamiaj przy każdej zmianie

Jedno polecenie lokalnie, to samo polecenie w CI. Zmiany promptu, modelu, wyszukiwania i narzędzi są traktowane jednakowo.

3
Decyduj na podstawie dowodów

Odczytaj różnice, otwórz nieudane ślady i zachowaj dowody dołączone do podjętej decyzji.

~/olodemo · po oloproof init
 oloproof run
Run run_01M3B0CCPA0JFQQ7HWRKYNWFJC [DECIDED/COMPLETE]
Gate: ALLOW (exit 0)

  Rule         Metric       State  Reasons
  label-floor  exact_label  PASS   lower_bound_meets_minimum

  Metric       Estimate  Interval          N
  exact_label  100.0%    [88.4%, 100.0%]   30 / 30 observed · 0 missing

Cache: execution 0 hit/30 miss; judgment 0 hit/30 miss

 oloproof run
Run run_01M3B0CXTTVPTBXAFK3WNGFX42 [DECIDED/COMPLETE]
Gate: ALLOW (exit 0)
Cache: execution 30 hit/0 miss; judgment 0 hit/30 miss
DOWODY, KTÓRE MOŻNA PRZEKAZAĆ

Każdą liczbę można prześledzić aż do przypadku.

Przebiegi są niezmienne i opatrzone datą. Zbiory danych, prompty, sędziowie i konfiguracja są wersjonowane razem, więc każdy wynik można odtworzyć lub zakwestionować.

Niezmienne
przebiegi, z pełnym pochodzeniem
Samodzielny hosting
na Twojej infrastrukturze, Twoje dane pozostają Twoje
Ograniczone
brakujące przypadki są wliczane, nigdy pomijane

Według estymacji punktowych reranker daje +12,7 punktu hit@1. Przy uczciwym odczycie ten panel nie potrafi stwierdzić, czy pomaga, czy szkodzi.

Oloproof wobec działającego systemu RAG, 22 września 2026
Oloproof
Pakiet dowodów
oloproof export RUN_ID
run.jsonprzebieg, jego zestaw, system i ewaluatory
cases.jsonlkażdy przypadek: wejście, wyjście, oceny, skróty
diagnoses.jsonlinterwencje i to, co odzyskały
signoffs.jsonlkto wydał mimo zablokowanej bramki i dlaczego
Wyeksportowany pakiet dowodów: przebieg i każdy przypadek stojący za jego liczbami, w postaci plików, które zachowujesz.
TA SAMA DYSCYPLINA, SKIEROWANA TUTAJ

Czym to jeszcze nie jest.

Wszystko poniżej jest prawdziwe w dniu, w którym to czytasz.

  1. 01

    Nie ma hostowanego wdrożenia, w którym można się zarejestrować. Dostęp jest na zaproszenie.

  2. 02

    Nie ma cennika. Jednostką jest oceniony przypadek; stawki nie są ustalone.

  3. 03

    Nie ma audytu bezpieczeństwa, raportu SOC 2 ani DPA. Nie ma klientów ani studiów przypadku, więc żadne nie są przytaczane.

  4. 04

    Powiadomienia są wyłącznie e-mailowe: bez Slacka, pagera czy webhooka. Nie ma dokumentu raportu. Przebieg odczytuje się w workbenchu lub eksportuje jako pakiet.

  5. 05

    Ocena produkcyjna nie została zbudowana: ślady są odbierane na Twojej własnej maszynie i nic jeszcze nie ocenia ruchu produkcyjnego.

  6. 06

    Został uruchomiony od początku do końca na dokładnie jednym działającym systemie zewnętrznym. To dowody powyżej, i jest to jeden system.

Zmierz, zanim wydasz.

Przynieś jeden system i jeden zbiór danych. Zacznij od jednego lokalnego przebiegu i zachowaj dowody na swojej maszynie.