Buduj w oparciu o dowody.
Oloproof pomaga zespołom oceniać systemy AI za pomocą powtarzalnych testów, diagnostyki i dowodów, na których można oprzeć decyzję.
Działa w Twoim CI. Dowody pozostają na Twojej maszynie.
Ręczne testowanie promptów nie wytrzymuje zderzenia z produkcją.
Zespoły co tydzień wdrażają zmiany modeli i promptów. Wyrywkowe sprawdzenie kilku odpowiedzi w playgroundzie nie mówi prawie nic o tym, co się zmieniło, dla kogo ani czy wydanie jest bezpieczne.
Oloproof zastępuje to zmierzonym zapisem: te same przypadki, ci sami sędziowie, te same ziarna losowości, uruchamiane przy każdej zmianie.
Edycja promptu naprawia jedną klasę błędów i po cichu psuje inną. Nikt tego nie zauważa, dopóki nie zauważy klient.
W działającym systemie RAG mniej więcej jeden na dziewięć zaobserwowanych przypadków zmieniał werdykt między identycznymi pomiarami.
Działający harness ocenił swoje 13,8% odpowiedzi HTTP 500 jako zera, obciążając awariami model. Średnia nie udźwignie decyzji.
Gdy dział ryzyka, dział prawny lub klient pyta, co zostało przetestowane, zrzuty ekranu w wątku nie są odpowiedzią.
Cztery rzeczy, których potrzebuje każda decyzja o wydaniu.
Wersjonowane zbiory danych, przypięte ziarna losowości i deklaratywni sędziowie. Każdy przebieg odtwarza się dokładnie, nawet po miesiącach.
Różnice z przedziałami ufności i progami, aby przesunięcie o dwa punkty nigdy nie zostało wzięte za sukces.
Błędy pogrupowane według segmentu, intencji i ścieżki narzędzi, każdy powiązany z dokładnymi śladami, które za nim stoją.
Rekomendacja wydania z dołączonymi dowodami — do wyeksportowania na potrzeby przeglądu, audytu i klientów.
Każdy przedział przecina przerywaną linię zera. Gdyby patrzeć tylko na estymacje punktowe, reranker trafiłby do wydania.
Stworzone dla zespołów, które muszą uzasadnić wydanie.
Definiuj zbiory danych, sędziów i progi w systemie kontroli wersji. Przeglądaj zmiany w ewaluacji tak, jak przegląda się kod.
Kontrole programowe, sędziowie LLM, wytrenowane klasyfikatory oceniające tekst na Twojej własnej maszynie oraz etykiety ludzi w jednym pipeline. Zgodność każdego sędziego z ludźmi jest mierzona z przedziałem, a sędzia, który nie przekroczył swojego progu, nie może decydować o wydaniu.
Oznacz pull request jako nieudany, gdy metryka przekroczy swój próg. Bramka raportuje, które przypadki się zmieniły i o ile.
Każdy wynik prowadzi do wejść, wyjść, wywołań narzędzi, pobranego kontekstu i uzasadnienia sędziego. Nic nie jest czarną skrzynką.
Jakość nigdy nie jest jedyną osią. Śledź wydatki i opóźnienia ogonowe obok poprawności, przy tych samych progach.
Udostępniaj przebieg, diagnostykę i rekomendację bez zmieniania zmierzonej decyzji, którą zawierają.
Trzy kroki, a potem działa samo.
Dostarcz własne przypadki jako plik JSONL. Zadeklaruj sędziów i progi, które wydanie musi przekroczyć.
Jedno polecenie lokalnie, to samo polecenie w CI. Zmiany promptu, modelu, wyszukiwania i narzędzi są traktowane jednakowo.
Odczytaj różnice, otwórz nieudane ślady i zachowaj dowody dołączone do podjętej decyzji.
Każdą liczbę można prześledzić aż do przypadku.
Przebiegi są niezmienne i opatrzone datą. Zbiory danych, prompty, sędziowie i konfiguracja są wersjonowane razem, więc każdy wynik można odtworzyć lub zakwestionować.
Według estymacji punktowych reranker daje +12,7 punktu hit@1. Przy uczciwym odczycie ten panel nie potrafi stwierdzić, czy pomaga, czy szkodzi.
Czym to jeszcze nie jest.
Wszystko poniżej jest prawdziwe w dniu, w którym to czytasz.
- 01
Nie ma hostowanego wdrożenia, w którym można się zarejestrować. Dostęp jest na zaproszenie.
- 02
Nie ma cennika. Jednostką jest oceniony przypadek; stawki nie są ustalone.
- 03
Nie ma audytu bezpieczeństwa, raportu SOC 2 ani DPA. Nie ma klientów ani studiów przypadku, więc żadne nie są przytaczane.
- 04
Powiadomienia są wyłącznie e-mailowe: bez Slacka, pagera czy webhooka. Nie ma dokumentu raportu. Przebieg odczytuje się w workbenchu lub eksportuje jako pakiet.
- 05
Ocena produkcyjna nie została zbudowana: ślady są odbierane na Twojej własnej maszynie i nic jeszcze nie ocenia ruchu produkcyjnego.
- 06
Został uruchomiony od początku do końca na dokładnie jednym działającym systemie zewnętrznym. To dowody powyżej, i jest to jeden system.
Zmierz, zanim wydasz.
Przynieś jeden system i jeden zbiór danych. Zacznij od jednego lokalnego przebiegu i zachowaj dowody na swojej maszynie.