Bouw op bewijs.
Oloproof helpt teams AI-systemen te evalueren met herhaalbare tests, diagnostiek en bewijs waarop je beslissingen kunt baseren.
Draait in je CI. Je bewijs blijft op je eigen machine.
Prompts met de hand testen houdt geen stand in productie.
Teams leveren wekelijks wijzigingen aan modellen en prompts op. Een handvol outputs steekproefsgewijs bekijken in een playground zegt bijna niets over wat er veranderde, voor wie, of of het veilig is om uit te brengen.
Oloproof vervangt dat door een gemeten verslag: dezelfde cases, dezelfde judges, dezelfde seeds, gedraaid bij elke wijziging.
Een aanpassing aan een prompt verhelpt één soort fout en breekt ongemerkt een andere. Niemand merkt het tot een klant het merkt.
Op een live RAG-systeem veranderde ongeveer één op de negen waargenomen cases van oordeel tussen identieke metingen.
Een live harness scoorde zijn 13,8% HTTP 500-fouten als nullen en rekende storingen zo aan het model toe. Een gemiddelde kan geen beslissing dragen.
Als risk, legal of een klant vraagt wat je hebt getest, zijn screenshots in een thread geen antwoord.
Vier dingen die elke releasebeslissing nodig heeft.
Geversioneerde datasets, vastgezette seeds en declaratieve judges. Elke run is maanden later nog exact te reproduceren.
Verschillen met betrouwbaarheidsintervallen en drempels, zodat een verschuiving van twee punten nooit voor winst wordt aangezien.
Fouten gegroepeerd per segment, intentie en toolpad, elk gekoppeld aan de exacte traces erachter.
Een releaseaanbeveling met het bewijs erbij — exporteerbaar voor review, audit en klanten.
Elk interval kruist de gestippelde nullijn. Op basis van alleen de puntschattingen was de reranker uitgebracht.
Gemaakt voor teams die de release moeten verantwoorden.
Definieer datasets, judges en drempels in versiebeheer. Review wijzigingen in evaluaties zoals je code reviewt.
Programmatische checks, LLM-judges, getrainde classifiers die tekst op je eigen machine scoren en menselijke labels in één pipeline. De overeenstemming van elke judge met mensen wordt gemeten met een interval, en een judge die zijn lat niet heeft gehaald, kan niet over een release beslissen.
Laat een pull request falen wanneer een metriek zijn drempel overschrijdt. De gate meldt welke cases verschoven en hoeveel.
Elke score linkt naar inputs, outputs, toolaanroepen, opgehaalde context en de redenering van de judge. Niets is een black box.
Kwaliteit is nooit de enige as. Volg uitgaven en tail latency naast correctheid, onder dezelfde drempels.
Deel de run, de diagnostiek en de aanbeveling zonder de gemeten beslissing die erin staat te veranderen.
Drie stappen, daarna draait het vanzelf.
Lever je eigen cases aan als JSONL-bestand. Declareer de judges en de drempels die een release moet halen.
Eén commando lokaal, hetzelfde commando in CI. Wijzigingen aan prompt, model, retrieval en tools krijgen allemaal dezelfde behandeling.
Lees de verschillen, open de falende traces en houd het bewijs gekoppeld aan de beslissing die je nam.
Elk getal is terug te voeren op een case.
Runs zijn onveranderlijk en gedateerd. Datasets, prompts, judges en configuratie worden samen geversioneerd, zodat elk resultaat kan worden gereproduceerd of betwist.
Op basis van de puntschattingen levert de reranker +12,7 punten hit@1 op. Eerlijk gelezen kan dit panel niet zeggen of hij helpt of schaadt.
Wat dit nog niet is.
Alles hieronder klopt op de dag dat je het leest.
- 01
Er is geen gehoste omgeving waarvoor je je kunt aanmelden. Toegang is op uitnodiging.
- 02
Er zijn geen prijzen. De eenheid is een geëvalueerde case; de tarieven liggen niet vast.
- 03
Er is geen beveiligingsaudit, geen SOC 2-rapport en geen DPA. Er zijn geen klanten en geen casestudy's, dus er worden er geen aangehaald.
- 04
Meldingen gaan alleen per e-mail: geen Slack, pager of webhook. Er is geen rapportdocument. Een run wordt gelezen in de workbench of geëxporteerd als bundel.
- 05
Evaluatie in productie is niet gebouwd: traces worden op uw eigen machine ontvangen, en nog niets beoordeelt productieverkeer.
- 06
Het is van begin tot eind gedraaid tegen precies één live systeem van een derde partij. Dat is het bewijs hierboven, en het is één systeem.
Meet voordat je uitbrengt.
Neem één systeem en één dataset mee. Begin met één lokale run en houd het bewijs op je eigen machine.