Skip to content
Evaluatie van AI-systemen

Bouw op bewijs.

Oloproof helpt teams AI-systemen te evalueren met herhaalbare tests, diagnostiek en bewijs waarop je beslissingen kunt baseren.

Draait in je CI. Je bewijs blijft op je eigen machine.

oloproof / compare · olotalk-docs-assistant
Samenvatting Vergelijken Diagnostiek Bewijs
BASELINE
olotalk docs assistant · rerank uit
KANDIDAAT
olotalk docs assistant · rerank aan
DATASET
olotalk golden panel · 58 cases
METRIEK BASELINE KANDIDAAT GEPAARDE Δ 95%-BI STATUS
page_hit_1 0.618 0.745 +6.2 [-36.3, +45.5] — Niet doorslaggevend
page_hit_3 0.683 0.742 +3.7 [-73.9, +76.2] — Niet doorslaggevend
answer_correct 0.685 0.760 +6.5 [-39.4, +48.4] — Niet doorslaggevend
page_hit_1 waargenomen 55 / 58 51 / 58 −4 in interval ! Begrensd
page_hit_3 waargenomen 41 / 58 31 / 58 −10 in interval ! Begrensd
answer_correct waargenomen 54 / 58 50 / 58 −4 in interval ! Begrensd
WAAROM EVALUEREN

Prompts met de hand testen houdt geen stand in productie.

Teams leveren wekelijks wijzigingen aan modellen en prompts op. Een handvol outputs steekproefsgewijs bekijken in een playground zegt bijna niets over wat er veranderde, voor wie, of of het veilig is om uit te brengen.

Oloproof vervangt dat door een gemeten verslag: dezelfde cases, dezelfde judges, dezelfde seeds, gedraaid bij elke wijziging.

01
Stille regressies

Een aanpassing aan een prompt verhelpt één soort fout en breekt ongemerkt een andere. Niemand merkt het tot een klant het merkt.

02
Onherhaalbare resultaten

Op een live RAG-systeem veranderde ongeveer één op de negen waargenomen cases van oordeel tussen identieke metingen.

03
Scores zonder betekenis

Een live harness scoorde zijn 13,8% HTTP 500-fouten als nullen en rekende storingen zo aan het model toe. Een gemiddelde kan geen beslissing dragen.

04
Geen verslag om te laten zien

Als risk, legal of een klant vraagt wat je hebt getest, zijn screenshots in een thread geen antwoord.

KERNFUNCTIES

Vier dingen die elke releasebeslissing nodig heeft.

METEN
Herhaalbare evaluaties

Geversioneerde datasets, vastgezette seeds en declaratieve judges. Elke run is maanden later nog exact te reproduceren.

VERGELIJKEN
Baseline tegenover kandidaat

Verschillen met betrouwbaarheidsintervallen en drempels, zodat een verschuiving van twee punten nooit voor winst wordt aangezien.

DIAGNOSTICEREN
Faalwijzen, geen gemiddelden

Fouten gegroepeerd per segment, intentie en toolpad, elk gekoppeld aan de exacte traces erachter.

BESLISSEN
Verslagen waarop je kunt beslissen

Een releaseaanbeveling met het bewijs erbij — exporteerbaar voor review, audit en klanten.

Diagnostiek23 mislukte cases, gouden context
Onopgelost: gouden context gaf geen uitsluitsel11 cases
Generatiefout: juiste context, verkeerd antwoord7 cases
Retrievalmisser: antwoord bereikbaar, niet opgehaald5 cases
Rerank aan min uit95%-interval, punten
hit@1
hit@3
correct

Elk interval kruist de gestippelde nullijn. Op basis van alleen de puntschattingen was de reranker uitgebracht.

PLATFORM

Gemaakt voor teams die de release moeten verantwoorden.

Evaluatiesuites als code

Definieer datasets, judges en drempels in versiebeheer. Review wijzigingen in evaluaties zoals je code reviewt.

Judges die je kunt auditen

Programmatische checks, LLM-judges, getrainde classifiers die tekst op je eigen machine scoren en menselijke labels in één pipeline. De overeenstemming van elke judge met mensen wordt gemeten met een interval, en een judge die zijn lat niet heeft gehaald, kan niet over een release beslissen.

Regressiegates in CI

Laat een pull request falen wanneer een metriek zijn drempel overschrijdt. De gate meldt welke cases verschoven en hoeveel.

Bewijs op traceniveau

Elke score linkt naar inputs, outputs, toolaanroepen, opgehaalde context en de redenering van de judge. Niets is een black box.

Budgetten voor kosten en latency

Kwaliteit is nooit de enige as. Volg uitgaven en tail latency naast correctheid, onder dezelfde drempels.

Bewijs voor wie de beslissing nodig heeft

Deel de run, de diagnostiek en de aanbeveling zonder de gemeten beslissing die erin staat te veranderen.

HOE HET WERKT

Drie stappen, daarna draait het vanzelf.

1
Definieer de suite

Lever je eigen cases aan als JSONL-bestand. Declareer de judges en de drempels die een release moet halen.

2
Draai bij elke wijziging

Eén commando lokaal, hetzelfde commando in CI. Wijzigingen aan prompt, model, retrieval en tools krijgen allemaal dezelfde behandeling.

3
Beslis met het bewijs

Lees de verschillen, open de falende traces en houd het bewijs gekoppeld aan de beslissing die je nam.

~/olodemo · na oloproof init
 oloproof run
Run run_01M3B0CCPA0JFQQ7HWRKYNWFJC [DECIDED/COMPLETE]
Gate: ALLOW (exit 0)

  Rule         Metric       State  Reasons
  label-floor  exact_label  PASS   lower_bound_meets_minimum

  Metric       Estimate  Interval          N
  exact_label  100.0%    [88.4%, 100.0%]   30 / 30 observed · 0 missing

Cache: execution 0 hit/30 miss; judgment 0 hit/30 miss

 oloproof run
Run run_01M3B0CXTTVPTBXAFK3WNGFX42 [DECIDED/COMPLETE]
Gate: ALLOW (exit 0)
Cache: execution 30 hit/0 miss; judgment 0 hit/30 miss
BEWIJS DAT JE KUNT OVERHANDIGEN

Elk getal is terug te voeren op een case.

Runs zijn onveranderlijk en gedateerd. Datasets, prompts, judges en configuratie worden samen geversioneerd, zodat elk resultaat kan worden gereproduceerd of betwist.

Onveranderlijk
runs, met volledige herkomst
Self-hosted
op je eigen infrastructuur, je data blijft van jou
Begrensd
ontbrekende cases meegeteld, nooit weggelaten

Op basis van de puntschattingen levert de reranker +12,7 punten hit@1 op. Eerlijk gelezen kan dit panel niet zeggen of hij helpt of schaadt.

Oloproof tegen een live RAG-systeem, 22 september 2026
Oloproof
Bewijsbundel
oloproof export RUN_ID
run.jsonde run, zijn suite, systeem en evaluators
cases.jsonlelke case: input, output, oordelen, digests
diagnoses.jsonlinterventies en wat ze herstelden
signoffs.jsonlwie uitbracht ondanks een blokkerende gate, en waarom
Een geëxporteerde bewijsbundel: de run en elke case achter zijn getallen, als bestanden die je bewaart.
DEZELFDE DISCIPLINE, HIEROP GERICHT

Wat dit nog niet is.

Alles hieronder klopt op de dag dat je het leest.

  1. 01

    Er is geen gehoste omgeving waarvoor je je kunt aanmelden. Toegang is op uitnodiging.

  2. 02

    Er zijn geen prijzen. De eenheid is een geëvalueerde case; de tarieven liggen niet vast.

  3. 03

    Er is geen beveiligingsaudit, geen SOC 2-rapport en geen DPA. Er zijn geen klanten en geen casestudy's, dus er worden er geen aangehaald.

  4. 04

    Meldingen gaan alleen per e-mail: geen Slack, pager of webhook. Er is geen rapportdocument. Een run wordt gelezen in de workbench of geëxporteerd als bundel.

  5. 05

    Evaluatie in productie is niet gebouwd: traces worden op uw eigen machine ontvangen, en nog niets beoordeelt productieverkeer.

  6. 06

    Het is van begin tot eind gedraaid tegen precies één live systeem van een derde partij. Dat is het bewijs hierboven, en het is één systeem.

Meet voordat je uitbrengt.

Neem één systeem en één dataset mee. Begin met één lokale run en houd het bewijs op je eigen machine.