Aan de slag
Kernbegrippen
Oloproof meet een AI-systeem zoals een onderzoek alles meet: dezelfde cases, dezelfde judges, dezelfde seeds, gedraaid bij elke wijziging. Wat het toevoegt aan een testsuite is dat elk getal met zijn onzekerheid komt, en dat een releasebeslissing wordt genomen op het interval in plaats van op de schatting.
De keten
Zeven schakels, en elk daarvan is een record dat je op zichzelf kunt lezen.
| Schakel | Wat het is |
|---|---|
| Observatie | Wat het systeem deed, vastgelegd als een uitvoeringsartefact |
| Meting | Wat een evaluator erover oordeelde |
| Inferentie | Een metriek met een interval, over een vermelde noemer |
| Diagnose | Mislukkingen gegroepeerd in factoren, met aantallen en aannames |
| Beslissing | PASS, FAIL, INSUFFICIENT_EVIDENCE of MANUAL_REVIEW |
| Aanbeveling | Een releaseactie, die een veld is en geen vijfde toestand |
| Bewijs | De herkomst waarmee iemand anders alles kan controleren |
Elke schakel wordt apart opgeslagen en is onafhankelijk herbruikbaar. Een suite opnieuw draaien tegen een ongewijzigde kandidaat hergebruikt de uitvoeringen en oordelen die er al zijn, en daarom kost een herhaalde run bijna niets.
De vier beslissingstoestanden
Er zijn er precies vier, en één daarvan is de reden dat dit product bestaat.
- PASS — de ondergrens van het interval haalt de minimumdrempel.
- FAIL — de bovengrens van het interval ligt eronder.
- INSUFFICIENT_EVIDENCE — geen van beide, dus het bewijs beslist niet.
- MANUAL_REVIEW — een persoon wordt gevraagd, omdat de methode weigerde te antwoorden.
Voor een minimumdrempel T en een interval [L, U]: geslaagd dan en slechts dan als L >= T, mislukt dan en slechts dan als U < T, anders onvoldoende. Regels met een maximumdrempel zijn het spiegelbeeld.
INSUFFICIENT_EVIDENCE is geen zachte mislukking. Het is het eerlijke antwoord wanneer een suite te klein is of een effect te dicht bij de drempel ligt om van ruis te onderscheiden, en het als een geslaagd resultaat behandelen is de meest voorkomende manier waarop een evaluatie het team dat haar draait misleidt.
Wat geen beslissingstoestand is
RUN_ERROR, PARTIAL en CANCELLED beschrijven wat er met een run gebeurde, niet wat er over een systeem werd besloten. Een run die een fout gaf, draagt helemaal geen kwaliteitsresultaat, en die als een mislukking presenteren vertelt een ontwikkelaar dat zijn wijziging slecht is terwijl in werkelijkheid het harnas omviel.
Het onderscheid doet er het meest toe wanneer het ongelegen komt. Een metriek die een niet-beoordeelde case als nul telt, rekent de eigen storingen van een systeem het model aan als kwaliteitsfouten, en dat is een echte bevinding uit het draaien van deze engine tegen een live assistent.
Noemers
Een percentage is een getal over een noemer, en de noemer is waar evaluaties stilletjes misgaan. Oloproof legt voor elke metriek vier aantallen vast — totaal, in aanmerking komend, geobserveerd en ontbrekend — en een case die niet gemeten kon worden, wordt begrensd in plaats van weggelaten.
Een noemer die krimpt wanneer een systeem begint te falen, is hoe een falend systeem een stijgende score rapporteert.
Verder lezen
- Een suite schrijven: wat een case, een systeem en een evaluator zijn, en hoe je ze declareert.
- CI gaten: een beslissing omzetten in een exitcode.
- Judges: waaraan een LLM-judge moet voldoen voordat die een release mag gaten.
- Geclusterde cases: wat er verandert wanneer cases niet onafhankelijk zijn.