Documentatie
Schrijf een suite. Gebruik hem als gate.
Oloproof beslist over releases op basis van betrouwbaarheidsintervallen in plaats van puntschattingen. Deze pagina's behandelen hoe je declareert wat je meet, hoe je een beslissing omzet in een exitcode en wat een LLM-judge moet halen voordat hij ergens als gate mag dienen.
Snel aan de slagInstalleer de engine, zet een project op en krijg een eerste run en een gate-beslissing op je eigen machine. Er verlaat niets die machine tenzij je pusht.KernbegrippenOloproof meet een AI-systeem zoals een onderzoek alles meet: dezelfde cases, dezelfde judges, dezelfde seeds, gedraaid bij elke wijziging. Wat het toevoegt aan een testsuite is dat elk getal met zijn onzekerheid komt, en dat een releasebeslissing wordt genomen op het interval in plaats van op de schatting.Een suite schrijvenEen suite bestaat uit twee bestanden en een dataset. oloproof init zet beide op, en de opzet is van commentaar voorzien omdat de eerste onboardingronde vier pogingen verloor aan een ontbrekende string in plaats van aan een ontbrekende functie.De Python-APIAlles wat de CLI doet, doet de library ook. Gebruik die wanneer de evaluatie thuishoort in een script, een notebook of een testsuite in plaats van naast een configuratiebestand.Recording what a system didA system's output is what an evaluator reads by default. Everything else it did — the prompt it built, the passages it retrieved, the tools it called, the tokens it spent — is recorded alongside the output as artifacts and usage, and every artifact is stored content-addressed with the execution that produced it.Voortgang en gelijktijdigheidEen suite tegen een live model duurt minuten, en de meeste daarvan gaan op aan wachten op het model. Deze pagina behandelt hoeveel aanroepen Oloproof tegelijk onderweg houdt, wat het je laat zien terwijl ze lopen, en hoe je uitzoekt hoeveel meer draaien een regel zou beslechten die niet besliste.Gating CIA gate compares measured evidence against a threshold you declared, and exits with a code your CI understands. The decision is made on the interval, not on the estimate.Draaien in CICI gaten behandelt de releasepolicy en wat elke exitcode betekent. Deze pagina is het deel dat zich binnen een CI-job afspeelt: hoe je Oloproof daar installeert, waar het bewijs staat terwijl de job draait, hoe je een resultaat leest zonder een tabel te parsen, en hoe je een pull request vergelijkt met de branch waarop die gericht is.Comparing a candidate to a baselineThe workflow the rest of this product exists for: you changed something, and you want to know whether it helped. A comparison pairs two runs case by case and reports the difference with an interval, so a two-point move is never mistaken for a win.VergelijkingsregelsEen kandidaat met een baseline vergelijken laat de workflow zien. Deze pagina is de referentie voor de regels waarmee over een vergelijking wordt beslist: welke soorten er zijn, wat elke soort vraagt, waarin een marge wordt gemeten, en wat het interval verschuift waaruit ze worden gelezen.Geclusterde casesDe meeste intervalberekeningen gaan ervan uit dat elke case onafhankelijk is van elke andere. Drie beurten van één gesprek zijn dat niet: wanneer het gesprek misgaat, gaan ze meestal alle drie mis. Een suite die ze als onafhankelijk behandelt, rapporteert een smaller interval dan het bewijs ondersteunt, en een gate kan daarop slagen.SlicesEen globaal percentage kan stabiel blijven terwijl één deel van de suite instort. Een slice is een gedeclareerd deel van de suite, op zichzelf gemeten, zodat de instorting zichtbaar is. Slices komen met twee disciplines, omdat naar veel delen van een suite kijken de manier is waarop een evaluatie ruis vindt en het een bevinding noemt.JudgesAn LLM judge is one kind of evaluator, not all of them. Oloproof has three kinds — deterministic, LLM judge, and custom — and the rules on this page are about the second, because a model's verdict is the one that needs measuring against a human's.RAG-evaluatieEen retrieval-augmented antwoord kan om vier verschillende redenen fout zijn: de juiste passage werd nooit opgehaald, ze werd opgehaald en te laag gerangschikt, ze werd hoog genoeg gerangschikt en daarna uit de context gelaten, of ze bereikte het model en het model deed het toch fout. Eén accuracycijfer kan ze niet uit elkaar houden. Oloproof draait een RAG-systeem als twee fasen die het kan zien, meet elke fase, en voert mislukte cases opnieuw uit onder gecontroleerde wijzigingen om uit te zoeken welke reden van toepassing is.Agents en toolsOloproof stuurt geen agent aan. Je agent draait zijn eigen lus, roept zijn eigen tools aan, en legt vast wat er gebeurde als een agent_trajectory/v1-artefact. Elke agentmetriek wordt uit dat record gelezen, dus het record is de hele integratie.Classifiers en regressorsEen predictief model wordt geëvalueerd zoals elk ander systeem: een aanroepbare functie geeft voor elke case een voorspelling terug, en evaluators lezen die. Wat er verandert, zijn de noemers. Accuracy, recall en precisie zijn drie percentages over drie verschillende verzamelingen rijen, en een model kan er op de ene goed uitzien terwijl het faalt op de vraag die het bedrijf stelt.MeldingenEen geslaagde run meldt niemand iets. Wanneer Oloproof een melding stuurt, betekent dat dat er iets een beslissing nodig heeft of op het punt staat niet meer te werken: een release die een gate blokkeerde, een beheerde run die eindigde, een tegoed dat opraakt.FoutenHet onderscheid waarvoor deze pagina bestaat: een run die mislukte en een run die een fout gaf zijn verschillende dingen, en het ene als het andere presenteren vertelt een ontwikkelaar dat zijn wijziging slecht is terwijl in werkelijkheid het harnas omviel.CLI-referentieElke opdracht die Oloproof registreert, met wat die doet. Elke opdracht accepteert --help, dat de volledige tekst afdrukt waaruit deze samenvattingen komen.