Loslegen
Kernkonzepte
Oloproof misst ein KI-System so, wie eine Studie irgendetwas misst: dieselben Fälle, dieselben Judges, dieselben Seeds, bei jeder Änderung ausgeführt. Was es einer Testsuite hinzufügt: Jede Zahl kommt mit ihrer Unsicherheit, und eine Release-Entscheidung fällt anhand des Intervalls statt anhand der Schätzung.
Die Kette
Sieben Glieder, und jedes ist ein Datensatz, den Sie für sich lesen können.
| Glied | Was es ist |
|---|---|
| Beobachtung | Was das System getan hat, erfasst als Ausführungsartefakt |
| Messung | Was ein Evaluator darüber geurteilt hat |
| Inferenz | Eine Metrik mit einem Intervall, über einen angegebenen Nenner |
| Diagnose | Fehlschläge, zu Faktoren gruppiert, mit Zählungen und Annahmen |
| Entscheidung | PASS, FAIL, INSUFFICIENT_EVIDENCE oder MANUAL_REVIEW |
| Empfehlung | Eine Release-Aktion, die ein Feld ist und kein fünfter Zustand |
| Evidenz | Die Herkunftsnachweise, mit denen jemand anderes all das prüfen kann |
Jedes Glied wird separat gespeichert und ist unabhängig wiederverwendbar. Eine Suite erneut gegen einen unveränderten Kandidaten auszuführen, verwendet die bereits vorhandenen Ausführungen und Urteile wieder. Deshalb kostet ein wiederholter Lauf fast nichts.
Die vier Entscheidungszustände
Es gibt genau vier, und einer davon ist der Grund, warum es dieses Produkt gibt.
- PASS — die untere Grenze des Intervalls erreicht den Mindestschwellenwert.
- FAIL — die obere Grenze des Intervalls liegt darunter.
- INSUFFICIENT_EVIDENCE — keines von beiden, die Evidenz entscheidet also nicht.
- MANUAL_REVIEW — ein Mensch wird gefragt, weil die Methode eine Antwort abgelehnt hat.
Für einen Mindestschwellenwert T und ein Intervall [L, U]: bestanden genau dann, wenn L >= T, fehlgeschlagen genau dann, wenn U < T, andernfalls unzureichend. Regeln mit Höchstschwellenwert sind das Spiegelbild.
INSUFFICIENT_EVIDENCE ist kein weicher Fehlschlag. Es ist die ehrliche Antwort, wenn eine Suite zu klein oder ein Effekt zu nah am Schwellenwert ist, um ihn von Rauschen zu unterscheiden, und es als bestanden zu werten, ist der mit Abstand häufigste Weg, auf dem eine Evaluierung das Team in die Irre führt, das sie betreibt.
Was kein Entscheidungszustand ist
RUN_ERROR, PARTIAL und CANCELLED beschreiben, was mit einem Lauf geschehen ist, nicht, was über ein System entschieden wurde. Ein Lauf mit Fehler trägt überhaupt kein Qualitätsergebnis, und wer ihn als Fehlschlag darstellt, sagt einem Entwickler, seine Änderung sei schlecht, während in Wahrheit der Harness umgefallen ist.
Die Unterscheidung zählt dann am meisten, wenn sie unbequem ist. Eine Metrik, die einen unbewerteten Fall als Null zählt, lastet die eigenen Ausfälle eines Systems dem Modell als Qualitätsmängel an — ein echter Befund aus dem Einsatz dieser Engine gegen einen produktiven Assistenten.
Nenner
Eine Rate ist eine Zahl über einem Nenner, und am Nenner gehen Evaluierungen still schief. Oloproof zeichnet für jede Metrik vier Zählungen auf — gesamt, zulässig, beobachtet und fehlend —, und ein Fall, der nicht gemessen werden konnte, wird begrenzt statt verworfen.
Ein Nenner, der schrumpft, sobald ein System zu versagen beginnt, ist der Weg, auf dem ein versagendes System einen steigenden Score meldet.
Wie es weitergeht
- Eine Suite schreiben: was ein Fall, ein System und ein Evaluator sind und wie Sie sie
deklarieren.
- Gating in der CI: aus einer Entscheidung einen Exit-Code machen.
- Judges: was ein LLM-Judge erfüllen muss, bevor er als Gate für ein Release dienen darf.
- Geclusterte Fälle: was sich ändert, wenn Fälle nicht unabhängig sind.