Skip to content

Dokumentation

Schreiben Sie eine Suite. Machen Sie sie zum Gate.

Oloproof entscheidet Releases anhand von Konfidenzintervallen statt Punktschätzungen. Diese Seiten behandeln, wie Sie deklarieren, was gemessen wird, wie aus einer Entscheidung ein Exit-Code wird und was ein LLM-Judge erfüllen muss, bevor er als Gate für irgendetwas dienen darf.

SchnellstartInstallieren Sie die Engine, legen Sie ein Projekt an und erhalten Sie einen ersten Lauf und eine Gate-Entscheidung auf Ihrem eigenen Rechner. Nichts verlässt ihn, solange Sie nicht pushen.KernkonzepteOloproof misst ein KI-System so, wie eine Studie irgendetwas misst: dieselben Fälle, dieselben Judges, dieselben Seeds, bei jeder Änderung ausgeführt. Was es einer Testsuite hinzufügt: Jede Zahl kommt mit ihrer Unsicherheit, und eine Release-Entscheidung fällt anhand des Intervalls statt anhand der Schätzung.Eine Suite schreibenEine Suite besteht aus zwei Dateien und einem Datensatz. oloproof init legt beide an, und das Gerüst ist kommentiert, weil beim ersten Onboarding-Durchgang vier Versuche an einem fehlenden String scheiterten und nicht an einer fehlenden Funktion.Die Python-APIAlles, was die CLI tut, tut auch die Bibliothek. Verwenden Sie sie, wenn die Evaluierung in ein Skript, ein Notebook oder eine Testsuite gehört statt neben eine Konfigurationsdatei.Recording what a system didA system's output is what an evaluator reads by default. Everything else it did — the prompt it built, the passages it retrieved, the tools it called, the tokens it spent — is recorded alongside the output as artifacts and usage, and every artifact is stored content-addressed with the execution that produced it.Fortschritt und NebenläufigkeitEine Suite gegen ein produktives Modell dauert Minuten, und die meisten davon vergehen mit Warten auf das Modell. Diese Seite behandelt, wie viele Aufrufe Oloproof gleichzeitig offen hält, was es Ihnen während ihrer Ausführung zeigt und wie Sie herausfinden, wie viel weiteres Ausführen eine Regel entscheiden würde, die nicht entschieden hat.Gating CIA gate compares measured evidence against a threshold you declared, and exits with a code your CI understands. The decision is made on the interval, not on the estimate.In CI ausführenGating in der CI beschreibt die Release-Policy und die Bedeutung jedes Exit-Codes. Diese Seite behandelt den Teil, der innerhalb eines CI-Jobs passiert: wie Sie Oloproof dort installieren, wo die Evidenz während des Jobs liegt, wie Sie ein Ergebnis lesen, ohne eine Tabelle zu parsen, und wie Sie einen Pull Request mit dem Branch vergleichen, auf den er zielt.Comparing a candidate to a baselineThe workflow the rest of this product exists for: you changed something, and you want to know whether it helped. A comparison pairs two runs case by case and reports the difference with an interval, so a two-point move is never mistaken for a win.VergleichsregelnEinen Kandidaten mit einer Baseline vergleichen zeigt den Workflow. Diese Seite ist die Referenz für die Regeln, nach denen ein Vergleich entschieden wird: welche Arten es gibt, was jede fragt, in welcher Einheit eine Marge gemessen wird und was das Intervall verschiebt, aus dem sie gelesen werden.Geclusterte FälleDie meiste Intervallrechnung nimmt an, dass jeder Fall von jedem anderen unabhängig ist. Drei Züge eines Gesprächs sind es nicht: Wenn das Gespräch schiefgeht, gehen meist alle drei schief. Eine Suite, die sie als unabhängig behandelt, meldet ein engeres Intervall, als die Evidenz trägt, und ein Gate kann darauf bestehen.SlicesEine globale Rate kann stabil bleiben, während ein Teil der Suite einbricht. Ein Slice ist ein deklarierter Teil der Suite, der für sich gemessen wird, sodass der Einbruch sichtbar wird. Slices kommen mit zwei Disziplinen, denn der Blick auf viele Teile einer Suite ist genau der Weg, auf dem eine Evaluation Rauschen findet und es für einen Befund hält.JudgesAn LLM judge is one kind of evaluator, not all of them. Oloproof has three kinds — deterministic, LLM judge, and custom — and the rules on this page are about the second, because a model's verdict is the one that needs measuring against a human's.RAG-EvaluationEine durch Retrieval gestützte Antwort kann aus vier verschiedenen Gründen falsch sein: Die richtige Passage wurde nie abgerufen, sie wurde abgerufen und zu niedrig eingestuft, sie wurde hoch genug eingestuft und dann aus dem Kontext entfernt, oder sie hat das Modell erreicht, und das Modell hat trotzdem falsch geantwortet. Eine einzelne Accuracy-Zahl kann diese Fälle nicht auseinanderhalten. Oloproof führt ein RAG-System als zwei Stufen aus, die es einsehen kann, misst jede davon und führt fehlgeschlagene Fälle unter kontrollierten Änderungen erneut aus, um herauszufinden, welcher Grund zutrifft.Agenten und ToolsOloproof steuert keinen Agenten. Ihr Agent führt seine eigene Schleife aus, ruft seine eigenen Tools auf und zeichnet auf, was passiert ist, als agent_trajectory/v1-Artefakt. Jede Agentenmetrik wird aus diesem Datensatz gelesen, daher ist der Datensatz die gesamte Integration.Klassifikatoren und RegressorenEin prädiktives Modell wird wie jedes andere System evaluiert: Ein Callable liefert für jeden Fall eine Vorhersage, und Evaluatoren lesen sie. Was sich ändert, sind die Nenner. Accuracy, Recall und Precision sind drei Raten über drei verschiedene Mengen von Zeilen, und ein Modell kann bei einer davon gut aussehen und zugleich an der Frage scheitern, die das Geschäft stellt.BenachrichtigungenEin bestandener Lauf benachrichtigt niemanden. Wenn Oloproof eine Benachrichtigung sendet, bedeutet das, dass etwas eine Entscheidung braucht oder bald nicht mehr funktioniert: ein Release, das ein Gate blockiert hat, ein verwalteter Lauf, der geendet hat, ein Kontingent, das zur Neige geht.FehlerDie Unterscheidung, für die diese Seite existiert: Ein fehlgeschlagener Lauf und ein Lauf mit Fehler sind verschiedene Dinge, und wer das eine als das andere darstellt, sagt einem Entwickler, seine Änderung sei schlecht, während in Wahrheit der Harness umgefallen ist.CLI-ReferenzJeder Befehl, den Oloproof registriert, mit seiner Funktion. Jeder akzeptiert --help, das den vollständigen Text ausgibt, aus dem diese Zusammenfassungen stammen.