Skip to content
Evaluierung von KI-Systemen

Mit Evidenz entwickeln.

Oloproof hilft Teams, KI-Systeme mit wiederholbaren Tests, Diagnosen und entscheidungsfähiger Evidenz zu evaluieren.

Läuft in Ihrer CI. Ihre Evidenz bleibt auf Ihrem Rechner.

oloproof / compare · olotalk-docs-assistant
Übersicht Vergleich Diagnose Evidenz
BASELINE
olotalk docs assistant · Rerank aus
KANDIDAT
olotalk docs assistant · Rerank an
DATENSATZ
olotalk golden panel · 58 Fälle
METRIK BASELINE KANDIDAT GEPAARTES Δ 95%-KI STATUS
page_hit_1 0.618 0.745 +6.2 [-36.3, +45.5] — Nicht schlüssig
page_hit_3 0.683 0.742 +3.7 [-73.9, +76.2] — Nicht schlüssig
answer_correct 0.685 0.760 +6.5 [-39.4, +48.4] — Nicht schlüssig
page_hit_1 beobachtet 55 / 58 51 / 58 −4 im Intervall ! Begrenzt
page_hit_3 beobachtet 41 / 58 31 / 58 −10 im Intervall ! Begrenzt
answer_correct beobachtet 54 / 58 50 / 58 −4 im Intervall ! Begrenzt
WARUM EVALUIERUNG

Prompts von Hand zu testen übersteht die Produktion nicht.

Teams liefern jede Woche Änderungen an Modellen und Prompts aus. Eine Handvoll Ausgaben in einem Playground stichprobenartig zu prüfen, sagt Ihnen fast nichts darüber, was sich geändert hat, für wen, oder ob ein Release sicher ist.

Oloproof ersetzt das durch eine gemessene Aufzeichnung: dieselben Fälle, dieselben Judges, dieselben Seeds, bei jeder Änderung ausgeführt.

01
Stille Regressionen

Eine Prompt-Änderung behebt eine Fehlerklasse und bricht still eine andere. Niemand bemerkt es, bis ein Kunde es bemerkt.

02
Nicht wiederholbare Ergebnisse

Bei einem produktiven RAG-System änderte etwa jeder neunte beobachtete Fall sein Urteil zwischen identischen Messungen.

03
Scores ohne Bedeutung

Ein produktiver Harness wertete seine 13,8 % HTTP-500-Antworten als Nullen und lastete Ausfälle dem Modell an. Ein Durchschnitt kann keine Entscheidung tragen.

04
Nichts, was man vorzeigen kann

Wenn Risikomanagement, Rechtsabteilung oder ein Kunde fragt, was Sie getestet haben, sind Screenshots in einem Thread keine Antwort.

KERNFUNKTIONEN

Vier Dinge, die jede Release-Entscheidung braucht.

MESSEN
Wiederholbare Evaluierungen

Versionierte Datensätze, fixierte Seeds und deklarative Judges. Jeder Lauf lässt sich exakt reproduzieren, auch Monate später.

VERGLEICHEN
Baseline gegen Kandidat

Differenzen mit Konfidenzintervallen und Schwellenwerten, damit eine Bewegung um zwei Punkte nie mit einem Gewinn verwechselt wird.

DIAGNOSTIZIEREN
Fehlermodi statt Durchschnitte

Fehler gruppiert nach Segment, Intention und Tool-Pfad, jeweils verknüpft mit den genauen Traces dahinter.

ENTSCHEIDEN
Entscheidungsfähige Aufzeichnungen

Eine Release-Empfehlung mit angehängter Evidenz — exportierbar für Review, Audit und Kunden.

Diagnose23 fehlgeschlagene Fälle, Gold-Kontext
Ungeklärt: Gold-Kontext hat es nicht entschieden11 Fälle
Generierungsfehler: richtiger Kontext, falsche Antwort7 Fälle
Retrieval-Fehlschlag: Antwort erreichbar, nicht abgerufen5 Fälle
Rerank an minus aus95%-Intervall, Punkte
hit@1
hit@3
korrekt

Jedes Intervall schneidet die gestrichelte Nulllinie. Allein nach den Punktschätzungen wäre der Reranker ausgeliefert worden.

PLATTFORM

Für Teams, die das Release begründen müssen.

Evaluierungs-Suites als Code

Definieren Sie Datensätze, Judges und Schwellenwerte in der Versionsverwaltung. Prüfen Sie Änderungen an der Evaluierung so, wie Sie Code prüfen.

Judges, die Sie auditieren können

Programmatische Prüfungen, LLM-Judges, trainierte Klassifikatoren, die Text auf Ihrem eigenen Rechner bewerten, und menschliche Labels in einer Pipeline. Die Übereinstimmung jedes Judges mit Menschen wird mit einem Intervall gemessen, und ein Judge, der seine Hürde nicht genommen hat, kann kein Release entscheiden.

Regressions-Gates in der CI

Lassen Sie einen Pull Request fehlschlagen, wenn eine Metrik ihren Schwellenwert überschreitet. Das Gate meldet, welche Fälle sich bewegt haben und um wie viel.

Evidenz auf Trace-Ebene

Jeder Score verweist auf Eingaben, Ausgaben, Tool-Aufrufe, abgerufenen Kontext und die Begründung des Judges. Nichts ist eine Blackbox.

Kosten- und Latenzbudgets

Qualität ist nie die einzige Achse. Verfolgen Sie Ausgaben und Tail-Latenz neben der Korrektheit, unter denselben Schwellenwerten.

Evidenz für die Menschen, die die Entscheidung brauchen

Teilen Sie Lauf, Diagnose und Empfehlung, ohne die gemessene Entscheidung darin zu verändern.

SO FUNKTIONIERT ES

Drei Schritte, dann läuft es von selbst.

1
Suite definieren

Bringen Sie Ihre eigenen Fälle als JSONL-Datei mit. Deklarieren Sie Judges und die Schwellenwerte, die ein Release erreichen muss.

2
Bei jeder Änderung ausführen

Ein Befehl lokal, derselbe Befehl in der CI. Änderungen an Prompt, Modell, Retrieval und Tools werden alle gleich behandelt.

3
Mit der Evidenz entscheiden

Lesen Sie die Differenzen, öffnen Sie die fehlschlagenden Traces und halten Sie die Evidenz an der getroffenen Entscheidung fest.

~/olodemo · nach oloproof init
 oloproof run
Run run_01M3B0CCPA0JFQQ7HWRKYNWFJC [DECIDED/COMPLETE]
Gate: ALLOW (exit 0)

  Rule         Metric       State  Reasons
  label-floor  exact_label  PASS   lower_bound_meets_minimum

  Metric       Estimate  Interval          N
  exact_label  100.0%    [88.4%, 100.0%]   30 / 30 observed · 0 missing

Cache: execution 0 hit/30 miss; judgment 0 hit/30 miss

 oloproof run
Run run_01M3B0CXTTVPTBXAFK3WNGFX42 [DECIDED/COMPLETE]
Gate: ALLOW (exit 0)
Cache: execution 30 hit/0 miss; judgment 0 hit/30 miss
EVIDENZ, DIE SIE WEITERGEBEN KÖNNEN

Jede Zahl führt auf einen Fall zurück.

Läufe sind unveränderlich und datiert. Datensätze, Prompts, Judges und Konfiguration werden gemeinsam versioniert, sodass jedes Ergebnis reproduziert oder angefochten werden kann.

Unveränderlich
Läufe, mit vollständiger Herkunft
Selbst gehostet
auf Ihrer Infrastruktur, Ihre Daten bleiben Ihre
Begrenzt
fehlende Fälle eingepreist, nie verworfen

Nach den Punktschätzungen liefert der Reranker +12,7 Punkte hit@1. Ehrlich gelesen kann dieses Panel nicht sagen, ob er hilft oder schadet.

Oloproof gegen ein produktives RAG-System, 22. September 2026
Oloproof
Evidenz-Bundle
oloproof export RUN_ID
run.jsonder Lauf, seine Suite, sein System und seine Evaluatoren
cases.jsonljeder Fall: Eingabe, Ausgabe, Urteile, Digests
diagnoses.jsonlInterventionen und was sie zurückgewonnen haben
signoffs.jsonlwer trotz blockiertem Gate ausgeliefert hat, und warum
Ein exportiertes Evidenz-Bundle: der Lauf und jeder Fall hinter seinen Zahlen, als Dateien, die Sie behalten.
DIESELBE DISZIPLIN, HIERAUF GERICHTET

Was dies noch nicht ist.

Alles Folgende gilt an dem Tag, an dem Sie es lesen.

  1. 01

    Es gibt kein gehostetes Deployment, für das Sie sich registrieren können. Der Zugang erfolgt auf Einladung.

  2. 02

    Es gibt keine Preise. Die Einheit ist ein evaluierter Fall; die Tarife sind nicht festgelegt.

  3. 03

    Es gibt kein Sicherheitsaudit, keinen SOC-2-Bericht und keinen DPA. Es gibt keine Kunden und keine Fallstudien, daher werden keine zitiert.

  4. 04

    Benachrichtigungen gibt es nur per E-Mail: kein Slack, kein Pager, kein Webhook. Es gibt kein Berichtsdokument. Ein Lauf wird in der Workbench gelesen oder als Bundle exportiert.

  5. 05

    Die Bewertung in Produktion ist nicht gebaut: Traces werden auf Ihrem eigenen Rechner empfangen, und noch bewertet nichts den Produktionsverkehr.

  6. 06

    Es wurde durchgängig gegen genau ein produktives Drittsystem ausgeführt. Das ist die Evidenz oben, und es ist ein System.

Messen, bevor Sie ausliefern.

Bringen Sie ein System und einen Datensatz mit. Beginnen Sie mit einem lokalen Lauf und behalten Sie die Evidenz auf Ihrem Rechner.