Documentation
Écrivez une suite. Faites-en une porte.
Oloproof décide des publications sur des intervalles de confiance plutôt que sur des estimations ponctuelles. Ces pages expliquent comment déclarer ce qu’il faut mesurer, transformer une décision en code de sortie, et ce qu’un juge LLM doit franchir avant de pouvoir servir de porte.
Démarrage rapideInstallez le moteur, générez la structure d’un projet, et obtenez une première exécution et une décision de porte sur votre propre machine. Rien n’en sort à moins que vous ne le poussiez.Concepts fondamentauxOloproof mesure un système d’IA comme une étude mesure n’importe quoi : les mêmes cas, les mêmes juges, les mêmes graines, exécutés à chaque changement. Ce qu’il ajoute à une suite de tests, c’est que chaque nombre arrive avec son incertitude, et qu’une décision de publication est prise sur l’intervalle plutôt que sur l’estimation.Écrire une suiteUne suite, c’est deux fichiers et un jeu de données. oloproof init génère la structure des deux, et cette structure est commentée parce que le premier parcours d’intégration a perdu quatre tentatives à cause d’une chaîne manquante plutôt que d’une fonctionnalité manquante.L’API PythonTout ce que fait la CLI, la bibliothèque le fait. Utilisez-la quand l’évaluation a sa place dans un script, un notebook ou une suite de tests plutôt qu’à côté d’un fichier de configuration.Recording what a system didA system's output is what an evaluator reads by default. Everything else it did — the prompt it built, the passages it retrieved, the tools it called, the tokens it spent — is recorded alongside the output as artifacts and usage, and every artifact is stored content-addressed with the execution that produced it.Progression et concurrenceUne suite exécutée face à un modèle en service prend plusieurs minutes, dont la plupart passées à attendre le modèle. Cette page explique combien d’appels Oloproof garde en vol, ce qu’il vous montre pendant qu’ils s’exécutent, et comment savoir combien d’exécution supplémentaire permettrait de trancher une règle qui ne l’a pas été.Gating CIA gate compares measured evidence against a threshold you declared, and exits with a code your CI understands. The decision is made on the interval, not on the estimate.Exécution en CIPorte de CI couvre la politique de publication et la signification de chaque code de sortie. Cette page traite de ce qui se passe à l'intérieur d'un job de CI : comment y installer Oloproof, où résident les preuves pendant l'exécution du job, comment lire un résultat sans analyser un tableau, et comment comparer une pull request à la branche qu'elle cible.Comparing a candidate to a baselineThe workflow the rest of this product exists for: you changed something, and you want to know whether it helped. A comparison pairs two runs case by case and reports the difference with an interval, so a two-point move is never mistaken for a win.Règles de comparaisonComparer un candidat à une référence présente le flux de travail. Cette page est la référence des règles qui tranchent une comparaison : quels types existent, ce que chacun demande, dans quelle unité une marge est exprimée, et ce qui déplace l'intervalle sur lequel elles sont lues.Cas groupésLa plupart des calculs d’intervalles supposent que chaque cas est indépendant de tous les autres. Trois tours d’une même conversation ne le sont pas : quand la conversation déraille, les trois ont tendance à dérailler ensemble. Une suite qui les traite comme indépendants rapporte un intervalle plus étroit que ce que les preuves justifient, et une porte peut réussir sur cette base.SegmentsUn taux global peut rester stable alors qu'une partie de la suite s'effondre. Un segment est une partie déclarée de la suite, mesurée à part, afin que l'effondrement soit visible. Les segments s'accompagnent de deux disciplines, car examiner de nombreuses parties d'une suite est précisément la manière dont une évaluation trouve du bruit et le prend pour un résultat.JudgesAn LLM judge is one kind of evaluator, not all of them. Oloproof has three kinds — deterministic, LLM judge, and custom — and the rules on this page are about the second, because a model's verdict is the one that needs measuring against a human's.Évaluation RAGUne réponse augmentée par la recherche peut être fausse pour quatre raisons différentes : le bon passage n'a jamais été récupéré ; il a été récupéré mais classé trop bas ; il a été classé assez haut puis retiré du contexte ; ou il a atteint le modèle et le modèle s'est trompé malgré tout. Un chiffre d'exactitude unique ne permet pas de les distinguer. Oloproof exécute un système RAG en deux étapes qu'il peut observer, mesure chacune, et réexécute les cas en échec sous des modifications contrôlées pour déterminer laquelle de ces raisons s'applique.Agents et outilsOloproof ne pilote pas d'agent. Votre agent exécute sa propre boucle, appelle ses propres outils et enregistre ce qui s'est passé sous la forme d'un artefact agent_trajectory/v1. Chaque métrique d'agent est lue à partir de cet enregistrement : l'enregistrement constitue donc toute l'intégration.Classifieurs et régresseursUn modèle prédictif s'évalue comme tout autre système : un appelable renvoie une prédiction pour chaque cas, et des évaluateurs la lisent. Ce qui change, ce sont les dénominateurs. L'exactitude, le rappel et la précision sont trois taux calculés sur trois ensembles de lignes différents, et un modèle peut sembler bon sur l'un tout en échouant à la question que pose le métier.NotificationsUne exécution réussie ne notifie personne. Quand Oloproof envoie une notification, cela veut dire que quelque chose attend une décision ou est sur le point de cesser de fonctionner : une publication qu’une porte a bloquée, une exécution gérée qui s’est terminée, une allocation qui s’épuise.ErreursLa distinction pour laquelle cette page existe : une exécution en échec et une exécution en erreur sont deux choses différentes, et présenter l’une comme l’autre dit à un développeur que son changement est mauvais alors qu’en vérité c’est le banc de test qui est tombé.Référence de la CLIChaque commande qu’Oloproof enregistre, avec ce qu’elle fait. Chacune accepte --help, qui affiche le texte complet dont ces résumés sont tirés.