Skip to content

Commencer

Concepts fondamentaux

Oloproof mesure un système d’IA comme une étude mesure n’importe quoi : les mêmes cas, les mêmes juges, les mêmes graines, exécutés à chaque changement. Ce qu’il ajoute à une suite de tests, c’est que chaque nombre arrive avec son incertitude, et qu’une décision de publication est prise sur l’intervalle plutôt que sur l’estimation.

La chaîne

Sept maillons, et chacun est un enregistrement que vous pouvez lire isolément.

MaillonCe que c’est
ObservationCe qu’a fait le système, capturé comme artefact d’exécution
MesureCe qu’un évaluateur en a jugé
InférenceUne métrique avec un intervalle, sur un dénominateur déclaré
DiagnosticDes échecs regroupés en facteurs, avec effectifs et hypothèses
DécisionPASS, FAIL, INSUFFICIENT_EVIDENCE ou MANUAL_REVIEW
RecommandationUne action de publication, qui est un champ et non un cinquième état
PreuvesLa provenance qui permet à quelqu’un d’autre de tout vérifier

Chaque maillon est stocké séparément et réutilisable indépendamment. Relancer une suite sur un candidat inchangé réutilise les exécutions et les jugements déjà disponibles, ce qui explique qu’une exécution répétée ne coûte presque rien.

Les quatre états de décision

Il y en a exactement quatre, et l’un d’eux est la raison d’être de ce produit.

  • PASS — la borne inférieure de l’intervalle atteint le seuil minimal.
  • FAIL — la borne supérieure de l’intervalle est en dessous.
  • INSUFFICIENT_EVIDENCE — ni l’un ni l’autre : les preuves ne tranchent pas.
  • MANUAL_REVIEW — une personne est sollicitée, parce que la méthode a refusé de répondre.

Pour un seuil minimal T et un intervalle [L, U] : réussite si et seulement si L >= T, échec si et seulement si U < T, sinon insuffisant. Les règles à seuil maximal en sont l’image miroir.

INSUFFICIENT_EVIDENCE n’est pas un échec atténué. C’est la réponse honnête quand une suite est trop petite ou un effet trop proche du seuil pour être distingué du bruit, et le traiter comme une réussite est de loin la manière la plus courante dont une évaluation induit en erreur l’équipe qui la mène.

Ce qui n’est pas un état de décision

RUN_ERROR, PARTIAL et CANCELLED décrivent ce qui est arrivé à une exécution, pas ce qui a été décidé à propos d’un système. Une exécution en erreur ne porte aucun résultat de qualité, et la présenter comme un échec dit à un développeur que son changement est mauvais alors qu’en vérité c’est le banc de test qui est tombé.

La distinction compte surtout quand elle dérange. Une métrique qui compte un cas non noté comme un zéro impute au modèle, comme des échecs de qualité, les pannes du système lui-même ; c’est un constat réel, tiré de l’exécution de ce moteur face à un assistant en service.

Dénominateurs

Un taux est un nombre rapporté à un dénominateur, et c’est dans le dénominateur que les évaluations se trompent sans bruit. Oloproof enregistre quatre effectifs pour chaque métrique — total, éligible, observé et manquant — et un cas qui n’a pas pu être mesuré est borné plutôt qu’écarté.

Un dénominateur qui rétrécit quand un système commence à échouer, c’est ainsi qu’un système en échec affiche un score en hausse.

Pour aller plus loin

  • Écrire une suite : ce que sont un cas, un système et un évaluateur, et comment les déclarer.
  • Porte de CI : transformer une décision en code de sortie.
  • Juges : ce qu’un juge LLM doit franchir avant de pouvoir servir de porte à une publication.
  • Cas groupés : ce qui change quand les cas ne sont pas indépendants.