Commencer
Concepts fondamentaux
Oloproof mesure un système d’IA comme une étude mesure n’importe quoi : les mêmes cas, les mêmes juges, les mêmes graines, exécutés à chaque changement. Ce qu’il ajoute à une suite de tests, c’est que chaque nombre arrive avec son incertitude, et qu’une décision de publication est prise sur l’intervalle plutôt que sur l’estimation.
La chaîne
Sept maillons, et chacun est un enregistrement que vous pouvez lire isolément.
| Maillon | Ce que c’est |
|---|---|
| Observation | Ce qu’a fait le système, capturé comme artefact d’exécution |
| Mesure | Ce qu’un évaluateur en a jugé |
| Inférence | Une métrique avec un intervalle, sur un dénominateur déclaré |
| Diagnostic | Des échecs regroupés en facteurs, avec effectifs et hypothèses |
| Décision | PASS, FAIL, INSUFFICIENT_EVIDENCE ou MANUAL_REVIEW |
| Recommandation | Une action de publication, qui est un champ et non un cinquième état |
| Preuves | La provenance qui permet à quelqu’un d’autre de tout vérifier |
Chaque maillon est stocké séparément et réutilisable indépendamment. Relancer une suite sur un candidat inchangé réutilise les exécutions et les jugements déjà disponibles, ce qui explique qu’une exécution répétée ne coûte presque rien.
Les quatre états de décision
Il y en a exactement quatre, et l’un d’eux est la raison d’être de ce produit.
- PASS — la borne inférieure de l’intervalle atteint le seuil minimal.
- FAIL — la borne supérieure de l’intervalle est en dessous.
- INSUFFICIENT_EVIDENCE — ni l’un ni l’autre : les preuves ne tranchent pas.
- MANUAL_REVIEW — une personne est sollicitée, parce que la méthode a refusé de répondre.
Pour un seuil minimal T et un intervalle [L, U] : réussite si et seulement si L >= T, échec si et seulement si U < T, sinon insuffisant. Les règles à seuil maximal en sont l’image miroir.
INSUFFICIENT_EVIDENCE n’est pas un échec atténué. C’est la réponse honnête quand une suite est trop petite ou un effet trop proche du seuil pour être distingué du bruit, et le traiter comme une réussite est de loin la manière la plus courante dont une évaluation induit en erreur l’équipe qui la mène.
Ce qui n’est pas un état de décision
RUN_ERROR, PARTIAL et CANCELLED décrivent ce qui est arrivé à une exécution, pas ce qui a été décidé à propos d’un système. Une exécution en erreur ne porte aucun résultat de qualité, et la présenter comme un échec dit à un développeur que son changement est mauvais alors qu’en vérité c’est le banc de test qui est tombé.
La distinction compte surtout quand elle dérange. Une métrique qui compte un cas non noté comme un zéro impute au modèle, comme des échecs de qualité, les pannes du système lui-même ; c’est un constat réel, tiré de l’exécution de ce moteur face à un assistant en service.
Dénominateurs
Un taux est un nombre rapporté à un dénominateur, et c’est dans le dénominateur que les évaluations se trompent sans bruit. Oloproof enregistre quatre effectifs pour chaque métrique — total, éligible, observé et manquant — et un cas qui n’a pas pu être mesuré est borné plutôt qu’écarté.
Un dénominateur qui rétrécit quand un système commence à échouer, c’est ainsi qu’un système en échec affiche un score en hausse.
Pour aller plus loin
- Écrire une suite : ce que sont un cas, un système et un évaluateur, et comment les déclarer.
- Porte de CI : transformer une décision en code de sortie.
- Juges : ce qu’un juge LLM doit franchir avant de pouvoir servir de porte à une publication.
- Cas groupés : ce qui change quand les cas ne sont pas indépendants.