Skip to content

Empezar

Conceptos básicos

Oloproof mide un sistema de IA de la misma forma en que un estudio mide cualquier cosa: los mismos casos, los mismos jueces, las mismas semillas, ejecutados en cada cambio. Lo que añade a una suite de pruebas es que cada número llega con su incertidumbre, y que una decisión de publicación se toma sobre el intervalo y no sobre la estimación.

La cadena

Siete eslabones, y cada uno es un registro que se puede leer por separado.

EslabónQué es
ObservaciónLo que hizo el sistema, capturado como artefacto de ejecución
MediciónLo que un evaluador juzgó al respecto
InferenciaUna métrica con un intervalo, sobre un denominador declarado
DiagnósticoFallos agrupados en factores, con conteos y supuestos
DecisiónPASS, FAIL, INSUFFICIENT_EVIDENCE o MANUAL_REVIEW
RecomendaciónUna acción de publicación, que es un campo y no un quinto estado
EvidenciaLa procedencia que permite a otra persona comprobarlo todo

Cada eslabón se almacena por separado y se puede reutilizar de forma independiente. Volver a ejecutar una suite contra un candidato sin cambios reutiliza las ejecuciones y los juicios que ya tiene, y por eso una ejecución repetida no cuesta casi nada.

Los cuatro estados de decisión

Hay exactamente cuatro, y uno de ellos es la razón por la que existe este producto.

  • PASS: el límite inferior del intervalo alcanza el umbral mínimo.
  • FAIL: el límite superior del intervalo queda por debajo de él.
  • INSUFFICIENT_EVIDENCE: ninguna de las dos cosas, así que la evidencia no decide.
  • MANUAL_REVIEW: se consulta a una persona, porque el método declinó responder.

Para un umbral mínimo T y un intervalo [L, U]: se pasa si y solo si L >= T, se falla si y solo si U < T; en otro caso, la evidencia es insuficiente. Las reglas de umbral máximo son la imagen especular.

INSUFFICIENT_EVIDENCE no es un fallo suave. Es la respuesta honesta cuando una suite es demasiado pequeña, o un efecto está demasiado cerca del umbral, para separarlo del ruido; tratarlo como un aprobado es la forma más común en que una evaluación engaña al equipo que la ejecuta.

Lo que no es un estado de decisión

RUN_ERROR, PARTIAL y CANCELLED describen lo que le ocurrió a una ejecución, no lo que se decidió sobre un sistema. Una ejecución con error no lleva ningún resultado de calidad, y presentarla como un fallo le dice a un desarrollador que su cambio es malo cuando la verdad es que el harness se cayó.

La distinción importa sobre todo cuando es incómoda. Una métrica que cuenta como cero un caso sin calificar atribuye las caídas del propio sistema al modelo como fallos de calidad, y ese es un hallazgo real de ejecutar este motor contra un asistente en vivo.

Denominadores

Una tasa es un número sobre un denominador, y el denominador es donde las evaluaciones se equivocan sin hacer ruido. Oloproof registra cuatro conteos para cada métrica (total, elegibles, observados y faltantes), y un caso que no se pudo medir se acota en lugar de descartarse.

Un denominador que se reduce cuando un sistema empieza a fallar es la manera en que un sistema que falla informa una puntuación en alza.

Siguientes pasos

  • Escribir una suite: qué son un caso, un sistema y un evaluador, y cómo se declaran.
  • Gates en CI: convertir una decisión en un código de salida.
  • Jueces: lo que un juez LLM debe superar antes de poder actuar como gate de una publicación.
  • Casos agrupados: lo que cambia cuando los casos no son independientes.