Skip to content

Inizia

Concetti fondamentali

Oloproof misura un sistema di IA nel modo in cui uno studio misura qualsiasi cosa: gli stessi casi, gli stessi giudici, gli stessi seed, eseguiti a ogni modifica. Ciò che aggiunge a una suite di test è che ogni numero arriva con la propria incertezza, e una decisione di rilascio viene presa sull'intervallo anziché sulla stima.

La catena

Sette anelli, e ciascuno è un record che puoi leggere da solo.

AnelloChe cos'è
OsservazioneCiò che il sistema ha fatto, catturato come artefatto di esecuzione
MisuraCiò che un valutatore ne ha giudicato
InferenzaUna metrica con un intervallo, su un denominatore dichiarato
DiagnosiFallimenti raggruppati in fattori, con conteggi e ipotesi
DecisionePASS, FAIL, INSUFFICIENT_EVIDENCE o MANUAL_REVIEW
RaccomandazioneUn'azione di rilascio, che è un campo e non un quinto stato
EvidenzaLa provenienza che permette a qualcun altro di verificare tutto quanto

Ogni anello è memorizzato separatamente ed è riutilizzabile in modo indipendente. Rieseguire una suite su un candidato invariato riutilizza le esecuzioni e i giudizi già disponibili, ed è per questo che un'esecuzione ripetuta non costa quasi nulla.

I quattro stati di decisione

Sono esattamente quattro, e uno di essi è la ragione per cui questo prodotto esiste.

  • PASS — il limite inferiore dell'intervallo supera la soglia minima.
  • FAIL — il limite superiore dell'intervallo è al di sotto di essa.
  • INSUFFICIENT_EVIDENCE — nessuno dei due, quindi l'evidenza non decide.
  • MANUAL_REVIEW — si interpella una persona, perché il metodo si è rifiutato di rispondere.

Per una soglia minima T e un intervallo [L, U]: pass se e solo se L >= T, fail se e solo se U < T, altrimenti insufficiente. Le regole con soglia massima sono l'immagine speculare.

INSUFFICIENT_EVIDENCE non è un fallimento attenuato. È la risposta onesta quando una suite è troppo piccola o un effetto troppo vicino alla soglia per distinguerlo dal rumore, e trattarlo come un pass è in assoluto il modo più comune in cui una valutazione inganna il team che la esegue.

Ciò che non è uno stato di decisione

RUN_ERROR, PARTIAL e CANCELLED descrivono ciò che è accaduto a un'esecuzione, non ciò che è stato deciso su un sistema. Un'esecuzione andata in errore non porta alcun risultato di qualità, e presentarla come un fallimento dice a uno sviluppatore che la sua modifica è sbagliata quando la verità è che l'infrastruttura di test è caduta.

La distinzione conta soprattutto quando è scomoda. Una metrica che conta come zero un caso non valutato addebita al modello, come fallimenti di qualità, le interruzioni del sistema stesso: è un risultato reale emerso eseguendo questo motore su un assistente in produzione.

Denominatori

Un tasso è un numero su un denominatore, e il denominatore è il punto in cui le valutazioni sbagliano in silenzio. Oloproof registra quattro conteggi per ogni metrica — totali, idonei, osservati e mancanti — e un caso che non è stato possibile misurare viene delimitato anziché scartato.

Un denominatore che si riduce quando un sistema inizia a fallire è il modo in cui un sistema che fallisce riporta un punteggio in crescita.

Dove andare dopo

  • Scrivere una suite: che cosa sono un caso, un sistema e un valutatore, e come dichiararli.
  • Gating in CI: trasformare una decisione in un codice di uscita.
  • Giudici: ciò che un giudice LLM deve superare prima di poter fare da gate a un rilascio.
  • Casi raggruppati: che cosa cambia quando i casi non sono indipendenti.