Costruisci sulle prove.
Oloproof aiuta i team a valutare i sistemi di IA con test ripetibili, diagnostica e prove su cui basare le decisioni.
Gira nella tua CI. Le tue prove restano sulla tua macchina.
Testare i prompt a mano non regge in produzione.
I team rilasciano modifiche a modelli e prompt ogni settimana. Controllare a campione una manciata di output in un playground non ti dice quasi nulla su cosa è cambiato, per chi, né se sia sicuro rilasciarlo.
Oloproof lo sostituisce con un registro misurato: gli stessi casi, gli stessi giudici, gli stessi seed, eseguiti a ogni modifica.
Una modifica al prompt corregge una classe di errori e ne rompe silenziosamente un'altra. Nessuno se ne accorge finché non se ne accorge un cliente.
Su un sistema RAG in produzione, circa un caso osservato su nove ha cambiato verdetto tra misurazioni identiche.
Un harness in produzione ha conteggiato come zeri il suo 13,8% di HTTP 500, attribuendo i disservizi al modello. Una media non può reggere una decisione.
Quando il risk management, l'ufficio legale o un cliente chiedono cosa è stato testato, gli screenshot in una conversazione non sono una risposta.
Quattro cose di cui ogni decisione di rilascio ha bisogno.
Dataset versionati, seed fissati e giudici dichiarativi. Ogni esecuzione si riproduce esattamente, anche mesi dopo.
Differenze con intervalli di confidenza e soglie, così uno spostamento di due punti non viene mai scambiato per un successo.
Errori raggruppati per segmento, intento e percorso degli strumenti, ciascuno collegato alle tracce esatte che lo sostengono.
Una raccomandazione di rilascio con le prove allegate — esportabile per revisione, audit e clienti.
Ogni intervallo attraversa la linea tratteggiata dello zero. Guardando solo le stime puntuali, il reranker sarebbe stato rilasciato.
Pensato per i team che devono giustificare il rilascio.
Definisci dataset, giudici e soglie nel controllo di versione. Rivedi le modifiche alla valutazione come rivedi il codice.
Controlli programmatici, giudici LLM, classificatori addestrati che assegnano punteggi al testo sulla tua macchina ed etichette umane in un'unica pipeline. L'accordo di ogni giudice con le persone è misurato con un intervallo, e un giudice che non ha superato la sua soglia non può decidere un rilascio.
Fai fallire una pull request quando una metrica supera la sua soglia. Il gate indica quali casi si sono spostati e di quanto.
Ogni punteggio rimanda a input, output, chiamate agli strumenti, contesto recuperato e motivazione del giudice. Niente è una scatola nera.
La qualità non è mai l'unico asse. Monitora la spesa e la latenza di coda insieme alla correttezza, con le stesse soglie.
Condividi l'esecuzione, la diagnostica e la raccomandazione senza alterare la decisione misurata che contengono.
Tre passi, poi procede da solo.
Porta i tuoi casi come file JSONL. Dichiara i giudici e le soglie che un rilascio deve superare.
Un comando in locale, lo stesso comando in CI. Le modifiche a prompt, modello, recupero e strumenti ricevono lo stesso trattamento.
Leggi le differenze, apri le tracce che falliscono e mantieni le prove allegate alla decisione che hai preso.
Ogni numero risale a un caso.
Le esecuzioni sono immutabili e datate. Dataset, prompt, giudici e configurazione sono versionati insieme, così qualsiasi risultato può essere riprodotto o contestato.
Guardando le stime puntuali, il reranker porta +12,7 punti di hit@1. Letto onestamente, questo panel non può dire se aiuta o peggiora.
Cosa questo non è, ancora.
Tutto quanto segue è vero nel giorno in cui lo leggi.
- 01
Non esiste un deployment ospitato a cui puoi registrarti. L'accesso è su invito.
- 02
Non ci sono prezzi. L'unità è un caso valutato; le tariffe non sono fissate.
- 03
Non c'è alcun audit di sicurezza, nessun report SOC 2 e nessun DPA. Non ci sono clienti né casi di studio, quindi non se ne cita nessuno.
- 04
Le notifiche sono solo via email: niente Slack, cercapersone o webhook. Non c'è un documento di report. Un'esecuzione si legge nel workbench o si esporta come pacchetto.
- 05
La valutazione in produzione non è stata realizzata: le tracce vengono ricevute sulla tua macchina e niente valuta ancora il traffico di produzione.
- 06
È stato eseguito dall'inizio alla fine su esattamente un sistema di terze parti in produzione. Sono le prove qui sopra, ed è un solo sistema.
Misura prima di rilasciare.
Porta un sistema e un dataset. Inizia con un'esecuzione locale e tieni le prove sulla tua macchina.