Documentação
Escreva uma suíte. Use-a como gate.
O Oloproof decide lançamentos com base em intervalos de confiança, e não em estimativas pontuais. Estas páginas tratam de como declarar o que medir, como transformar uma decisão em um código de saída e do que um juiz LLM precisa atingir antes de poder servir de gate para qualquer coisa.
Início rápidoInstale o engine, gere a estrutura de um projeto e obtenha uma primeira execução e uma decisão de gate na sua própria máquina. Nada sai dela a menos que você faça push.Conceitos básicosO Oloproof mede um sistema de IA da forma como um estudo mede qualquer coisa: os mesmos casos, os mesmos juízes, as mesmas seeds, executados a cada mudança. O que ele acrescenta a uma suíte de testes é que todo número chega com a sua incerteza, e uma decisão de lançamento é tomada sobre o intervalo, e não sobre a estimativa.Escrevendo uma suíteUma suíte é composta de dois arquivos e um dataset. oloproof init gera a estrutura dos dois, e essa estrutura vem comentada porque a primeira sessão de onboarding perdeu quatro tentativas por causa de uma string ausente, e não de um recurso ausente.A API PythonTudo o que a CLI faz, a biblioteca faz. Use-a quando a avaliação pertencer a um script, um notebook ou uma suíte de testes, e não a um arquivo de configuração ao lado.Recording what a system didA system's output is what an evaluator reads by default. Everything else it did — the prompt it built, the passages it retrieved, the tools it called, the tokens it spent — is recorded alongside the output as artifacts and usage, and every artifact is stored content-addressed with the execution that produced it.Progresso e concorrênciaUma suíte contra um modelo real leva minutos, e a maior parte deles é gasta esperando o modelo. Esta página trata de quantas chamadas o Oloproof mantém em andamento, do que ele mostra enquanto elas rodam e de como descobrir quanto mais de execução resolveria uma regra que não decidiu.Gating CIA gate compares measured evidence against a threshold you declared, and exits with a code your CI understands. The decision is made on the interval, not on the estimate.Executando no CIGate no CI trata da política de lançamento e do que cada código de saída significa. Esta página é a parte que acontece dentro de um job de CI: como instalar o Oloproof ali, onde a evidência fica enquanto o job é executado, como ler um resultado sem interpretar uma tabela e como comparar um pull request com o branch de destino.Comparing a candidate to a baselineThe workflow the rest of this product exists for: you changed something, and you want to know whether it helped. A comparison pairs two runs case by case and reports the difference with an interval, so a two-point move is never mistaken for a win.Regras de comparaçãoComparando um candidato com uma linha de base mostra o fluxo de trabalho. Esta página é a referência das regras pelas quais uma comparação é decidida: quais tipos existem, o que cada um pergunta, em que unidade uma margem é medida e o que altera o intervalo a partir do qual elas são lidas.Casos agrupadosA maior parte da aritmética de intervalos supõe que cada caso é independente de todos os outros. Três turnos de uma mesma conversa não são: quando a conversa dá errado, os três tendem a dar errado. Uma suíte que os trata como independentes informa um intervalo mais estreito do que a evidência sustenta, e um gate pode passar com base nele.SegmentosUma taxa global pode se manter estável enquanto uma parte da suíte desmorona. Um segmento é uma parte declarada da suíte, medida por si só, para que o colapso fique visível. Os segmentos vêm com duas disciplinas, porque olhar para muitas partes de uma suíte é a forma como uma avaliação encontra ruído e o chama de descoberta.JudgesAn LLM judge is one kind of evaluator, not all of them. Oloproof has three kinds — deterministic, LLM judge, and custom — and the rules on this page are about the second, because a model's verdict is the one that needs measuring against a human's.Avaliação de RAGUma resposta aumentada por recuperação pode estar errada por quatro razões diferentes: a passagem certa nunca foi recuperada; foi recuperada e ficou numa posição baixa demais; ficou numa posição alta o suficiente e depois foi retirada do contexto; ou chegou ao modelo e o modelo errou mesmo assim. Um único número de acurácia não consegue distingui-las. O Oloproof executa um sistema RAG como duas etapas que ele consegue ver, mede cada uma e reexecuta os casos que falharam sob mudanças controladas para descobrir qual razão se aplica.Agentes e ferramentasO Oloproof não conduz um agente. Seu agente executa o próprio loop, chama as próprias ferramentas e registra o que aconteceu como um artefato agent_trajectory/v1. Toda métrica de agente é lida desse registro, então o registro é toda a integração.Classificadores e regressoresUm modelo preditivo é avaliado como qualquer outro sistema: uma função chamável retorna uma predição para cada caso, e avaliadores a leem. O que muda são os denominadores. Acurácia, recall e precisão são três taxas sobre três conjuntos diferentes de linhas, e um modelo pode parecer bom em uma enquanto falha na pergunta que o negócio está fazendo.NotificaçõesUma execução aprovada não notifica ninguém. Quando o Oloproof envia uma notificação, isso significa que algo precisa de uma decisão ou está prestes a parar de funcionar: uma release que um gate bloqueou, uma execução gerenciada que terminou, uma franquia que está acabando.ErrosA distinção pela qual esta página existe: uma execução que falhou e uma execução que deu erro são coisas diferentes, e apresentar uma como a outra diz a um desenvolvedor que a mudança dele é ruim quando a verdade é que o harness caiu.Referência da CLITodos os comandos que o Oloproof registra, com o que cada um faz. Todos aceitam --help, que imprime o texto completo de onde estes resumos vêm.