Construa com evidência.
O Oloproof ajuda equipes a avaliar sistemas de IA com testes repetíveis, diagnósticos e evidência que sustenta decisões.
Roda no seu CI. A sua evidência fica na sua máquina.
Testar prompts à mão não sobrevive à produção.
As equipes publicam mudanças de modelo e de prompt toda semana. Conferir por amostragem algumas saídas em um playground não diz quase nada sobre o que mudou, para quem, ou se é seguro lançar.
O Oloproof substitui isso por um registro medido: os mesmos casos, os mesmos juízes, as mesmas seeds, executados a cada mudança.
Uma edição de prompt corrige uma classe de falha e quebra outra sem alarde. Ninguém percebe até que um cliente perceba.
Em um sistema RAG real, cerca de um em cada nove casos observados mudou de veredito entre medições idênticas.
Um harness real pontuava como zeros os seus 13,8% de HTTP 500, atribuindo as quedas ao modelo. Uma média não sustenta uma decisão.
Quando a área de risco, o jurídico ou um cliente pergunta o que você testou, capturas de tela em uma conversa não são uma resposta.
Quatro coisas de que toda decisão de lançamento precisa.
Datasets versionados, seeds fixas e juízes declarativos. Cada execução se reproduz exatamente, meses depois.
Diferenças com intervalos de confiança e limiares, para que uma variação de dois pontos nunca seja confundida com uma vitória.
Falhas agrupadas por segmento, intenção e caminho de ferramentas, cada uma ligada aos traces exatos por trás dela.
Uma recomendação de lançamento com a evidência anexada — exportável para revisão, auditoria e clientes.
Todos os intervalos cruzam a linha tracejada do zero. Lendo apenas as estimativas pontuais, o reranker teria sido publicado.
Feito para equipes que precisam justificar o lançamento.
Defina datasets, juízes e limiares no controle de versão. Revise mudanças na avaliação da mesma forma que revisa código.
Verificações programáticas, juízes LLM, classificadores treinados que pontuam texto na sua própria máquina e rótulos humanos em um único pipeline. A concordância de cada juiz com as pessoas é medida com um intervalo, e um juiz que não atingiu o seu limite não pode decidir um lançamento.
Faça um pull request falhar quando uma métrica cruza o seu limiar. O gate informa quais casos mudaram e quanto.
Cada pontuação está ligada a entradas, saídas, chamadas de ferramentas, contexto recuperado e justificativa do juiz. Nada é uma caixa-preta.
A qualidade nunca é o único eixo. Acompanhe o gasto e a latência de cauda junto com a correção, sob os mesmos limiares.
Compartilhe a execução, o diagnóstico e a recomendação sem alterar a decisão medida que ela contém.
Três passos, e depois roda sozinho.
Traga os seus próprios casos em um arquivo JSONL. Declare os juízes e os limiares que um lançamento precisa atingir.
Um comando localmente, o mesmo comando no CI. Mudanças de prompt, de modelo, de recuperação e de ferramentas recebem o mesmo tratamento.
Leia as diferenças, abra os traces que falharam e mantenha a evidência anexada à decisão que você tomou.
Todo número remonta a um caso.
As execuções são imutáveis e datadas. Datasets, prompts, juízes e configuração são versionados juntos, então qualquer resultado pode ser reproduzido ou contestado.
Lendo as estimativas pontuais, o reranker entrega +12,7 pontos de hit@1. Lido com honestidade, este painel não consegue dizer se ele ajuda ou atrapalha.
O que isto ainda não é.
Tudo o que está abaixo é verdade no dia em que você está lendo.
- 01
Não existe uma implantação hospedada em que você possa se cadastrar. O acesso é por convite.
- 02
Não existe tabela de preços. A unidade é um caso avaliado; os valores não estão definidos.
- 03
Não há auditoria de segurança, nem relatório SOC 2, nem DPA. Não há clientes nem estudos de caso, por isso nenhum é citado.
- 04
As notificações são apenas por e-mail: não há Slack, pager nem webhook. Não há documento de relatório. Uma execução é lida no workbench ou exportada como um bundle.
- 05
A avaliação em produção não foi construída: os traces são recebidos na sua própria máquina, e nada ainda pontua o tráfego de produção.
- 06
Ele foi executado de ponta a ponta contra exatamente um sistema real de terceiros. Essa é a evidência acima, e é um único sistema.
Meça antes de publicar.
Traga um sistema e um dataset. Comece com uma execução local e mantenha a evidência na sua máquina.