Skip to content
Avaliação de sistemas de IA

Construa com evidência.

O Oloproof ajuda equipes a avaliar sistemas de IA com testes repetíveis, diagnósticos e evidência que sustenta decisões.

Roda no seu CI. A sua evidência fica na sua máquina.

oloproof / compare · olotalk-docs-assistant
Resumo Comparar Diagnóstico Evidência
LINHA DE BASE
olotalk docs assistant · rerank desativado
CANDIDATO
olotalk docs assistant · rerank ativado
DATASET
painel de referência olotalk · 58 casos
MÉTRICA LINHA DE BASE CANDIDATO Δ PAREADO IC 95% STATUS
page_hit_1 0.618 0.745 +6.2 [-36.3, +45.5] — Inconclusivo
page_hit_3 0.683 0.742 +3.7 [-73.9, +76.2] — Inconclusivo
answer_correct 0.685 0.760 +6.5 [-39.4, +48.4] — Inconclusivo
page_hit_1 observado 55 / 58 51 / 58 −4 no intervalo ! Limitado
page_hit_3 observado 41 / 58 31 / 58 −10 no intervalo ! Limitado
answer_correct observado 54 / 58 50 / 58 −4 no intervalo ! Limitado
POR QUE AVALIAR

Testar prompts à mão não sobrevive à produção.

As equipes publicam mudanças de modelo e de prompt toda semana. Conferir por amostragem algumas saídas em um playground não diz quase nada sobre o que mudou, para quem, ou se é seguro lançar.

O Oloproof substitui isso por um registro medido: os mesmos casos, os mesmos juízes, as mesmas seeds, executados a cada mudança.

01
Regressões silenciosas

Uma edição de prompt corrige uma classe de falha e quebra outra sem alarde. Ninguém percebe até que um cliente perceba.

02
Resultados que não se repetem

Em um sistema RAG real, cerca de um em cada nove casos observados mudou de veredito entre medições idênticas.

03
Pontuações sem significado

Um harness real pontuava como zeros os seus 13,8% de HTTP 500, atribuindo as quedas ao modelo. Uma média não sustenta uma decisão.

04
Nenhum registro para mostrar

Quando a área de risco, o jurídico ou um cliente pergunta o que você testou, capturas de tela em uma conversa não são uma resposta.

RECURSOS PRINCIPAIS

Quatro coisas de que toda decisão de lançamento precisa.

MEDIR
Avaliações repetíveis

Datasets versionados, seeds fixas e juízes declarativos. Cada execução se reproduz exatamente, meses depois.

COMPARAR
Linha de base vs. candidato

Diferenças com intervalos de confiança e limiares, para que uma variação de dois pontos nunca seja confundida com uma vitória.

DIAGNOSTICAR
Modos de falha, não médias

Falhas agrupadas por segmento, intenção e caminho de ferramentas, cada uma ligada aos traces exatos por trás dela.

DECIDIR
Registros que sustentam decisões

Uma recomendação de lançamento com a evidência anexada — exportável para revisão, auditoria e clientes.

Diagnóstico23 casos com falha, contexto de referência
Não resolvido: o contexto de referência não definiu11 casos
Falha de geração: contexto certo, resposta errada7 casos
Falha de recuperação: resposta alcançável, não recuperada5 casos
Rerank ativado menos desativadoIntervalo de 95%, pontos
hit@1
hit@3
correto

Todos os intervalos cruzam a linha tracejada do zero. Lendo apenas as estimativas pontuais, o reranker teria sido publicado.

PLATAFORMA

Feito para equipes que precisam justificar o lançamento.

Suítes de avaliação como código

Defina datasets, juízes e limiares no controle de versão. Revise mudanças na avaliação da mesma forma que revisa código.

Juízes que você pode auditar

Verificações programáticas, juízes LLM, classificadores treinados que pontuam texto na sua própria máquina e rótulos humanos em um único pipeline. A concordância de cada juiz com as pessoas é medida com um intervalo, e um juiz que não atingiu o seu limite não pode decidir um lançamento.

Gates de regressão no CI

Faça um pull request falhar quando uma métrica cruza o seu limiar. O gate informa quais casos mudaram e quanto.

Evidência no nível do trace

Cada pontuação está ligada a entradas, saídas, chamadas de ferramentas, contexto recuperado e justificativa do juiz. Nada é uma caixa-preta.

Orçamentos de custo e latência

A qualidade nunca é o único eixo. Acompanhe o gasto e a latência de cauda junto com a correção, sob os mesmos limiares.

Evidência para quem precisa da decisão

Compartilhe a execução, o diagnóstico e a recomendação sem alterar a decisão medida que ela contém.

COMO FUNCIONA

Três passos, e depois roda sozinho.

1
Defina a suíte

Traga os seus próprios casos em um arquivo JSONL. Declare os juízes e os limiares que um lançamento precisa atingir.

2
Execute a cada mudança

Um comando localmente, o mesmo comando no CI. Mudanças de prompt, de modelo, de recuperação e de ferramentas recebem o mesmo tratamento.

3
Decida com a evidência

Leia as diferenças, abra os traces que falharam e mantenha a evidência anexada à decisão que você tomou.

~/olodemo · após oloproof init
 oloproof run
Run run_01M3B0CCPA0JFQQ7HWRKYNWFJC [DECIDED/COMPLETE]
Gate: ALLOW (exit 0)

  Rule         Metric       State  Reasons
  label-floor  exact_label  PASS   lower_bound_meets_minimum

  Metric       Estimate  Interval          N
  exact_label  100.0%    [88.4%, 100.0%]   30 / 30 observed · 0 missing

Cache: execution 0 hit/30 miss; judgment 0 hit/30 miss

 oloproof run
Run run_01M3B0CXTTVPTBXAFK3WNGFX42 [DECIDED/COMPLETE]
Gate: ALLOW (exit 0)
Cache: execution 30 hit/0 miss; judgment 0 hit/30 miss
EVIDÊNCIA QUE VOCÊ PODE ENTREGAR

Todo número remonta a um caso.

As execuções são imutáveis e datadas. Datasets, prompts, juízes e configuração são versionados juntos, então qualquer resultado pode ser reproduzido ou contestado.

Imutáveis
execuções, com linhagem completa
Auto-hospedado
na sua infraestrutura, os seus dados continuam seus
Limitados
casos ausentes contabilizados, nunca descartados

Lendo as estimativas pontuais, o reranker entrega +12,7 pontos de hit@1. Lido com honestidade, este painel não consegue dizer se ele ajuda ou atrapalha.

O Oloproof contra um sistema RAG real, 22 de setembro de 2026
Oloproof
Bundle de evidência
oloproof export RUN_ID
run.jsona execução, a sua suíte, o sistema e os avaliadores
cases.jsonlcada caso: entrada, saída, julgamentos, digests
diagnoses.jsonlintervenções e o que elas recuperaram
signoffs.jsonlquem publicou apesar de um gate bloqueado, e por quê
Um bundle de evidência exportado: a execução e cada caso por trás dos seus números, como arquivos que você guarda.
A MESMA DISCIPLINA, APONTADA PARA CÁ

O que isto ainda não é.

Tudo o que está abaixo é verdade no dia em que você está lendo.

  1. 01

    Não existe uma implantação hospedada em que você possa se cadastrar. O acesso é por convite.

  2. 02

    Não existe tabela de preços. A unidade é um caso avaliado; os valores não estão definidos.

  3. 03

    Não há auditoria de segurança, nem relatório SOC 2, nem DPA. Não há clientes nem estudos de caso, por isso nenhum é citado.

  4. 04

    As notificações são apenas por e-mail: não há Slack, pager nem webhook. Não há documento de relatório. Uma execução é lida no workbench ou exportada como um bundle.

  5. 05

    A avaliação em produção não foi construída: os traces são recebidos na sua própria máquina, e nada ainda pontua o tráfego de produção.

  6. 06

    Ele foi executado de ponta a ponta contra exatamente um sistema real de terceiros. Essa é a evidência acima, e é um único sistema.

Meça antes de publicar.

Traga um sistema e um dataset. Comece com uma execução local e mantenha a evidência na sua máquina.