Skip to content
Evaluación de sistemas de IA

Construya con evidencia.

Oloproof ayuda a los equipos a evaluar sistemas de IA con pruebas repetibles, diagnósticos y evidencia apta para fundamentar decisiones.

Se ejecuta en su CI. Su evidencia se queda en su máquina.

oloproof / compare · olotalk-docs-assistant
Resumen Comparar Diagnósticos Evidencia
LÍNEA BASE
olotalk docs assistant · rerank desactivado
CANDIDATO
olotalk docs assistant · rerank activado
CONJUNTO DE DATOS
olotalk golden panel · 58 casos
MÉTRICA LÍNEA BASE CANDIDATO Δ PAREADA IC 95% ESTADO
page_hit_1 0.618 0.745 +6.2 [-36.3, +45.5] — No concluyente
page_hit_3 0.683 0.742 +3.7 [-73.9, +76.2] — No concluyente
answer_correct 0.685 0.760 +6.5 [-39.4, +48.4] — No concluyente
page_hit_1 observado 55 / 58 51 / 58 −4 en el intervalo ! Acotado
page_hit_3 observado 41 / 58 31 / 58 −10 en el intervalo ! Acotado
answer_correct observado 54 / 58 50 / 58 −4 en el intervalo ! Acotado
POR QUÉ EVALUAR

Probar prompts a mano no sobrevive a producción.

Los equipos publican cambios de modelo y de prompt cada semana. Revisar a ojo un puñado de salidas en un playground no dice casi nada sobre qué cambió, para quién, ni si es seguro publicarlo.

Oloproof lo sustituye por un registro medido: los mismos casos, los mismos jueces, las mismas semillas, ejecutados en cada cambio.

01
Regresiones silenciosas

Una edición del prompt corrige un tipo de fallo y rompe otro sin hacer ruido. Nadie lo nota hasta que lo nota un cliente.

02
Resultados irrepetibles

En un sistema RAG en vivo, aproximadamente uno de cada nueve casos observados cambió de veredicto entre mediciones idénticas.

03
Puntuaciones sin significado

Un harness en vivo puntuó como ceros su 13,8% de respuestas HTTP 500, atribuyendo las caídas del servicio al modelo. Un promedio no puede sostener una decisión.

04
Ningún registro que mostrar

Cuando el área de riesgos, el área legal o un cliente preguntan qué se probó, unas capturas de pantalla en un hilo no son una respuesta.

CAPACIDADES CENTRALES

Cuatro cosas que toda decisión de publicación necesita.

MEDIR
Evaluaciones repetibles

Conjuntos de datos versionados, semillas fijadas y jueces declarativos. Cada ejecución se reproduce exactamente, meses después.

COMPARAR
Línea base frente a candidato

Diferencias con intervalos de confianza y umbrales, para que un movimiento de dos puntos nunca se confunda con una mejora.

DIAGNOSTICAR
Modos de fallo, no promedios

Fallos agrupados por segmento, intención y ruta de herramientas, cada uno enlazado a las trazas exactas que lo respaldan.

DECIDIR
Registros aptos para decidir

Una recomendación de publicación con la evidencia adjunta — exportable para revisión, auditoría y clientes.

Diagnósticos23 casos fallidos, contexto de referencia
Sin resolver: el contexto de referencia no lo zanjó11 casos
Fallo de generación: contexto correcto, respuesta incorrecta7 casos
Fallo de recuperación: respuesta alcanzable, no recuperada5 casos
Rerank activado menos desactivadoIntervalo del 95%, puntos
hit@1
hit@3
correcta

Todos los intervalos cruzan la línea discontinua del cero. Leyendo solo las estimaciones puntuales, el reranker se habría publicado.

PLATAFORMA

Hecho para equipos que deben justificar la publicación.

Suites de evaluación como código

Defina conjuntos de datos, jueces y umbrales en el control de versiones. Revise los cambios de evaluación como revisa el código.

Jueces que se pueden auditar

Comprobaciones programáticas, jueces LLM, clasificadores entrenados que puntúan texto en su propia máquina y etiquetas humanas en un mismo pipeline. La concordancia de cada juez con las personas se mide con un intervalo, y un juez que no ha superado su umbral no puede decidir una publicación.

Gates de regresión en CI

Haga fallar un pull request cuando una métrica cruce su umbral. El gate informa qué casos se movieron y cuánto.

Evidencia a nivel de traza

Cada puntuación enlaza con las entradas, las salidas, las llamadas a herramientas, el contexto recuperado y el razonamiento del juez. Nada es una caja negra.

Presupuestos de costo y latencia

La calidad nunca es el único eje. Siga el gasto y la latencia de cola junto con la corrección, bajo los mismos umbrales.

Evidencia para quienes necesitan la decisión

Comparta la ejecución, los diagnósticos y la recomendación sin alterar la decisión medida que contiene.

CÓMO FUNCIONA

Tres pasos, y después funciona solo.

1
Defina la suite

Aporte sus propios casos como un archivo JSONL. Declare los jueces y los umbrales que una publicación debe superar.

2
Ejecute en cada cambio

Un comando en local, el mismo comando en CI. Los cambios de prompt, modelo, recuperación y herramientas reciben el mismo trato.

3
Decida con la evidencia

Lea las diferencias, abra las trazas que fallan y mantenga la evidencia adjunta a la decisión que tomó.

~/olodemo · tras oloproof init
 oloproof run
Run run_01M3B0CCPA0JFQQ7HWRKYNWFJC [DECIDED/COMPLETE]
Gate: ALLOW (exit 0)

  Rule         Metric       State  Reasons
  label-floor  exact_label  PASS   lower_bound_meets_minimum

  Metric       Estimate  Interval          N
  exact_label  100.0%    [88.4%, 100.0%]   30 / 30 observed · 0 missing

Cache: execution 0 hit/30 miss; judgment 0 hit/30 miss

 oloproof run
Run run_01M3B0CXTTVPTBXAFK3WNGFX42 [DECIDED/COMPLETE]
Gate: ALLOW (exit 0)
Cache: execution 30 hit/0 miss; judgment 0 hit/30 miss
EVIDENCIA QUE SE PUEDE ENTREGAR

Cada número se remonta a un caso.

Las ejecuciones son inmutables y están fechadas. Los conjuntos de datos, los prompts, los jueces y la configuración se versionan juntos, de modo que cualquier resultado puede reproducirse o cuestionarse.

Inmutables
ejecuciones, con linaje completo
Autoalojado
en su infraestructura, sus datos siguen siendo suyos
Acotados
casos faltantes contabilizados, nunca descartados

Leyendo las estimaciones puntuales, el reranker aporta +12,7 puntos de hit@1. Leído con honestidad, este panel no puede decir si ayuda o perjudica.

Oloproof frente a un sistema RAG en vivo, 22 de septiembre de 2026
Oloproof
Paquete de evidencia
oloproof export RUN_ID
run.jsonla ejecución, su suite, su sistema y sus evaluadores
cases.jsonlcada caso: entrada, salida, juicios, digests
diagnoses.jsonlintervenciones y lo que recuperaron
signoffs.jsonlquién publicó pese a un gate bloqueado, y por qué
Un paquete de evidencia exportado: la ejecución y cada caso detrás de sus números, como archivos que usted conserva.
LA MISMA DISCIPLINA, APLICADA AQUÍ

Lo que esto aún no es.

Todo lo que sigue es cierto el día en que usted lo lee.

  1. 01

    No hay ningún despliegue alojado en el que registrarse. El acceso es por invitación.

  2. 02

    No hay precios. La unidad es un caso evaluado; las tarifas no están fijadas.

  3. 03

    No hay auditoría de seguridad, ni informe SOC 2, ni DPA. No hay clientes ni estudios de caso, así que no se cita ninguno.

  4. 04

    Las notificaciones son solo por correo electrónico: no hay Slack, ni buscapersonas, ni webhook. No hay documento de informe. Una ejecución se lee en el workbench o se exporta como paquete.

  5. 05

    La evaluación en producción no está construida: las trazas se reciben en su propia máquina y todavía nada puntúa el tráfico de producción.

  6. 06

    Se ha ejecutado de principio a fin contra exactamente un sistema de terceros en vivo. Esa es la evidencia de arriba, y es un solo sistema.

Mida antes de publicar.

Traiga un sistema y un conjunto de datos. Empiece con una ejecución local y mantenga la evidencia en su máquina.