Construya con evidencia.
Oloproof ayuda a los equipos a evaluar sistemas de IA con pruebas repetibles, diagnósticos y evidencia apta para fundamentar decisiones.
Se ejecuta en su CI. Su evidencia se queda en su máquina.
Probar prompts a mano no sobrevive a producción.
Los equipos publican cambios de modelo y de prompt cada semana. Revisar a ojo un puñado de salidas en un playground no dice casi nada sobre qué cambió, para quién, ni si es seguro publicarlo.
Oloproof lo sustituye por un registro medido: los mismos casos, los mismos jueces, las mismas semillas, ejecutados en cada cambio.
Una edición del prompt corrige un tipo de fallo y rompe otro sin hacer ruido. Nadie lo nota hasta que lo nota un cliente.
En un sistema RAG en vivo, aproximadamente uno de cada nueve casos observados cambió de veredicto entre mediciones idénticas.
Un harness en vivo puntuó como ceros su 13,8% de respuestas HTTP 500, atribuyendo las caídas del servicio al modelo. Un promedio no puede sostener una decisión.
Cuando el área de riesgos, el área legal o un cliente preguntan qué se probó, unas capturas de pantalla en un hilo no son una respuesta.
Cuatro cosas que toda decisión de publicación necesita.
Conjuntos de datos versionados, semillas fijadas y jueces declarativos. Cada ejecución se reproduce exactamente, meses después.
Diferencias con intervalos de confianza y umbrales, para que un movimiento de dos puntos nunca se confunda con una mejora.
Fallos agrupados por segmento, intención y ruta de herramientas, cada uno enlazado a las trazas exactas que lo respaldan.
Una recomendación de publicación con la evidencia adjunta — exportable para revisión, auditoría y clientes.
Todos los intervalos cruzan la línea discontinua del cero. Leyendo solo las estimaciones puntuales, el reranker se habría publicado.
Hecho para equipos que deben justificar la publicación.
Defina conjuntos de datos, jueces y umbrales en el control de versiones. Revise los cambios de evaluación como revisa el código.
Comprobaciones programáticas, jueces LLM, clasificadores entrenados que puntúan texto en su propia máquina y etiquetas humanas en un mismo pipeline. La concordancia de cada juez con las personas se mide con un intervalo, y un juez que no ha superado su umbral no puede decidir una publicación.
Haga fallar un pull request cuando una métrica cruce su umbral. El gate informa qué casos se movieron y cuánto.
Cada puntuación enlaza con las entradas, las salidas, las llamadas a herramientas, el contexto recuperado y el razonamiento del juez. Nada es una caja negra.
La calidad nunca es el único eje. Siga el gasto y la latencia de cola junto con la corrección, bajo los mismos umbrales.
Comparta la ejecución, los diagnósticos y la recomendación sin alterar la decisión medida que contiene.
Tres pasos, y después funciona solo.
Aporte sus propios casos como un archivo JSONL. Declare los jueces y los umbrales que una publicación debe superar.
Un comando en local, el mismo comando en CI. Los cambios de prompt, modelo, recuperación y herramientas reciben el mismo trato.
Lea las diferencias, abra las trazas que fallan y mantenga la evidencia adjunta a la decisión que tomó.
Cada número se remonta a un caso.
Las ejecuciones son inmutables y están fechadas. Los conjuntos de datos, los prompts, los jueces y la configuración se versionan juntos, de modo que cualquier resultado puede reproducirse o cuestionarse.
Leyendo las estimaciones puntuales, el reranker aporta +12,7 puntos de hit@1. Leído con honestidad, este panel no puede decir si ayuda o perjudica.
Lo que esto aún no es.
Todo lo que sigue es cierto el día en que usted lo lee.
- 01
No hay ningún despliegue alojado en el que registrarse. El acceso es por invitación.
- 02
No hay precios. La unidad es un caso evaluado; las tarifas no están fijadas.
- 03
No hay auditoría de seguridad, ni informe SOC 2, ni DPA. No hay clientes ni estudios de caso, así que no se cita ninguno.
- 04
Las notificaciones son solo por correo electrónico: no hay Slack, ni buscapersonas, ni webhook. No hay documento de informe. Una ejecución se lee en el workbench o se exporta como paquete.
- 05
La evaluación en producción no está construida: las trazas se reciben en su propia máquina y todavía nada puntúa el tráfico de producción.
- 06
Se ha ejecutado de principio a fin contra exactamente un sistema de terceros en vivo. Esa es la evidencia de arriba, y es un solo sistema.
Mida antes de publicar.
Traiga un sistema y un conjunto de datos. Empiece con una ejecución local y mantenga la evidencia en su máquina.