시작하기
핵심 개념
Oloproof는 연구가 무엇이든 측정하는 방식으로 AI 시스템을 측정합니다. 같은 케이스, 같은 심사, 같은 시드를 모든 변경마다 실행합니다. 테스트 스위트에 더해지는 것은, 모든 숫자가 불확실성과 함께 나오고 릴리스 결정이 추정치가 아니라 구간을 기준으로 내려진다는 점입니다.
연결 고리
일곱 개의 고리가 있으며, 각각은 독립적으로 읽을 수 있는 레코드입니다.
| 고리 | 무엇인가 |
|---|---|
| 관측 | 시스템이 한 일을 실행 아티팩트로 포착한 것 |
| 측정 | 평가기가 그에 대해 판정한 것 |
| 추론 | 명시된 분모에 대한, 구간이 붙은 지표 |
| 진단 | 실패를 요인별로 묶은 것, 집계와 가정 포함 |
| 결정 | PASS, FAIL, INSUFFICIENT_EVIDENCE 또는 MANUAL_REVIEW |
| 권고 | 릴리스 조치. 필드이며 다섯 번째 상태가 아닙니다 |
| 근거 | 다른 사람이 이 모두를 확인할 수 있게 하는 출처 정보 |
각 고리는 따로 저장되며 독립적으로 재사용할 수 있습니다. 바뀌지 않은 후보에 대해 스위트를 다시 실행하면 이미 있는 실행 결과와 판정을 재사용하므로, 반복 실행에는 비용이 거의 들지 않습니다.
네 가지 결정 상태
정확히 네 가지가 있으며, 그중 하나가 이 제품이 존재하는 이유입니다.
- PASS — 구간의 하한이 최소 임계값 이상입니다.
- FAIL — 구간의 상한이 임계값보다 낮습니다.
- INSUFFICIENT_EVIDENCE — 둘 다 아니므로 근거로 결정되지 않습니다.
- MANUAL_REVIEW — 방법이 답하기를 거부했으므로 사람에게 묻습니다.
최소 임계값 T와 구간 [L, U]에 대해, 통과는 L >= T일 때만, 실패는 U < T일 때만이며, 그 밖에는 근거 불충분입니다. 최대 임계값 규칙은 그 거울상입니다.
INSUFFICIENT_EVIDENCE는 약한 실패가 아닙니다. 스위트가 너무 작거나 효과가 임계값에 너무 가까워 잡음과 구분할 수 없을 때의 정직한 답이며, 이를 통과로 취급하는 것은 평가가 그것을 운영하는 팀을 오도하는 가장 흔한 방식입니다.
결정 상태가 아닌 것
RUN_ERROR, PARTIAL, CANCELLED는 시스템에 대해 무엇이 결정되었는지가 아니라 실행에 무슨 일이 있었는지를 설명합니다. 오류가 난 실행은 품질 결과를 전혀 담고 있지 않으며, 이를 실패로 제시하면 실제로는 하니스가 넘어졌을 뿐인데 개발자에게 변경이 나쁘다고 말하는 셈이 됩니다.
이 구분은 불편할 때 가장 중요합니다. 채점되지 않은 케이스를 0으로 세는 지표는 시스템 자체의 장애를 모델의 품질 실패로 떠넘기는데, 이는 이 엔진을 운영 중인 어시스턴트에 대해 실행해서 얻은 실제 발견입니다.
분모
비율은 분모 위의 숫자이며, 평가가 조용히 잘못되는 곳이 바로 분모입니다. Oloproof는 모든 지표에 대해 전체, 적격, 관측, 누락의 네 가지 집계를 기록하며, 측정할 수 없었던 케이스는 버려지지 않고 범위로 반영됩니다.
시스템이 실패하기 시작할 때 줄어드는 분모는 실패하는 시스템이 상승하는 점수를 보고하게 되는 경로입니다.
다음 단계
- 스위트 작성하기: 케이스, 시스템, 평가기가 무엇이며 어떻게 선언하는지.
- CI 게이트: 결정을 종료 코드로 바꾸기.
- 심사: LLM 심사 모델이 릴리스를 게이트하기 전에 통과해야 하는 기준.
- 군집 케이스: 케이스가 독립적이지 않을 때 무엇이 달라지는지.