Skip to content
AI 시스템 평가

근거를 갖고 만드십시오.

Oloproof는 반복 가능한 테스트, 진단, 그리고 의사결정에 쓸 수 있는 근거로 팀이 AI 시스템을 평가하도록 돕습니다.

여러분의 CI에서 실행됩니다. 근거는 여러분의 머신에 남습니다.

oloproof / compare · olotalk-docs-assistant
요약 비교 진단 근거
기준선
olotalk docs assistant · 리랭크 끔
후보
olotalk docs assistant · 리랭크 켬
데이터셋
olotalk golden panel · 58개 케이스
지표 기준선 후보 대응 Δ 95% 신뢰구간 상태
page_hit_1 0.618 0.745 +6.2 [-36.3, +45.5] — 결론 없음
page_hit_3 0.683 0.742 +3.7 [-73.9, +76.2] — 결론 없음
answer_correct 0.685 0.760 +6.5 [-39.4, +48.4] — 결론 없음
page_hit_1 관측값 55 / 58 51 / 58 −4 구간 내 ! 범위 한정
page_hit_3 관측값 41 / 58 31 / 58 −10 구간 내 ! 범위 한정
answer_correct 관측값 54 / 58 50 / 58 −4 구간 내 ! 범위 한정
왜 평가인가

수작업 프롬프트 테스트는 프로덕션에서 버티지 못합니다.

팀은 매주 모델과 프롬프트 변경을 배포합니다. 플레이그라운드에서 출력 몇 개를 훑어보는 것으로는 무엇이, 누구에게 바뀌었는지, 릴리스해도 안전한지 거의 알 수 없습니다.

Oloproof는 이를 측정된 기록으로 대체합니다. 같은 케이스, 같은 심사, 같은 시드를 모든 변경마다 실행합니다.

01
조용한 회귀

프롬프트 수정 하나가 한 종류의 실패를 고치고 다른 종류를 조용히 망가뜨립니다. 고객이 알아채기 전까지 아무도 모릅니다.

02
반복되지 않는 결과

운영 중인 RAG 시스템에서, 관측된 케이스 약 아홉 건 중 한 건이 동일한 측정 사이에서 판정이 바뀌었습니다.

03
의미 없는 점수

운영 중인 한 하니스는 전체의 13.8%를 차지한 HTTP 500 응답을 영점으로 채점해 장애를 모델 탓으로 돌렸습니다. 평균으로는 결정을 내릴 수 없습니다.

04
보여 줄 기록이 없음

리스크 부서, 법무팀, 또는 고객이 무엇을 테스트했느냐고 물을 때, 스레드에 올린 스크린샷은 답이 되지 않습니다.

핵심 기능

모든 릴리스 결정에 필요한 네 가지.

측정
반복 가능한 평가

버전 관리되는 데이터셋, 고정된 시드, 선언형 심사. 모든 실행은 몇 달 뒤에도 정확히 재현됩니다.

비교
기준선 대 후보

신뢰구간과 임계값이 붙은 차이. 그래서 2포인트 움직임을 승리로 착각하지 않습니다.

진단
평균이 아닌 실패 유형

세그먼트, 의도, 도구 경로별로 묶인 실패. 각 묶음은 그 뒤에 있는 정확한 트레이스에 연결됩니다.

결정
의사결정에 쓸 수 있는 기록

근거가 첨부된 릴리스 권고. 검토, 감사, 고객에게 내보낼 수 있습니다.

진단실패한 케이스 23건, 정답 컨텍스트
미해결: 정답 컨텍스트로도 결론 나지 않음케이스 11건
생성 실패: 컨텍스트는 맞고 답은 틀림케이스 7건
검색 누락: 답에 도달할 수 있었으나 검색되지 않음케이스 5건
리랭크 켬 빼기 끔95% 구간, 포인트
hit@1
hit@3
정답

모든 구간이 점선으로 된 영점 선을 가로지릅니다. 점추정치만 읽었다면 리랭커는 배포되었을 것입니다.

플랫폼

릴리스를 정당화해야 하는 팀을 위해 만들었습니다.

코드로 관리하는 평가 스위트

데이터셋, 심사, 임계값을 버전 관리에 정의하십시오. 평가 변경을 코드처럼 리뷰하십시오.

감사할 수 있는 심사

프로그래밍 방식 검사, LLM 심사 모델, 여러분의 머신에서 텍스트를 채점하는 학습된 분류기, 사람의 레이블을 하나의 파이프라인에서 다룹니다. 각 심사가 사람과 얼마나 일치하는지는 구간과 함께 측정되며, 기준을 통과하지 못한 심사는 릴리스를 결정할 수 없습니다.

CI의 회귀 게이트

지표가 임계값을 넘으면 풀 리퀘스트를 실패시킵니다. 게이트는 어떤 케이스가 얼마나 움직였는지 보고합니다.

트레이스 수준의 근거

모든 점수는 입력, 출력, 도구 호출, 검색된 컨텍스트, 심사 근거에 연결됩니다. 블랙박스는 없습니다.

비용과 지연 시간 예산

품질이 유일한 축인 경우는 없습니다. 지출과 꼬리 지연 시간을 정확성과 함께, 같은 임계값 아래에서 추적하십시오.

결정이 필요한 사람들을 위한 근거

실행, 진단, 권고를 공유하되, 그 안에 담긴 측정된 결정은 바꾸지 않습니다.

작동 방식

세 단계, 그다음은 알아서 돌아갑니다.

1
스위트 정의

여러분의 케이스를 JSONL 파일로 가져오십시오. 심사와 릴리스가 통과해야 할 임계값을 선언하십시오.

2
모든 변경마다 실행

로컬에서 명령 하나, CI에서도 같은 명령. 프롬프트, 모델, 검색, 도구 변경이 모두 같은 방식으로 다뤄집니다.

3
근거로 결정

차이를 읽고, 실패한 트레이스를 열고, 내린 결정에 근거를 첨부해 두십시오.

~/olodemo · oloproof init 실행 후
 oloproof run
Run run_01M3B0CCPA0JFQQ7HWRKYNWFJC [DECIDED/COMPLETE]
Gate: ALLOW (exit 0)

  Rule         Metric       State  Reasons
  label-floor  exact_label  PASS   lower_bound_meets_minimum

  Metric       Estimate  Interval          N
  exact_label  100.0%    [88.4%, 100.0%]   30 / 30 observed · 0 missing

Cache: execution 0 hit/30 miss; judgment 0 hit/30 miss

 oloproof run
Run run_01M3B0CXTTVPTBXAFK3WNGFX42 [DECIDED/COMPLETE]
Gate: ALLOW (exit 0)
Cache: execution 30 hit/0 miss; judgment 0 hit/30 miss
넘겨줄 수 있는 근거

모든 숫자는 케이스까지 거슬러 올라갑니다.

실행은 변경 불가능하며 날짜가 기록됩니다. 데이터셋, 프롬프트, 심사, 설정이 함께 버전 관리되므로 어떤 결과든 재현하거나 이의를 제기할 수 있습니다.

변경 불가능
실행, 전체 계보 포함
셀프 호스팅
여러분의 인프라에서, 데이터는 여러분의 것으로 남습니다
범위 한정
누락된 케이스는 반영되며, 버려지지 않습니다

점추정치로 읽으면 리랭커는 hit@1을 +12.7포인트 올립니다. 정직하게 읽으면 이 패널로는 도움이 되는지 해가 되는지 알 수 없습니다.

운영 중인 RAG 시스템에 대한 Oloproof, 2026년 9월 22일
Oloproof
근거 번들
oloproof export RUN_ID
run.json실행과 그 스위트, 시스템, 평가기
cases.jsonl모든 케이스: 입력, 출력, 판정, 다이제스트
diagnoses.jsonl개입과 그것이 회복한 것
signoffs.jsonl차단된 게이트를 무릅쓰고 누가 배포했는지, 그리고 그 이유
내보낸 근거 번들: 실행과 그 숫자 뒤에 있는 모든 케이스를, 보관할 수 있는 파일로.
같은 규율을 이곳에 적용합니다

아직 아닌 것.

아래 내용은 모두 여러분이 읽고 있는 오늘 기준으로 사실입니다.

  1. 01

    가입할 수 있는 호스팅 배포는 없습니다. 초대를 통해서만 이용할 수 있습니다.

  2. 02

    가격은 없습니다. 단위는 평가한 케이스이며, 요율은 정해지지 않았습니다.

  3. 03

    보안 감사도, SOC 2 보고서도, DPA도 없습니다. 고객도 사례 연구도 없으므로 인용한 것도 없습니다.

  4. 04

    알림은 이메일로만 보냅니다. Slack, 호출기, 웹훅은 없습니다. 보고서 문서는 없습니다. 실행은 워크벤치에서 읽거나 번들로 내보냅니다.

  5. 05

    프로덕션 평가는 구현되지 않았습니다. 트레이스는 자신의 머신에서 수신되며, 아직 프로덕션 트래픽을 채점하는 것은 없습니다.

  6. 06

    실제 운영 중인 서드파티 시스템 정확히 하나에 대해서만 처음부터 끝까지 실행해 보았습니다. 그것이 위의 근거이며, 시스템은 하나입니다.

배포하기 전에 측정하십시오.

시스템 하나와 데이터셋 하나를 가져오십시오. 로컬 실행 한 번으로 시작하고 근거는 여러분의 머신에 두십시오.