Skip to content

문서

스위트를 작성하십시오. 그것으로 게이트를 거십시오.

Oloproof는 점추정치가 아니라 신뢰구간으로 릴리스를 결정합니다. 이 페이지들은 무엇을 측정할지 선언하는 방법, 결정을 종료 코드로 바꾸는 방법, 그리고 LLM 심사 모델이 무언가를 게이트하기 전에 통과해야 하는 기준을 다룹니다.

빠른 시작엔진을 설치하고, 프로젝트 골격을 만들고, 여러분의 머신에서 첫 실행과 게이트 결정을 얻습니다. 여러분이 push하지 않는 한 아무것도 머신 밖으로 나가지 않습니다.핵심 개념Oloproof는 연구가 무엇이든 측정하는 방식으로 AI 시스템을 측정합니다. 같은 케이스, 같은 심사, 같은 시드를 모든 변경마다 실행합니다. 테스트 스위트에 더해지는 것은, 모든 숫자가 불확실성과 함께 나오고 릴리스 결정이 추정치가 아니라 구간을 기준으로 내려진다는 점입니다.스위트 작성하기스위트는 파일 두 개와 데이터셋 하나로 이루어집니다. oloproof init이 두 파일의 골격을 만들며, 골격에는 주석이 달려 있습니다. 첫 온보딩 과정에서 기능이 없어서가 아니라 문자열 하나가 빠져서 네 번의 시도를 허비했기 때문입니다.Python APICLI가 하는 모든 일은 라이브러리도 합니다. 평가가 설정 파일 옆이 아니라 스크립트, 노트북, 테스트 스위트 안에 있어야 할 때 사용하십시오.Recording what a system didA system's output is what an evaluator reads by default. Everything else it did — the prompt it built, the passages it retrieved, the tools it called, the tokens it spent — is recorded alongside the output as artifacts and usage, and every artifact is stored content-addressed with the execution that produced it.진행 상황과 동시성운영 중인 모델에 대해 스위트를 실행하면 몇 분이 걸리며, 그 대부분은 모델을 기다리는 시간입니다. 이 페이지는 Oloproof가 동시에 몇 개의 호출을 진행시키는지, 호출이 진행되는 동안 무엇을 보여 주는지, 그리고 결정하지 못한 규칙에 결론을 내려면 얼마나 더 실행해야 하는지 알아내는 방법을 다룹니다.Gating CIA gate compares measured evidence against a threshold you declared, and exits with a code your CI understands. The decision is made on the interval, not on the estimate.CI에서 실행하기CI 게이트는 릴리스 정책과 각 종료 코드의 의미를 다룹니다. 이 페이지는 CI 작업 내부에서 일어나는 부분을 다룹니다. 그곳에 Oloproof를 설치하는 방법, 작업이 실행되는 동안 근거가 어디에 저장되는지, 표를 파싱하지 않고 결과를 읽는 방법, 그리고 풀 리퀘스트를 대상 브랜치와 비교하는 방법입니다.Comparing a candidate to a baselineThe workflow the rest of this product exists for: you changed something, and you want to know whether it helped. A comparison pairs two runs case by case and reports the difference with an interval, so a two-point move is never mistaken for a win.비교 규칙후보를 기준선과 비교하기는 워크플로를 보여 줍니다. 이 페이지는 비교의 결정 기준이 되는 규칙에 대한 참조 문서입니다. 어떤 종류가 있는지, 각각 무엇을 묻는지, 마진은 어떤 단위로 측정되는지, 그리고 규칙이 읽는 구간을 무엇이 움직이는지를 다룹니다.군집 케이스대부분의 구간 계산은 모든 케이스가 서로 독립이라고 가정합니다. 한 대화의 세 턴은 그렇지 않습니다. 대화가 잘못되면 세 턴 모두 잘못되는 경향이 있습니다. 이들을 독립으로 취급하는 스위트는 근거가 뒷받침하는 것보다 좁은 구간을 보고하며, 게이트가 그 구간으로 통과할 수 있습니다.슬라이스전체 비율은 그대로인데 스위트의 한 부분이 무너질 수 있습니다. 슬라이스는 선언된 스위트의 한 부분으로, 따로 측정되므로 그런 붕괴가 보이게 됩니다. 슬라이스에는 두 가지 규율이 따릅니다. 스위트의 여러 부분을 들여다보는 것이야말로 평가가 잡음을 찾아내고 그것을 발견이라고 부르게 되는 경로이기 때문입니다.JudgesAn LLM judge is one kind of evaluator, not all of them. Oloproof has three kinds — deterministic, LLM judge, and custom — and the rules on this page are about the second, because a model's verdict is the one that needs measuring against a human's.RAG 평가검색 증강 답변이 틀리는 이유는 네 가지로 서로 다를 수 있습니다. 올바른 구절이 아예 검색되지 않았거나, 검색되었지만 순위가 너무 낮았거나, 순위는 충분히 높았지만 컨텍스트에서 빠졌거나, 모델에 도달했는데도 모델이 틀렸을 수 있습니다. 하나의 정확도 수치로는 이들을 구별할 수 없습니다. Oloproof는 RAG 시스템을 볼 수 있는 두 단계로 실행하고, 각 단계를 측정하며, 실패한 케이스를 통제된 변경 아래에서 다시 실행해 어떤 이유에 해당하는지 알아냅니다.에이전트와 도구Oloproof는 에이전트를 구동하지 않습니다. 에이전트는 자체 루프를 실행하고, 자체 도구를 호출하며, 일어난 일을 agent_trajectory/v1 아티팩트로 기록합니다. 모든 에이전트 지표는 이 기록에서 읽어 내므로, 기록이 곧 통합의 전부입니다.분류기와 회귀 모델예측 모델도 다른 시스템과 똑같이 평가합니다. 호출 가능한 객체가 케이스마다 예측을 반환하고, 평가기가 그것을 읽습니다. 달라지는 것은 분모입니다. 정확도, 재현율, 정밀도는 서로 다른 세 행 집합에 대한 세 가지 비율이며, 모델은 하나에서는 좋아 보이면서도 비즈니스가 묻는 질문에서는 실패할 수 있습니다.알림통과한 실행은 누구에게도 알리지 않습니다. Oloproof가 알림을 보낸다는 것은 무언가에 결정이 필요하거나 곧 작동을 멈춘다는 뜻입니다. 게이트가 차단한 릴리스, 끝난 관리형 실행, 소진되어 가는 사용 한도가 그런 경우입니다.오류이 페이지가 존재하는 이유는 하나의 구분 때문입니다. 실패한(failed) 실행과 오류가 난(errored) 실행은 서로 다른 것이며, 하나를 다른 하나로 제시하면 실제로는 하니스가 넘어졌을 뿐인데 개발자에게 변경이 나쁘다고 말하는 셈이 됩니다.CLI 레퍼런스Oloproof가 등록하는 모든 명령과 각 명령이 하는 일입니다. 모든 명령은 --help를 받으며, 이 요약의 출처인 전체 설명을 출력합니다.