Skip to content

Mulai

Mulai cepat

Pasang mesinnya, buat kerangka proyek, lalu dapatkan eksekusi pertama dan keputusan gerbang di mesin Anda sendiri. Tidak ada yang keluar dari mesin itu kecuali Anda melakukan push.

Langkah-langkah ini berasal dari README, ditampilkan di sini alih-alih diketik ulang: README.md adalah salinan yang ditemui pengembang di GitHub dan yang dicocokkan oleh pengujian onboarding dengan kodenya, sehingga README tetap menjadi sumbernya dan halaman ini dihasilkan darinya oleh scripts/generate_quickstart.py.

Instalasi untuk pengembangan

Dari root repositori:

python3 -m venv .venv
.venv/bin/python -m pip install -e '.[dev]'
pnpm install --frozen-lockfile
make check
pnpm --filter @oloproof/web check

Antarmuka Python publiknya adalah:

from oloproof import evaluate, system, current_case
from oloproof.evaluators import ExactMatch, Contains, JsonSchema, Regex, RubricJudge, evaluator

Semua yang berada di bawah oloproof_core adalah bagian internal mesin.

Mulai cepat

Buat proyek kecil:

. .venv/bin/activate
oloproof init /tmp/oloproof-demo
cd /tmp/oloproof-demo
oloproof run

Evaluator

Nilai type: yang diterima oloproof.yaml:

deterministikexact_match, contains, regex, json_schema
juri LLMrubric_judge, groundedness_judge, citation_support_judge; probability_judge: pertanyaan ya/tidak, pilihan, atau skor yang dijawab oleh probabilitas satu token; cascade: juri probabilitas lebih dulu, juri kedua hanya di tempat juri pertama tidak yakin
modelmodel_classifier: classifier terlatih atau model NLI di server TEI, dinilai terhadap sebuah ambang batas
retrievalhit_rate, recall, mrr, ndcg, citation_validity
agenagent_max_steps, agent_tool_called, agent_no_tool_loop, agent_tool_sequence, agent_no_undeclared_tool, agent_constraints_satisfied
multi-agenagent_route, agent_tool_permissions, agent_max_handoffs
prediktifpredictive_correct, predictive_precision, predictive_recall, predictive_ranking, predictive_brier, predictive_log_loss, predictive_absolute_error

Sebuah juri menyebutkan provider-nya (anthropic, openai atau openai_compatible), model-nya, dan rubriknya sebagai rubric_text atau rubric_file. Juri pada penyedia yang menggunakan API OpenAI tetapi bukan OpenAI — Groq, Together, server lokal — juga memerlukan base_url dan api_key_env:

evaluators:
  - type: rubric_judge
    criterion: answer_correct
    provider: openai_compatible
    model: openai/gpt-oss-20b
    base_url: https://api.groq.com/openai/v1
    api_key_env: GROQ_API_KEY
    rubric_text: "PASS if the answer conveys the same fact as the reference."

Menyebutkan field yang tidak diterima sebuah evaluator akan dijawab dengan daftar field yang diterimanya.

Putuskan ulang eksekusi yang sudah ada tanpa menjalankan ulang sistem atau evaluator:

oloproof gate RUN_ID --policy release.yaml

Periksa kegagalan dan satu kasus:

oloproof inspect RUN_ID --failures
oloproof inspect RUN_ID --case refund_00

Ekspor bundel dan buka di workbench web:

oloproof export RUN_ID
OLOPROOF_BUNDLE_DIR="$PWD/.oloproof/bundles" pnpm --dir /path/to/Oloproof --filter @oloproof/web dev

Path bundel harus absolut, karena pnpm menjalankan aplikasi dari apps/web. Workbench terbuka pada indeks ruang kerjanya; satu OLOPROOF_BUNDLE_DIR saja muncul di sana sebagai proyek local/bundles. Untuk menampung beberapa proyek di satu mesin, arahkan OLOPROOF_WORKBENCH_DIR ke direktori yang berisi workbench.json sebagai gantinya (docs/API_CONTRACTS.md).