Mulai
Mulai cepat
Pasang mesinnya, buat kerangka proyek, lalu dapatkan eksekusi pertama dan keputusan gerbang di mesin Anda sendiri. Tidak ada yang keluar dari mesin itu kecuali Anda melakukan push.
Langkah-langkah ini berasal dari README, ditampilkan di sini alih-alih diketik ulang: README.md adalah salinan yang ditemui pengembang di GitHub dan yang dicocokkan oleh pengujian onboarding dengan kodenya, sehingga README tetap menjadi sumbernya dan halaman ini dihasilkan darinya oleh scripts/generate_quickstart.py.
Instalasi untuk pengembangan
Dari root repositori:
python3 -m venv .venv
.venv/bin/python -m pip install -e '.[dev]'
pnpm install --frozen-lockfile
make check
pnpm --filter @oloproof/web checkAntarmuka Python publiknya adalah:
from oloproof import evaluate, system, current_case
from oloproof.evaluators import ExactMatch, Contains, JsonSchema, Regex, RubricJudge, evaluatorSemua yang berada di bawah oloproof_core adalah bagian internal mesin.
Mulai cepat
Buat proyek kecil:
. .venv/bin/activate
oloproof init /tmp/oloproof-demo
cd /tmp/oloproof-demo
oloproof runEvaluator
Nilai type: yang diterima oloproof.yaml:
| deterministik | exact_match, contains, regex, json_schema |
| juri LLM | rubric_judge, groundedness_judge, citation_support_judge; probability_judge: pertanyaan ya/tidak, pilihan, atau skor yang dijawab oleh probabilitas satu token; cascade: juri probabilitas lebih dulu, juri kedua hanya di tempat juri pertama tidak yakin |
| model | model_classifier: classifier terlatih atau model NLI di server TEI, dinilai terhadap sebuah ambang batas |
| retrieval | hit_rate, recall, mrr, ndcg, citation_validity |
| agen | agent_max_steps, agent_tool_called, agent_no_tool_loop, agent_tool_sequence, agent_no_undeclared_tool, agent_constraints_satisfied |
| multi-agen | agent_route, agent_tool_permissions, agent_max_handoffs |
| prediktif | predictive_correct, predictive_precision, predictive_recall, predictive_ranking, predictive_brier, predictive_log_loss, predictive_absolute_error |
Sebuah juri menyebutkan provider-nya (anthropic, openai atau openai_compatible), model-nya, dan rubriknya sebagai rubric_text atau rubric_file. Juri pada penyedia yang menggunakan API OpenAI tetapi bukan OpenAI — Groq, Together, server lokal — juga memerlukan base_url dan api_key_env:
evaluators:
- type: rubric_judge
criterion: answer_correct
provider: openai_compatible
model: openai/gpt-oss-20b
base_url: https://api.groq.com/openai/v1
api_key_env: GROQ_API_KEY
rubric_text: "PASS if the answer conveys the same fact as the reference."Menyebutkan field yang tidak diterima sebuah evaluator akan dijawab dengan daftar field yang diterimanya.
Putuskan ulang eksekusi yang sudah ada tanpa menjalankan ulang sistem atau evaluator:
oloproof gate RUN_ID --policy release.yamlPeriksa kegagalan dan satu kasus:
oloproof inspect RUN_ID --failures
oloproof inspect RUN_ID --case refund_00Ekspor bundel dan buka di workbench web:
oloproof export RUN_ID
OLOPROOF_BUNDLE_DIR="$PWD/.oloproof/bundles" pnpm --dir /path/to/Oloproof --filter @oloproof/web devPath bundel harus absolut, karena pnpm menjalankan aplikasi dari apps/web. Workbench terbuka pada indeks ruang kerjanya; satu OLOPROOF_BUNDLE_DIR saja muncul di sana sebagai proyek local/bundles. Untuk menampung beberapa proyek di satu mesin, arahkan OLOPROOF_WORKBENCH_DIR ke direktori yang berisi workbench.json sebagai gantinya (docs/API_CONTRACTS.md).