Bắt đầu
Bắt đầu nhanh
Cài đặt engine, tạo khung cho một dự án, và có được lần chạy đầu tiên cùng một quyết định của cổng ngay trên máy của bạn. Không có gì rời khỏi máy trừ khi bạn push.
Các bước này là của README, được hiển thị lại ở đây thay vì gõ lại: README.md là bản mà nhà phát triển nhìn thấy trên GitHub và là bản mà các bài kiểm thử onboarding đối chiếu với mã nguồn, nên nó vẫn là nguồn gốc và trang này được sinh ra từ nó bởi scripts/generate_quickstart.py.
Cài đặt để phát triển
Từ thư mục gốc của repository:
python3 -m venv .venv
.venv/bin/python -m pip install -e '.[dev]'
pnpm install --frozen-lockfile
make check
pnpm --filter @oloproof/web checkBề mặt Python công khai là:
from oloproof import evaluate, system, current_case
from oloproof.evaluators import ExactMatch, Contains, JsonSchema, Regex, RubricJudge, evaluatorMọi thứ nằm dưới oloproof_core đều là phần nội bộ của engine.
Bắt đầu nhanh
Tạo một dự án nhỏ:
. .venv/bin/activate
oloproof init /tmp/oloproof-demo
cd /tmp/oloproof-demo
oloproof runBộ đánh giá
Các giá trị type: mà oloproof.yaml chấp nhận:
| tất định | exact_match, contains, regex, json_schema |
| giám khảo LLM | rubric_judge, groundedness_judge, citation_support_judge; probability_judge: một câu hỏi có/không, lựa chọn hoặc điểm số được trả lời bằng xác suất của một token; cascade: một giám khảo xác suất trước, và một giám khảo thứ hai chỉ ở những chỗ nó không chắc chắn |
| mô hình | model_classifier: một bộ phân loại đã huấn luyện hoặc một mô hình NLI trên máy chủ TEI, được chấm điểm so với một ngưỡng |
| truy xuất | hit_rate, recall, mrr, ndcg, citation_validity |
| agent | agent_max_steps, agent_tool_called, agent_no_tool_loop, agent_tool_sequence, agent_no_undeclared_tool, agent_constraints_satisfied |
| đa agent | agent_route, agent_tool_permissions, agent_max_handoffs |
| dự đoán | predictive_correct, predictive_precision, predictive_recall, predictive_ranking, predictive_brier, predictive_log_loss, predictive_absolute_error |
Một giám khảo nêu rõ provider của nó (anthropic, openai hoặc openai_compatible), model của nó, và rubric của nó dưới dạng rubric_text hoặc rubric_file. Một giám khảo dùng nhà cung cấp nói được API của OpenAI nhưng không phải OpenAI — Groq, Together, một máy chủ cục bộ — còn cần thêm base_url và api_key_env:
evaluators:
- type: rubric_judge
criterion: answer_correct
provider: openai_compatible
model: openai/gpt-oss-20b
base_url: https://api.groq.com/openai/v1
api_key_env: GROQ_API_KEY
rubric_text: "PASS if the answer conveys the same fact as the reference."Nếu bạn nêu một trường mà bộ đánh giá không nhận, câu trả lời sẽ liệt kê các trường mà nó nhận.
Quyết định lại một lần chạy đã có mà không chạy lại hệ thống hay các bộ đánh giá:
oloproof gate RUN_ID --policy release.yamlXem các thất bại và một trường hợp:
oloproof inspect RUN_ID --failures
oloproof inspect RUN_ID --case refund_00Xuất một gói và mở nó trong web workbench:
oloproof export RUN_ID
OLOPROOF_BUNDLE_DIR="$PWD/.oloproof/bundles" pnpm --dir /path/to/Oloproof --filter @oloproof/web devĐường dẫn tới gói phải là đường dẫn tuyệt đối, vì pnpm khởi động ứng dụng từ apps/web. Workbench mở ra ở trang danh mục không gian làm việc; một OLOPROOF_BUNDLE_DIR đơn lẻ xuất hiện ở đó dưới dạng dự án local/bundles. Để chứa nhiều dự án trên một máy, hãy trỏ OLOPROOF_WORKBENCH_DIR tới một thư mục chứa tệp workbench.json thay vào đó (docs/API_CONTRACTS.md).