Skip to content

Bắt đầu

Bắt đầu nhanh

Cài đặt engine, tạo khung cho một dự án, và có được lần chạy đầu tiên cùng một quyết định của cổng ngay trên máy của bạn. Không có gì rời khỏi máy trừ khi bạn push.

Các bước này là của README, được hiển thị lại ở đây thay vì gõ lại: README.md là bản mà nhà phát triển nhìn thấy trên GitHub và là bản mà các bài kiểm thử onboarding đối chiếu với mã nguồn, nên nó vẫn là nguồn gốc và trang này được sinh ra từ nó bởi scripts/generate_quickstart.py.

Cài đặt để phát triển

Từ thư mục gốc của repository:

python3 -m venv .venv
.venv/bin/python -m pip install -e '.[dev]'
pnpm install --frozen-lockfile
make check
pnpm --filter @oloproof/web check

Bề mặt Python công khai là:

from oloproof import evaluate, system, current_case
from oloproof.evaluators import ExactMatch, Contains, JsonSchema, Regex, RubricJudge, evaluator

Mọi thứ nằm dưới oloproof_core đều là phần nội bộ của engine.

Bắt đầu nhanh

Tạo một dự án nhỏ:

. .venv/bin/activate
oloproof init /tmp/oloproof-demo
cd /tmp/oloproof-demo
oloproof run

Bộ đánh giá

Các giá trị type: mà oloproof.yaml chấp nhận:

tất địnhexact_match, contains, regex, json_schema
giám khảo LLMrubric_judge, groundedness_judge, citation_support_judge; probability_judge: một câu hỏi có/không, lựa chọn hoặc điểm số được trả lời bằng xác suất của một token; cascade: một giám khảo xác suất trước, và một giám khảo thứ hai chỉ ở những chỗ nó không chắc chắn
mô hìnhmodel_classifier: một bộ phân loại đã huấn luyện hoặc một mô hình NLI trên máy chủ TEI, được chấm điểm so với một ngưỡng
truy xuấthit_rate, recall, mrr, ndcg, citation_validity
agentagent_max_steps, agent_tool_called, agent_no_tool_loop, agent_tool_sequence, agent_no_undeclared_tool, agent_constraints_satisfied
đa agentagent_route, agent_tool_permissions, agent_max_handoffs
dự đoánpredictive_correct, predictive_precision, predictive_recall, predictive_ranking, predictive_brier, predictive_log_loss, predictive_absolute_error

Một giám khảo nêu rõ provider của nó (anthropic, openai hoặc openai_compatible), model của nó, và rubric của nó dưới dạng rubric_text hoặc rubric_file. Một giám khảo dùng nhà cung cấp nói được API của OpenAI nhưng không phải OpenAI — Groq, Together, một máy chủ cục bộ — còn cần thêm base_url và api_key_env:

evaluators:
  - type: rubric_judge
    criterion: answer_correct
    provider: openai_compatible
    model: openai/gpt-oss-20b
    base_url: https://api.groq.com/openai/v1
    api_key_env: GROQ_API_KEY
    rubric_text: "PASS if the answer conveys the same fact as the reference."

Nếu bạn nêu một trường mà bộ đánh giá không nhận, câu trả lời sẽ liệt kê các trường mà nó nhận.

Quyết định lại một lần chạy đã có mà không chạy lại hệ thống hay các bộ đánh giá:

oloproof gate RUN_ID --policy release.yaml

Xem các thất bại và một trường hợp:

oloproof inspect RUN_ID --failures
oloproof inspect RUN_ID --case refund_00

Xuất một gói và mở nó trong web workbench:

oloproof export RUN_ID
OLOPROOF_BUNDLE_DIR="$PWD/.oloproof/bundles" pnpm --dir /path/to/Oloproof --filter @oloproof/web dev

Đường dẫn tới gói phải là đường dẫn tuyệt đối, vì pnpm khởi động ứng dụng từ apps/web. Workbench mở ra ở trang danh mục không gian làm việc; một OLOPROOF_BUNDLE_DIR đơn lẻ xuất hiện ở đó dưới dạng dự án local/bundles. Để chứa nhiều dự án trên một máy, hãy trỏ OLOPROOF_WORKBENCH_DIR tới một thư mục chứa tệp workbench.json thay vào đó (docs/API_CONTRACTS.md).