Skip to content

Bắt đầu

Viết một bộ kiểm thử

Một bộ kiểm thử gồm hai tệp và một tập dữ liệu. oloproof init tạo khung cho cả hai, và khung này có chú thích vì lần thử onboarding đầu tiên đã mất bốn lần thử do thiếu một chuỗi chứ không phải do thiếu một tính năng.

Tệp dự án

oloproof.yaml khai báo những gì được đo và cái gì thực hiện việc đo.

version: 1
project: example
dataset: data/example.jsonl
system:
  name: example-support-bot
  version: "1"
  callable: app:answer
  config: {}
evaluators:
  - type: exact_match
    criterion: exact_label
    field: label

system.callable là một đường dẫn import tới thứ đang được kiểm thử. criterion là cái tên mà một chỉ số, một ngưỡng và một báo cáo đều sẽ dùng cho kết quả của bộ đánh giá này, nên đáng để chọn một từ mà bạn sẽ nhận ra khi nhìn vào một cổng.

Các loại bộ đánh giá

Mọi type: mà tệp chấp nhận, theo nhóm. Một trường bị từ chối sẽ được trả lời bằng các trường mà bộ đánh giá đó nhận, nên một lần đoán sai chỉ cách lần đoán đúng một lần chạy.

NhómLoại
Tất địnhexact_match, contains, regex, json_schema
Giám khảo LLMrubric_judge, groundedness_judge, citation_support_judge, probability_judge, cascade
Mô hìnhmodel_classifier
Truy xuấthit_rate, recall, mrr, ndcg, citation_validity
Agentagent_max_steps, agent_tool_called, agent_no_tool_loop, agent_tool_sequence, agent_no_undeclared_tool, agent_constraints_satisfied
Đa agentagent_route, agent_tool_permissions, agent_max_handoffs
Dự đoánpredictive_correct, predictive_precision, predictive_recall, predictive_ranking, predictive_brier, predictive_log_loss, predictive_absolute_error

Một giám khảo LLM trên một endpoint không phải của OpenAI cần thêm hai trường: base_url: và api_key_env:. Khóa được đọc từ biến môi trường tại thời điểm gọi và không bao giờ được lưu lại.

Chạy bộ kiểm thử

oloproof run

Một lần chạy thực thi mọi trường hợp, chấm từng trường hợp bằng mọi bộ đánh giá, và lưu kết quả dưới dạng các bản ghi định địa chỉ theo nội dung. Chạy lại với một hệ thống không đổi và một tập dữ liệu không đổi sẽ tái sử dụng những gì đã có, đó là lý do một lần chạy lặp lại gần như không tốn gì và không bị tính phí.

oloproof plan RUN_ID --run báo cáo cần những gì để phân định một quy tắc chưa được quyết định, với chi phí ước tính dựa trên những gì lần chạy đó thực sự đã tiêu tốn. Nếu thay vào đó bạn đưa vào một id so sánh, nó không cần cờ nào.

Lặp lại (replicates)

Một trường hợp được đo một lần cho bạn biết điều đã xảy ra một lần. replicates: đo mỗi trường hợp nhiều hơn một lần và báo cáo có bao nhiêu trường hợp đã thay đổi phán quyết giữa các lần đo giống hệt nhau.

Con số đó đáng được biết trước khi bạn tin vào bất kỳ so sánh nào: với một trợ lý đang hoạt động thực tế, cứ khoảng chín trường hợp quan sát thì có một trường hợp thay đổi phán quyết giữa các lần chạy giống hệt nhau.

Tiếp theo

và độ trễ.

Bộ phân loại và mô hình hồi quy trình bày các loại truy xuất, agent và dự đoán.

  • Cổng trong CI biến một quyết định thành một mã thoát.
  • Giám khảo trình bày những gì một giám khảo LLM phải vượt qua trước khi được phép

làm cổng cho một bản phát hành.

trọng.