Skip to content

Başlayın

Paket yazma

Bir paket, iki dosya ve bir veri kümesinden oluşur. oloproof init ikisinin de iskeletini oluşturur ve iskelet yorumlarla gelir, çünkü ilk başlangıç denemesi dört girişimi eksik bir özelliğe değil, eksik bir dizgeye kaptırmıştı.

Proje dosyası

oloproof.yaml neyin ölçüldüğünü ve ölçümü neyin yaptığını bildirir.

version: 1
project: example
dataset: data/example.jsonl
system:
  name: example-support-bot
  version: "1"
  callable: app:answer
  config: {}
evaluators:
  - type: exact_match
    criterion: exact_label
    field: label

system.callable, test edilen şeye giden bir içe aktarma yoludur. criterion, bir metriğin, bir eşiğin ve bir raporun bu değerlendiricinin sonucu için kullanacağı addır; bu yüzden bir kapıda tanıyacağınız bir kelime seçmeye değer.

Değerlendirici türleri

Dosyanın kabul ettiği her type:, aileye göre. Reddedilen bir alan, o değerlendiricinin aldığı alanlarla yanıtlanır; böylece yanlış bir tahmin, doğrusuna bir çalıştırma uzaklıktadır.

AileTürler
Deterministikexact_match, contains, regex, json_schema
LLM hakemirubric_judge, groundedness_judge, citation_support_judge, probability_judge, cascade
modelmodel_classifier
Getirmehit_rate, recall, mrr, ndcg, citation_validity
Ajanagent_max_steps, agent_tool_called, agent_no_tool_loop, agent_tool_sequence, agent_no_undeclared_tool, agent_constraints_satisfied
Çoklu ajanagent_route, agent_tool_permissions, agent_max_handoffs
Tahminselpredictive_correct, predictive_precision, predictive_recall, predictive_ranking, predictive_brier, predictive_log_loss, predictive_absolute_error

OpenAI'ınki olmayan bir uç noktadaki LLM hakemi iki alana daha ihtiyaç duyar: base_url: ve api_key_env:. Anahtar, çağrı anında ortamdan okunur ve asla saklanmaz.

Çalıştırma

oloproof run

Bir çalıştırma her vakayı yürütür, her birini her değerlendiriciyle yargılar ve sonuçları içerik adresli kayıtlar olarak saklar. Onu değişmemiş bir sisteme ve değişmemiş bir veri kümesine karşı yeniden çalıştırmak elindekini yeniden kullanır; tekrarlanan bir çalıştırmanın neredeyse hiçbir maliyeti olmamasının ve ölçülmemesinin nedeni budur.

oloproof plan RUN_ID --run, karara bağlanmamış bir kuralı netleştirmenin neye mal olacağını, o çalıştırmanın fiilen harcadığından yola çıkarak fiyatlandırıp bildirir. Bunun yerine bir karşılaştırma kimliği verilirse hiçbir bayrağa gerek duymaz.

Tekrarlar

Bir kez ölçülen bir vaka, bir kez ne olduğunu söyler. replicates: her vakayı birden fazla kez ölçer ve birebir aynı ölçümler arasında kaç vakanın hükmünü değiştirdiğini bildirir.

Herhangi bir karşılaştırmaya güvenmeden önce bu sayıyı bilmeye değer: canlı bir asistana karşı, gözlenen yaklaşık her dokuz vakadan biri birebir aynı çalıştırmalar arasında hükmünü değiştirdi.

Sonraki adımlar

anlatır.

Sınıflandırıcılar ve regresörler getirme, ajan ve tahminsel türleri anlatır.

  • CI'da kapı denetimi bir kararı bir çıkış koduna dönüştürür.
  • Hakemler bir LLM hakeminin bir sürümü kapıdan geçirmeye karar verebilmesi için

neyi geçmesi gerektiğini anlatır.

  • Temel kavramlar dört karar durumunu ve paydaların neden önemli olduğunu

açıklar.