Belgeler
Bir paket yazın. Kapıyı ona bağlayın.
Oloproof sürümlere nokta tahminlerine göre değil, güven aralıklarına göre karar verir. Bu sayfalar neyin ölçüleceğini bildirmeyi, bir kararı bir çıkış koduna dönüştürmeyi ve bir LLM hakeminin herhangi bir kapıda söz sahibi olabilmesi için neyi geçmesi gerektiğini ele alır.
Hızlı başlangıçMotoru kurun, bir proje iskeleti oluşturun ve kendi makinenizde ilk çalıştırmanızı ve ilk kapı kararınızı alın. Siz push etmedikçe hiçbir şey makinenizden çıkmaz.Temel kavramlarOloproof bir yapay zekâ sistemini, bir araştırmanın herhangi bir şeyi ölçtüğü gibi ölçer: her değişiklikte çalıştırılan aynı vakalar, aynı hakemler, aynı tohum değerleri. Bir test paketine eklediği şey, her sayının belirsizliğiyle birlikte gelmesi ve bir sürüm kararının tahmine göre değil, aralığa göre verilmesidir.Paket yazmaBir paket, iki dosya ve bir veri kümesinden oluşur. oloproof init ikisinin de iskeletini oluşturur ve iskelet yorumlarla gelir, çünkü ilk başlangıç denemesi dört girişimi eksik bir özelliğe değil, eksik bir dizgeye kaptırmıştı.Python API'siCLI'ın yaptığı her şeyi kütüphane de yapar. Değerlendirme bir yapılandırma dosyasının yanında değil de bir betiğin, bir not defterinin ya da bir test paketinin içinde yer alıyorsa onu kullanın.Recording what a system didA system's output is what an evaluator reads by default. Everything else it did — the prompt it built, the passages it retrieved, the tools it called, the tokens it spent — is recorded alongside the output as artifacts and usage, and every artifact is stored content-addressed with the execution that produced it.İlerleme ve eşzamanlılıkCanlı bir modele karşı bir paket dakikalar sürer ve bu dakikaların çoğu modeli beklemekle geçer. Bu sayfa Oloproof'un aynı anda kaç çağrıyı sürdürdüğünü, bunlar çalışırken size neyi gösterdiğini ve karar vermemiş bir kuralı netleştirmek için ne kadar daha çalıştırma gerektiğini nasıl öğreneceğinizi anlatır.Gating CIA gate compares measured evidence against a threshold you declared, and exits with a code your CI understands. The decision is made on the interval, not on the estimate.CI'da çalıştırmaCI'da kapı denetimi sürüm politikasını ve her çıkış kodunun ne anlama geldiğini anlatır. Bu sayfa ise bir CI işinin içinde olan kısımdır: Oloproof'un orada nasıl kurulacağı, iş çalışırken kanıtın nerede durduğu, bir sonucun tablo ayrıştırmadan nasıl okunacağı ve bir pull request'in hedeflediği dala karşı nasıl karşılaştırılacağı.Comparing a candidate to a baselineThe workflow the rest of this product exists for: you changed something, and you want to know whether it helped. A comparison pairs two runs case by case and reports the difference with an interval, so a two-point move is never mistaken for a win.Karşılaştırma kurallarıBir adayı bir temelle karşılaştırmak iş akışını gösterir. Bu sayfa ise bir karşılaştırmanın hangi kurallarla karara bağlandığının başvuru kaynağıdır: hangi türlerin olduğu, her birinin ne sorduğu, bir marjın hangi birimle ölçüldüğü ve kuralların okunduğu güven aralığını neyin değiştirdiği.Kümelenmiş vakalarAralık hesaplarının çoğu, her vakanın diğer her vakadan bağımsız olduğunu varsayar. Tek bir konuşmanın üç turu bağımsız değildir: konuşma ters gittiğinde üçü de ters gitme eğilimindedir. Onları bağımsız sayan bir paket, kanıtın desteklediğinden daha dar bir aralık bildirir ve bir kapı bu aralıkla geçebilir.DilimlerPaketin bir bölümü çökerken genel bir oran sabit kalabilir. Dilim, paketin bildirilmiş ve kendi başına ölçülen bir bölümüdür; böylece çöküş görünür olur. Dilimler iki disiplinle birlikte gelir, çünkü bir paketin birçok bölümüne bakmak, bir değerlendirmenin gürültüyü bulup ona bulgu demesinin yoludur.JudgesAn LLM judge is one kind of evaluator, not all of them. Oloproof has three kinds — deterministic, LLM judge, and custom — and the rules on this page are about the second, because a model's verdict is the one that needs measuring against a human's.RAG değerlendirmesiGetirmeyle zenginleştirilmiş (retrieval-augmented) bir yanıt dört farklı nedenle yanlış olabilir: doğru pasaj hiç getirilmemiştir; getirilmiş ama çok aşağıda sıralanmıştır; yeterince yukarıda sıralanmış ama sonra bağlamdan düşürülmüştür; ya da modele ulaşmış ve model yine de yanlış yapmıştır. Tek bir doğruluk sayısı bunları birbirinden ayıramaz. Oloproof bir RAG sistemini görebildiği iki aşama olarak çalıştırır, her birini ölçer ve hangi nedenin geçerli olduğunu bulmak için başarısız vakaları kontrollü değişiklikler altında yeniden yürütür.Ajanlar ve araçlarOloproof bir ajanı yönetmez. Ajanınız kendi döngüsünü çalıştırır, kendi araçlarını çağırır ve olanı bir agent_trajectory/v1 yapıtı (artifact) olarak kaydeder. Her ajan metriği bu kayıttan okunur; dolayısıyla entegrasyonun tamamı bu kayıttır.Sınıflandırıcılar ve regresörlerTahmine dayalı bir model de diğer her sistem gibi değerlendirilir: bir çağrılabilir her vaka için bir tahmin döndürür ve değerlendiriciler onu okur. Değişen şey paydalardır. Doğruluk (accuracy), duyarlılık (recall) ve kesinlik (precision), üç farklı satır kümesi üzerindeki üç orandır; bir model bunlardan birinde iyi görünürken işin sorduğu soruda başarısız olabilir.BildirimlerBaşarılı bir çalıştırma kimseye bildirim göndermez. Oloproof bir bildirim gönderdiğinde bu, bir şeyin karar gerektirdiği ya da çalışmayı bırakmak üzere olduğu anlamına gelir: bir kapının engellediği bir sürüm, sona eren yönetilen bir çalıştırma, tükenmekte olan bir kullanım hakkı.HatalarBu sayfanın var olma nedeni olan ayrım şudur: başarısız olan bir çalıştırma ile hata veren bir çalıştırma farklı şeylerdir ve birini diğeri gibi sunmak, gerçekte test düzeneği çökmüşken geliştiriciye değişikliğinin kötü olduğunu söyler.CLI başvurusuOloproof'un kaydettiği her komut ve ne yaptığı. Her biri --help alır; bu da bu özetlerin alındığı tam metni yazdırır.