Skip to content

ابدأ الآن

كتابة مجموعة اختبار

مجموعة الاختبار ملفّان ومجموعة بيانات. ينشئ oloproof init هيكل الملفين كليهما، والهيكل مزوَّد بالتعليقات لأن أول تجربة للإعداد الأولي أضاعت أربع محاولات بسبب سلسلة نصية ناقصة لا بسبب ميزة ناقصة.

ملف المشروع

يُصرّح oloproof.yaml بما يُقاس وبما يتولّى القياس.

version: 1
project: example
dataset: data/example.jsonl
system:
  name: example-support-bot
  version: "1"
  callable: app:answer
  config: {}
evaluators:
  - type: exact_match
    criterion: exact_label
    field: label

system.callable مسار استيراد إلى الشيء الخاضع للاختبار. وcriterion هو الاسم الذي سيستخدمه المقياس والعتبة والتقرير جميعًا لنتيجة هذا المُقيِّم، لذا يستحق أن تختار كلمة ستتعرّف عليها في البوابة.

أنواع المُقيِّمات

كل قيمة type: يقبلها الملف، مصنّفة حسب العائلة. والحقل المرفوض يُجاب بالحقول التي يقبلها ذلك المُقيِّم، فيكون التخمين الخاطئ على بُعد تشغيل واحد من التخمين الصحيح.

العائلةالأنواع
حتميexact_match، contains، regex، json_schema
حَكَم LLMrubric_judge، groundedness_judge، citation_support_judge، probability_judge، cascade
نموذجmodel_classifier
الاسترجاعhit_rate، recall، mrr، ndcg، citation_validity
وكيلagent_max_steps، agent_tool_called، agent_no_tool_loop، agent_tool_sequence، agent_no_undeclared_tool، agent_constraints_satisfied
متعدد الوكلاءagent_route، agent_tool_permissions، agent_max_handoffs
تنبؤيpredictive_correct، predictive_precision، predictive_recall، predictive_ranking، predictive_brier، predictive_log_loss، predictive_absolute_error

يحتاج حَكَم LLM على نقطة نهاية ليست تابعة لـ OpenAI إلى حقلين إضافيين: base_url: وapi_key_env:. يُقرأ المفتاح من البيئة وقت الاستدعاء ولا يُخزَّن أبدًا.

تشغيلها

oloproof run

يُنفّذ التشغيل كل حالة، ويحكم على كل واحدة بكل مُقيِّم، ويخزّن النتائج سجلاتٍ معنونةً بمحتواها. وتشغيله مجددًا مقابل نظام لم يتغير ومجموعة بيانات لم تتغير يعيد استخدام ما لديه بالفعل، ولهذا لا يكلّف التشغيل المتكرر شيئًا يُذكر ولا يُحتسب في الاستهلاك.

يُبلغ oloproof plan RUN_ID --run بما يتطلبه حسم قاعدة لم يُبَتّ فيها، مُسعَّرًا بحسب ما أنفقه ذلك التشغيل فعلًا. وإذا أُعطي معرّف مقارنة بدلًا من ذلك، فلا يحتاج إلى أي خيار.

التكرارات

الحالة التي تُقاس مرة واحدة تخبرك بما حدث مرة واحدة. يقيس replicates: كل حالة أكثر من مرة، ويُبلغ بعدد الحالات التي تغيّر حكمها بين قياسات متطابقة.

هذا العدد يستحق أن تعرفه قبل أن تثق بأي مقارنة: مع مساعد حيّ، غيّرت حالة واحدة تقريبًا من كل تسع حالات مرصودة حكمَها بين عمليات تشغيل متطابقة.

إلى أين بعد ذلك

والمُصنِّفات ونماذج الانحدار أنواع الاسترجاع والوكلاء والتنبؤ.