ابدأ الآن
كتابة مجموعة اختبار
مجموعة الاختبار ملفّان ومجموعة بيانات. ينشئ oloproof init هيكل الملفين كليهما، والهيكل مزوَّد بالتعليقات لأن أول تجربة للإعداد الأولي أضاعت أربع محاولات بسبب سلسلة نصية ناقصة لا بسبب ميزة ناقصة.
ملف المشروع
يُصرّح oloproof.yaml بما يُقاس وبما يتولّى القياس.
version: 1
project: example
dataset: data/example.jsonl
system:
name: example-support-bot
version: "1"
callable: app:answer
config: {}
evaluators:
- type: exact_match
criterion: exact_label
field: labelsystem.callable مسار استيراد إلى الشيء الخاضع للاختبار. وcriterion هو الاسم الذي سيستخدمه المقياس والعتبة والتقرير جميعًا لنتيجة هذا المُقيِّم، لذا يستحق أن تختار كلمة ستتعرّف عليها في البوابة.
أنواع المُقيِّمات
كل قيمة type: يقبلها الملف، مصنّفة حسب العائلة. والحقل المرفوض يُجاب بالحقول التي يقبلها ذلك المُقيِّم، فيكون التخمين الخاطئ على بُعد تشغيل واحد من التخمين الصحيح.
| العائلة | الأنواع |
|---|---|
| حتمي | exact_match، contains، regex، json_schema |
| حَكَم LLM | rubric_judge، groundedness_judge، citation_support_judge، probability_judge، cascade |
| نموذج | model_classifier |
| الاسترجاع | hit_rate، recall، mrr، ndcg، citation_validity |
| وكيل | agent_max_steps، agent_tool_called، agent_no_tool_loop، agent_tool_sequence، agent_no_undeclared_tool، agent_constraints_satisfied |
| متعدد الوكلاء | agent_route، agent_tool_permissions، agent_max_handoffs |
| تنبؤي | predictive_correct، predictive_precision، predictive_recall، predictive_ranking، predictive_brier، predictive_log_loss، predictive_absolute_error |
يحتاج حَكَم LLM على نقطة نهاية ليست تابعة لـ OpenAI إلى حقلين إضافيين: base_url: وapi_key_env:. يُقرأ المفتاح من البيئة وقت الاستدعاء ولا يُخزَّن أبدًا.
تشغيلها
oloproof runيُنفّذ التشغيل كل حالة، ويحكم على كل واحدة بكل مُقيِّم، ويخزّن النتائج سجلاتٍ معنونةً بمحتواها. وتشغيله مجددًا مقابل نظام لم يتغير ومجموعة بيانات لم تتغير يعيد استخدام ما لديه بالفعل، ولهذا لا يكلّف التشغيل المتكرر شيئًا يُذكر ولا يُحتسب في الاستهلاك.
يُبلغ oloproof plan RUN_ID --run بما يتطلبه حسم قاعدة لم يُبَتّ فيها، مُسعَّرًا بحسب ما أنفقه ذلك التشغيل فعلًا. وإذا أُعطي معرّف مقارنة بدلًا من ذلك، فلا يحتاج إلى أي خيار.
التكرارات
الحالة التي تُقاس مرة واحدة تخبرك بما حدث مرة واحدة. يقيس replicates: كل حالة أكثر من مرة، ويُبلغ بعدد الحالات التي تغيّر حكمها بين قياسات متطابقة.
هذا العدد يستحق أن تعرفه قبل أن تثق بأي مقارنة: مع مساعد حيّ، غيّرت حالة واحدة تقريبًا من كل تسع حالات مرصودة حكمَها بين عمليات تشغيل متطابقة.
إلى أين بعد ذلك
- يتناول تسجيل ما فعله النظام المُخرَجات ومقاييس الاستخدام وزمن الاستجابة.
- تتناول تقييم RAG والوكلاء والأدوات
والمُصنِّفات ونماذج الانحدار أنواع الاسترجاع والوكلاء والتنبؤ.
- يحوّل تطبيق البوابة في CI القرار إلى رمز خروج.
- يتناول الحُكّام ما يجب أن يجتازه حَكَم LLM قبل أن يُسمح له بحجب إصدار.
- يشرح المفاهيم الأساسية حالات القرار الأربع ولماذا تهمّ المقامات.