Bắt đầu
Khái niệm cốt lõi
Oloproof đo một hệ thống AI theo cách một nghiên cứu đo bất cứ thứ gì: cùng các trường hợp, cùng các giám khảo, cùng các seed, được chạy ở mỗi thay đổi. Điều nó bổ sung cho một bộ kiểm thử là mọi con số đều đi kèm độ bất định của nó, và một quyết định phát hành được đưa ra dựa trên khoảng thay vì dựa trên ước lượng.
Chuỗi
Bảy mắt xích, và mỗi mắt xích là một bản ghi mà bạn có thể đọc riêng.
| Mắt xích | Nó là gì |
|---|---|
| Quan sát | Những gì hệ thống đã làm, được ghi lại dưới dạng một artifact thực thi |
| Đo lường | Những gì một bộ đánh giá đã phán xét về nó |
| Suy luận | Một chỉ số với một khoảng, trên một mẫu số được nêu rõ |
| Chẩn đoán | Các thất bại được gom cụm thành các yếu tố, kèm số đếm và giả định |
| Quyết định | PASS, FAIL, INSUFFICIENT_EVIDENCE hoặc MANUAL_REVIEW |
| Khuyến nghị | Một hành động phát hành, là một trường chứ không phải một trạng thái thứ năm |
| Bằng chứng | Nguồn gốc cho phép người khác kiểm tra toàn bộ những điều trên |
Mỗi mắt xích được lưu riêng và có thể tái sử dụng độc lập. Chạy lại một bộ kiểm thử với một ứng viên không đổi sẽ tái sử dụng các lần thực thi và phán quyết đã có, đó là lý do một lần chạy lặp lại gần như không tốn gì.
Bốn trạng thái quyết định
Có đúng bốn trạng thái, và một trong số đó là lý do sản phẩm này tồn tại.
- PASS — cận dưới của khoảng vượt qua ngưỡng tối thiểu.
- FAIL — cận trên của khoảng nằm dưới ngưỡng đó.
- INSUFFICIENT_EVIDENCE — không trường hợp nào ở trên, nên bằng chứng chưa quyết định được.
- MANUAL_REVIEW — cần hỏi một người, vì phương pháp đã từ chối trả lời.
Với một ngưỡng tối thiểu T và một khoảng [L, U]: đạt khi và chỉ khi L >= T, thất bại khi và chỉ khi U < T, ngược lại là không đủ. Các quy tắc ngưỡng tối đa là hình ảnh đối xứng.
INSUFFICIENT_EVIDENCE không phải là một thất bại nhẹ. Đó là câu trả lời trung thực khi một bộ kiểm thử quá nhỏ hoặc một hiệu ứng quá gần ngưỡng để có thể tách khỏi nhiễu, và coi nó là đạt chính là cách phổ biến nhất khiến một đợt đánh giá đánh lừa chính nhóm đang chạy nó.
Những gì không phải là trạng thái quyết định
RUN_ERROR, PARTIAL và CANCELLED mô tả điều đã xảy ra với một lần chạy, không phải điều đã được quyết định về một hệ thống. Một lần chạy gặp lỗi hoàn toàn không mang kết quả nào về chất lượng, và trình bày nó như một thất bại sẽ nói với nhà phát triển rằng thay đổi của họ tồi trong khi sự thật là harness đã bị sập.
Sự phân biệt này quan trọng nhất đúng vào lúc nó gây bất tiện. Một chỉ số tính một trường hợp chưa được chấm là điểm không sẽ đổ lỗi các sự cố ngừng dịch vụ của chính hệ thống cho mô hình như thể đó là thất bại về chất lượng, và đây là một phát hiện thực tế khi chạy engine này với một trợ lý đang hoạt động thực tế.
Mẫu số
Một tỷ lệ là một con số trên một mẫu số, và mẫu số là nơi các đợt đánh giá sai một cách âm thầm. Oloproof ghi bốn số đếm cho mọi chỉ số — tổng, đủ điều kiện, quan sát được và thiếu — và một trường hợp không thể đo được sẽ được tính vào giới hạn của khoảng thay vì bị loại bỏ.
Một mẫu số co lại khi hệ thống bắt đầu hỏng chính là cách một hệ thống đang hỏng báo cáo một điểm số đang tăng.
Tiếp theo
- Viết một bộ kiểm thử: một trường hợp, một hệ thống và một bộ đánh giá là gì, và cách bạn khai báo
chúng.
- Cổng trong CI: biến một quyết định thành một mã thoát.
- Giám khảo: những gì một giám khảo LLM phải vượt qua trước khi được phép làm cổng cho một bản phát
hành.
- Trường hợp theo cụm: điều gì thay đổi khi các trường hợp không độc lập.