Skip to content

Bắt đầu

Khái niệm cốt lõi

Oloproof đo một hệ thống AI theo cách một nghiên cứu đo bất cứ thứ gì: cùng các trường hợp, cùng các giám khảo, cùng các seed, được chạy ở mỗi thay đổi. Điều nó bổ sung cho một bộ kiểm thử là mọi con số đều đi kèm độ bất định của nó, và một quyết định phát hành được đưa ra dựa trên khoảng thay vì dựa trên ước lượng.

Chuỗi

Bảy mắt xích, và mỗi mắt xích là một bản ghi mà bạn có thể đọc riêng.

Mắt xíchNó là gì
Quan sátNhững gì hệ thống đã làm, được ghi lại dưới dạng một artifact thực thi
Đo lườngNhững gì một bộ đánh giá đã phán xét về nó
Suy luậnMột chỉ số với một khoảng, trên một mẫu số được nêu rõ
Chẩn đoánCác thất bại được gom cụm thành các yếu tố, kèm số đếm và giả định
Quyết địnhPASS, FAIL, INSUFFICIENT_EVIDENCE hoặc MANUAL_REVIEW
Khuyến nghịMột hành động phát hành, là một trường chứ không phải một trạng thái thứ năm
Bằng chứngNguồn gốc cho phép người khác kiểm tra toàn bộ những điều trên

Mỗi mắt xích được lưu riêng và có thể tái sử dụng độc lập. Chạy lại một bộ kiểm thử với một ứng viên không đổi sẽ tái sử dụng các lần thực thi và phán quyết đã có, đó là lý do một lần chạy lặp lại gần như không tốn gì.

Bốn trạng thái quyết định

Có đúng bốn trạng thái, và một trong số đó là lý do sản phẩm này tồn tại.

  • PASS — cận dưới của khoảng vượt qua ngưỡng tối thiểu.
  • FAIL — cận trên của khoảng nằm dưới ngưỡng đó.
  • INSUFFICIENT_EVIDENCE — không trường hợp nào ở trên, nên bằng chứng chưa quyết định được.
  • MANUAL_REVIEW — cần hỏi một người, vì phương pháp đã từ chối trả lời.

Với một ngưỡng tối thiểu T và một khoảng [L, U]: đạt khi và chỉ khi L >= T, thất bại khi và chỉ khi U < T, ngược lại là không đủ. Các quy tắc ngưỡng tối đa là hình ảnh đối xứng.

INSUFFICIENT_EVIDENCE không phải là một thất bại nhẹ. Đó là câu trả lời trung thực khi một bộ kiểm thử quá nhỏ hoặc một hiệu ứng quá gần ngưỡng để có thể tách khỏi nhiễu, và coi nó là đạt chính là cách phổ biến nhất khiến một đợt đánh giá đánh lừa chính nhóm đang chạy nó.

Những gì không phải là trạng thái quyết định

RUN_ERROR, PARTIAL và CANCELLED mô tả điều đã xảy ra với một lần chạy, không phải điều đã được quyết định về một hệ thống. Một lần chạy gặp lỗi hoàn toàn không mang kết quả nào về chất lượng, và trình bày nó như một thất bại sẽ nói với nhà phát triển rằng thay đổi của họ tồi trong khi sự thật là harness đã bị sập.

Sự phân biệt này quan trọng nhất đúng vào lúc nó gây bất tiện. Một chỉ số tính một trường hợp chưa được chấm là điểm không sẽ đổ lỗi các sự cố ngừng dịch vụ của chính hệ thống cho mô hình như thể đó là thất bại về chất lượng, và đây là một phát hiện thực tế khi chạy engine này với một trợ lý đang hoạt động thực tế.

Mẫu số

Một tỷ lệ là một con số trên một mẫu số, và mẫu số là nơi các đợt đánh giá sai một cách âm thầm. Oloproof ghi bốn số đếm cho mọi chỉ số — tổng, đủ điều kiện, quan sát được và thiếu — và một trường hợp không thể đo được sẽ được tính vào giới hạn của khoảng thay vì bị loại bỏ.

Một mẫu số co lại khi hệ thống bắt đầu hỏng chính là cách một hệ thống đang hỏng báo cáo một điểm số đang tăng.

Tiếp theo

  • Viết một bộ kiểm thử: một trường hợp, một hệ thống và một bộ đánh giá là gì, và cách bạn khai báo

chúng.

  • Cổng trong CI: biến một quyết định thành một mã thoát.
  • Giám khảo: những gì một giám khảo LLM phải vượt qua trước khi được phép làm cổng cho một bản phát

hành.