Xây dựng dựa trên bằng chứng.
Oloproof giúp các nhóm đánh giá hệ thống AI bằng các bài kiểm thử lặp lại được, chẩn đoán và bằng chứng đủ tin cậy để ra quyết định.
Chạy trong CI của bạn. Bằng chứng của bạn ở lại trên máy của bạn.
Kiểm thử prompt thủ công không trụ được trong môi trường production.
Các nhóm triển khai thay đổi mô hình và prompt hằng tuần. Kiểm tra ngẫu nhiên một vài đầu ra trong playground gần như không cho bạn biết điều gì đã thay đổi, với ai, hay liệu có an toàn để phát hành hay không.
Oloproof thay thế điều đó bằng một hồ sơ đo lường: cùng các trường hợp, cùng các giám khảo, cùng các seed, được chạy ở mỗi thay đổi.
Một chỉnh sửa prompt sửa được một loại lỗi và lặng lẽ làm hỏng một loại khác. Không ai nhận ra cho đến khi khách hàng nhận ra.
Trên một hệ thống RAG đang hoạt động, cứ khoảng chín trường hợp quan sát thì có một trường hợp thay đổi phán quyết giữa các lần đo giống hệt nhau.
Một harness thực tế đã chấm 13,8% phản hồi HTTP 500 của nó là điểm không, đổ lỗi các sự cố ngừng dịch vụ cho mô hình. Một giá trị trung bình không thể gánh một quyết định.
Khi bộ phận rủi ro, pháp lý hoặc một khách hàng hỏi bạn đã kiểm thử những gì, ảnh chụp màn hình trong một luồng trao đổi không phải là câu trả lời.
Bốn điều mà mọi quyết định phát hành đều cần.
Tập dữ liệu có phiên bản, seed cố định và giám khảo khai báo. Mọi lần chạy tái lập chính xác, kể cả nhiều tháng sau.
Chênh lệch kèm khoảng tin cậy và ngưỡng, để một thay đổi hai điểm không bao giờ bị nhầm là một chiến thắng.
Các thất bại được gom cụm theo phân khúc, ý định và đường đi qua công cụ, mỗi cụm liên kết tới đúng các trace đứng sau nó.
Một khuyến nghị phát hành kèm theo bằng chứng — có thể xuất ra để xem xét, kiểm toán và gửi khách hàng.
Mọi khoảng đều cắt qua đường số không nét đứt. Nếu chỉ đọc các ước lượng điểm, reranker đã được phát hành.
Xây dựng cho những nhóm phải chứng minh được quyết định phát hành.
Định nghĩa tập dữ liệu, giám khảo và ngưỡng trong hệ thống quản lý phiên bản. Xem xét các thay đổi về đánh giá theo cách bạn review mã.
Kiểm tra bằng chương trình, giám khảo LLM, bộ phân loại đã huấn luyện chấm điểm văn bản ngay trên máy của bạn, và nhãn do con người gán, trong cùng một pipeline. Mức độ đồng thuận của mỗi giám khảo với con người được đo kèm một khoảng, và giám khảo nào chưa vượt qua ngưỡng của mình thì không thể quyết định một bản phát hành.
Làm thất bại một pull request khi một chỉ số vượt qua ngưỡng. Cổng báo cáo những trường hợp nào đã thay đổi và thay đổi bao nhiêu.
Mọi điểm số đều liên kết tới đầu vào, đầu ra, lệnh gọi công cụ, ngữ cảnh được truy xuất và lập luận của giám khảo. Không có gì là hộp đen.
Chất lượng không bao giờ là trục duy nhất. Theo dõi chi tiêu và độ trễ đuôi song song với độ chính xác, theo cùng các ngưỡng.
Chia sẻ lần chạy, chẩn đoán và khuyến nghị mà không làm thay đổi quyết định đã đo lường bên trong đó.
Ba bước, sau đó nó tự chạy.
Mang các trường hợp của riêng bạn dưới dạng tệp JSONL. Khai báo giám khảo và các ngưỡng mà một bản phát hành phải vượt qua.
Một lệnh ở máy cục bộ, cùng lệnh đó trong CI. Thay đổi về prompt, mô hình, truy xuất và công cụ đều được xử lý như nhau.
Đọc các chênh lệch, mở các trace thất bại, và giữ bằng chứng gắn liền với quyết định bạn đã đưa ra.
Mọi con số đều truy ngược được về một trường hợp.
Các lần chạy là bất biến và có ghi ngày. Tập dữ liệu, prompt, giám khảo và cấu hình được quản lý phiên bản cùng nhau, nên mọi kết quả đều có thể được tái lập hoặc bị chất vấn.
Nếu chỉ đọc các ước lượng điểm, reranker mang lại +12,7 điểm hit@1. Đọc một cách trung thực, bộ mẫu này không thể cho biết nó giúp ích hay gây hại.
Những gì sản phẩm này chưa phải là, ít nhất là lúc này.
Mọi điều dưới đây đều đúng vào ngày bạn đọc nó.
- 01
Không có bản triển khai được lưu trữ sẵn (hosted) nào để bạn đăng ký. Quyền truy cập chỉ theo lời mời.
- 02
Chưa có bảng giá. Đơn vị tính là một trường hợp được đánh giá; mức giá chưa được ấn định.
- 03
Không có đợt kiểm toán bảo mật nào, không có báo cáo SOC 2 và không có DPA. Không có khách hàng và không có nghiên cứu điển hình, nên không có gì được trích dẫn.
- 04
Thông báo chỉ gửi qua email: không có Slack, máy nhắn tin hay webhook. Không có tài liệu báo cáo. Một lần chạy được đọc trong workbench hoặc được xuất ra dưới dạng một gói (bundle).
- 05
Việc đánh giá production chưa được xây dựng: trace được nhận trên chính máy của bạn, và chưa có gì chấm điểm lưu lượng production.
- 06
Nó đã được chạy từ đầu đến cuối với đúng một hệ thống bên thứ ba đang hoạt động thực tế. Đó là bằng chứng ở trên, và đó chỉ là một hệ thống.
Đo lường trước khi phát hành.
Mang theo một hệ thống và một tập dữ liệu. Bắt đầu với một lần chạy cục bộ và giữ bằng chứng trên máy của bạn.