Skip to content

Tài liệu

Viết một bộ kiểm thử. Dùng nó làm cổng.

Oloproof quyết định phát hành dựa trên khoảng tin cậy thay vì ước lượng điểm. Các trang này hướng dẫn cách khai báo những gì cần đo, cách biến một quyết định thành mã thoát (exit code), và những gì một giám khảo LLM phải vượt qua trước khi được phép làm cổng cho bất cứ điều gì.

Bắt đầu nhanhCài đặt engine, tạo khung cho một dự án, và có được lần chạy đầu tiên cùng một quyết định của cổng ngay trên máy của bạn. Không có gì rời khỏi máy trừ khi bạn push.Khái niệm cốt lõiOloproof đo một hệ thống AI theo cách một nghiên cứu đo bất cứ thứ gì: cùng các trường hợp, cùng các giám khảo, cùng các seed, được chạy ở mỗi thay đổi. Điều nó bổ sung cho một bộ kiểm thử là mọi con số đều đi kèm độ bất định của nó, và một quyết định phát hành được đưa ra dựa trên khoảng thay vì dựa trên ước lượng.Viết một bộ kiểm thửMột bộ kiểm thử gồm hai tệp và một tập dữ liệu. oloproof init tạo khung cho cả hai, và khung này có chú thích vì lần thử onboarding đầu tiên đã mất bốn lần thử do thiếu một chuỗi chứ không phải do thiếu một tính năng.API PythonMọi việc CLI làm được, thư viện cũng làm được. Hãy dùng nó khi việc đánh giá thuộc về bên trong một script, một notebook hoặc một bộ kiểm thử phần mềm thay vì nằm cạnh một tệp cấu hình.Recording what a system didA system's output is what an evaluator reads by default. Everything else it did — the prompt it built, the passages it retrieved, the tools it called, the tokens it spent — is recorded alongside the output as artifacts and usage, and every artifact is stored content-addressed with the execution that produced it.Tiến trình và mức đồng thờiMột bộ kiểm thử chạy với một mô hình thực tế mất vài phút, và phần lớn thời gian đó là chờ mô hình. Trang này trình bày Oloproof giữ bao nhiêu lời gọi đang diễn ra cùng lúc, những gì nó hiển thị cho bạn trong khi chúng chạy, và cách tìm ra cần chạy thêm bao nhiêu nữa để phân định một quy tắc chưa được quyết định.Gating CIA gate compares measured evidence against a threshold you declared, and exits with a code your CI understands. The decision is made on the interval, not on the estimate.Chạy trong CICổng trong CI trình bày chính sách phát hành và ý nghĩa của từng mã thoát. Trang này là phần diễn ra bên trong một job CI: cách cài đặt Oloproof ở đó, bằng chứng nằm ở đâu trong khi job chạy, cách đọc một kết quả mà không cần phân tích cú pháp một bảng, và cách so sánh một pull request với nhánh mà nó nhắm tới.Comparing a candidate to a baselineThe workflow the rest of this product exists for: you changed something, and you want to know whether it helped. A comparison pairs two runs case by case and reports the difference with an interval, so a two-point move is never mistaken for a win.Quy tắc so sánhSo sánh một ứng viên với một đường cơ sở trình bày quy trình làm việc. Trang này là tài liệu tham chiếu cho các quy tắc dùng để quyết định một so sánh: có những loại nào, mỗi loại hỏi gì, biên được đo bằng đơn vị nào, và điều gì làm thay đổi khoảng tin cậy mà các quy tắc dựa vào.Trường hợp theo cụmPhần lớn các phép tính khoảng đều giả định mọi trường hợp độc lập với mọi trường hợp khác. Ba lượt của cùng một cuộc hội thoại thì không: khi cuộc hội thoại đi sai hướng, cả ba lượt thường đều sai theo. Một bộ kiểm thử coi chúng là độc lập sẽ báo cáo một khoảng hẹp hơn mức bằng chứng cho phép, và một cổng có thể đạt dựa trên khoảng đó.Lát cắtMột tỷ lệ tổng thể có thể giữ ổn định trong khi một phần của bộ kiểm thử sụp đổ. Lát cắt là một phần đã khai báo của bộ kiểm thử, được đo riêng, để sự sụp đổ đó hiện ra. Lát cắt đi kèm hai nguyên tắc, vì nhìn vào nhiều phần của một bộ kiểm thử chính là cách một đánh giá tìm thấy nhiễu và gọi đó là phát hiện.JudgesAn LLM judge is one kind of evaluator, not all of them. Oloproof has three kinds — deterministic, LLM judge, and custom — and the rules on this page are about the second, because a model's verdict is the one that needs measuring against a human's.Đánh giá RAGMột câu trả lời có tăng cường truy xuất có thể sai vì bốn lý do khác nhau: đoạn văn đúng chưa bao giờ được truy xuất, nó được truy xuất nhưng bị xếp hạng quá thấp, nó được xếp hạng đủ cao nhưng sau đó bị loại khỏi ngữ cảnh, hoặc nó đã tới được mô hình nhưng mô hình vẫn trả lời sai. Một con số accuracy duy nhất không thể phân biệt các trường hợp này. Oloproof chạy một hệ thống RAG như hai giai đoạn mà nó có thể quan sát, đo từng giai đoạn, và thực thi lại các trường hợp thất bại dưới những thay đổi có kiểm soát để tìm ra lý do nào đúng.Agent và công cụOloproof không điều khiển agent. Agent của bạn chạy vòng lặp riêng, gọi các công cụ riêng, và ghi lại những gì đã xảy ra dưới dạng một artifact agent_trajectory/v1. Mọi chỉ số agent đều được đọc ra từ bản ghi đó, nên bản ghi chính là toàn bộ phần tích hợp.Bộ phân loại và mô hình hồi quyMột mô hình dự đoán được đánh giá như mọi hệ thống khác: một hàm gọi được trả về một dự đoán cho mỗi trường hợp, và các bộ đánh giá đọc dự đoán đó. Điều thay đổi là các mẫu số. Accuracy, recall và precision là ba tỷ lệ trên ba tập hàng khác nhau, và một mô hình có thể trông tốt ở tỷ lệ này trong khi không đáp ứng câu hỏi mà doanh nghiệp đang đặt ra.Thông báoMột lần chạy đạt yêu cầu không thông báo cho ai cả. Khi Oloproof gửi một thông báo, điều đó có nghĩa là có việc cần ra quyết định hoặc sắp ngừng hoạt động: một bản phát hành bị cổng chặn, một lần chạy được quản lý đã kết thúc, một hạn mức sắp cạn.LỗiSự phân biệt mà trang này tồn tại để làm rõ: một lần chạy thất bại và một lần chạy gặp lỗi là hai chuyện khác nhau, và trình bày cái này như cái kia sẽ nói với nhà phát triển rằng thay đổi của họ tồi trong khi sự thật là harness đã bị sập.Tham chiếu CLIMọi lệnh mà Oloproof đăng ký, cùng với chức năng của nó. Mỗi lệnh đều nhận --help, lệnh này in ra toàn văn mà các phần tóm tắt dưới đây được lấy từ đó.