Skip to content
Đánh giá hệ thống AI

Xây dựng dựa trên bằng chứng.

Oloproof giúp các nhóm đánh giá hệ thống AI bằng các bài kiểm thử lặp lại được, chẩn đoán và bằng chứng đủ tin cậy để ra quyết định.

Chạy trong CI của bạn. Bằng chứng của bạn ở lại trên máy của bạn.

oloproof / compare · olotalk-docs-assistant
Tóm tắt So sánh Chẩn đoán Bằng chứng
ĐƯỜNG CƠ SỞ
olotalk docs assistant · tắt rerank
ỨNG VIÊN
olotalk docs assistant · bật rerank
TẬP DỮ LIỆU
olotalk golden panel · 58 trường hợp
CHỈ SỐ ĐƯỜNG CƠ SỞ ỨNG VIÊN Δ GHÉP CẶP KTC 95% TRẠNG THÁI
page_hit_1 0.618 0.745 +6.2 [-36.3, +45.5] — Chưa kết luận
page_hit_3 0.683 0.742 +3.7 [-73.9, +76.2] — Chưa kết luận
answer_correct 0.685 0.760 +6.5 [-39.4, +48.4] — Chưa kết luận
page_hit_1 quan sát được 55 / 58 51 / 58 −4 trong khoảng ! Có giới hạn
page_hit_3 quan sát được 41 / 58 31 / 58 −10 trong khoảng ! Có giới hạn
answer_correct quan sát được 54 / 58 50 / 58 −4 trong khoảng ! Có giới hạn
VÌ SAO CẦN ĐÁNH GIÁ

Kiểm thử prompt thủ công không trụ được trong môi trường production.

Các nhóm triển khai thay đổi mô hình và prompt hằng tuần. Kiểm tra ngẫu nhiên một vài đầu ra trong playground gần như không cho bạn biết điều gì đã thay đổi, với ai, hay liệu có an toàn để phát hành hay không.

Oloproof thay thế điều đó bằng một hồ sơ đo lường: cùng các trường hợp, cùng các giám khảo, cùng các seed, được chạy ở mỗi thay đổi.

01
Hồi quy thầm lặng

Một chỉnh sửa prompt sửa được một loại lỗi và lặng lẽ làm hỏng một loại khác. Không ai nhận ra cho đến khi khách hàng nhận ra.

02
Kết quả không lặp lại được

Trên một hệ thống RAG đang hoạt động, cứ khoảng chín trường hợp quan sát thì có một trường hợp thay đổi phán quyết giữa các lần đo giống hệt nhau.

03
Điểm số không có ý nghĩa

Một harness thực tế đã chấm 13,8% phản hồi HTTP 500 của nó là điểm không, đổ lỗi các sự cố ngừng dịch vụ cho mô hình. Một giá trị trung bình không thể gánh một quyết định.

04
Không có hồ sơ để trình ra

Khi bộ phận rủi ro, pháp lý hoặc một khách hàng hỏi bạn đã kiểm thử những gì, ảnh chụp màn hình trong một luồng trao đổi không phải là câu trả lời.

TÍNH NĂNG CỐT LÕI

Bốn điều mà mọi quyết định phát hành đều cần.

ĐO LƯỜNG
Đánh giá lặp lại được

Tập dữ liệu có phiên bản, seed cố định và giám khảo khai báo. Mọi lần chạy tái lập chính xác, kể cả nhiều tháng sau.

SO SÁNH
Đường cơ sở và ứng viên

Chênh lệch kèm khoảng tin cậy và ngưỡng, để một thay đổi hai điểm không bao giờ bị nhầm là một chiến thắng.

CHẨN ĐOÁN
Các kiểu thất bại, không phải giá trị trung bình

Các thất bại được gom cụm theo phân khúc, ý định và đường đi qua công cụ, mỗi cụm liên kết tới đúng các trace đứng sau nó.

QUYẾT ĐỊNH
Hồ sơ đủ tin cậy để ra quyết định

Một khuyến nghị phát hành kèm theo bằng chứng — có thể xuất ra để xem xét, kiểm toán và gửi khách hàng.

Chẩn đoán23 trường hợp thất bại, ngữ cảnh chuẩn
Chưa phân định: ngữ cảnh chuẩn không giải quyết được11 trường hợp
Lỗi sinh: đúng ngữ cảnh, sai câu trả lời7 trường hợp
Truy xuất trượt: câu trả lời có thể tìm được, nhưng không được truy xuất5 trường hợp
Bật rerank trừ tắt rerankKhoảng 95%, điểm
hit@1
hit@3
correct

Mọi khoảng đều cắt qua đường số không nét đứt. Nếu chỉ đọc các ước lượng điểm, reranker đã được phát hành.

NỀN TẢNG

Xây dựng cho những nhóm phải chứng minh được quyết định phát hành.

Bộ kiểm thử đánh giá dưới dạng mã

Định nghĩa tập dữ liệu, giám khảo và ngưỡng trong hệ thống quản lý phiên bản. Xem xét các thay đổi về đánh giá theo cách bạn review mã.

Giám khảo có thể kiểm toán

Kiểm tra bằng chương trình, giám khảo LLM, bộ phân loại đã huấn luyện chấm điểm văn bản ngay trên máy của bạn, và nhãn do con người gán, trong cùng một pipeline. Mức độ đồng thuận của mỗi giám khảo với con người được đo kèm một khoảng, và giám khảo nào chưa vượt qua ngưỡng của mình thì không thể quyết định một bản phát hành.

Cổng hồi quy trong CI

Làm thất bại một pull request khi một chỉ số vượt qua ngưỡng. Cổng báo cáo những trường hợp nào đã thay đổi và thay đổi bao nhiêu.

Bằng chứng ở cấp trace

Mọi điểm số đều liên kết tới đầu vào, đầu ra, lệnh gọi công cụ, ngữ cảnh được truy xuất và lập luận của giám khảo. Không có gì là hộp đen.

Ngân sách chi phí và độ trễ

Chất lượng không bao giờ là trục duy nhất. Theo dõi chi tiêu và độ trễ đuôi song song với độ chính xác, theo cùng các ngưỡng.

Bằng chứng cho những người cần quyết định

Chia sẻ lần chạy, chẩn đoán và khuyến nghị mà không làm thay đổi quyết định đã đo lường bên trong đó.

CÁCH HOẠT ĐỘNG

Ba bước, sau đó nó tự chạy.

1
Định nghĩa bộ kiểm thử

Mang các trường hợp của riêng bạn dưới dạng tệp JSONL. Khai báo giám khảo và các ngưỡng mà một bản phát hành phải vượt qua.

2
Chạy ở mỗi thay đổi

Một lệnh ở máy cục bộ, cùng lệnh đó trong CI. Thay đổi về prompt, mô hình, truy xuất và công cụ đều được xử lý như nhau.

3
Quyết định dựa trên bằng chứng

Đọc các chênh lệch, mở các trace thất bại, và giữ bằng chứng gắn liền với quyết định bạn đã đưa ra.

~/olodemo · sau oloproof init
 oloproof run
Run run_01M3B0CCPA0JFQQ7HWRKYNWFJC [DECIDED/COMPLETE]
Gate: ALLOW (exit 0)

  Rule         Metric       State  Reasons
  label-floor  exact_label  PASS   lower_bound_meets_minimum

  Metric       Estimate  Interval          N
  exact_label  100.0%    [88.4%, 100.0%]   30 / 30 observed · 0 missing

Cache: execution 0 hit/30 miss; judgment 0 hit/30 miss

 oloproof run
Run run_01M3B0CXTTVPTBXAFK3WNGFX42 [DECIDED/COMPLETE]
Gate: ALLOW (exit 0)
Cache: execution 30 hit/0 miss; judgment 0 hit/30 miss
BẰNG CHỨNG BẠN CÓ THỂ BÀN GIAO

Mọi con số đều truy ngược được về một trường hợp.

Các lần chạy là bất biến và có ghi ngày. Tập dữ liệu, prompt, giám khảo và cấu hình được quản lý phiên bản cùng nhau, nên mọi kết quả đều có thể được tái lập hoặc bị chất vấn.

Bất biến
các lần chạy, với đầy đủ nguồn gốc
Tự triển khai
trên hạ tầng của bạn, dữ liệu của bạn vẫn là của bạn
Có giới hạn
các trường hợp thiếu được tính đến, không bao giờ bị bỏ qua

Nếu chỉ đọc các ước lượng điểm, reranker mang lại +12,7 điểm hit@1. Đọc một cách trung thực, bộ mẫu này không thể cho biết nó giúp ích hay gây hại.

Oloproof trên một hệ thống RAG đang hoạt động, ngày 22 tháng 9 năm 2026
Oloproof
Gói bằng chứng
oloproof export RUN_ID
run.jsonlần chạy, bộ kiểm thử, hệ thống và các bộ đánh giá của nó
cases.jsonlmọi trường hợp: đầu vào, đầu ra, phán quyết, digest
diagnoses.jsonlcác can thiệp và những gì chúng đã khôi phục được
signoffs.jsonlai đã phát hành bất chấp cổng đang chặn, và vì sao
Một gói bằng chứng đã xuất: lần chạy và mọi trường hợp đứng sau các con số của nó, dưới dạng các tệp bạn giữ lại.
CÙNG MỘT KỶ LUẬT, ÁP DỤNG TẠI ĐÂY

Những gì sản phẩm này chưa phải là, ít nhất là lúc này.

Mọi điều dưới đây đều đúng vào ngày bạn đọc nó.

  1. 01

    Không có bản triển khai được lưu trữ sẵn (hosted) nào để bạn đăng ký. Quyền truy cập chỉ theo lời mời.

  2. 02

    Chưa có bảng giá. Đơn vị tính là một trường hợp được đánh giá; mức giá chưa được ấn định.

  3. 03

    Không có đợt kiểm toán bảo mật nào, không có báo cáo SOC 2 và không có DPA. Không có khách hàng và không có nghiên cứu điển hình, nên không có gì được trích dẫn.

  4. 04

    Thông báo chỉ gửi qua email: không có Slack, máy nhắn tin hay webhook. Không có tài liệu báo cáo. Một lần chạy được đọc trong workbench hoặc được xuất ra dưới dạng một gói (bundle).

  5. 05

    Việc đánh giá production chưa được xây dựng: trace được nhận trên chính máy của bạn, và chưa có gì chấm điểm lưu lượng production.

  6. 06

    Nó đã được chạy từ đầu đến cuối với đúng một hệ thống bên thứ ba đang hoạt động thực tế. Đó là bằng chứng ở trên, và đó chỉ là một hệ thống.

Đo lường trước khi phát hành.

Mang theo một hệ thống và một tập dữ liệu. Bắt đầu với một lần chạy cục bộ và giữ bằng chứng trên máy của bạn.