Just Ask Jev: Reinforcement Learning for Calibrated Decisions as a Zero-Shot Detector of AI Alignment Failures
Bài báo giới thiệu Jev, một mô hình được huấn luyện bằng học tăng cường cho các quyết định được hiệu chuẩn (RLCD) để hoạt động như một bộ dò lỗi căn chỉnh zero-shot. Thay vì sử dụng các giám khảo sinh văn bản tiêu tốn nhiều thời gian giải mã, Jev trả lời nhiều câu hỏi có cấu trúc về một đầu vào duy nhất bằng các xác suất được hiệu chuẩn chỉ trong một lần gọi. Đánh giá trên RLCDAlignBench bao gồm 10 loại lỗi căn chỉnh và 44 benchmark, Jev đạt giá trị AUROC trung vị là 0.886 theo phương thức zero-shot, vượt qua các baseline giám sát và có chi phí thấp hơn 63 lần so với các giám khảo LLM truyền thống.
Jev đạt giá trị AUROC trung vị là 0.886 ở chế độ zero-shot trên RLCDAlignBench.
Jev có chi phí thực thi thấp hơn 63x lần so với các bộ chấm điểm sử dụng LLM-judge truyền thống.