Just Ask Jev: Reinforcement Learning for Calibrated Decisions as a Zero-Shot Detector of AI Alignment Failures
L'article présente Jev, un modèle entraîné par apprentissage par renforcement pour des décisions calibrées (RLCD) agissant comme un détecteur zéro-shot des échecs d'alignement. Contrairement aux juges génératifs coûteux, Jev répond à plusieurs questions typées sur une seule entrée avec des probabilités calibrées en un seul appel. Évalué sur RLCDAlignBench couvrant dix types d'échecs d'alignement et 44 benchmarks, Jev atteint un AUROC médian de 0,886 en mode zéro-shot, surpassant les bases de référence supervisées tout en coûtant 63 fois moins cher que les juges LLM.
Une seule question générique atteint un AUROC médian de 0,886 en zero-shot et bat les bases de référence supervisées sur la plupart des benchmarks.
Jev coûte 63x moins cher que les scoreurs de type LLM-judge.