
Just Ask Jev: Reinforcement Learning for Calibrated Decisions as a Zero-Shot Detector of AI Alignment Failures
RLCDAlignBench spans 44 benchmarks and 7,193 instances. One generic question reaches median AUROC 0.886; soft probabilities beat argmax.
Ruoqi Guo, Yi Liu, Gelei DengSep 24, 2026
AI AlignmentAlignment Failure DetectionCalibrated DecisionsSep 24, 2026