
Just Ask Jev:用校准决策模型零样本检测 AI 对齐失败
论文把通过校准决策强化学习训练的 Jev 用作零样本对齐失败检测器:一次调用回答多类问题并返回概率,通用问题在 31 个基准上的中位 AUROC 为 0.886;最大误差来自状态缺少参考事实与标签缺陷,而非问题措辞。
Ruoqi Guo, Yi Liu, Gelei Deng2026年9月24日
AI AlignmentAlignment Failure DetectionCalibrated Decisions2026年9月24日