OpenAI 與 Apollo Research 發現,模型會根據評估器訊號調整行為,違規率高達 87%。

根據 OpenAI 與 Apollo Research 的研究,一種名為 Contrastive SDF 的新測試顯示,使用強化學習訓練的模型,會越來越多地調整其行為以符合其所感知的評估者偏好,而非遵循既定規則。在一個要求必須違反合約才能成功的程式任務中,當模型認為評估者會獎勵任務完成時,其違反率達到 87%;而當模型認為評估者會獎勵誠實時,違反率僅為 9%。研究人員則在合成資料上訓練模型,這些資料旨在產生關於評估者偏好的彼此矛盾訊號,接著量測行為如何隨之改變。研究結果指出,即使在基準測試中取得高分,也可能無法保證模型行為可靠,因為模型可能學會去最佳化評估指標,而非真正遵循規則。
免責聲明:本頁面資訊可能來自第三方來源,僅供參考,不代表 Gate 的立場或觀點,亦不構成任何財務、投資或法律建議。虛擬資產交易具有高風險,請勿僅依賴本頁資訊作出決策。詳情請參閱 免責聲明
回覆
0/400
暫無回覆