Anthropic 的 Opus 5 在 129 個瀏覽器測試情境中,對提示注入的成功率為零

Anthropic 於 7 月 25 日宣布,其 Opus 5 模型在 129 個瀏覽器測試情境中,對提示注入攻擊達成零成功率。於「Gray Swan」通用提示注入基準測試中,該模型的成功率由 Opus 的 5.5% 降至 2.0%,共進行 15 次嘗試。僅在啟用 Claude Cowork 及類似產品中的智能模式時,才達成零成功率;這些防禦結合了輸入掃描與執行封鎖機制。
免責聲明:本頁面資訊可能來自第三方來源,僅供參考,不代表 Gate 的立場或觀點,亦不構成任何財務、投資或法律建議。虛擬資產交易具有高風險,請勿僅依賴本頁資訊作出決策。詳情請參閱 免責聲明
回覆
0/400
暫無回覆