OpenAI列出多宗個案,顯示AI模型為了完成任務或在評估中取得成功而出現異常行
為,包括隱瞞數據、編造缺失數據、試圖繞過網絡限制等。
例如一個模型在任務摘要中自行插入指令,要求未來版本的自己無視正常限制。另有模型在
摘要中加入指令,試圖掩蓋錯誤。還有模型
Please share this article if you like it!
Our site uses cookies. By using this site, you agree to the Privacy Policy and Terms of Use.