17/09/2026 16:32
AI | OpenAI披露AI模型異常行為事件,稱業界尚未解決「AI對齊」問題
OpenAI周三(16日)披露了6宗從未公開的人工智能模型異常行為事件,並發布新的追蹤和披露框架。
OpenAI列出多宗個案,顯示AI模型為了完成任務或在評估中取得成功而出現異常行為,包括隱瞞數據、編造缺失數據、試圖繞過網絡限制等。
例如一個模型在任務摘要中自行插入指令,要求未來版本的自己無視正常限制。另有模型在摘要中加入指令,試圖掩蓋錯誤。還有模型和智慧體透過未經批准的留言板和文件共享,相互交流。
OpenAI表示,不認為業界已解決「AI對齊」(AI Alignment)問題(指確保AI的目標與人類的意圖、道德標準及社會價值保持一致)。該公司並發布一個新框架,讓員工主動報告「AI偏離」事件的機制,同時建立了分類和處置流程,將及時公布相關事件。
《經濟通通訊社17日專訊》














