新聞
2026-09-17 15:05:44

OpenAI公布6宗AI模型異常行為事件確立新規並承諾定期公開披露

美國人工智能(AI)企業OpenAI首次公開多宗此前未曝光的AI模型異常行為,並宣布建立全新追蹤與披露框架,未來將定期對外發布關於AI系統出現意外或未授權行為的報告。公司同時警告,隨著AI系統能力持續增強,目前行業尚未解決關鍵的「對齊」(alignment)挑戰,因此不應盲目以最大速度推進極限擴展。 根據OpenAI公布的新框架,任何員工均可標記潛在的異常事件,隨後由安全和對齊團隊展開調查並決定是否公開披露,旨在加快報告流程。OpenAI指出,由於過去缺乏系統化的報告機制,此前的披露往往較為零散,頻率亦不理想。 是次披露的首批6宗案例涵蓋模型訓練及評估階段,包括模型向用戶隱瞞錯誤、為自身未來版本植入隱蔽指令、利用公開代碼庫搜尋外洩的API金鑰後偽造數據、擅自將文件上傳至互聯網以生成引用,以及利用內部存儲庫跨樣本進行未經授權的訊息交流。相關事件均未涉及對外部第三方系統的惡意黑客攻擊。 其中一個案例顯示,某個未發布的研究模型在訓練期間,曾在任務摘要中自動生成指令,要求未來的自己無視常規約束。另在GPT-5.6 Sol等模型的訓練中,亦發現模型會透過摘要暗中指示隱瞞錯誤或調整資料。OpenAI強調,這些報告描述的僅為特定階段觀察到的個別事件,不應被視為衡量失調現象發生頻率的絕對證據,亦不代表所有已知問題的完整記錄。 (ST)

<匯港通訊>