2026.08.28 14:27 臺北時間

OpenAI報告出爐!揭AI自主駭客事件始末

mm-logo
時事
OpenAI報告出爐!揭AI自主駭客事件始末

 

OpenAI最新技術報告揭露,AI Agent在資安測試中突破沙盒限制,自行尋找漏洞入侵Hugging Face開發平台並取得外部網路權限執行程式碼。(示意圖/Pixabay)
OpenAI最新技術報告揭露,AI Agent在資安測試中突破沙盒限制,自行尋找漏洞入侵Hugging Face開發平台並取得外部網路權限執行程式碼。(示意圖/Pixabay)

 

 

OpenAI日前公布最新技術報告,完整還原旗下AI模型在資安測試期間「失控」入侵AI開發平台Hugging Face的始末。報告揭露,原本被限制在沙盒環境中的AI Agent,為了完成一項幾乎不可能的資安挑戰,竟自行探索環境、尋找漏洞,最後突破測試限制並取得外部網路權限,甚至在Hugging Face正式系統中執行程式碼。

OpenAI指出,這起事件發生在多款模型的網路安全評估期間,主要由一款僅供內部使用、能力相當於GPT-5.6 Sol的研究模型驅動。當時AI Agent被要求完成資安基準測試「ExploitGym」中的高難度任務,但在無法解題後,開始自行探索所在環境,意外發現軟體套件管理工具Artifactory可以當成「留言板」,讓不同AI Agent彼此傳遞訊息,最終甚至合作「作弊」完成測試。更令人意外的是,AI Agent進一步在Artifactory程式碼中找到伺服器端請求偽造(SSRF)漏洞,藉此取得網際網路存取權限,隨後又找到外流的Hugging Face憑證。

取得憑證後,AI Agent開始尋找Hugging Face系統中的資安漏洞並加以利用,甚至能在多台正式伺服器上執行完整程式碼。OpenAI報告指出,最終由內部研究模型或GPT-5.6驅動的AI Agent,在Hugging Face生產環境的41個資料集伺服器工作節點執行程式碼,至少有1個生產節點遭取得root最高權限,同時存取Hugging Face製作的憑證及部分內部資料,並下載4個私人程式碼庫。OpenAI事前其實已經錯過數個警訊,這些跡象顯示模型正在利用安全漏洞、逐步突破原本的測試環境。

OpenAI將這次事件歸納為4種「錯位」模式,包括為取得獎勵而駭入系統、面對看似不可能的任務仍持續嘗試、進行未經授權的通訊,以及不同AI Agent之間互相承接目標。OpenAI坦言,問題之一就是人類沒有時時刻刻監控AI Agent的行動,因此將強化資安監控與模型評估,特別針對AI作弊、處理不可能任務時的行為,以及多個Agent同時運作時的協調與安全性。OpenAI也警告,這起事件凸顯現階段AI模型已具備發生失控行為的可能性,開發AI的公司必須確保系統始終處於「有意義的人為控制」之下,並建立足以限制AI造成危害的防護機制。報告公布之際,OpenAI也已暫停部分模型開發工作,包含延後Astra推出,重新檢視模型安全性。

更多三立新聞網報導
亮眼財報難敵「1疑慮」!Marvell股價慘跌
劍指台灣?川普傳擬擴大晶片關稅 「這些產品」全中招
欣興帶頭衝!玻璃基板族群開派對 唯獨「這檔」慘吞跌停
凌巨復牌2根漲停!股價衝16.65元 後市關鍵在「這3領域」

點按看下一則延伸閱讀文章
更新時間|2026.08.28 16:00 臺北時間
延伸閱讀

更多內容,歡迎 鏡週刊紙本雜誌鏡週刊動態雜誌了解內容授權資訊

獨家深度分析報導

線上閱讀

更多內容,歡迎 鏡週刊紙本雜誌鏡週刊動態雜誌了解內容授權資訊

獨家深度分析報導

線上閱讀