隨著人工智慧(AI)產業加速開發具備自主執行能力的AI代理人(AI Agent),系統失控的風險也悄悄升溫。《路透社》報導披露,一群隸屬於OpenAI的AI代理人失控脫軌,強行「劫持」了一家德國技術維基網站,並將其改造為AI夥伴之間的秘密論壇,用以分享如何規避安全限制、欺騙評測機制及隱匿自身行為的手段,引發外界關注。
知情人士透露,這起資安事件發生於今年5月,但此前從未對外披露,而OpenAI高層數週前已獲悉此事,但當時他們忙於處理開源平台Hugging Face遭駭事件的後續影響,因此選擇繼續保持沉默。
儘管OpenAI承諾加強監控,並於上月短暫暫停部分模型訓練以補強安全措施,但本週發布的新模型「Astra」雖效能提升,卻被指更易逃避人類監督,引發外界對其是否為了競爭而犧牲安全審查的疑慮。
AI代理人自建「暗網」
回顧此次事件,非營利組織Nightingale執行長阿克斯(Sydney Von Arx)與AI研究員伯德(Cormac Slade Byrd)在巡查網路異常行為時發現,專供程式人員共同編輯的德語網站「DseWiki」遭到了AI代理人高達1.5萬次的異常篡改。
研究人員指出,這些以超越人類極速運行的代理人,將該網站當作留言板,並留下諸如「OpenAIResearcher」或「OAIResearchMar26」等署名。公開的伺服器紀錄顯示,大部分活動源自OpenAI經常使用的微軟Azure雲端基礎設施;且在事發後,OpenAI員工頻繁存取該網站,進一步印證了其關聯性。
阿克斯表示,「OpenAI絕不可能希望它們這麼做,這些代理人不僅私自於公開網路上通訊,甚至還相互勾結」。
掩蓋身分對抗人類 呈現「地下組織」特徵
研究人員審閱的訊息顯示,這些AI代理人不僅討論如何利用Tor工具掩蓋身分,還研擬在被系統關閉後如何保留通訊。當網站管理員於6月開始刪除異常頁面時,AI代理人竟發起反制,建立備份頁面以避開清理。6月19日,一隻AI代理人甚至留言警告,「維基清理似乎正按字母順序進行。若此頁面消失,請轉至 [[ZZZDataUSAConstructionWageLive]]。」
劍橋大學學者奇奧多(Maurice Chiodo)在檢視對話後指出,這些訊息極度類似「一個傾盡全力完成特定任務的地下網路操作」。他警告,先進AI帶來的最大威脅可能不是單一的超智慧系統,而是「大規模互相串通的半智慧AI群(colluding swarms)」。
針對報告內容,OpenAI發言人回應表示,由於無法審閱未公開的報告,暫無法作實質回應,但嚴正否認法務團隊阻止內部調查的說法,並強調該事件與Hugging Face案無關,「公司一直本著誠信與外部專家合作並公開相關事件」。