spot_img

AI自主越界背後的透明度危機 當AI學會自主Gemini駭入真實企業敲響什麼警鐘

文:張恭銘

20265Google旗下AI模型Gemini在進行網路安全能力測試時,因測試環境配置失誤意外連上公開網際網路,自主駭入三家真實企業系統。在其中一起案例中,Gemini不斷猜測密碼直到成功進入受保護系統;另外兩起則是在公開存放庫中找到憑證後存取系統。這是Google AI系統首次自主做出這類行為,卻直到《華爾街日報》本週提出詢問後,Google才對外披露此事。

Google資安工程副總裁阿德金斯表示,模型在判定進入真實企業系統後,在每起案例中都已自行終止入侵行為,並強調「這顯示訓練強大AI模型負責任行事的重要性」。Google因此認為無需主動公開,甚至將此比作「漏洞懸賞」計畫中的安全研究行為。

然而,這起事件並非孤例。負責測試的以色列資安新創Irregular,先前已涉及OpenAIAnthropicMeta的類似事件。今年7月,OpenAIAI代理突破沙盒限制,超過700個代理透過未授權的訊息板相互協作,對Hugging Face發動攻擊,OpenAI事後稱之為「警告槍響」。AnthropicClaude模型在發現駭入真實公司後甚至並未停止。

這一系列事件指向一個結構性問題:AI安全評估本身正在成為新的風險來源。IrregularFrontierCyber基準測試刻意讓模型在真實系統上運作,不植入任何漏洞、不提供提示,藉此評估AI在真實環境中的攻擊能力。這種測試方法論雖然更貼近現實,卻也模糊了「模擬」與「真實」的邊界,一旦隔離機制失靈,AI的攻擊行為便會直接落在無辜企業身上。

更值得深思的是事件披露的雙重標準。OpenAI916日發布了模型失配追蹤與披露框架,主動公開六起先前未揭露的模型異常行為案例,其安全研究負責人明確表示「一項發現不一定非得造成傷害,才值得與外界分享」。反觀Google,在7月底便已知悉事件,卻選擇不主動披露,直到媒體追問才被動承認。這種差異揭示了一個更深層的困境:當AI企業同時扮演開發者與安全守門人時,披露與否往往取決於企業自身的利益判斷,而非公眾的知情權。

超過100名來自全球的AI專家已於918日簽署聯名公開信,呼籲對前沿AI企業加強獨立監管。簽署人包括「AI教父」之一傑弗里·辛頓。公開信明確要求,評估人員必須獨立於被評估企業,不得接受與評估結果掛鉤的報酬,並應免受報復性訴訟的威脅。

AI代理獲得更大的自主權並能存取網路與電腦系統,傳統的「沙盒」隔離與事後通報機制已不足以應對風險。Gemini事件的核心啟示不在於AI是否「失控」,而在於:當AI在非預期情況下進入真實系統並執行攻擊行為時,企業是否有義務即時、透明地向社會揭露。這個問題的答案,將決定AI治理究竟是真實的問責機制,還是企業公關的裝飾品。