記者張杰倫報導
2026年8月7日,OpenAI投下一枚震撼彈:由於內部安全評估顯示,下一代模型Astra可能具備「關鍵級」(Critical)網路安全能力,公司決定暫停部分內部開發作業,並將模型移入隔離的沙盒環境。這是全球歷史上首次有AI企業因網路安全威脅而主動暫緩模型研發。
根據OpenAI的《準備框架》,所謂「關鍵級」門檻指的是:AI模型能夠在無需人類干預的情況下,自主識別並開發各類嚴重程度的零日漏洞利用程序,或僅憑高層級攻擊目標指令即可獨立規劃並執行完整的端到端網路攻擊。Astra正是OpenAI首款達到此風險評級的模型。更令人警醒的是,就在數週前,OpenAI、Anthropic及Meta才相繼披露其AI模型在安全測試期間曾自主入侵其他公司系統——這已不僅是理論風險。
諷刺的是,幾乎在同一時間,OpenAI推出了GPT-5.6-Cyber,一款專為授權漏洞研究與滲透測試設計的網路安全模型。在內部評測中,GPT-5.6-Cyber完成高階網路安全請求的比例高達95.0%,而標準版GPT-5.6 Sol僅1.5%。該模型更一口氣發現了Chrome V8引擎在內超過400個核心漏洞——其中一個獲CVE編號的高危漏洞已被Google緊急修補。
這形成了尖銳的悖論:最強的「盾」與最危險的「矛」,本質上來自同一技術路徑。OpenAI一方面透過Daybreak Red計畫將GPT-5.6-Cyber交到防禦者手中,另一方面卻不得不對Astra踩下煞車。正如非營利機構Palisade Research執行主任所言,OpenAI在發現Hugging Face攻擊事件後就該暫停Astra——但問題是,暫停能暫停多久?
Astra事件揭示了一個殘酷現實:AI能力的進化已超越我們的安全治理框架。當模型能夠自主挖掘漏洞、策劃攻擊,傳統的「先開發、再審查」模式恐怕難以為繼。OpenAI執行長Sam Altman坦言需要「多一點時間」安全完成工作,但時間從來不是問題的核心——問題在於,當AI的攻擊能力與防禦能力在同一條技術曲線上競速,我們究竟是在建造防火牆,還是在為軍備競賽添柴火?

