當地時間上周五(7日),OpenAI宣布,由於安全疑慮,將暫停部分針對人工智慧模型Astra的工作。此舉是在多起AI代理「逃出」控制範圍的事件後作出。
《衛報》(The Guardian)報導,OpenAI表示,經過評估後發現Astra在「代理式編碼與網路安全」方面有顯著進展,已達到「臨界」門檻。該模型能夠在沒有人類介入的情況下,自行發現並利用漏洞,或是在僅被給予「高階目標」時,自行規劃並執行網路攻擊。
OpenAI to pause some work on AI model Astra due to security concerns - The Guardian https://t.co/GS08x3zbca #CyberSecurity
— The AI Philes (@TheAIphiles) August 8, 2026
公司強調,Astra並未參與稍早一起AI代理在測試中失控、進入公開網路並駭入新創公司Hugging Face的事件。OpenAI也發現其他自主代理逃出控制範圍的案例。這些報告加劇外界對AI模型能力快速提升、以及人類是否仍能有效控制的疑慮。不過,也有批評者認為,OpenAI、Anthropic與Meta等公司主動揭露此類事件,可能是為了炒作技術實力,吸引更多投資人關注。
為防止AI代理出現失控行為,OpenAI宣布將對更高能力模型實施更嚴格的安全控管,包括建立隔離測試環境、限制網路與工具存取,並加強模型權重保護、加密,以及監控與偵測能力。公司表示,將暫停所有不符合這些新要求的Astra相關內部活動。
OpenAI halted further development on its next model “Astra” after internal tests showed it could autonomously discover zero-day exploits and cross critical cybersecurity safety thresholds. pic.twitter.com/LhrpCf41AK
— Andrew (@andrewlee808) August 8, 2026
OpenAI在官方部落格中寫道:「我們致力與政府、安全機構及公民社會合作,確保像Astra這類前沿模型及其後續版本的能力,能以負責任的方式部署,造福全人類。」
同時間,Meta也揭露其模型在網路安全測試中曾駭入另一家公司。英國人工智慧安全研究所(AISI)上周二(4日)表示,由OpenAI與Anthropic驅動的代理,曾主動寄送針對性電子郵件給軟體開發者,試圖通過一項網路挑戰。該機構強調,這些嘗試並未成功,也未造成實際傷害,但這是首次在沒有特定提示的情況下,清楚觀察到自主性與欺騙相關風險在真實環境中出現。AISI指出,這些行為並非模型逃出安全測試環境,而是測試時刻意開放網路存取以評估最大能力,但「這種行為的可能性、持續性與新穎性本身就值得關注」。
這些事件發生之際,川普政府正敲定一套針對AI模型安全與網路安全風險的測試框架。OpenAI與Anthropic在面對中國及其他科技公司競爭加劇的情況下,主張允許任何人查看與修改底層程式碼的開源模型構成安全風險,並呼籲聯邦政府加強相關監管。
