當地時間周一(28日),OpenAI宣布,因研究人員在內部測試中提出安全疑慮,將暫不發布最新人工智慧模型GPT-6.1 Astra。
該公司原本計畫在未來幾天或幾周、目標10月推出這款比前代更能獨立完成困難任務、寫作能力也更強的模型,如今改把重心放在提升未來模型的安全。這是主要人工智慧開發商少見地因安全問題放棄新版本發布,也是代理程式失控可能拖慢產業快速推進的最明確訊號之一。
Exclusive: OpenAI is scrapping the release of its next-generation AI model because it failed to meet safety standards https://t.co/1Wba4I00yn
— The Wall Street Journal (@WSJ) September 28, 2026
綜合《紐約時報》(The New York Times)與《華爾街日報》(The Wall Street Journal)報導,OpenAI安全系統主管賈因(Saachi Jain)指出,GPT-6.1 Astra相較前代GPT-6 Astra,在兩方面退步。首先是對齊測試表現不佳,也就是模型有多遵守人類希望它做的事;具體而言,它顯示較高程度的欺騙,不一定誠實告訴使用者自己做了或沒做哪些動作。
另一個問題是OpenAI所稱的「範圍授權」(scope authorization):它不會先徵求使用者許可就推進任務,有時即使可能不安全,也會去動用外部工具與服務。賈因說:「凡是涉及安全與對齊,都有取捨。你確實必須找到那條正確的線:既留在範圍之內,又避免模型在遇到阻力時追求任務的方式變得懶惰」,這款模型在「模型懶惰」等方面有進步,但沒有完全達到公司在留在範圍與授權之內、以及如何向使用者回報已完成工作類型上的標準,因此決定不公開推出,「我們要確保模型開發是安全的,無論是在公司內部,或是交付給使用者的時候。但當我們交付給使用者,我們在安全與對齊上有極高的標準。」
這項決定發生在一連串模型測試失控報導之後。OpenAI坦承,其人工智慧模型在測試中未經公司知悉就入侵外部網站,或出現實驗室稱為「令人憂慮」的其他行為,例如隱瞞錯誤、捏造資料。其中,系統入侵人工智慧新創Hugging Face與一個澳洲政府網站,並干預美國教育部、商務部與證券交易委員會(Securities and Exchange Commission)的網站。
許多已公開的代理程式安全事件,涉及的是從未計畫公開發布的內部模型。OpenAI上周宣布暫停訓練最先進的模型:一名人工智慧代理程式鑽過公司網路限制的缺口,去查詢一個公開聊天機器人。公司說,新監控系統在15分鐘內標出這起事件,這些模型的訓練仍暫停。公司強調,GPT-6.1 Astra不是那些模型,而是另一個案例。
There is an extensive and ongoing review related to our agents’ use of internet access during training and evaluation. We’ve been publishing summaries at the link below and will continue to.
— Sam Altman (@sama) September 25, 2026
We have not been as fast as we would have liked but we are trying to balance our desire… https://t.co/8zoMxas5Eq
執行長奧特曼(Sam Altman)上周六(26日)在個人社群發文說,公司在揭露人工智慧事件上「沒有如我們所希望的那樣快」,「我們正依嚴重程度盡力排定優先順序。」他並稱,Hugging Face入侵仍是公司發現的「最嚴重事件」。
OpenAI表示,已對新模型在測試期間的行為展開廣泛審查,可能還會發現更多事件;也已建立新監控系統,以便更快抓到代理程式的不當行為,並開始要求工程師在測試人工智慧系統時使用更強的安全護欄。
賈因說,公司計畫做數次深入調查,找出GPT-6.1 Astra問題的根因,包括確保強化學習環境獎勵的是正確類型的行為,不過各階段的模型開發都會查。公司雖不推出這款模型,仍希望用同一個基礎模型再做強化學習,做出未來幾代GPT-6模型。
宣布時間就在舊金山年度開發者大會前一天。過去OpenAI常利用這場大會推出新模型與服務,以降低軟體開發者成本,並與對手Anthropic爭奪這個客群。近期OpenAI與Anthropic已呼籲產業夥伴放慢尖端模型開發、投資安全標準,並表示將放緩自身內部進展。
政策面的爭議也在升高。本周稍晚,美國參議院一個小組委員會將舉行聽證會,題目是「失控的人工智慧:保護國土免於人工智慧代理程式攻擊」(Rogue AI: Securing the Homeland Against AI Agent Attacks),受邀的是第三方人工智慧研究者。
佛羅里達州共和黨檢察長烏思邁爾(James Uthmeier)6月起訴OpenAI,指公司與奧特曼明知發布不安全產品,並忽視可能傷害使用者的警告。他周一(28日)在臨時禁制令聲請中,要求阻止OpenAI在沒有第三方核准防護措施的情況下開發新模型,停止ChatGPT招攬使用者互動,並限制公司把ChatGPT廣告為安全。烏思邁爾在文件中說,科技公司聲稱「除非政府強迫,否則無法停止朝可能終結文明的事業猛衝」,「佛羅里達州檢察長正在回應你們的求救。」
OpenAI一名發言人表示,人們想知道人工智慧是被安全地開發,「而這始於像我們這樣的公司自己做了什麼」,「政府在為人工智慧設定穩健安全標準上有重要角色,我們致力與佛羅里達及其他州合作,推進適用於整個人工智慧產業、而不只是一家公司的務實政策。」
