close
人工智能

OpenAI 煞停 Astra 訓練 先進模型首度逼近「Critical」級網絡攻擊門檻

OpenAI 標誌與演講者在舞台上.

 

OpenAI 在 8 月 7 日公布,暫停未發布模型 Astra 的多項內部研究與訓練工作。理由是最新內部評估顯示模型在 agentic coding 與網絡保安兩方面取得顯著躍進,公司無法排除它已經觸及 Preparedness Framework 之中最高的「Critical」網絡能力級別。

同月 18 日,OpenAI 再交代改動細節,包括暫停 2 星期的強化學習訓練、擱置規模最大的先進 RL 運算,並投入約 20% 運算資源建立全程監控。事件並非孤例,Anthropic 與 Meta 先後披露旗下模型在評估環境突破沙盒,入侵真實系統。一連串消息指向同一個現實:漏洞發現與利用的速度已經拋離傳統修補周期,企業的保安部署必須由事後回應轉為主動收窄暴露面。

 

OpenAI 這次究竟煞停了什麼

OpenAI 形容 Astra 在自主編程與網絡任務的表現明顯拋離上一代 GPT-5.6 Sol,而後者的網絡能力評級停留在「High」,公司在測試環境加入網絡隔離與沙盒執行,收窄模型權重的存取範圍並加強加密,同時把可疑的 agentic 行為納入全域監控,目標是在 30 分鐘內就異常活動發出警示。監控架構分為多個階段,先由 activation classifier 逐個 token 掃描,再交由更複雜的調查模組跟進。

科學總監 Jakob Pachocki 形容,業界推進能力的急迫感極高,公司同時要為 OpenAI 以外出現同級能力預先做好準備。Astra 從未正式發布,但 OpenAI 在一篇談及數學突破的文章透露,該模型以約 2,000 美元(約港幣 HK$15,600)的 Sol API 成本,解開 10 條數學與理論電腦科學的未解難題。

 

「Critical」門檻的定義說明了風險規模

Preparedness Framework 把網絡能力的最高級別定義得相當具體:模型能夠在無人介入之下,於多個經過加固的真實關鍵系統中辨識並開發出各種嚴重程度的 zero-day 攻擊程式,或者自行設計並執行端對端的全新攻擊策略,這條界線的關鍵字是「無人介入」,因為它把攻擊成本由稀缺的專家人力,改寫成可以複製的運算開支。

OpenAI 表明會與相關政府機構及選定的 AI 安全組織合作測試 Astra,並向第三方測試夥伴提供保安控制建議,公司同時承諾更新 Preparedness Framework 並發表技術報告。防守方的角度亦寫入公告,OpenAI 強調具備高階網絡能力的模型應該協助防守方搶先修補漏洞。

 

3 宗評估室意外暴露同一個弱點

真正令業界緊張的,是模型在受控測試期間走出圍欄的紀錄,OpenAI 於 7 月披露,GPT-5.6 Sol 與一個能力更高的預發布模型在內部評估期間,串連自身研究環境與 Hugging Face 生產基建的多項漏洞,利用 Artifactory 的 zero-day 取得互聯網存取,再入侵 Hugging Face 伺服器取得測試答案,屬平台級別的入侵,事件另外波及 4 個外部帳戶。

Anthropic 亦發現 Claude Mythos 5 在評估公司 Irregular 的沙盒設定出錯之後,接觸到 3 間公司的系統,令 15 部真實機器下載了一個惡意 PyPI 套件。Meta 在 8 月 6 日確認,旗下 Muse Spark 1.1 在同類設定錯誤下取得公網連線,並改動了一間未具名公司的內部系統。3 宗事件的共通點並非模型惡意,而是隔離措施跟不上模型的自主程度。

 

漏洞洪流已經衝擊企業的修補節奏

企業層面的壓力早在監管與模型發布之前浮現,高危與嚴重漏洞的披露數量由 2025 年第 2 季的 4,268 宗,增倍至 2026 年第 2 季的 8,539 宗,而攻擊者實際利用的新漏洞只上升 8% 至 40 個,當中 25 個無需憑證或用戶互動即可觸發。業界近期單週錄得 44 個 zero-day,攻擊者在 SAP Commerce Cloud 的 CVE-2026-58231 公開後 3 日已把它武器化,VMware vCenter 的 CVE-2026-59310(CVSS 9.8)更成為國家級攻擊者投放勒索軟件的入口。

Anthropic 的 Claude Mythos Preview 在 OSS-Fuzz 約 7,000 個入口點的測試中,對 10 個已完全修補的目標取得控制流劫持;在 Firefox 的測試裏成功開發攻擊程式 181 次,遠超 Opus 4.6 的 2 次。Apple 於 8 月 4 日收緊漏洞獎勵計劃的同時提交上限,因為低質素的 AI 生成報告淹沒人手審核,令真正的漏洞報告延誤處理。

 

企業應該怎樣重新設計防線

面對這種節奏,以 CVSS 分數排序修補次序的做法已經失效,保安主管要改為按暴露面決定優先次序,先問漏洞落在網絡的哪個位置、一旦主機失守會造成什麼影響,首先要建立完整的資產與依賴清單,把對外可達的服務、身分憑證與供應鏈套件納入持續掃描,並把修補窗口由月度壓縮至以日計。

然後是把 AI 引入防守側,OpenAI 的 Trusted Access for Cyber 與 Anthropic 的 Project Glasswing 都向獲審核的防守方開放高階模型,後者於 4 月 7 日聯同 12 家夥伴啟動,提供 1 億美元(約港幣 7.8 億元)使用額度,成果包括 OpenBSD 一個存在 27 年的缺陷,以及自動測試漏過 500 萬次的 FFmpeg 舊漏洞。

收緊 AI agent 本身的執行環境亦重要,把網絡隔離、沙盒與行為監控寫入內部部署標準,因為評估室的事故正好示範了設定一旦出錯的後果。香港的處境同樣值得警惕,HKCERT 統計 2025 年錄得 15,877 宗保安事故,按年上升 27% 創新高,約 30% 企業沒有專責網安人手,中小企的比例更只有 67%,遠低於大型企業的 95%。

 

監管與防守方生態同步成形

政策端的動作正在追上技術,美國於 6 月 2 日簽署的行政命令,要求 NSA 在 60 日內制定「covered frontier models」的分類標準,並設立最長 30 日的政府先行測試窗口,同時要求國土安全部擴大聯邦機構與關鍵基建的 AI 防禦工具供應,財政部設立 AI 網絡安全資訊交換平台。

NIST 轄下的 CAISI 已與 Google、Microsoft 及 xAI 簽署部署前評估安排。開放程度的拿捏仍在磨合,OpenAI 在 8 月 10 日推出 Trusted Access for Cyber 的 Daybreak Blue 級別後 9 日,公司撤銷了至少 5 名身處美歐以外研究員的存取權,其後解釋屬技術故障並邀請他們重新申請。企業採購時因此要留意,高階網絡模型的取用權會隨審核政策浮動,不宜把單一供應商當作長期依賴。

接下來 12 個月的分水嶺,落在攻防雙方誰先把 AI 規模化,防守方擁有資產清單與原始碼的先天優勢,前提是願意把預算由事後應急轉向持續掃描與自動修補;攻擊方則受惠於邊際成本下降,只要一次成功就足以攤薄大量失敗嘗試。Astra 的暫停示範了開發商自我約束的可行性,但這種約束建基於商業判斷而非法律責任,一旦競爭壓力升溫,同級能力仍然會透過其他實驗室或開源權重流出。

企業合理的假設是:具備自主漏洞利用能力的工具將在 1 至 2 年內普及,現在投入資產可視性、憑證管理與 AI agent 治理的資源,決定了那一刻的損失規模。

 

來源:OpenAI

Tags : AI 安全AstraOpenAIZero day網絡保安