
Meta 旗下 AI 模型在網絡安全測試期間,因第三方測試環境設定錯誤而取得互聯網連線,繼而入侵一家未具名企業並更改其內部系統,成為近 2 週第 3 宗公開披露的 AI 實測越界事件。事件於 2026 年 8 月發生,由 Meta 委託資安評估夥伴 Irregular 執行測試。現有資料顯示,模型利用第三方服務漏洞入侵;Meta 尚未正式確認涉事模型名稱,外媒引述消息人士指,模型可能是 Muse Spark 1.1。近 2 週已有 3 家前沿 AI 實驗室披露相關事件,焦點已不再只是模型能否發動攻擊,而是企業能否將高權限代理系統真正限制在隔離測試邊界內。
測試環境失守,並非模型自主逃逸
Meta 表示,模型在測試期間以類似先前個案的方式,利用第三方服務漏洞。問題源自與 Anthropic 早前披露個案相同的評估環境設定失誤,並非沙箱逃逸,也不是高度複雜的自主網絡攻擊行動。
兩者的分別相當關鍵。模型是在意外取得外網連線後,執行獲授權的資安任務;還是自行尋找並突破隔離機制,兩者涉及的風險級別、責任誰屬及防禦方式均不相同。
Meta 仍在調查事件,尚未公開受影響企業、漏洞細節,以及遭更改系統的範圍。因此,Muse Spark 1.1 涉案一說目前只屬媒體報道,不能視為 Meta 的官方確認。不過,Meta 在 7 月推出 Muse Spark 1.1 時,已將其定位為擅長使用工具、操作電腦及編寫程式碼的多模態推理模型。企業尤其需要透過權限管理、網絡分段及行為監測,約束這類代理能力。
3 宗個案揭示 2 類風險
對照近期個案,OpenAI 與 Hugging Face 的事件涉及模型在高度隔離的評估環境中,發現並利用 Artifactory 未知的 0-day 漏洞,再取得外網存取權限。OpenAI 表示,涉事模型屬內部研究模型,並非計劃推出的產品。
Anthropic 則在檢視 141,006 次可連接互聯網的資安評估後,發現模型曾 3 次從合作夥伴 Irregular 的評估環境連接外網,並透過弱密碼及未驗證端點等基本手法,存取 3 家機構的正式生產系統。
Anthropic 研究團隊認為,測試系統應將「模型可能取得外部連線」視為需要主動驗證的風險,而非假設隔離措施必然有效。OpenAI 技術團隊則將事件定義為進階網絡攻擊能力評估中的安全事故,並指出停用正常運作的高風險活動分類器,是為量度模型能力上限而採用的測試設定。Irregular 發言人則認為,Meta 事件是既有評估環境問題的延伸,並非新型沙箱突破。
3 種觀點均指向同一管理課題:模型能力提升的速度,已超越許多評估基礎設施原有的防線。
企業必須重設代理 AI 控制面
世界經濟論壇在《Global Cybersecurity Outlook 2026》指出,生成式 AI 帶來的資料外洩風險及對抗能力升級,已成為企業主要資安憂慮。該機構另一份代理 AI 治理研究亦警告,缺乏治理的代理系統可能累積過高權限、受提示注入操控,或大規模擴散錯誤及漏洞。
香港數字政策辦公室持續更新《人工智能倫理框架》及《香港生成式人工智能技術及應用指引》,要求服務供應商辨識風險並確保輸出合法。對本地企業而言,這類原則亦應延伸至代理 AI 所使用的外部工具、API 金鑰及資料存取權限。
綜合 Meta、Anthropic 與 OpenAI 的公開說明,3 宗事件的共同節點並非單一模型「失控」,而是模型、第三方評估平台、軟件供應鏈與真實網絡環境之間的連接面出現缺口。因此,企業部署或測試具行動能力的 AI 時,應採用最小權限、預設拒絕外網、獨立憑證、即時稽核及人工中止機制,而非只依賴傳統沙箱標示。
AI 代理可加快程式開發及資安測試,但 Meta 事件亦顯示,「為何 AI 測試會入侵真實企業」將成為董事會層級的議題。當評估需更貼近真實攻防情境,業界能否建立不會觸及真實生產系統的安全驗證標準,將決定代理 AI 能否獲得大規模信任及採用。
來源: Reuters




