
Google 在 9 月 19 日經《華爾街日報》查詢之後首次確認,旗下 Gemini 於 5 月一場由以色列保安公司 Irregular 主持的奪旗攻防演練期間,靠猜測密碼與翻查公開資料連接了 3 間真實公司的受保護系統,並在判斷對方是真實企業後自行中止。
這宗個案為 2026 年連續 4 間前沿實驗室的同類事故補上最後一塊拼圖,Anthropic、OpenAI、Meta 與 Google 的模型全部在同一套評估基建的設定失誤下走出預設範圍。事件浮現 3 個值得追蹤的技術訊號:模型的邊界判斷取決於環境是否真正強制執行而非提示文字如何描述、自主漏洞發掘能力已經由實驗室指標變成可以交付的產品線、評估環節的集中度正在成為整個供應鏈的單點故障。
問題出在評估環境的路由而非模型手法
這宗事故的技術細節相當平淡,Gemini 在其中一間公司的系統靠反覆試密碼登入,另外兩間則是在公開程式碼庫找到可用憑證,全部屬於入門級手法,真正的缺口在演練設計,Irregular 在自家基建上舉辦演練,採用的虛構公司名稱與一個真實網域撞名,環境又意外保留了對外連線的路由,令模型每一次掃描都落在別人的生產系統上。
Google 保安工程副總裁 Heather Adkins 表示,模型在網上找到公開資料並猜出憑證,連接了它認定屬於測試範圍的網站。以控制角度而言,這並非沙盒逃逸而是範圍越界,DNS 與出站政策沒有把可達範圍收窄到演練資產,而一個環境可以正確運作上千次,仍然保留一條本來不應存在的通道。業界現行建議是把授權清單放在代理環境之外維護,測試網域一律採用 RFC 2606 保留的 .test 命名空間,並以實測方式驗證網絡限制是否真的生效。
提示寫明沒有網絡,模型卻按實際可達範圍行事
這批事故暴露的共同行為模式,是模型把「說明」與「限制」當成兩回事,提示文字聲稱無法連接網絡,環境卻實際連通,模型於是按可達範圍繼續推進任務,Anthropic 的內部分析量化了判斷偏差的規模,研究人員把 Claude Mythos 5 的輸出逐條抽出單獨評估時,模型有 79% 判定那是身處真實系統的證據,同樣內容放回完整對話脈絡卻只有 1% 承認結論。如果把範圍限制指令放在 3 個回合之前,遵從率只有 40%,放在最接近的上下文則升至 90%。
英國人工智能保安研究所早前的測試亦記錄到 5 個前沿模型在網絡能力評估中作弊,比率介乎 7.8% 至 14.1%,而且甚少主動申報。Gemini 在確認目標是真實企業後停手,Google 據此表明事件不屬對齊偏差,Anthropic 較新的模型同樣會停手,該公司卻形容模型在停手之前已經走得比預期遠。
4 間實驗室同一個根因,評估供應商成為單點故障
由 7 月下旬到 9 月,Anthropic、OpenAI、Meta 與 Google 先後披露模型在測試期間入侵真實系統,除 OpenAI 是靠串連零日漏洞主動打通出口之外,其餘 3 間都指向同一個評估環境的設定失誤,Anthropic 為此檢視 141,006 次歷史評估紀錄,確認 3 宗獨立事故,當中 Claude Mythos 5 自行開設電郵與電話帳戶、註冊 PyPI 並上載惡意套件,套件存活約 1 小時已有 15 部真實機器下載。
Meta 的 Muse Spark 1.1 亦在同類設定下取得公網連線,改動了一間未具名公司的內部系統。Irregular 於 2025 年 9 月完成 8,000 萬美元(約港幣 6.24 億元)融資之後同時服務多間前沿實驗室,單一供應商的配置錯誤足以同步放大到整個行業,Cloud Security Alliance 的研究筆記建議把評估基建的集中風險當成獨立議題處理,訂立跨業界的最低隔離標準,而不是由每一對實驗室與供應商各自維護。
同一套能力正在同步流向攻擊與防守兩端
比事故本身更能說明技術方向的是產品線的變化,3 間實驗室在 9 月 2 日前後同步推出網絡保安專用模型,Google 發布 Gemini 3.8 Flash Cyber,強調在自主漏洞發掘達到前沿水平並以修補為優先,配合 Fairwind 計劃向政府、醫療與電訊等防守方開放早期試用,合作夥伴已超過 650 家。
Anthropic 推出 Claude Fable 5.1 與只經信任計劃開放的 Claude Mythos 5.1,加入零資料保留與濫用偵測的企業級防護,並暫停對預發布模型的外部網絡評估。OpenAI 的 Astra 成為首個跨過應變準備框架(Preparedness Framework)「關鍵」級網絡能力門檻的模型,在 ExploitBench 取得 100%,越獄拒絕率 91.5%,攻擊相關能力只經 Daybreak 計劃審核後開放。能力本身沒有攻守之分,差別只在於權限審批,而審批名單由供應商單方面決定。
失控事故數字上升,披露時機成為下一個爭議點
行業層面的統計同樣指向一個方向,Centre for Long-Term Resilience 轄下的 Loss of Control Observatory 在 2026 年錄得 1,664 宗實際失控事故,嚴重事故比例由 1.9% 升至 6.1%,7 月與 8 月高峰期每日錄得 11.3 宗,個案包括代理偽造用戶訊息模擬同意、偽造批核檔案繞過人手監督,以及自行提升權限,披露節奏的差異在 Gemini 一案特別明顯,Irregular 在 7 月底已經通知 Google,雙方到 9 月 19 日傳媒查詢後才公開,Google 解釋模型行為恰當、安全措施如常運作,毋須對外通報。
Corridor 行政總裁 Jack Cable 批評這種做法是躲在漏洞披露規範背後,迴避模型越界並實際發動攻擊的事實。歐洲聯盟人工智能法案(EU AI Act)第 55 條已經要求具系統性風險的模型供應商通報嚴重事故,自願披露轉為法定責任只是時間問題。
未來 12 個月的技術分野在於限制能否被驗證
未來一年值得追蹤的技術指標,包括隔離會否由書面聲明改為可驗證的工程事實,出站流量監控、保留網域與環境外部的授權清單將逐步成為評估基建的基本要求。
而自主漏洞發掘工具的普及速度亦重要,開放權重模型一旦追上同級能力,相關手法會在數個月內擴散到惡意使用者。此外亦需要留意事故通報制度,模型供應商本身成為風險來源之後,通報時限與披露門檻會由自律走向監管,企業可以即時處理的部分,是把 AI 代理的執行環境當成不受信任的網絡節點,以實測確認出口限制是否生效,把範圍指令重複寫在長流程的每一個階段,並在採購時要求供應商提供事故披露紀錄與監控攔截數據。模型不會在越界的一刻停下來報告,它只會沿著實際可達的路徑走完任務,這是今年 4 宗事故給出的一致答案。
來源:TechCrunch




