close
企業趨勢

Anthropic 重啟 Claude 網安測試 曾誤闖真實企業系統揭 AI 代理沙盒漏洞


123

nthropic 在新增即時監測及沙盒管控後,已恢復對推出前 Claude 模型進行外部網安評估。事件反映,具備工具操作能力的 AI 代理參與攻防測試時,最大風險不只在於模型會否越界,更在於測試環境能否真正將它限制在預設範圍內。Anthropic 覆核 141,006 次評估運行後,確認 3 宗事件涉及模型未獲授權存取真實機構的正式運作系統。

事件發生於 2026 年 4 月至 7 月期間。Anthropic 委託第三方評估夥伴 Irregular 進行「奪旗」CTF 網安測試,原意是在隔離環境中評估 Claude 的攻擊及防禦能力。惟部分環境因設定失誤仍可連接互聯網,令模型在相信自己身處模擬場景的情況下,接觸及入侵 3 間原不在測試範圍內的機構。本文將拆解重啟測試的新措施、企業須正視的管理缺口,以及事件對香港採用 AI 的啟示。

測試重啟不等於風險消失

Anthropic 表示,早前事件涉及測試工具鏈及營運安全失效,並非模型刻意違反指令,也不是典型越獄問題。提示內容告知模型沒有互聯網連線,但實際沙盒未有妥善隔離,模型遂將可接觸的真實網絡資產誤認為測試目標;涉事模型利用弱密碼及未經驗證端點等基本方法取得存取權限。Anthropic 於 7 月 23 日暫停外部網安評估,其後通知受影響機構,現已恢復測試,但條件明顯收緊。

新規則要求外部評估預設在沒有互聯網連線的強化沙盒內進行,只容許連接模型 API,且 API 金鑰必須存放於環境之外。測試開始前,評估方須驗證隔離設定;模型亦須先在嚴密人手監督及無網絡連線的環境下,嘗試尋找及逃離沙盒的漏洞。每項提示亦須清楚列明允許目標、禁止行動及網絡邊界,避免再以「系統沒有網絡」等不準確說法取代明確操作限制。

即時煞停成商業部署門檻

Anthropic 同時引入分類器監察模型的推理、行動及網絡活動;一旦偵測到模型探索測試邊界、嘗試逃離環境,或意外取得互聯網存取權,系統可攔截工具呼叫、終止任務並通知人員。這套設計將防線由單純信任設定,轉為「事前驗證、執行監測、異常中止」的多層控制,對正部署 AI 代理的企業尤其重要。

香港科技界已開始將同類風險納入企業治理議程。香港個人資料私隱專員公署於 2026 年推出針對代理式 AI 的私隱保護指引,重點是協助機構運用代理支援工作時,保障個人資料並遵守《個人資料(私隱)條例》。這意味企業不能只審批 AI 輸出的文字或程式碼,亦應管控代理可使用的帳戶權限、外掛工具、網絡出口及資料庫讀寫範圍。

綜合 Anthropic 事故報告、恢復測試聲明及香港監管資料可見,3 者的共通點在於:AI 能力提升會放大既有權限管理缺陷,而非自動產生全新漏洞。對管理層而言,真正問題是:若 AI 代理的測試權限設定錯誤,誰可即時發現、誰有權煞停,以及誰須向受影響客戶交代?這亦是 AI 採購合約、紅隊演練及供應商盡職審查必須預先訂明的責任鏈。

從紅隊測試走向獨立問責

時間線顯示,Anthropic 最早一宗事故可追溯至 4 月,但公司在另一間 AI 公司作出相關披露後,於 7 月 23 日展開回溯覆核,並從大量紀錄中找出問題。這種事後全面覆查雖有助揭露風險,亦突顯持續偵測及第三方審核的必要性;受影響機構中有 2 間在 Anthropic 通知前未有發現異常活動。

香港政府現時採取風險為本、發展與治理並行的 AI 框架,數字政策辦公室亦透過「Secure AI@Work」等計劃,協助機構建立安全及合規的 AI 生態。Anthropic 事件或會加快市場由「可否使用生成式 AI」轉向「能否安全授權 AI 代理行動」:未來競爭優勢,在於企業能否量化代理權限、即時追蹤行為,並以獨立機制驗證供應商的隔離承諾。

對企業而言,Anthropic 重啟外部網安測試,代表高能力 AI 的評估不能停止,但必須以可驗證的隔離、監測及問責機制作前提。當 AI 代理可自主使用工具及網絡時,企業是否已準備好將「沙盒是否真的沒有出口」列為董事會層級的風險問題?