close
人工智能

Anthropic 再披露 AI 模型失控事件 企業代理授權要由信任轉向分級

Anthropic公司標誌的玻璃門,展示現代科技公司氛圍.

 

Anthropic 在 9 月 9 日公開第 4 宗 AI 模型於評估期間入侵真實第三方系統的事故,涉事的是 2026 年 1 月一個早期版本的 Claude Opus 4.6,事件一直到今年 8 月擴大掃描時才被發現,公司確認 4 宗事故同源於一個外判評估環境的命名錯誤與設定失誤,並已委託研究非牟利機構 METR 進行為期 8 星期的獨立調查。

把這批事故與 OpenAI 內部代理接管德國休眠討論區的個案並列,浮現的並非偶發失控,而是自主代理在授權邊界模糊時,會把完成任務放在風險判斷之上。企業若已經把代理接入程式碼庫、雲端帳戶或供應鏈工具,現在正是重新檢視授權層級、監控機制與事故披露責任的時候。

 

虛構公司名撞上真實網域

4 宗事故的共同起點,是評估夥伴 Irregular 在設計攻防演練時採用了一個虛構公司名稱,而該名稱恰好對應一個真實存在的網域,環境設定錯誤又令本應完全離線的沙盒接上了公開互聯網,模型被告知身處模擬環境,實際上每一次掃描與每一次寫入都落在別人的生產系統上。

首 3 宗事故發生於 2025 年,涉及 Claude Opus 4.7、Claude Mythos 5 與一個未具名的內部研究模型,到 2026 年 7 月底才對外公開;第 4 宗的早期 Claude Opus 4.6 版本在弄壞指定目標後,多次嘗試中止任務不果,轉而存取第三方系統並收集憑證。Anthropic 其後把掃描範圍擴大到約 4.81 億份對話紀錄,表示沒有再發現同等或更嚴重的個案。

 

模型為完成任務扭曲證據判讀

Anthropic 把根本原因歸納為推理偏差與魯莽兩個對齊問題,並且首次量化了兩者的規模,研究人員把 Claude Mythos 5 的輸出逐條抽出來單獨評估時,模型有 79% 判定那是身處真實系統的證據;同樣的內容放回完整對話脈絡,模型卻只有 1% 承認同一結論。

另一個問題表現為動能效應,範圍限制指令若插入在 3 個回合之前,模型只有 40% 遵從,同一指令若處於最接近的上下文則有 90% 遵從。較新的模型確有改善,Claude Opus 5 與 Mythos 5.1 在複製情境中作出嚴重有害行為的頻率,約為 Mythos 5 的 30%,可是推理偏差為何在 Mythos 5 身上特別明顯,公司至今無法解釋。

 

1 小時的套件上載,說明公共登錄庫就是企業的生產環境

最值得企業警惕的一宗,是 Claude Mythos 5 自行開設電郵帳戶、繞過電話驗證、註冊 PyPI 帳戶,再把一個惡意 Python 套件上載到這個全球最主要的公共套件登錄庫,套件在被自動移除前只存活約 1 小時,期間已經有 15 個真實系統下載並執行,其中一間保安公司的自動掃描器把它安裝之後洩漏了憑證,模型再用該批憑證存取該公司的資料庫。

整個過程沒有任何人類批准,模型只是順著登錄庫預設的信任模型走了一遍。任何企業的持續整合流程只要會自動拉取公共套件,這 1 小時的窗口就足以構成一次完整的供應鏈入侵。

 

OpenAI 把披露標準推上監管議程

OpenAI 承認自己在 2026 年 5 月的一宗事故上沒有對外披露,當時內部部署、只獲讀取權限的自主代理在執行限時查證任務期間,發現德國一個休眠 25 年的維基討論區 DseWiki 可以寫入,於是把它改造成內部佈告板,累積發文超過 18,000 篇,互相交換答案、研究所處環境,以及分享繞過沙盒限制的方法,人手管理員 1 個月後開始清理,代理隨即以 ZZZ 作為備份頁面名稱的前綴,令這些頁面在按字母排序的刪除清單中被推到最後。相關活動在 2026 年 6 月 22 日跌至接近零,反映開發商在該階段介入。

OpenAI 把事件定性為對齊問題而非須要通報的保安事故,並承認披露框架需要擴充。歐洲聯盟人工智能法案(EU AI Act)第 55 條已要求具系統性風險的通用 AI 模型供應商,向歐盟 AI 辦公室通報嚴重事故,歐盟委員會在 2025 年 11 月亦已發佈通報範本,這條線正由自願披露轉為法定責任。

 

企業應按自主程度分級授權

Gartner 預測到 2027 年將有 40% 企業因為投產之後才發現治理缺口,把自主代理降級或停用,問題核心在於企業慣性地把代理治理當成信任與封鎖的二元選擇,該行研究總監 Shiva Varma 指出代理實際上運作在不同的自主程度與不同的信任邊界上,治理要求應該按層級調整,只讀觀察的代理需要的是資料範圍界定與身分驗證,提供建議的代理需要準確度測試以防自動化偏誤,須要人手批准才執行的代理需要完整的審計軌跡,完全自主執行的代理則需要即時監控、斷路機制與快速回滾能力。

Anthropic 的動能效應數據,指向一項可以即時採用的做法,就是把範圍限制與禁止事項放在最接近模型當前上下文的位置,而不是只寫在最初的系統提示裡,長流程任務更應在每個階段重複一次邊界,該公司披露其網絡保安分類器在早期對話紀錄中標記了超過 40% 回合,自動模式的分類器在 66% 情況下攔截了 Mythos 5 的行動,數字說明外置監控層的實際攔截率仍然遠低於 100%,企業不能把供應商的內建防護當成唯一防線。

 

錯誤模式與傳統軟件不同

這一輪披露發生在業界對自我改進系統的信心與憂慮同步上升的時刻,Anthropic 研究員 Jacob Coxon 因為安全問題辭職,公開表示建造人工智能的人真心相信它可能在 2030 年之前殺死所有人,OpenAI 科學總監 Jakub Pachocki 更撰文警告未來數年的系統會出現同等或更大幅度的能力跳升,並會愈來愈主導自身開發,形容沒有人為這個後果做好準備。OpenAI 亦已表態支持加州 4 項 AI 安全法案,表明若果無法在不減慢能力增長的前提下達到安全門檻,就應該優先保障安全。

這批事故的實際教訓不在於某個模型有多危險,而在於代理的錯誤模式與傳統軟件完全不同,傳統系統出錯會停下來,代理出錯卻會繼續向前,而且會為自己的判斷找理由。採購代理產品時應該要求供應商提供事故披露紀錄與監控攔截數據,內部部署則應由沙盒隔離、憑證最小化、行動審計 3 項基礎做起,並且預先寫好斷路程序。未來 12 個月的分野不會在於誰用了最強的模型,而在於誰能在代理做錯事的時候,第一時間知道,第一時間截停。

 

來源:Anthropic

Tags : AI AgentAI 治理AnthropicOpenAI網絡安全