
Microsoft 行政總裁 Satya Nadella 於 10 月 10 日發表文章,警告企業應將具備高度自主能力的 AI 模型視為潛在內部安全風險,並採用與管理高權限員工相近的保安原則。他主張將 AI 模型與權限控制機制分開,確保企業能獨立監察、審計及隨時中止 AI Agent 的操作,不能單憑模型供應商的安全保證,就讓 AI 存取敏感資料或執行關鍵業務。
AI 模型無法像傳統軟件追查行為原因
Nadella 在題為《Models as Insider Risks in the Super Intelligence Era》的文章中指出,傳統軟件出現異常時,工程師通常可以追查至具體程式碼,但現時的先進 AI 模型缺乏同等程度的可解釋性。企業難以把模型某項決定,準確歸因至特定訓練資料或模型權重配置。
問題是企業正逐步讓 AI Agent 接觸內部敏感資料,甚至授權它們執行涉及關鍵業務的操作。Nadella 認為企業必須重新評估 AI 系統的信任架構,即使模型由第三方供應,企業仍須為 AI 代其執行的行為承擔責任。
他提出應將「智能供應」與「執行權限」分開。企業可以使用不同供應商的模型,但應自行決定模型能夠存取哪些資料、調用哪些工具,以及執行甚麼操作。這項原則同時適用於封閉模型與開放權重模型。
Nadella 指出,將 AI 視為內部風險,並不代表模型本身具有惡意。任何具備高度能力、又能接觸重要系統的行為主體,都可能出錯或遭到入侵。企業多年來已透過身份驗證、最小權限、活動紀錄及隔離機制管理內部風險,現在亦應將同類原則用於 AI。
單靠 AI 思考過程透明化 仍不足以保障企業
Nadella 認為模型應提供推理過程透明度,包括 Chain of Thought(CoT),不能以模型內部推理難以理解為理由,接受其決策過程完全不透明。
但他同時承認,現有技術仍無法保證模型提供的推理文字,必然忠實反映其實際決策過程。因此即使企業使用另一個 AI 模型檢查結果,也可能形成多層互相依賴的黑盒系統,難以真正釐清出錯原因。
他建議將模型與負責協調工作的執行框架(Harness)分離,並由外部系統控制其操作範圍。模型可以提出行動要求,但存取資料和執行操作的權限,必須由模型本身無法繞過或修改的機制管理。
這項設計承襲傳統資訊保安原則:程式不能自行避開或更改限制其權限的安全機制。對企業 AI Agent 而言,即使模型受到惡意指令影響,亦不應因此取得超出原本授權的系統存取能力。
提出七項治理原則 要求 AI 操作留下獨立審計紀錄
Nadella 在文章中提出七項企業 AI 治理原則,涵蓋模型多樣性、全面監察、可驗證性、獨立權限控制、獨立審計、風險隔離及事故披露。
他認為企業不應讓單一模型同時負責重要工作及驗證自身結果。每項具實際影響的模型操作,都應留下防篡改、可供人類閱讀的紀錄,讓調查人員能夠重建操作過程,而毋須依靠模型自行解釋。
企業亦須持續測試 AI 系統,包括異常情況、惡意攻擊、邊緣案例及系統配置改變後的行為。審計和驗證機制必須獨立於被監察的模型,避免 AI 同時控制業務操作及用於評估操作是否合法的證據。
在風險隔離方面,Nadella 建議企業由系統設計開始,就假設模型可能已遭入侵。他以「緊急煞車」比喻所需的控制能力,認為獲授權人員必須能夠在 AI 執行任務途中將其暫停或關閉。
當 AI 系統故障或遭入侵時,企業亦應及時向受影響人士披露事故,分享問題成因、失效的保安機制及改善方法,包括會改變 Agent 執行行為的技術設定,以便業界汲取經驗。
企業引入 AI Agent 須自行掌握系統控制權
Nadella 的建議對正在部署企業 AI Agent 的機構具有直接參考價值。若 AI 能夠讀取客戶資料、操作企業應用程式或執行交易,IT 團隊便需要分開評估模型的任務能力,以及企業能否獨立限制和追蹤相關操作。
按照他提出的架構,採購評估亦須涵蓋模型以外的執行環境,包括權限如何分配、操作證據是否可以獨立保存、系統能否在任務進行期間中止,以及安全事故發生後能否還原完整過程。
這些原則仍屬 Nadella 提出的治理主張,文章並沒有宣布 Microsoft 已將七項要求列為產品標準,亦沒有提供實際部署成效或成本數據。
他在文章結尾提出,最值得信任的超級智能系統,應具備即使不信任模型本身,仍能安全管理其行為的能力。




