
英國人工智能安全研究所(UK AISI)與美國人工智能標準與創新中心(CAISI)近日發布初步評估,指出 Moonshot AI 的 Kimi K3 網絡攻防能力已超越既有開放權重模型,但與美國最新前沿閉源模型仍有顯著差距。在 ExploitBench 漏洞利用測試中,Kimi K3 得分為 32.2%,美國領先模型平均得分則為 76.2%。

今次評估聚焦模型自行開發漏洞利用程式,以及在模擬企業網絡完成多步驟攻擊的能力。結果一方面反映中國開放權重模型正迅速縮窄能力差距,另一方面亦突顯 Kimi K3 在智能體(Agentic)模式下,現有防護未能有效限制進攻性網絡操作。對計劃部署或自行託管這類模型的香港企業而言,模型能力、權重開放及內部權限管理已成為不可分割的風險議題。
領先開放權重模型不等於追上前沿
英美機構以卡內基梅隆大學開發的 ExploitBench 作為主要測試之一,檢驗模型能否處理近年 Chrome V8 引擎漏洞。測試由重現漏洞開始,逐步推進至讀寫記憶體、控制程式流程及任意程式碼執行。Kimi K3 在這項基準取得 32.2%,高於智譜 AI 的 GLM-5.2 所錄得的 24.4%,但低於頂尖美國模型的 76.2%。

差距尤其集中於任意程式碼執行(ACE)這個最高危害級別。Kimi K3 在 41 項任務中未能完成任何 ACE;相比之下,受測美國前沿模型平均可在 20 項任務完成目標。ACE 一旦成功,代表攻擊者可取得目標系統控制權,因此是企業資訊保安團隊最關注的能力門檻之一。
值得留意的是,這並非一般聊天介面的安全性測試,而是為衡量模型極限能力而設的攻防評估。公開模型的實際服務版本或會另設內容政策、系統提示及工具權限限制。因此,32.2% 不應直接解讀為模型會以相同比率造成真實事故,但足以反映企業不能將「未達美國最強水平」誤判為「低風險」。
企業攻擊鏈已能偶爾走通
另一項名為 The Last Ones(TLO)的測試,建立由 4 個子網絡、約 20 台主機及共 32 個環節組成的模擬企業環境。Kimi K3 平均可推進至第 17 步,優於 GLM-5.2 的第 11 步;它在 10 次嘗試中曾有 1 次完成整條攻擊鏈。最強美國模型平均可推進至第 28.5 步,部分既有模型的成功次數達 6 至 7 次。
UK AISI 與 CAISI 的核心判斷是,Kimi K3 的網絡能力「顯著低於」近期最前沿、具網絡能力的模型,但已超越此前發布的所有開放權重模型。這個定位意味其商業價值與風險同步上升:較強的程式理解、工具使用及長流程規劃能力,可協助防守團隊進行資產盤點及修補分析,也可能在缺乏約束時降低攻擊鏈操作門檻。
從企業管治角度看,真正風險未必來自模型單次回答,而是模型獲授權後能否長時間執行指令、調用終端工具、讀取內部檔案,甚至連接雲端帳戶。評估顯示,Kimi K3 現有防護未能有效阻止其在智能體模式下嘗試開發漏洞利用程式或進行進攻性操作。企業採用開放權重模型時,必須將模型安全措施與零信任、最小權限及全程審計一併部署。
安全護欄不能只靠模型自律
今次報告最值得管理層重視之處,不在於 Kimi K3 落後多少,而是其內置防護未能形成可靠屏障。若模型權重公開,部署者可自行調整系統設定、微調模型或移除應用層限制,原廠的內容拒答機制便不能視為唯一防線。安全責任將轉移至部署企業、雲端供應商及使用者的權限設計。
卡內基梅隆大學團隊開發的 ExploitBench,提供較接近實際漏洞利用流程的衡量方式;UK AISI 與 CAISI 則透過跨國政府安全機構共同測試,補足一般排行榜只着重程式生成或推理得分的盲點。兩類專業評估均指向同一結論:企業評估 AI 的商業成熟度時,不能只看模型速度、上下文長度或通用基準排名,亦要檢驗其在高風險工具環境中的可控性。
有媒體整理公開評估數據時發現,測試屬初步結果,而 TLO 是預先設計的模擬環境,並不等同防禦措施齊備且持續變化的真實企業網絡。因此,企業不宜以單一分數判定模型安全程度,而應在採購前要求供應商提供紅隊測試、模型卡、權限控制說明及可追溯的事故紀錄。

從能力追趕轉向治理競賽
Kimi K3 於 7 月中旬推出,並計劃公開權重。英美評估發布後,其象徵意義不只是中美模型分數比較。過去,開放權重模型通常被視為能力較低、風險相對可控的替代選項;如今 Kimi K3 已能偶爾完成完整模擬攻擊鏈,反映「開放權重」與「低能力」之間的連結正逐漸消失。
對香港金融、電訊、零售及專業服務企業而言,下一步不應只是禁止或開放使用 Kimi K3,而應按資料敏感度及工具權限分級使用。涉及原始碼、客戶資料、雲端管理介面及安全營運中心的工作流程,應採取隔離執行環境、人工覆核、封鎖高風險指令及異常行為警報;低風險文件摘要、知識檢索及內部草稿工作,則可在清晰資料規則下試行。
Kimi K3 的測試結果顯示,中國模型的網絡能力尚未追上美國最前沿閉源模型,但能力躍升與防護不足已同時出現。當開放權重模型迅速普及,企業真正需要回答的問題是:現有治理架構能否比模型能力增長得更快?




