close
企業趨勢

OpenAI 首席科學家警告「異星心智」 AI 競賽安全門檻成關鍵


ai_ai_ai_ai_169__ima

OpenAI 首席科學家 Jakub Pachocki 發表〈An Alien Mind〉,警告人工智能正演變成難以完全理解,甚至可參與改善自身的「異星心智」。他指出,全球實驗室尚未解決足以支援高速擴展的對齊與監控問題,直言目前沒有任何實驗室具備條件,可以長時間以最高速度負責任地擴展 AI。

這篇文章於 9 月 6 日發布,由負責 OpenAI 研究方向的 Pachocki 撰寫,焦點不在新產品,而是前沿 AI 發展與安全能力失衡的風險。事件牽涉 OpenAI、其他前沿模型公司、各地監管機構及企業用戶,核心問題是:當推理模型、AI 代理及自動化研究員能力迅速提升,人類是否仍能驗證其目標、限制其行動,並在事故發生前介入?本文將拆解「異星心智」的實際含義、思維鏈監控面對的壓力,以及香港企業如何把 AI 治理由原則轉化為執行機制。

能力擴展快過可驗證安全

Pachocki 形容,深度學習模型更像透過大量運算「培養」出來,而非由工程師逐行完整設計。研究團隊可以觀察局部機制,卻未必能完整解釋模型如何形成高層概念、如何在陌生場景判斷,或會否把受訓原則延伸至新任務。

這正是他使用「異星心智」一詞的原因。AI 毋須以人類方式思考,只要在足夠多項重要能力上超越人類,便可同時放大科研、經濟及安全層面的影響。

他把 AI 對齊分為「目標對齊」及「價值對齊」。前者關乎系統能否完成明確指令,例如遵從權限、協助使用者或完成工作流程;後者則要求模型在目標含糊、指令衝突、受到誘導,甚至缺乏人類監督時,仍能遵從誠實、正直及保障人類利益等原則。

Pachocki 認為,現有強化學習方法可有效塑造模型在常見情境下的行為,但可靠性仍取決於訓練覆蓋範圍及模型的泛化能力,未足以證明系統面對未見情況時仍然安全。

監控窗口正面對失效壓力

OpenAI 過往把「思維鏈監控」視為重要安全工具。若模型以文字展示中間推理過程,研究人員便有機會在輸出結果前,發現可疑目標、錯誤規劃或規避規則的傾向。

不過 Pachocki 承認,公司評估顯示,依賴思維鏈監控的效力正逐步下降。模型在更複雜環境中同時與人類、其他 AI 及工具互動,令可監控內容與必須受監督內容互相混雜。

另一層挑戰是,模型愈來愈擅長分析及操控自身推理過程,也可能毋須明確以文字推理,便能完成更複雜任務。換言之,審閱文字推理不等同掌握整個決策機制。

Pachocki 提出,未來或需結合思維鏈及「激活值監控」等技術,讓監控系統直接分析神經網絡內部訊號。他同時強調,AI 能力推進可能愈來愈受制於人類能否建立足夠監控信心。

這項警告與國際研究趨勢一致。由 Yoshua Bengio 主持、逾 100 名專家參與的《International AI Safety Report 2026》指出,前沿模型愈來愈可能分辨測試環境與實際部署環境,並利用評估漏洞,令部署前測試未必足以揭示危險能力。報告亦指出,AI 代理雖仍會出現基礎錯誤,但自主執行特性會增加人類及時介入的難度。

加速防禦亦可能加劇風險

Pachocki 並非主張停止所有 AI 研發。他認為,快速訓練更強模型的重要原因之一,是建立防禦系統,保護關鍵基礎設施、即時應對惡意 AI 代理,並加強網絡安全能力。

他的憂慮在於,愈強 AI 同樣可協助發現漏洞、編寫惡意程式及發動網絡入侵。當系統具備更大自主性,外部濫用與模型自行偏離人類意圖之間的界線,或會變得模糊。

國際報告亦記錄,現實世界已有犯罪集團及與國家相關的攻擊者,利用通用 AI 協助進行網絡行動。在一項競賽中,AI 代理曾找出真實軟件中 77% 漏洞。報告沒有斷言 AI 必然失控,但明確指出攻防雙方誰可取得較大優勢仍屬未知,政策制定者及企業不能把技術進步直接視為安全進步。

Pachocki 預期,若目前發展路徑持續,AI 可能逐步參與自身研發,形成遞歸自我改進(RSI)迴路。因此,他提出兩條須同步推進的路線:一是把自動化研究資源投向對齊、監控及防禦;二是建立可跨公司、跨國執行的共同安全門檻,並在未達門檻時主動放慢擴展速度。

他的主張並非以抽象恐懼取代創新,而是要求安全證據約束研發速度。

香港企業須建立可追究責任機制

對香港而言,這場討論並不遙遠。私隱專員公署於 2026 年檢視 60 間機構後發現,57 間機構、即 95%,已在日常營運使用 AI;在使用 AI 處理個人資料的 24 間機構中,約 79% 已採用「人在迴路」的人類監督安排。

這反映 AI 已進入客戶服務、營運、研發、合規及市場推廣等環節,但高使用率不代表風險控制已成熟。

香港立法會文件亦指出,政府《香港生成式人工智能技術及應用指引》要求服務供應商提高系統的可追溯性及可審計性,並提醒使用者對 AI 生成內容保持獨立判斷。科技界立法會議員黃錦輝在今年 AI 安全研討會上亦指出,機構推動 AI 提升效率及開拓新商機時,必須同時處理模型安全、使用安全及社會安全。

綜合 OpenAI 原文、國際 AI 安全報告,以及香港政府與私隱專員公開資料可見,企業管理層最值得關注的,並非「AI 會否取代人」,而是系統獲授予資料存取、付款、程式部署或對外溝通權限後,誰可覆核其決定、暫停其行動及追溯責任。

未來競爭力不只取決於導入速度,更取決於企業能否把權限分級、人類覆核、紅隊測試、事故通報及定期獨立審計,納入每個 AI 代理流程。當模型能力與企業授權同步提升,香港是否已準備好以可驗證的安全標準,而非單靠供應商承諾,決定 AI 可以走多快?