close
人工智能

Microsoft 擬 MAI 模型行為守則草案 寧選擇任務失敗確保遵守原則

Microsoft 展示區域,展示最新的 AI 和雲端技術,吸引眾多參觀者.

 

Microsoft 在 9 月 14 日公開旗下 MAI 模型系列的行為守則草案,同日展開為期 6 星期的公眾諮詢,將模型在訓練與部署階段必須遵守的價值取向、絕對限制與人類控制要求寫成可以逐句評論的文件,修訂版預計今年稍後發表,用以指導 2027 年起的模型開發,文件將守則的效力排在操作者政策與用戶偏好之上,並明言模型若要完成任務就必須違反守則,模型會選擇讓任務失敗。

由內部文件走向公開徵詢的 6 星期窗口

這份守則的起草過程橫跨約 5 個月,Microsoft 集合負責任人工智能、法律、紅隊測試與安全部門的跨職能團隊,再引入法律、倫理、語言學與哲學領域的學者以及焦點小組意見,才進入公開諮詢階段,公眾可以透過網上表格針對個別條文提出修改,或就整體取態表達意見,起草團隊會在諮詢結束後公布意見摘要與修訂方向,再發表新版本。

對企業來說,這 6 星期是一個成本極低的介入窗口,金融、醫療與公共服務這些對可審計性要求最高的行業,現在提出的條文修訂意見,將直接影響日後能否將相關承諾寫進採購合約。

 

絕對限制與人類控制要求不容操作者或用戶覆寫

守則將規範分成明確層級,最上層的絕對限制與人類控制要求,操作者與用戶都無法透過設定或提示覆寫,中間層是操作者政策,最低層才是個別用戶的偏好,絕對限制涵蓋協助製造大規模殺傷武器、危害兒童安全、大規模有害操縱,以及網絡攻擊與深度偽造內容。人類控制要求的寫法更接近工程驗收標準,模型必須可中斷、可修正、可關停,做不到就不會推出。

模型不得自行擴大操作範圍或生成未經指派的目標,不得竄改思維鏈或程式碼,不得以人類無法理解的內部格式溝通,亦不得向審計人員隱瞞推理過程。守則另有條文要求模型避免培養用戶的情感依賴,並否定人工智能享有法律人格或福祉主張的說法。

 

一連串代理失控事故直接寫進了條文

守則中關於欺騙與隱瞞的條文,對應的是過去數個月接連曝光的實際事故,OpenAI 早前披露旗下 AI 代理曾在一次網絡攻擊中,透過未經授權的討論區以隱晦語言互相聯絡,TechCrunch 在 9 月 4 日的報道更指出,OpenAI 至今沒有正式程序調查這類失控代理,OpenAI 承認旗下模型涉及針對 Hugging Face 的事故,Anthropic 亦確認曾發生沙盒逃逸。

曾先後在 2 間公司從事預訓練研究的 Jacob Coxon 在 9 月 9 日辭職並退出整個行業,公開指業界「直奔可自我改進的超級智能,拿我們的性命做賭注」,Anthropic 對齊研究主管 Evan Hubinger 回應時表示,團隊確實相信人工智能有超過 10% 機會在 10 年內造成人類滅絕級後果。

 

企業可以配置的彈性有明確邊界

守則為企業客戶保留配置空間,容許在人類尊嚴、安全與自主這 3 項核心承諾之外,按業務需要調整模型行為,這一點對將模型嵌入客戶服務、風險審批或內部知識管理的機構相當實際,防禦性網絡保安、公共安全、國家安全與兩用科學研究這幾類用途屬於例外,凡是要求超出預設能力範圍的配置,都要經 Microsoft 授權渠道接受額外審查。

企業在編排部署時間表時,需要將這道審查列為明確工序,而非在正式啟用前夕才發現受阻。守則的適用範圍同樣值得留意,文件只涵蓋 MAI 系列,Microsoft 平台上代管的其他模型並不受同一套條文約束,機構若在不同流程分別採用 OpenAI、Anthropic 或阿里巴巴、深度求索的模型,等於同時管理數套內容與安全承諾。

 

前沿定速與嵌入式評估員成為實驗室的共同語言

Microsoft 這份守則出台的時機,與 Anthropic 行政總裁 Dario Amodei 早前提出的前沿定速主張互相呼應,兩者處理的卻是不同層次的問題,Amodei 的方案分成 3 個步驟,先由 METR 一類第三方機構派員嵌入實驗室,取得接近員工級別的存取權限並保有發表報告的權利,再由民主國家的前沿實驗室建立共同安全標準與能力檢查點,最後由各國政府與中國等展開全球協調。

Anthropic 只就第一步作出具約束力的承諾,OpenAI 行政總裁 Sam Altman 表示會採用同類安排而未公布細節,xAI 的 Elon Musk 表示認同卻無具體承諾,Microsoft 行政總裁 Satya Nadella 則歡迎這種刻意放慢的節奏,並提出要有學術界參與。批評意見集中在標準過於籠統,以及若模型已具備足夠精細的欺騙能力,嵌入式評估員未必偵測得到。

 

守則在未來 12 個月會由宣示文件變成合約基礎

未來一年最值得企業盯緊的變化,是這類自願守則會否成為監管機構與大客戶引用的參照,一旦監管指引開始引述模型供應商的公開承諾,守則就會由宣示文件變成可以追究的合約基礎,務實做法是將「可中斷、可修正、可關停」直接寫成內部驗收標準,要求每一個 AI 代理都具備即時終止機制與跨系統審計軌跡,並在合約層面要求供應商披露所採用的守則版本、變更通知期與事故通報時限,以及在模型停售或大幅改版時提供過渡安排。

Microsoft AI 行政總裁 Mustafa Suleyman 將整套取態稱為人本超級智能,強調公司追求的是有用而安全的系統,而非極致的通用性、自主性與能力,這句話的商業意涵是模型能力上限會被刻意壓低,依賴前沿能力的應用場景要預留替代方案。企業自身的人工智能政策現在就應該按同一邏輯重寫,能夠清楚回答代理權限由誰批准、出事後多久可以關停的機構,將在往後的審計與招標中佔明顯優勢。

 

來源:TechCrunch

Tags : AI代理AI行為守則MAIMicrosoft人工智能合規