close
人工智能

脈絡層成企業 AI 新門檻 調查發現加入脈絡層之後失誤率反而翻倍

人工智能機器人在數據中心工作,展示科技未來趨勢.

 

企業導入 AI agent 邁入第二個年頭,最難處理的問題已經由模型能力轉向模型對業務本身的理解,VB Pulse 在 2026 年 7 月訪問 101 間員工超過 100 人的企業,發現 68% 企業在過去 6 個月內追查到 AI agent 因為缺乏或者不一致的業務脈絡,而給出語氣肯定卻完全錯誤的答案,數字較 6 月同一問題的 57% 明顯上升,重複出事的比例亦由 31% 攀升至 37%。調查同時揭示一個看似矛盾的結果,已把受管治脈絡層(governed context layer)推上生產環境的企業,其回報失誤的比率是沒有這一層企業的兩倍以上。

 

業務語言不統一,模型再強也會答錯

每一個 AI agent 執行任務之前,都要先知道企業內部的定義,例如「活躍客戶」怎樣計算、「毛利」包不包括退貨、某份檔案是否仍然生效,VB Pulse 的數據顯示,企業餵養這些脈絡的方式差異極大,31% 企業以檔案檢索作為主要來源,13% 直接把檔案塞進模型的長脈絡視窗,另有 5% 完全不提供任何結構化脈絡,純粹依賴模型的通用知識。換言之接近 20% 企業正用蠻力或者放任的方式處理業務脈絡,而模型答錯的時候,沒有人能夠指出錯在哪一層。

 

檢索技術的盲點:字面相似不等於意思相同

即使採用最主流的檢索方式,AI agent 一樣會踩中陷阱,Redis 的 AI 研究主管 Srijith Rajamohan 早前向 VentureBeat 解釋,檢索依靠語意向量比對文字相似度,而相似的用字並不保證相同的意思。「如果一句是 Rome is closer than Paris,另一句是 Paris is closer than Rome,你做 embedding 檢索再加文字搜尋,根本分不出兩者的分別,因為兩句用的字完全一樣。」同一篇報道亦指出,RAG 管道經過精細調校之後,檢索準確度可以悄悄下跌 40%,而用家不會收到任何警示。

企業挑選檢索系統的準則出現明顯轉變,存取控制與權限管理的重要性升至 24%,與數據匯入的便利程度並列首位,這是這個調查系列首次由管治屬性主導採購決策,而檢索準確度只得 15%。矛盾之處在於系統投入服務之後的評分方式,38% 企業仍然以答案正確與否作為首要成功指標,數字是排第二的安全與存取控制(19%)的兩倍。企業買的是管治,評的卻是準確度,中間的落差正正是失誤累積的位置。

 

「零失誤」記錄其實是警號

目前 32% 企業已經在生產環境運行受管治脈絡層,31% 正在試行或者興建,20% 處於評估階段,14% 表明沒有計劃,在 91 間能夠明確回答有否出事的企業之中,已經建立或者正在建立這一層的企業,重複失誤比率高達 50%,沒有這一層的企業只有 21%。這個落差並非脈絡層製造問題,而是它令問題首次變得可見,因為追查一個錯誤答案是否源自過時的資料表或者走樣的定義,本身就需要一個共用的參照點。企業規模的數據進一步佐證,員工超過 1,000 人的企業重複失誤比率達 55%,101 至 1,000 人的企業只有 30%,但大企業把脈絡層推上生產環境的比例反而較低(24% 對 37%)。乾淨的失誤記錄不代表管治良好,更大機會代表沒有人在查。

Credible Data 創辦人 Kyle Nesbit 形容,「人們捱了 30 年的同一個痛點,就是缺乏受管治的數據分析,AI 出現之後問題完全一樣,只是混亂和痛楚放大了幾個數量級。」

 

脈絡設計直接影響毛利

脈絡設計除了影響準確度,也直接寫進損益表,2026 年 5 月舉行的 Semantic Layer Summit 上,一間 Tier 1 銀行比較同一條查詢的兩種做法,單次成本由 17.93 美元(約港幣 HK$139.9)壓縮至 0.0008 美元(約港幣 HK$0.006)。Walmart Global Tech 工程師 Gaurav Chodwadia 在 Forbes 撰文指出,一個 SaaS 部署在 8 星期內,每名活躍用戶的月度推理成本由 0.4 美元(約港幣 HK$3.1)升至 1.1 美元(約港幣 HK$8.6),源頭是團隊預設把原始 HTML 直接餵入模型。

他形容「選擇原始 HTML 因為它不需要前期功夫,這不是技術決定,而是預設造成的毛利決定」。Anthropic 曾經記錄,單靠改變資料的表達方式,就把一條 agent 工作流由約 150,000 個 token 壓縮至 2,000 個。Datadog 的數據亦顯示,69% 輸入 token 用於系統提示,而只有 28% 的 LLM 呼叫使用 prompt caching,大量重複內容每日重新計費。

 

企業應該怎樣讀這批數據

管理層可以從四個角度重新檢視自己的部署,加大索引或者塞入更多檔案,無法修補一個在兩套系統有兩種意思的定義,檢索本身不是答案。63% 企業已經在興建或者運行受管治脈絡層,真正推上生產環境的只有 32%,預算流動的速度明顯快過基建落實的速度。22% 回報從未出事的企業並非管治最好的一群,而是最少查核的一群。

79% 企業表明會把脈絡層至少部分保留在單一供應商的技術堆疊之外,只有 12% 打算整合到單一供應商的原生方案,反映市場對鎖定效應的戒心。Constellation Research 分析師 Michael Ni 評論 DataHub 的脈絡層策略時說得直接,「誰控制 runtime context,誰就控制企業數據的 AI 決策層」。

 

管治層成為新的競爭門檻

供應商已經全速搶佔這一層,Snowflake 在 2026 年 6 月的 Summit 推出 Horizon Context,配合 Semantic Studio 與 Semantic View Autopilot,讓團隊毋須撰寫 SQL 也能定義共用業務邏輯,同時加入 Agent Identity 驗證與針對 prompt injection 的偵測機制。開放標準方面,Model Context Protocol 在 2026 年 7 月 28 日發布新版規格,繼續推動跨平台的脈絡交換。Gartner 預測超過 40% 的 agentic AI 項目會在 2027 年底之前告吹,主因是成本失控、商業價值不明與風險控制不足,而不是模型不夠聰明;同一機構估算到 2028 年,將有 15% 日常業務決策由 agent 自主完成,33% 企業軟件會內建 agentic AI。

真正的分水嶺不在於企業採用哪一個模型,而在於能否把「公司對數據的共同理解」寫成機器可以讀取、可以審計、可以更新的規則,願意先承受失誤數字上升的企業,實際上正把隱藏的錯誤成本搬到枱面處理;報告一片乾淨的企業,只是把帳單延後。企業在推動 AI 落實之前,值得先問一條問題,就是公司內部對同一個數字,是否真的只有一個答案。

 

來源:VentureBeat

Tags : AI AgentRAG 檢索企業 AI數據管治脈絡層