
DeepSeek 於 9 月 10 日正式推出 V4.1 Flash。這款新一代多模態模型以較低記憶體需求、更快推理速度及下調後 API 收費,接替部分 V4 Pro 的服務定位。它真正改變的未必只是模型排行榜,而是企業部署 AI Agent 的單位成本。
官方表示,新模型擁有 5,520 億個總參數,但處理輸入及輸出時,分別只會啟動 80 億及 160 億個參數,藉此減少運算及記憶體開銷。
DeepSeek 於 9 月 10 日中午透過官方 API 同步推出新模型,香港開發者可把模型名稱改為 deepseek-flash 使用。V4.1 Flash 原生支援視覺理解,舊有 V4 Flash 及 V4 Flash Vision Exp 已下線。
DeepSeek 亦預告,由 9 月 14 日 04:00 UTC 起,原本發送至 V4 Pro 的請求將暫時改由 V4.1 Flash 處理,並按 Flash 收費計算。事件核心可歸納為 3 點:模型如何降低 AI Agent 成本、基準測試成績能否轉化為商業能力,以及香港企業採用低價大模型時需要補足哪些治理環節。
用較少啟動參數降低營運門檻
DeepSeek V4.1 Flash 採用 Mixture-of-Experts(MoE,混合專家)設計,以及新的 Causal-Encoder-Decoder 結構。簡單而言,模型雖保留龐大總參數容量,卻不會在每次請求中同時啟動全部參數;系統會按任務需要,選擇部分「專家」網絡運算。
DeepSeek 指,V4.1 Flash 處理輸入時啟動 80 億個參數,輸出時則啟動 160 億個參數,並透過新預訓練方法及大規模強化學習後訓練提升能力。
更重要的是 KV Cache 縮減。KV Cache 是大型語言模型在多輪對話、長篇文本或 Agent 工作流程中保留既有上下文的記憶區,可避免系統重複運算,卻會佔用大量高速記憶體。DeepSeek 表示,V4.1 Flash 相較上一代,HBM 需求降至 1/4,SSD 需求降至 1/8。
IEEE Computer 的研究亦指出,隨著上下文及輸出內容愈來愈長,KV Cache 已成為推理部署在容量及記憶體頻寬上的主要瓶頸。因此,壓縮或分層管理快取,確實可能直接影響長上下文服務的成本及吞吐量。
綜合 DeepSeek 公告、模型卡、香港政府 AI 文件及記憶體研究資料可見,市場焦點已由「模型總參數有多大」,轉向「每次工具呼叫、每輪上下文及每 100 萬個 Token 的實際支出」。對客服自動化、程式開發代理、文件檢索及內容審核等高頻應用而言,快取成本通常比單次問答更具商業意義。
跑分領先不等於企業可直接換模
DeepSeek 技術團隊表示,V4.1 Flash 在多項基準測試中超越 V4 Pro 及部分旗艦競品。公開模型卡顯示,模型在 Terminal-Bench 2.1 的 Pass@1 成績為 90.6、DeepSWE v1.1 為 74.2、CyberGym 為 88.1、AutomationBench 為 54.8。這些測試主要衡量終端操作、軟件工程、安全任務及自動化工作流程能力。
從產品策略角度看,這亦是 DeepSeek 把部分 V4 Pro 流量轉向 Flash 的根據。
不過,基準測試結果應視為供應商公開的性能指標,而非經獨立驗證後得出的採購結論。專研 AI Agent 評測的業界觀察指出,靜態基準測試通常難以完整反映真實企業環境中的權限控制、工具故障、資料品質、長鏈推理穩定性及安全風險。同一模型即使在單次任務取得高分,也不代表能在連續、多步驟流程中維持相同成功率。
另一項 KV Cache 綜述亦提醒,壓縮、淘汰及混合記憶體方案,未有一種方法適合所有工作負載。實際成效仍取決於上下文長度、硬件條件及任務類型。
因此,企業不宜只因「Flash」定位或官方跑分便全面遷移。較務實的做法是先以非敏感資料進行 A/B 測試,比較 V4.1 Flash 與現有模型在中文文件理解、粵語或繁體中文輸出、工具呼叫成功率、平均延遲、人工覆核率及每宗任務成本等方面的表現。
若涉及合約、客戶資料、金融決策或程式部署,企業仍應保留人手覆核,以及可隨時切換的備用模型路徑。換言之,「DeepSeek V4.1 Flash 為何能降低成本」與「它是否適合企業生產環境」,其實是 2 個不同問題。
香港採用 AI 代理要兼顧速度與資料責任
從香港市場角度看,V4.1 Flash 的低成本及多模態能力,可能降低中小企試用 AI Agent 的門檻。香港政府在 2026 至 2027 年度《財政預算案》提到,約 30 宗涉及大語言模型、新材料及生物醫學的研發申請,已獲 30 億港元 AI 資助計劃批准。政府亦提出成立 AI+ 及產業發展策略委員會,推動 AI 產業化。
本地企業加快利用模型處理客服、營銷、文件及內部知識庫時,推理單價下降將進一步提高採用誘因。
香港數字政策辦公室發布的《生成式人工智能技術及應用指引》,則提出另一個不可忽視的專業角度:部署生成式 AI 時,企業不應只評估效能,亦要處理個人資料私隱、知識產權、犯罪預防、可靠性及系統安全 5 類風險。
對公司管理層而言,V4.1 Flash 的意義並非「成本更低便可無限制使用」,而是可把節省下來的推理預算,投放於資料分類、提示詞防護、輸出審核、存取權限及事故應變。
這次更新亦延續大模型競爭由訓練規模轉向推理經濟的趨勢。MoE 架構可透過稀疏啟動提高運算效率,但研究界同時指出,動態挑選專家亦會帶來排程、記憶體管理及負載平衡難題。
DeepSeek 把 V4 Pro 請求轉接至 V4.1 Flash,是一次針對新架構的商業化測試。真正考驗將是模型在高併發、長上下文、繁體中文及跨工具代理任務下,能否持續維持成本優勢而不犧牲穩定度。
成本革命仍待生產環境驗證
DeepSeek V4.1 Flash 把多模態、MoE 稀疏運算及快取壓縮整合至較低價 API,將加劇 AI 服務供應商之間的推理成本競爭。
對香港企業而言,下一步並非盲目追逐最低 Token 價格,而是量化每宗任務的可靠性、合規成本及人手覆核需求。待 V4.1 Pro 推出後,Flash 能否繼續兼顧性能、速度及成本,將決定這次架構轉向能否形成長期優勢。




