
Nvidia 高調介入開放權重政策爭議之後,最近終於推出全新開源模型 Nemotron 3.5 Lightning,這個 300 億參數的混合專家 (MoE) 架構每次只啟動 30 億參數,一張顯示卡或一部配備 RTX 的個人電腦已經足夠推動,企業可以免費下載、修改並投入商業用途,毋須取得 Nvidia 許可,也毋須付費。
Nvidia 同日開源模型路由工具 NeMo Switchyard,讓開發者按品質、延遲與成本,把代理工作流程的每一步分派給最合適的模型。這套「開源模型加智能路由」的組合,把企業部署 AI 代理的成本控制問題正面拆開,也令黃仁勳「免費 AI 對晶片有利」的判斷,由公開表態推進到具體產品。
一封公開信改寫了華府的政策走向
黃仁勳在 7 月 24 日公開一封題為《Open Weights and American AI Leadership》的 3 頁信件,最初有 25 家公司與機構聯署,1 日之內簽署方倍增至 50 家,OpenAI 和 Google 先後加入,Amazon 與 Anthropic 則沒有署名,信件要求華府避免對可下載模型設下過早限制,也要求政策制訂者停止把蒸餾 (distillation) 等同盜竊行為。
推動這場爭論的導火線來自中國公司月之暗面 (Moonshot AI),這家公司在 7 月 16 日發布 Kimi K3,並在 7 月 27 日釋出權重,2.8 兆參數、每個 token 啟動 1,040 億參數、100 萬 token 上下文視窗的規格,令它成為目前規模最大的開放權重模型,在 Arena 的前端程式碼評測中更以 1,679 分排名首位。華府部分官員擔心中國模型帶來國家安全風險,質疑對方透過蒸餾取用美國模型的成果,一度考慮全面封鎖。
聯署行動最終改變了政策方向,白宮在 8 月初敲定的 AI 安全審查框架,只要求具備尖端網絡攻防能力的美國閉源模型自願接受 30 天政府審查,美國的開放權重模型獲全面豁免,中國的開放權重模型同樣不納入測試範圍。Meta 行政總裁 Mark Zuckerberg 在 8 月 10 日發表約 6,500 字的長文,警告 AI 控制權過度集中的風險,並同步釋出可在個人電腦運行的 Muse Glimmer 與能力更強的 Muse Spark 1.2,把矽谷的開源陣營推得更闊。
模型專攻代理的高頻執行工作
長時間運行的 AI 代理,大部分時間花在工具調用、結果驗證與子代理分派這類高頻動作,每一步都交給前沿推理模型處理,成本與延遲都會失控,Nvidia 把 Nemotron 3.5 Lightning 定位在這個「執行層」,由 Nemotron 3 Ultra 一類大模型負責規劃與編排,Lightning 負責跑量。混合專家架構的路由機制,每個 token 只調動少數專家,令模型以小模型的運算成本,交付接近大模型的容量。
技術層面上,Nvidia 在預訓練階段直接把多 token 預測 (MTP) 寫進模型,並附上 DFlash 與 DSpark 2 個草稿模型應付不同並發場景,同時提供 NVFP4 與 BF16 2 種權重檔案,官方數據顯示,模型輸出速度最高達到同級模型的 4 倍,代理任務完成時間快 30%;在 PinchBench 測試中,模型取得 86% 準確率,完成 10,000 項任務比準確率相近的 Qwen3.6 35B 快 30%。開發者可以在 NVIDIA Jetson、GeForce RTX 5090、DGX Spark 以至資料中心部署同一個檔案,並透過 LM Studio、llama.cpp、Ollama 與 Unsloth 等常用工具運行。
Nvidia 這次以 OpenMDW-1.1 授權,把權重、訓練資料與訓練配方一併公開,同場釋出用於訓練程式碼代理能力的強化學習資料集 Nemotron-RL-Agentic-Terminal-Pivot,模型現已上架 Hugging Face、ModelScope、OpenRouter 及 build.nvidia.com。
企業的實際着力點在於路由與微調
對企業而言,這次發布的價值並不止於多一個免費模型,而在於路由層帶來的可量化節省,NeMo Switchyard 讓開發者毋須改寫應用程式,就可以按自訂算法把請求分派到不同模型。Nvidia 內部測試顯示,路由方案在維持前沿級準確度的同時,把任務完成成本壓至單獨使用 Opus 4.8 的約 3 分之 1。合作夥伴的實測數字同樣具體:LangChain 在 145 項多輪 Deep Agents 任務中,只把 7% 請求送往前沿模型,成本下降 74%,準確度代價為 6%;Ramp 在自家 SWE-Bench 測試中削減 58% 成本與 33% 執行時間;Cognition 把路由器整合到 Devin Desktop,平均成本下降 28%;Boomi 把 59% 流量導向速度快 5 倍的微調模型,後段延遲改善 21%。
另一個着力點是微調,小模型的微調速度更快、成本更低,對硬件要求亦低得多,企業可以用 NeMo Automodel 進行 LoRA 或全參數微調,把自家領域資料、工具與工作流程訓練進模型。CrowdStrike 把模型用於網絡安全,Harvey 配合 Trajectory 應用於法律服務,CodeRabbit 與 Baseten 合作處理程式碼審查,Fastino Labs 則針對軟件開發、金融與醫療工作負載作出調校。對於受監管行業,模型可以完全在本地或私有環境運行,資料主權與私隱合規的處理難度隨之下降。
市場數據亦支持這個方向,開放權重模型在 OpenRouter 的推理 token 佔比,已由 2024 年底的極低水平升至 2026 年中的一半以上;在 Vercel 的生產環境閘道,開放權重模型 2026 年 6 月處理 29% token,但只佔不足 4% 開支。企業要留意的落差在於,Menlo Ventures 的調查顯示開源模型在企業實際使用中的比例由 2024 年的 19% 回落至 2025 年的 11%,反映採用門檻仍然集中在部署、維運與評估能力,而非模型本身的質素。
硬件商推開源的商業算式
Nvidia 推動開源的動機相當直接,開放權重模型無論免費與否,都需要 GPU 才能運行,價格下降會刺激用量上升,總體運算需求隨之擴大。黃仁勳上月接受 Axios 訪問時直言,免費 AI 對硬件有利,對晶片有利。當閉源模型的 API 定價壓縮企業預算,開源模型把開支由訂閱費轉移到自建或租用算力,Nvidia 正好站在收益端。
未來 12 至 24 個月,企業 AI 架構的重心會由「選一個最強的模型」轉向「編排一組模型」,前沿模型負責規劃與難題,中小型開源模型承擔 9 成以上的例行調用,路由層成為新的競爭焦點,Kong、LiteLLM、LangChain 等基礎設施供應商已經接入 Switchyard,反映這一層正在標準化。同一時間,中美開放權重模型的競爭會持續推低邊際成本,而美國政策既然選擇豁免開源模型,短期內出現全面封鎖的機會不高。
企業現階段值得做的,是先量度自家代理工作流程中各類請求的分布,找出可以下放到小模型的高頻任務,再以路由與微調逐步替換,這個過程的難度不在模型,而在評估體系與運維能力。誰先建立起可靠的評估與路由機制,誰就能在下一輪 AI 成本競賽中取得結構性優勢。
來源:CNBC




