close
人工智能

Google 推 Gemini 3.8 Live 語音 AI 跑分登頂 企業客服成本最低每小時 US$0.84

Google 推出新一代即時語音模型 Gemini 3.8 Live,以取代  Gemini 3.1 Flash Live。新模型採用 Speech-to-Speech 架構,可直接處理及生成語音,並在對話持續進行期間於背景執行工具及 API 調用,進一步把即時語音 AI 由單純問答推向可實際執行任務的 Voice Agent。

Gemini 3.8 Live 分為標準版,以及支援調節推理強度的 Gemini 3.8 Live Extended Thinking。第三方 AI 模型評測機構 Artificial Analysis 測試顯示,Extended Thinking 在 High reasoning effort 設定下,於其 Speech to Speech Index 取得 82.6 分,排名第一;其 Tau Voice 語音 Agent 測試亦錄得 68.6%,同樣排名第一

2026091652247

評測分數與版本定位

不過多項測試亦顯示,Extended Thinking 並非在所有語音場景都較標準版優勝。標準版 Gemini 3.8 Live 在真人語音偏好、任務完成率、延遲及成本方面反而更具優勢,顯示企業未來部署 Voice AI,可能需要按工作複雜程度分配不同推理層級,而非所有請求都使用最高推理設定。

Artificial Analysis 的 Speech to Speech Index 綜合 Speech Reasoning、Agentic Performance、真人偏好及任務成功率等指標。Gemini 3.8 Live Extended Thinking(High)取得 82.6 分,排名第一,高於 GPT-Live-1(Astra,medium)的 81.5、Grok Voice Think Fast 2.0 High 的 81.3,以及 GPT-Live-1(Sol,low)的 80.1。標準版 Gemini 3.8 Live 則取得 76.0 分,排名第五。相比上一代 Gemini 3.1 Flash Live High 的 71.5 分,Extended Thinking 提升 11.1 分,標準版亦增加 4.5 分。然而,綜合分數只能反映整體能力,不同測試進一步顯示,兩個版本實際上有相當不同的定位。

Artificial Analysis 的 Speech Agent Arena 並非傳統選擇題式 benchmark,而是讓真人與不同模型進行即時語音對話,在不知道模型身份的情況下,再選出自己較偏好的模型。結果顯示,標準版 Gemini 3.8 Live 取得 Elo 1083,排名第二,僅次於上一代 Gemini 3.1 Flash Live 的 1096,並高於 GPT-Live-1(Sol,low)的 1053。在 Task Success Rate 方面,標準版 Gemini 3.8 Live 完成 93.2% 任務,同樣排名第二,僅次於 Grok Voice Think Fast 2.0 High 的 94.6%。相反,Gemini 3.8 Live Extended Thinking(High)的 Elo 只有 990,Task Success Rate 為 89.1%。這組結果反映,增加推理深度不一定會令真人即時對話體驗同步改善。對需要快速來回、自然互動及高頻處理的客服或查詢場景而言,標準版反而可能更適合。

當測試轉向需要模型進行推理、工具操作及多步任務的 Agentic 工作時,結果則完全不同。Artificial Analysis 的 Tau Voice benchmark 專門評估語音 Agent 執行任務的能力。Gemini 3.8 Live Extended Thinking(High)取得 68.6%,排名第一,高於 GPT-Live-1(Astra,medium)的 67.9%、GPT-Live-1(Sol,low)的 59.3%,以及 Grok Voice Think Fast 2.0 High 的 56.5%。上一代 Gemini 3.1 Flash Live High 在同一測試只有 37.7%,而標準版 Gemini 3.8 Live 只有 30.1%。這顯示 Extended Thinking 最大價值並非令一般語音對話變得更自然,而是明顯提升需要理解複雜指令、持續推理、調用工具及完成多步工作的 Voice Agent 能力。對企業而言,這亦代表同一個語音 AI 平台內,可能需要同時存在兩種執行模式:簡單查詢由標準版處理,真正涉及後台系統及工作流程的任務,再交由 Extended Thinking 處理。

在 Big Bench Audio 語音推理測試中,Gemini 3.8 Live Extended Thinking(High)取得 97.7%,略高於 Grok Voice Think Fast 2.0 High 的 97.2%,但低於 Qwen Audio 3.0 Realtime Plus 的 99.2%。標準版 Gemini 3.8 Live 則取得 91.7%。這再次反映 Extended Thinking 的主要優勢集中於需要更深入理解及推理的語音任務,而非所有即時互動指標都全面領先。

延遲與成本考量

延遲是 Voice Agent 能否真正投入客服、銷售支援及前線工作的另一關鍵。Artificial Analysis 在 Big Bench Audio 測試中錄得,Gemini 3.8 Live 平均 Time to First Audio 為 1.18 秒,Extended Thinking(High)則為 1.35 秒,均明顯低於上一代 Gemini 3.1 Flash Live High 的 2.99 秒。標準版 1.18 秒亦略快於 GPT-Realtime-2.1 High 的 1.21 秒、GPT-Live-1(Sol,low)的 1.24 秒,以及 GPT-Live-1(Astra,medium)的 1.34 秒。在 Artificial Analysis Speech to Speech Index 排名前五的模型之中,只有 Grok Voice Think Fast 2.0 High 能將首次語音回應時間壓低至 1 秒以下,錄得 0.70 秒。對即時語音應用而言,這類差距十分重要。即使模型本身能力足夠,如果每輪對話都需要等待數秒,真人交談的自然感便會明顯下降。

成本可能是 Gemini 3.8 Live 對企業部署最直接的另一變化。按 Artificial Analysis 計算,Gemini 3.8 Live 的輸入語音成本約為每小時 0.84 美元(約港幣 HK$6.55),是其 Speech to Speech Index 所涵蓋模型中最低,亦約為上一代 Gemini 3.1 Flash Live High 每小時 1.75 美元(約港幣 HK$13.65)的一半。Gemini 3.8 Live Extended Thinking(High)則為每小時 3.50 美元(約港幣 HK$27.3)。雖然較標準版高出約 4 倍,但仍低於 GPT-Live-1(Sol,low)的 4.47 美元(約港幣 HK$34.87)、Grok Voice Think Fast 2.0 High 的 4.80 美元(約港幣 HK$37.44),以及 GPT-Live-1(Astra,medium)的 5.83 美元(約港幣 HK$45.47)。Artificial Analysis 指出,Extended Thinking(High)的成本亦約為 GPT-Realtime-2.1 High 每小時 10.75 美元(約港幣 HK$83.85)的三分之一。對需要處理大量電話客服或語音查詢的企業而言,每小時成本差距在大規模部署後會被迅速放大,因此所有請求都使用最高推理模式未必是最具成本效益的架構。

語音分析與任務成功率圖表,展示不同平台的性能. 多款AI語音模型性能比較,顯示準確率和反應速度. 多款語音辨識軟件的準確率比較圖表. 音頻時間分析圖,顯示不同語音片段的持續時間和分佈. Gemini 3.8 語音 AI跑分圖表,顯示多個AI模型性能比較.

企業 Voice AI 開始由單一模型走向分層調度

Gemini 3.8 Live 的測試結果帶出一個更值得企業留意的變化:Voice AI 的競爭已不再只是比較「說話是否像真人」,而是開始同時衡量對話體驗、推理深度、Agentic 任務成功率、延遲及每小時成本。

標準版 Gemini 3.8 Live 在真人偏好、任務成功率、延遲及成本方面表現較突出;Extended Thinking 則在 Agentic Performance 及複雜語音推理測試中取得較高分數。這種差異意味企業未來部署 Voice Agent 時,未必需要選擇單一「最強模型」,而是可以按照任務複雜程度進行分層調度。

一般 FAQ、身份確認、簡單查詢及大量高頻對話,可交由低延遲、低成本的標準版處理;當系統判斷任務涉及多步推理、工具調用、API 操作或跨系統流程時,再交由 Extended Thinking 處理。真正影響企業採用的問題,因此已由「哪個語音模型跑分最高」,逐步變成「如何在不同工作之間分配推理能力」,並在用戶體驗、任務成功率與營運成本之間取得平衡。

Tags : Artificial AnalysisGemini 3.8 LivegoogleVoice Agent語音 AI