Gemini Live 加入深度推理,邊想邊答
Google Blog · 2026-09-15
Google 的 Live API 一直只朝一個方向優化:把語音對話的延遲壓到最低,讓模型「秒回」。新推出的 Gemini 3.8 Live Extended Thinking 打破了這個單一目標,讓模型在對話進行中同時啟動多步推理迴圈,用「先開口、邊想邊答」取代「想完才答」。Google 於 2026 年 9 月 15 日發布 Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking 兩個版本,皆以 Gemini 3 Pro 為底層模型。
背景
Live API 走的是串流語音對話架構:麥克風輸入即時送進模型,模型幾乎同步吐出語音回應,中間沒有給推理留緩衝時間。這種設計對閒聊、簡單問答夠用,但遇到需要拆解步驟、查核事實、跨輪推算的任務——例如客服要先核對帳戶資料才能回答——模型只能用同一套淺層生成邏輯硬答,容易答錯或答得空泛。過去 Live API 沒有提供「先想清楚再回答」的模式可選。
核心改動
官方部落格描述 Extended Thinking 的機制是「reasons and speaks simultaneously」:模型在背景跑推理的同時,先用口語銜接詞(原文舉例「Let me check that...」)撐住對話節奏,而不是整段沉默等推理跑完。這讓語音互動在維持即時感的前提下,換得更長的思考深度。
不過官方公告、Live API 文件與 Gemini 3.8 Audio model card 三份原始資料都沒有揭露開發者要怎麼在 API 呼叫裡切換 Extended Thinking 的具體參數名稱、思考 token 預算,也沒有給出這個模式比一般 Live 模式多花多少延遲的數字——這些細節目前皆未公布。
規格細節
Model card 列出的規格:輸入情境窗上限 128K token,輸出上限 64K token,知識截止日為 2025 年 1 月。Live API 文件則載明串流格式:輸入為 16-bit PCM、16kHz、little-endian 原始音訊,可搭配 JPEG 影像(≤1FPS)與文字;輸出為 16-bit PCM、24kHz、little-endian 音訊,連線方式是長駐 WebSocket(WSS)。官方公告另指出 Gemini 3.8 Live 可在對話中即時偵測並切換 97 種語言。
| 指標 | 數值 | 對應版本 |
|---|---|---|
| Artificial Analysis Speech to Speech Quality Index | 82.6 | 3.8 Live Extended Thinking |
| τ-Voice agentic task completion | 68.6% | 3.8 Live Extended Thinking |
| Sierra τ-Voice-banking | 35.1% | 3.8 Live Extended Thinking |
| Big Bench Audio reasoning | 97.7% | 3.8 Live Extended Thinking |
| Speech Agent Arena 排名 | 第 2 名 | 3.8 Live |
影響範圍
對正在用 Gemini API/AI Studio 開發語音或多模態應用的工程師,現在要在兩顆模型之間做成本延遲取捨:Gemini 3.8 Live 主打低成本、高流量、低延遲場景;Gemini 3.8 Live Extended Thinking 換來推理深度,但沒有公開的延遲或計價數字可以直接排進 SLA,上線前得自己實測。定價也未公布,預算規劃要等後續資訊。
接取管道也分層:兩個版本都已在 Gemini API 與 Google AI Studio 開放;企業用戶僅能透過 Gemini Enterprise 私測管道申請;消費端則是 Gemini 3.8 Live 進 Search Live 全面開放,Extended Thinking 只給 Google AI Pro/Ultra 訂閱者的 Gemini Live 使用。若團隊原本就把 Live API 用在金融或客服類語音代理上,要留意 Sierra τ-Voice-banking 完成率僅 35.1%,正式導入前仍需要人工複核流程。原本串接輸入音訊格式(16kHz PCM)與影像張數限制(≤1FPS)的既有整合,不受這次更新影響,可維持原設定。