Gemini 3.8 & 3.8 Live Extended Thinking
Google DeepMind · 語音與語言 · 聊天機器人
Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking 是 Google DeepMind 的兩款即時語音 AI 模型,都在 2026 年 9 月 15 日推出。標準版 3.8 Live 是一款語音對語音模型,針對快速、低成本的語音介面調校;3.8 Live Extended Thinking 則加入背景多步驟推理,讓它在處理難題時還能繼續說話。開發者可以透過 Gemini API、Google AI Studio 和 Gemini Live API 取用兩者。無需額外設定。一般使用者已經在 Gemini Live 和 Search Live 裡遇到它們,Google 也表示兩款模型已開始在 Gemini 應用程式與 Google Workspace 中推出。

關於 Gemini 3.8 & 3.8 Live Extended Thinking
什麼是 Gemini 3.8 與 3.8 Live Extended Thinking
根據 Google 的說法,這是該公司至今最先進的即時對話模型。兩者都原生支援語音對語音,意思是它們直接聽取音訊並以音訊回覆,而不是把你的話先送進獨立的轉錄模型、再送進文字模型、再送進語音產生器。那條舊流程正是大量延遲與語氣流失的來源。
兩者的差異在於如何處理棘手問題,而這一個設計選擇就決定了你該以哪一款為基礎打造產品。Gemini 3.8 Live 回應快速並在背景呼叫工具,適合客服分流、語音搜尋與語言練習。Gemini 3.8 Live Extended Thinking 則在說話的同時維持一個「思考」流程,因此能在多步驟任務(例如規劃行程或除錯程式碼)中一邊說明進度、一邊不陷入沉默。
主要限制很實際。Extended Thinking 只支援非阻塞式的非同步工具呼叫。另外,結束工作階段前必須等收到明確的閒置訊號。而且最高的思考等級每分鐘音訊成本更高。計價是按音訊分鐘數、不是按 token,因此長時間常駐的語音應用需要事先算好預算。
開始使用
- 開啟 Google AI Studio 或 Gemini API 主控台,選擇
gemini-3.8-live或gemini-3.8-live-extended-thinking。 - 即時語音應用請透過狀態化的 WebSocket 連接 Gemini Live API,而不是單次請求。
- 以 16 位元 PCM、16 kHz、little-endian 送出輸入音訊,並預期輸出音訊為 16 位元 PCM、24 kHz。
- 如果使用 Extended Thinking,請設定思考等級(low、medium 或 high),並只使用非阻塞式工具呼叫。
- 只有在看到模型回報閒置狀態後,才結束工作階段。
產品資訊
快速了解 Gemini 3.8 & 3.8 Live Extended Thinking 的定價、支援平台與效能。
適合對象
這項工具最適合的使用者、任務與情境。
使用者
- 打造語音代理的開發者:Gemini Live API 提供低延遲的語音對語音連線。WebSocket 狀態要你自己管理。
- 客服團隊:3.8 Live 以低廉的每分鐘成本處理大量通話分流。實際部署通常會先經過電信服務商。
- Gemini 應用程式的一般使用者:Extended Thinking 已納入 Gemini Live。不用寫任何程式碼,就能試試「邊說邊想」的行為。
任務
- 即時疑難排解:Extended Thinking 可以一邊在背景持續處理,一邊口頭帶你走過多步驟的修復流程。
- 即時語言練習:3.8 Live 能在對話中途偵測並切換 97 種支援語言,當學習者在兩種語言之間游移時特別有用。
- 訂位與排程:模型會口頭確認請求,接著在背景完成呼叫,而不會凍結聊天。
情境
- 在開車或煮飯時使用免持助理,此時靜默等待回答會讓人覺得整個體驗壞掉了。
- 陪著某人看白板草圖做指導,因為 3.8 Live 幾乎即時讀取視覺輸入。
- 在單一語音工作階段中協調多個非同步函式,例如先查庫存、再查價格、最後查到貨時間。
主要功能
語音對語音對話
兩款模型都略過了舊有的先轉錄再生成流程。音訊進去。音訊回來。好處是語氣線索流失更少,你說的話與回覆之間的延遲也更短。對一款語音應用來說,那段落差就是全部的體驗。
邊想邊說,不會陷入沉默
Extended Thinking 讓推理與說話並行。面對難題時,它不會留下一片死寂,而是先用一句簡短的墊話開場,例如「讓我查一下」,接著一邊處理一邊說明進度。Google 的示範包括即時西洋棋指導,以及把白板草圖加上口頭回饋轉成可運作的 React 元件。
背景工具與 API 呼叫
模型執行網路搜尋或呼叫工具時,你可以繼續說話。在 Extended Thinking 中,只支援非阻塞式的非同步工具。最後這點很重要。阻塞式呼叫會讓模型正想保護的那段流程整個卡住。
單次呼叫切換 97 種語言
Gemini 3.8 Live 能偵測並切換 97 種支援語言,你不需要重啟工作階段。多語言家庭以及要接多語混合來電的客服台最能受益,而且沒有人需要事先選定語言。
近乎即時的視覺輸入
標準模型能理解陸續進來的影像與視訊畫格,大約每秒一個畫格。這讓它能對鏡頭所見做出回應。
SynthID 音訊浮水印
這些模型產生的每一段音訊都帶有看不見的 SynthID 浮水印。沒有開關可以關掉。它不會改變你聽到的內容,但讓平台有辦法標記 AI 生成的語音。
優缺點
優點
- 語音對語音設計減少了讓舊款語音助理聽起來很機械的延遲。
- Extended Thinking 在處理的同時讓對話保持活絡,因此複雜請求不會觸發靜默的死寂。
- 每分鐘音訊計價,輸入 $0.005、輸出 $0.018,對高流量應用維持可預測。
- 原生切換 97 種語言,無需額外設定就能迎合多語言產品。
- 看不見的 SynthID 浮水印內建其中,適合任何公開發布生成音訊的人。
缺點
- Extended Thinking 只允許非阻塞式非同步工具呼叫,因此同步工具會逼你改用另一種架構。
- 你必須等明確的閒置狀態才能結束工作階段,這多了一個程式碼得追蹤的狀態。
- 對常駐助理而言,按音訊分鐘計費可能快速攀升,因為沒有固定上限。
- 最強的思考等級會拉高每分鐘成本,所以最深的推理並不免費。
常見問題
Gemini 3.8 Live 針對快速、低成本的即時對話調校,而 3.8 Live Extended Thinking 加入背景多步驟推理,能同時說話與思考。兩者共用同一套語音對語音基礎,因此可依延遲或深度來選擇。
相關內容
探索與 Gemini 3.8 & 3.8 Live Extended Thinking 相關的工具、技能與文章。
Gemini 3.8 & 3.8 Live Extended Thinking 替代方案
Prosp
Prosp · 寫作 · 語音與語言 · 行銷Prosp 是一款 AI LinkedIn 開發信工具,專為代理商與業務團隊打造,會針對每位潛在客戶以你自己的聲音撰寫訊息與語音訊息,讓他們真的回覆。你連接帳號、尋找潛在客戶,讓 AI 大規模草擬並發送個人化訊息,全部在一個收件匣完成。它是為大量進行陌生開發的人設計的。這就是它全部的賣點。每一個接觸點仍然必須感覺像真人。
Wordly AI Translation
Wordly · 語音與語言 · 生產力Wordly AI Translation 是一套為會議、研討會與活動打造的即時 AI 翻譯與字幕平台。它提供 60 多種語言的即時翻譯、字幕、逐字稿與摘要,與會者只要掃描 QR Code 或開啟連結就能加入,不必配戴專用耳機。平台可搭配 Zoom、Microsoft Teams、Google Meet 與 Webex 運作,專為想在每場活動提供多語言服務、又不想每場都請真人口譯的組織而設計。就是這麼單純。
Musicful
Musicful AI · 語音與語言 · 影片Musicful 是一款 AI 音樂生成器與 AI 音樂影片製作工具,能在幾分鐘內把文字變成音樂。給它一段文字提示、一組歌詞或一段哼唱的旋律,它就會回傳一首帶人聲與樂器的完成曲目。它同時也是 AI 歌曲生成器,能用你創作的歌曲產出音樂影片,並提供 AI 翻唱工具與開發者 API。平台可在網頁瀏覽器與 Android App 上執行,所以你能在桌機開始一首歌,再用手機接著做。
