Gemini 3.8 & 3.8 Live Extended Thinking

Gemini 3.8 & 3.8 Live Extended Thinking

Google DeepMind · 音声・言語 · チャットボット

Gemini 3.8 Live と Gemini 3.8 Live Extended Thinking は、Google DeepMind のリアルタイム音声AIモデル2種で、どちらも2026年9月15日に公開された。標準の 3.8 Live は高速で低コストな音声インターフェース向けに調整した speech-to-speech モデルで、3.8 Live Extended Thinking はバックグラウンドの多段階推論を追加し、難しい問題を処理しながら話し続けられる。開発者は Gemini API、Google AI Studio、Gemini Live API から両方に到達できる。追加設定は不要。一般ユーザーはすでに Gemini Live と Search Live の中で両者に触れており、Google によれば両モデルは Gemini アプリと Google Workspace でも展開が始まっている。

Gemini 3.8 & 3.8 Live Extended Thinking の画面プレビュー

Gemini 3.8 & 3.8 Live Extended Thinking について

Gemini 3.8 と 3.8 Live Extended Thinking とは

Google によれば、同社がこれまでで最も先進的なリアルタイム対話モデルである。両方ともネイティブに speech-to-speech で動く。つまり音声を聞き、音声で答える。あなたの発話を別の文字起こしモデル、次にテキストモデル、次に音声生成器へと通す旧来の流れは使わない。その古い経路こそ、遅延とトーンの欠落の大きな原因だった。

両者の違いは難しい質問への対処法に集約され、その一つの設計判断がどちらを土台にすべきかを決める。Gemini 3.8 Live は素早く答え、バックグラウンドでツールを呼び出す。顧客サポートの振り分け、音声検索、語学練習に向く。Gemini 3.8 Live Extended Thinking は話しながら「思考」プロセスを走らせ続けるので、旅行の計画やコードのデバッグといった多段階タスクの進捗を、黙り込まずに語れる。

主な制約は実務的である。Extended Thinking はノンブロッキングの非同期ツール呼び出ししか対応しない。また、セッションを終える前に明示的なアイドル信号を待つ必要がある。そして最も高い思考レベルは音声1分あたりのコストが増える。課金はトークンではなく音声の分単位なので、常時稼働の音声アプリは事前に予算を計算しておく必要がある。

はじめかた

  1. Google AI Studio か Gemini API のコンソールを開き、gemini-3.8-live または gemini-3.8-live-extended-thinking を選ぶ。
  2. リアルタイム音声アプリなら、単一リクエストではなく状態を持つ WebSocket 経由で Gemini Live API に接続する。
  3. 入力音声は16ビット PCM・16 kHz・little-endian で送り、出力音声は16ビット PCM・24 kHz を想定する。
  4. Extended Thinking を使う場合は思考レベル(low、medium、high)を設定し、ノンブロッキングのツール呼び出しだけを使う。
  5. モデルからアイドル状態が返ってきたのを確認してからセッションを終える。

AIツール情報

Gemini 3.8 & 3.8 Live Extended Thinkingの料金、対応プラットフォーム、性能を簡単に確認できます。

無料プランはい
有料プラン$0.005 - $0.018/min audio
プラットフォームGemini API, Google AI Studio, Gemini Live API, Gemini Live, Search Live, Google Workspace
開発元Google DeepMind
カテゴリ音声・言語 · チャットボット
リリース日Sep 2026
最終更新Sep 2026
サイト訪問数8.8M
サイト世界ランキング8.7K
API提供状況はい

こんな人におすすめ

このツールが最も力を発揮するユーザー、タスク、シーン。

ユーザー

  • 音声エージェントを作る開発者:Gemini Live API が低遅延の speech-to-speech 接続を提供する。WebSocket の状態管理は自分で行う。
  • カスタマーサポートチーム:3.8 Live は大量の通話振り分けを低い分単価でさばく。実際の導入では通常、先に電話事業者を経由する。
  • Gemini アプリの一般ユーザー:Extended Thinking は Gemini Live に入った。コードを書かずに「話しながら考える」挙動を試せる。

タスク

  • リアルタイムのトラブル対応:Extended Thinking はバックグラウンドで作業を続けながら、多段階の修正手順を声に出してたどれる。
  • ライブの語学練習:3.8 Live は対応する97言語を会話の途中で検出して切り替える。学習者が2つの言語を行き来するときに役立つ。
  • 予約とスケジューリング:モデルは要求を声で確認し、その後チャットを止めずにバックグラウンドの呼び出しを終える。

シーン

  • 運転中や料理中にハンズフリーのアシスタントを使う場面。答えを黙って待つのは壊れているように感じる。
  • ホワイトボードのスケッチを見ながら誰かを指導する場面。3.8 Live は視覚入力をほぼリアルタイムで読む。
  • 在庫、次に価格、次に配送時間を確認するなど、1回の音声セッションで複数の非同期関数を連携させる場面。

主な機能

音声対音声の会話

両モデルは旧来の「文字起こししてから生成する」流れを飛ばす。音声が入る。音声が返る。得られるのは、失われるトーンの手がかりの減少と、話した内容と返ってくる内容の間の遅れの縮小である。音声アプリにとって、そのずれが体験のすべてだ。

黙らずに声に出して考える

Extended Thinking は推論を発話と並行して走らせる。難しい質問で無音になる代わりに、「確認します」のような短い口頭のつなぎで始め、作業しながら進捗を語る。Google のデモにはライブのチェス指南や、ホワイトボードのスケッチと音声フィードバックを動く React コンポーネントに変える例がある。

バックグラウンドのツール呼び出しと API 呼び出し

モデルがウェブ検索をしたりツールを呼んだりしている間も話し続けられる。Extended Thinking ではノンブロッキングの非同期ツールだけに対応する。この最後の点が重要だ。ブロッキング呼び出しは、モデルが守ろうとしているその流れを止めてしまう。

1回の呼び出しで97言語を切り替え

Gemini 3.8 Live は対応する97言語を検出し、セッションを再起動せずに切り替える。多言語の家庭や、混在した言語の通話をさばくサポート窓口が最も恩恵を受ける。誰も事前に言語を選ぶ必要はない。

ほぼリアルタイムの視覚入力

標準モデルは入ってくる画像や動画フレームを理解する。おおよそ毎秒1フレームだ。これにより、カメラが見ているものに言及できる。

SynthID の音声ウォーターマーク

これらのモデルが生成する音声クリップには、目に見えない SynthID ウォーターマークが必ず入る。無効にする切り替えはない。聞こえ方は変わらないが、プラットフォーム側が AI 生成の音声を識別する手立てになる。

メリットとデメリット

メリット

  • speech-to-speech 設計が、旧来の音声アシスタントを機械的に感じさせていた遅延を削る。
  • Extended Thinking は処理中も会話を生かし続けるので、複雑な要求でも無音の沈黙を招かない。
  • 音声1分あたりの料金は入力 $0.005、出力 $0.018 で、大量利用のアプリでも見通しが立つ。
  • 97言語のネイティブ切り替えは、追加設定なしで多言語製品に合う。
  • 目に見えない SynthID ウォーターマークが最初から入っており、生成音声を公開する人に適する。

デメリット

  • Extended Thinking はノンブロッキングの非同期ツール呼び出ししか許さないので、同期ツールでは別のアーキテクチャを強いられる。
  • セッションを終えるには明示的なアイドル状態を待つ必要があり、コードが追うべき状態が1つ増える。
  • 常時稼働のアシスタントでは音声の分課金が急速に膨らみうる。定額の上限がないためだ。
  • 最も強い思考レベルは分単価を押し上げるので、最も深い推論は無料ではない。

よくある質問

Gemini 3.8 Live は高速で低コストなリアルタイム対話向けに調整され、3.8 Live Extended Thinking はバックグラウンドの多段階推論を追加し、話しながら同時に考えることができる。両者は同じ speech-to-speech の土台を共有するので、遅延か深さで選ぶ。

関連コンテンツ

Gemini 3.8 & 3.8 Live Extended Thinkingに関連するツール、スキル、記事を探す。

Gemini 3.8 & 3.8 Live Extended Thinkingの代替ツール

Prosp

Prosp

Prosp · ライティング · 音声・言語 · マーケティング

Prospは、代理店や営業チーム向けに作られたAI LinkedInアプローチツールだ。見込み客ごとに自分の声でメッセージとボイスメッセージを書き、相手が本当に返信するように仕向ける。アカウントをつなぎ、リードを見つけ、AIにパーソナライズされたメッセージを大量に下書きさせて送信させる。すべて1つの受信トレイから行える。大量のアウトバウンドを回す人向けにできている。それがこの製品の売り込みのすべてだ。それでも各接点は人間らしく感じられなければならない。

有料 / $30.99 - $79.99 per account/mo詳細を見る
Wordly AI Translation

Wordly AI Translation

Wordly · 音声・言語 · 生産性向上

Wordly AI Translationは、会議・カンファレンス・イベント向けに作られたリアルタイムAI翻訳・字幕プラットフォームだ。60以上の言語でライブ翻訳、字幕、文字起こし、要約を提供し、参加者は専用ヘッドセットを使わず、QRコードを読み取るかリンクを開くだけで参加できる。Zoom、Microsoft Teams、Google Meet、Webexと連携し、セッションごとに人間の通訳を雇わずに多言語対応したい組織に向く。それだけのことだ。

有料 / $0 - $150/mo詳細を見る
Musicful

Musicful

Musicful AI · 音声・言語 · 動画

Musicfulは、テキストを数分で音楽に変えるAI音楽ジェネレーター兼AIミュージックビデオ作成ツール。テキストの指示、歌詞、あるいは口ずさんだメロディーを渡すと、ボーカルと楽器が入った完成したトラックを返す。AI楽曲ジェネレーターとしても機能し、自分が作った曲からミュージックビデオを生成し、AIカバーツールと開発者向けAPIも備える。ウェブブラウザとAndroidアプリで動くので、パソコンで曲を始めてスマホで続きを進められる。

無料 / $0 - $20/mo詳細を見る