Googleは2026年9月15日、リアルタイム音声対話向けの新モデルGemini 3.8 LiveとGemini 3.8 Live Extended Thinkingを発表しました。どちらもGemini Live APIを使った音声エージェント向けのモデルですが、狙いは少し違います。
Gemini 3.8 Liveは、低遅延で自然な会話を続けながらツールやAPIを呼び出す用途が中心です。一方のExtended Thinkingは、複数ステップの判断や長めの処理を裏側で進めながら、会話を止めずに状況を伝えることを重視しています。
SEの実務で注目したいのは、単に「音声が自然になった」ことではありません。これまで音声エージェントでは、外部APIの応答待ちや複雑な推論が入ると無言時間が生まれやすく、ユーザー体験を損ねる原因になっていました。今回のExtended Thinkingでは、処理中も音声で進捗を返しつつ、非同期でツール実行を続ける設計が明確になっています。
本稿では、2026年9月16日時点のGoogle公式情報をもとに、2モデルの違い、料金、対応機能、Live API実装時の変更点、SEやフリーランス開発者が検証するときの注意点を整理します。
Gemini 3.8 Liveで何が変わったのか
Gemini 3.8 Liveは、Googleがリアルタイム音声対話向けに提供するaudio-to-audioモデルです。テキストへ変換してから別モデルで考え、さらに音声合成する従来型の構成ではなく、音声を中心に低遅延な対話を成立させることを重視しています。
Googleの発表では、Gemini 3.8 Liveはリアルタイムの視覚入力を会話へ取り込み、97言語に対応し、会話を続けながらバックグラウンドでツールやAPIを実行できると説明されています。開発者向けにはGemini APIとGoogle AI Studioで提供が始まっています。
モデルIDはgemini-3.8-liveです。入力はテキスト、画像、音声、動画を扱え、出力はテキストと音声に対応します。公式モデルページでは、入力上限131,072トークン、出力上限65,536トークンとされています。
ここで注意したいのは、同じ「Gemini 3.8」でも、既存のGemini 3.8 Flashとは用途が異なることです。3.8 Flashはテキスト中心の長時間タスクやコーディング、エージェント処理に向いたモデルで、Live APIには対応していません。リアルタイム音声対話を作るなら、3.8 Live系を選ぶ必要があります。
Gemini 3.8 Flashについては、既存記事「Gemini 3.8 Flashが正式提供開始|SE実務で注目したい変更点と導入判断」で整理しています。
Gemini 3.8 LiveとExtended Thinkingの違い
2モデルの違いを一言で整理すると、反応速度を優先するなら3.8 Live、複雑な処理を会話の裏側で進めたいならExtended Thinkingです。
| 項目 | Gemini 3.8 Live | Gemini 3.8 Live Extended Thinking |
|---|---|---|
| 主な用途 | 低遅延の音声対話、直接的な指示、短いツール処理 | 複数ステップの推論、複雑な計画、複数ツール連携 |
| モデルID | gemini-3.8-live |
gemini-3.8-live-extended-thinking |
| Thinking | 固定的な内部推論。thinking level指定は不可 | low、medium、highを指定可能 |
| Function Calling | 同期・非同期に対応 | 非同期のNON_BLOCKINGのみ |
| 処理中の会話 | ツール待ちでは応答が止まる場面がある | 処理中も進捗を音声で返せる |
| 向いている例 | 受付、FAQ、簡単な操作補助 | 障害切り分け、予約調整、複数システム照会 |
Extended Thinkingの特徴は、深く考えること自体よりも、考えている間も会話の流れを切らない点にあります。たとえば「在庫を確認して、納期を調べて、条件に合う候補を3つ比較して」と頼まれたとき、裏では複数APIを呼びながら、「在庫を確認しています」「次に配送条件を見ます」といった中間応答を返せます。
音声インターフェースでは、数秒の無音でもユーザーは「止まったのか」「聞き取れていないのか」と不安になります。Extended Thinkingは、この待ち時間を会話設計で吸収するための仕組みと考えると理解しやすいです。
実装で最も重要なのはinteraction_statusの扱い
Extended Thinkingを既存のLive API実装へ組み込む場合、モデル名を書き換えるだけでは不十分です。クライアント側の状態管理を見直す必要があります。
通常のLiveモデルでは、turnComplete: trueを「モデルの発話が終わり、次の入力待ちへ戻った」と扱いやすい構造でした。しかしExtended Thinkingでは、途中経過を音声で返した後も、裏側で推論やツール呼び出しが続くことがあります。
そのためGoogleは、interaction_statusを確認するよう案内しています。IN_PROGRESSなら、発話が一度終わっていても処理は継続中です。IDLEになって初めて、推論やツール呼び出しを含む一連の処理が完了したと判断します。
この変更は、UIや状態遷移に直接影響します。たとえばマイクボタンを再度有効化するタイミング、スピナー表示、ツール結果の待機、ユーザーが途中で割り込んだ場合のキャンセル処理などを、従来のturnCompleteだけで制御すると不整合が起きる可能性があります。
実装時に見直したい状態
- 音声を再生中
- モデルが裏で推論中
- 非同期ツールの結果待ち
- ユーザーの割り込みを受け付ける状態
- 完全に待機中の状態
リアルタイム音声では、モデルの賢さよりも状態管理のバグが使いにくさへ直結します。PoCでも、正常系だけでなく「ツールが遅い」「途中でキャンセル」「連続で話しかける」といったケースを含めて確認する必要があります。
料金は音声入力0.005ドル/分、音声出力0.018ドル/分
2026年9月16日時点のGemini Developer API公式料金ページでは、Gemini 3.8 LiveとGemini 3.8 Live Extended Thinkingは同じStandard料金として掲載されています。
| 項目 | Paid Tier |
|---|---|
| テキスト入力 | $0.75 / 100万トークン |
| 音声入力 | $3.00 / 100万トークン、または約$0.005/分 |
| 画像・動画入力 | $1.00 / 100万トークン、または約$0.002/分 |
| テキスト出力 | $4.50 / 100万トークン |
| 音声出力 | $12.00 / 100万トークン、または約$0.018/分 |
Free Tierも公式料金表では無料とされています。ただし利用上限はプランや時期によって変わる可能性があるため、実装前に最新のレート制限を確認してください。また料金表では、Free Tierは入力データがGoogle製品改善に利用される項目が「Yes」、Paid Tierは「No」とされています。顧客情報や非公開データを扱う業務用途では、単価だけでなくデータ利用条件も確認が必要です。
音声エージェントでは、トークン単価だけを見ても実コストをつかみにくい点にも注意が必要です。会話が長引く、ツール呼び出しを待つ間に中間発話が増える、再確認が多いといった要因で音声出力時間が増えれば、その分コストも増えます。
PoCでは「1分あたりの単価」ではなく、1件の問い合わせや1タスクを完了するまでの総コストで計測する方が実務的です。
SE実務で使いやすいのは「会話しながら処理する」場面
Gemini 3.8 Live系の強みは、単なる音声チャットではなく、会話を入口にして業務システムへ処理をつなげられることです。SE実務で検討しやすいのは、ユーザーと対話しながら情報を集め、裏側でツールやAPIを実行する場面です。
1. ヘルプデスクや障害一次切り分け
利用者から症状を音声で聞き取り、資産管理情報、監視ログ、既知障害、FAQなどを順に照会する構成が考えられます。単純なQ&Aで終わらず、「端末情報を確認します」「現在の障害情報を照合しています」と会話を続けながら処理できる点は、Extended Thinkingと相性があります。
ただし、障害対応でAIが出した原因候補をそのまま確定情報として扱うのは危険です。ログや監視結果など、どのデータを根拠にしたかをUI側で確認できる設計が必要です。
2. 現場作業の音声アシスタント
手がふさがっている作業では、画面操作より音声の方が向いています。機器の型番をカメラで映しながら質問し、手順書や部品情報を参照させるといった使い方です。Gemini 3.8 Liveは視覚入力をほぼリアルタイムに扱えるため、音声だけより文脈を与えやすくなります。
一方で、設備操作や安全に関わる判断はAIだけに任せず、正式な手順書や担当者確認を優先すべきです。
3. 社内申請や予約の対話型フロント
会議室予約、出張申請、アカウント発行、定型的な社内依頼などは、聞き取りとAPI実行を組み合わせやすい領域です。「来週火曜の午後で4人、オンライン会議設備あり」と話せば、条件を整理し、空き状況を取得し、候補を返す流れを作れます。
この種の処理では、入力内容の復唱や最終確認を必ず入れ、AIが勝手に予約や申請を確定しない設計にした方が安全です。
4. フリーランスSEの作業補助
個人で案件対応している場合、作業メモの整理、仕様確認、調査中の問いかけなどを音声化できると、IDEやブラウザを操作しながら情報を整理しやすくなります。ただし顧客コード、契約情報、認証情報を外部AIへ送信してよいかは案件ごとに異なります。便利さより先に契約とセキュリティルールを確認してください。
導入前に確認したい5つの注意点
1. Extended Thinkingを常用しない
複雑な処理には有効ですが、すべての会話をExtended Thinkingへ寄せると、設計が重くなり、処理時間やコストも増える可能性があります。FAQや単純なコマンドでは3.8 Liveを使い、複数ツールや長い判断が必要なケースだけExtended Thinkingへ振り分ける方が現実的です。
2. 非同期ツールのタイムアウトを設計する
Extended Thinkingは非同期のFunction Callingが前提です。外部APIが返らない場合、いつまで待つか、途中経過を何回まで話すか、失敗時にどの案内へ切り替えるかを決めておかないと、会話が終わらない状態になり得ます。
3. 音声認識の誤りを前提にする
確認コード、顧客番号、型番、金額、日付などは、一文字の誤りでも後続処理が変わります。Googleは英数字の正確な認識強化を挙げていますが、実運用では重要項目の復唱や画面表示による確認を残す方が安全です。
4. 業務データをそのままFree Tierへ入れない
無料枠の利用条件と、業務で許容されるデータ取り扱いは別問題です。検証では公開データや匿名化データを使い、本番データを扱う段階で契約、保存、ログ、アクセス権、監査方法まで確認してください。
5. AIが話し続けることを「成功」と見なさない
自然に会話できても、最終的な業務処理が失敗していれば価値はありません。評価指標は、音声の自然さだけでなく、タスク完了率、API失敗率、人間の訂正回数、処理時間、1件あたりコストまで含める必要があります。
既存の音声AIから移行するときのポイント
Googleは、従来のgemini-3.1-flash-live-previewからGemini 3.8 Liveへの移行では、モデル文字列の変更に加え、設定項目の見直しを案内しています。3.8 Liveではthinking_levelを指定しないため、以前の設定をそのまま流用しないよう注意が必要です。
Extended Thinkingへ移る場合はさらに変更が増えます。特に重要なのは、前述したinteraction_statusの監視、非同期Function Calling、thinking levelの設定です。
既存システムで音声AIを運用しているなら、いきなり本番モデルを置き換えるより、同じ会話シナリオで新旧モデルを比較した方が安全です。
- 最初の返答までの時間
- 会話が途切れた回数
- ユーザーの割り込み成功率
- ツール呼び出し成功率
- 最終タスク完了率
- 1件あたりの音声入出力時間
- 人間が訂正した回数
- 想定外のAPI実行や重複実行の有無
音声エージェントでは「速い」だけでも「賢い」だけでも不十分です。短い待ち時間で正しい処理を最後まで完了できるかを、実際の業務シナリオで確認する必要があります。
Gemini 3.8 Liveが向いている人・向いていない人
向いている人
- リアルタイム音声エージェントを作りたい開発者
- 会話中に外部APIや業務システムを呼び出したい人
- 視覚入力と音声を組み合わせた現場支援を検討している人
- ヘルプデスクや受付を対話型にしたい企業
- 複数ステップ処理の待ち時間を自然な会話で埋めたい人
向いていない可能性がある人
- 音声を使わず、テキスト中心のコーディング支援だけが目的の人
- 単純なFAQだけで、外部ツール連携を必要としない人
- 低価格な音声文字起こしだけが目的の人
- 業務データを外部AIへ送信できない環境の人
- 非同期処理や状態管理を追加できない既存システムを運用している人
テキスト中心の開発タスクならGemini 3.8 Flash、リアルタイム音声ならGemini 3.8 Live、会話を続けながら複雑な業務処理まで行うならExtended Thinkingという分け方が、現時点では分かりやすい判断軸です。
これから試すなら小さな音声ワークフローから始める
最初から「電話受付を全部AIへ任せる」のではなく、1つの閉じたタスクから試す方が失敗を見つけやすくなります。
- 公開データだけで動く検証用シナリオを1つ決める
- まずGemini 3.8 Liveで低遅延な会話を確認する
- 外部APIを1つだけつなぎ、Function Callingを検証する
- ツール待ちが長い場合だけExtended Thinkingへ切り替える
interaction_statusを使って状態管理を実装する- 割り込み、タイムアウト、API失敗、聞き間違いをテストする
- タスク完了率と1件あたりコストを記録する
たとえば「社内FAQを答えつつ、必要な場合だけチケットを作成する」といった小さな構成なら、音声対話とツール連携の両方を試せます。実務では、音声の自然さよりも、誤ったチケット作成や二重実行が起きないことの方が重要です。
またGoogleは、AI生成音声へSynthIDによる不可知覚のウォーターマークを付与すると説明しています。音声を外部へ配信したり顧客対応へ使ったりする場合は、AI音声であることの案内や社内ルールも合わせて検討してください。
まとめ
Gemini 3.8 LiveとGemini 3.8 Live Extended Thinkingは、2026年9月15日に発表されたリアルタイム音声対話向けモデルです。3.8 Liveは低遅延で自然な対話を重視し、Extended Thinkingは複雑な推論や非同期ツール処理を会話の裏側で続ける設計が特徴です。
SE実務で重要なのは、音声品質そのものより、外部APIの待ち時間を含む業務フローをどこまで自然に完了できるかです。Extended ThinkingではturnCompleteだけでなくinteraction_statusを監視する必要があるため、既存のLive API実装から移行する場合は状態管理の見直しが欠かせません。
料金は2026年9月16日時点で、音声入力が約0.005ドル/分、音声出力が約0.018ドル/分と公式料金ページに掲載されています。ただし、実運用では会話時間、再試行、ツール待ち、中間発話まで含めた「1タスクあたりの総コスト」で見る必要があります。
まずは1つの小さな音声ワークフローで、Gemini 3.8 Liveを基準に試し、複雑な判断や複数ツールの待ち時間が問題になる場面だけExtended Thinkingを使うのが現実的です。
参考情報
- Google Blog: Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking
- Google Blog: Build real-time voice applications with Gemini 3.8 Live and 3.5 Transcribe
- Google AI for Developers: Gemini 3.8 Live
- Google AI for Developers: Gemini 3.8 Live Extended Thinking
- Google AI for Developers: Thinking in the Live API
- Gemini Developer API pricing
本記事の機能、料金、提供条件は2026年9月16日時点で確認した内容です。モデル仕様、料金、利用上限、提供地域、対象プランは変更される可能性があります。導入前にGoogle公式ページで最新情報を確認してください。



コメント