Googleは2026年9月15日、音声対話向けの「Gemini 3.8 Live」を発表しました。会話を続けながら、検索や外部サービスを使った処理を進められるモデルです。
大きな変化は「97言語で話せること」だけではありません。頼んだ作業の待ち時間にも会話を続けられる点です。ただし、会話が途切れないことと、頼んだ作業が正しく完了することは分けて考える必要があります。
Googleは同時に、複雑な作業向けの「Gemini 3.8 Live Extended Thinking」も発表しました。本記事では両者を分けて、従来モデルや競合との違い、料金、実際に使う際の注意点を確認します。情報は2026年9月19日時点です。
Gemini 3.8 Liveで何ができるようになった?
Gemini 3.8 Liveは、会話を続けながら外部の機能を呼び出し、処理結果を待っている間も音声で応答できます。ここでいう外部の機能とは、検索や予約システムなど、開発者が接続する機能のことです。
たとえば「空いている日時を調べて」と頼むと、AIが予定表へ照会します。その間にも条件を確認したり、進行状況を伝えたりできます。照会が終わるまで会話が止まる従来の方式とは、この点が異なります。
カメラなどから送られる映像も、ほぼリアルタイムで扱います。会話の途中で言語が変わった場合も、対応する97言語を自動で判別して切り替えるとGoogleは説明しています。出典:Googleの発表
Extended Thinkingは、複数の手順を考えながら進める作業を重視したモデルです。処理を裏で続けながら、途中経過も話せる設計になっています。素早い対話を重視する通常版とは、想定する用途が異なります。出典:Googleのモデル仕様
従来モデルや競合の音声AIとは何が違う?
Googleの旧モデルとの大きな違いは、外部処理を待っている間も会話を続けられることです。ただし、この仕組み自体をGoogleが初めて実現したわけではありません。
| モデル | 音声対話と外部処理 | 確認できる位置づけ |
|---|---|---|
| Gemini 3.1 Flash Live Preview | 外部処理の結果を受け取るまで応答を待つ | Googleの旧世代の試験版 |
| Gemini 3.8 Live | 外部処理中も音声対話を続けられる | 速い対話を重視する通常版 |
| Gemini 3.8 Live Extended Thinking | 外部処理と複数段階の推論を裏で進める | 複雑な作業向け |
| OpenAIのgpt-realtime | 長い外部処理を待つ間も対話を続けられる | 2025年に同種の機能を案内 |
Googleの旧モデルの仕様には、外部処理の結果を受け取るまで待つ方式だと記載されています。新しい3.8 Liveの仕様では、結果を待たずに会話を進める方式が標準です。
競合するOpenAIも、2025年のgpt-realtimeの発表で、長い外部処理の途中でも対話を続けられる仕組みを説明しています。そのため、「会話しながら作業を進める」という特徴はGoogleだけのものではありません。
性能を示す数値も、同じものとして比べることはできません。Googleによると、Extended Thinkingは音声AIの総合評価で82.6点です。音声エージェントの課題完了率は、試験の種類によって68.6%と35.1%でした。試験内容が異なるため、この二つの数値をそのまま比べて優劣を判断することはできません。通常版の性能として扱うこともできません。出典:Googleの発表
会話と作業を重ねると、待ち時間はどのくらい減る?
同時進行が効果を発揮するのは、外部処理を待っている間にも、利用者と意味のある会話を続けられる場合です。次の計算は仕組みを説明するための仮定で、Googleが公開した実測値ではありません。
確認の会話に5秒、外部処理に8秒、最後の案内に2秒かかるとします。すべて順番に進めた場合、合計は5+8+2=15秒です。
確認と処理を同時に始められるなら、最短の目安は「長い方の8秒+最後の2秒」で10秒です。5秒短くなり、割合では約33%の短縮になります。
ただし、確認を終えなければ外部処理を始められない作業もあります。途中で条件が変われば、処理をやり直す場合もあるでしょう。同時進行によって、すべての作業が33%速くなるわけではありません。
「97言語対応」は翻訳も97言語でできるという意味?
97言語という数字は、Gemini 3.8 Liveが会話中に判別し、切り替えられる言語数を示しています。97言語すべてで同じ品質の翻訳が保証されたという意味ではありません。
Googleの製品でも、用途によって対応言語数は異なります。3.8 Liveの音声対話は97言語です。文字起こし専用の「Gemini 3.5 Transcribe」は85言語以上、音声翻訳用の「Gemini 3.5 Live Translate」は70言語以上と案内されています。出典:Googleの開発者向け発表
たとえば、日本語で話しながら英語の製品名を交えられることと、会議の内容を正確に同時通訳できることは別です。企業が導入する場合は、実際に使う言語の組み合わせで品質を確認する必要があります。
音声AIの利用料を独自計算すると?
開発者向けAPIの料金を基に計算すると、10分の会話が約0.14ドルになるケースがあります。これは一般利用者向けGeminiアプリの月額料金ではありません。
Googleが公開している単価は、入力音声が1分あたり約0.005ドル、出力音声が同約0.018ドルです。利用者が10分話し、AIが合計5分話した場合、0.005×10+0.018×5=0.14ドルとなります。
同じ条件で1,000件利用すると140ドルです。AIも10分話す場合は1件あたり0.23ドルとなり、1,000件では230ドルになります。AIの発話時間が5分増えるだけで、合計額には90ドルの差が出ます。
この単価は、Googleが示すトークン単価を基に換算した目安です。実際の請求額は処理量によって変わります。文字、映像、検索、接続先のサービスなどに別途費用がかかる場合もあります。出典:GoogleのAPI料金表
電話窓口などで利用する場合、AIの発話時間が長くなるほど費用も増えます。確認は短い音声で済ませ、詳しい結果を画面に表示する設計なら、聞きやすさと費用を両立できる可能性があります。これは公開単価からの分析であり、実際の運用でどの程度節約できるかを示したものではありません。
会話が自然なら、作業の成功率も高い?
自然に会話できても、予約や情報変更といった作業が最後まで正しく終わるとは限りません。会話の速さとは別に、手順ごとの成功率を確認する必要があります。
仮に三つの作業がそれぞれ90%の確率で成功するとします。各作業の成否が互いに独立しているなら、すべて成功する確率は0.9の3乗で72.9%です。これは製品の測定結果ではなく、複数の作業を連続して行う際の弱点を示すための計算です。
実際には、一つの失敗が次の作業へ影響することもあります。そのため、「検索できたか」「条件を確認したか」「変更が保存されたか」と手順を分けて測る方法が考えられます。最後の操作だけ人が確認する設計も有効です。
GoogleのAPI仕様を見ると、3.8 Live自体にはコード実行やファイル検索の機能はありません。外部の機能を接続して初めて、それぞれの作業を進められます。音声だけであらゆる操作を自動実行できるモデルと考えるのは早計です。出典:Googleのモデル仕様
一般利用者はどこで使える?
Googleの発表では、通常版はSearch Live、Extended ThinkingはGemini Liveへ順次導入されます。実際に利用できる画面や機能は、製品や契約内容によって異なります。
開発者はGemini APIとGoogle AI Studioで両モデルを利用できます。企業向けは一部が限定提供です。Google Workspaceでは、DocsやGmail、Keepで利用できる条件が、製品や有料プランによって異なります。出典:Googleの提供案内
日常生活では、カメラで機器を映しながら操作手順を聞くような使い方が考えられます。仕事では、問い合わせを受けながら情報を調べ、利用者へ確認しつつ処理を進める用途が中心になりそうです。ただし、接続先でどこまで操作できるか、どの段階で確認画面を挟むかはサービス側の設計に左右されます。
結局、何が変わり、何を確かめるべきか
Gemini 3.8 Liveは、音声AIを「質問に答える相手」から「会話を続けながら作業を進める相手」へ一歩近づけるモデルです。Googleの旧音声モデルと比べると、外部処理を待っている間も会話を続けられる点に明確な違いがあります。
ただし、同様の仕組みには競合の先例があります。97言語という数字だけでは翻訳品質を判断できず、会話が滑らかだからといって作業の完了まで保証されるわけでもありません。
利用者は、頼んだ操作が実際に完了したかを画面や履歴で確認する必要があります。企業が導入する場合は、待ち時間だけでなく、最終的な成功率、言語ごとの品質、1件あたりの総費用まで測って判断したいところです。
関連ページ
- AIエージェントとは?生成AIとの違い・仕組み・できることを初心者向けに解説:外部の道具を使うAIの基本を解説。
- 生成AIの学習と推論の違いとは?必要なGPU・電力・コストまで解説:音声AIを動かす計算資源と費用の背景を解説。



コメントを送信