Googleは2026年9月2日、推論、コーディング、自律型エージェント向けの新モデル「Gemini 3.8 Flash」を発表しました。前世代のGemini 3.7 Flashが発表されたのは8月13日です。更新までの間隔はわずか20日。Google自身も「6週間で3つ目のFlash」と説明しています。
注目したいのは、APIの表示単価が3.7 Flashと同じでも、同じ仕事を完了するまでの実質コストまで同じとは限らない点です。Gemini 3.8 Flashは、複雑な問題でより長く推論し、必要に応じてツールを繰り返し呼び出す設計になっています。独立系評価では、1タスク当たりの費用が3.7 Flashより約40%増えたという測定結果も出ています。
その一方で、コーディングや金融・法務分野のエージェント評価は大きく伸びています。「値上げ」と片付けるのも、「単価据え置きだから費用は変わらない」と考えるのも実態を捉えきれません。一次情報、比較データ、試算をもとに、性能向上に追加費用を払う価値がどこで生まれるのかを整理します。
Gemini 3.8 Flashは、20日で更新されたエージェント重視のFlashモデル
Gemini 3.8 Flashは、長時間のソフトウェア開発、自律型エージェント、複数工程を伴う企業業務を主な対象とした、Gemini 3系の最新Flashモデルです。テキストに加えて画像、音声、動画を入力でき、最大100万トークンのコンテキストと、最大6万4,000トークンのテキスト出力に対応します。
| 項目 | Gemini 3.8 Flash | Gemini 3.7 Flash |
|---|---|---|
| 発表日 | 2026年9月2日 | 2026年8月13日 |
| 発表間隔 | 20日(約2.9週間) | |
| 主用途 | 長期コーディング、自律エージェント、専門業務 | コーディング、エージェント、Web開発 |
| 入力 | テキスト・画像・音声・動画 | テキスト・画像・音声・動画 |
| コンテキスト | 最大100万トークン | 最大100万トークン |
| 最大出力 | 6万4,000トークン | 6万4,000トークン |
| 知識カットオフ | 原則2026年3月、一部分野は2025年1月 | 原則2026年3月、一部分野は2025年1月 |
Googleは3.8 Flashを、3.7 Flashを土台にした「次の反復」と位置付けています。まったく別系統の巨大モデルに置き換わったというより、短い開発周期でエージェント能力を上積みした更新と捉えるほうが実態に近いでしょう。
利用できるのはGemini API、Google AI Studio、Android Studio、Antigravity、Gemini Enterpriseなどです。個人向けでは、Google AI Pro/Ultra加入者向けのGeminiアプリ、Google検索のAI Mode、Google Sheetsにも提供されます。
2026年中は単価据え置き、2027年1月からは2倍に上がる
2026年12月31日までの標準API単価は、入力100万トークン当たり0.75ドル、出力100万トークン当たり3.75ドルで、3.7 Flashと同額です。ただし、この価格は期間限定です。2027年1月1日からは入力1.50ドル、出力7.50ドルとなり、それぞれ2倍に上がります。
| 料金項目 | 2026年12月31日まで | 2027年1月1日以降 | 変化 |
|---|---|---|---|
| 標準入力/100万トークン | 0.75ドル | 1.50ドル | 2倍 |
| 標準出力(思考を含む)/100万トークン | 3.75ドル | 7.50ドル | 2倍 |
| コンテキストキャッシュ読み取り | 0.075ドル | 0.15ドル | 2倍 |
| キャッシュ保存/100万トークン・時 | 0.50ドル | 1.00ドル | 2倍 |
| Batch APIの入力/出力 | 0.375ドル/1.875ドル | 0.75ドル/3.75ドル | 2倍 |
即時処理が必要ない場合、Batch APIなら標準料金の50%で利用できます。大量の分類や要約、静的コード解析などでは、モデルを変えるより処理方式を見直したほうが、費用を大きく下げられるケースもあります。
単価が同じでも、1件当たりの費用が増える理由は3つある
生成AIの請求額を決めるのは単価だけではありません。実際には、単価×消費トークン数×実行回数で費用が決まります。より長く考え、長い回答を返し、何度もツールを使うモデルであれば、料金表が同じでも1件の仕事にかかる費用は増えます。
1.内部の思考トークンも出力料金に含まれる
Googleの料金表では、出力料金に「thinking tokensを含む」と明記されています。利用者の画面に最終回答として表示されない内部推論も、課金対象の出力トークンに含まれます。
3.8 Flashが複雑な仕事でより多くの推論段階を踏むのであれば、最終的に表示される回答の長さが同じでも、請求対象となるトークン数は増える可能性があります。
2.ツールを繰り返し使うほど、入力と出力が積み重なる
エージェントは、検索、コード実行、ファイル確認、修正、再テストを一度の処理で終えられるとは限りません。ツールを呼び出すたびに、指示や会話履歴、ツールの実行結果などが次の入力として渡され、新たな出力も発生します。
3.8 Flashが得意とする粘り強い処理は、完了率を上げる一方で、課金されるターンを増やす要因にもなります。
3.独立系評価では、出力が約30%増え、1タスク費用は約40%上がった
独立系評価機関Artificial Analysisの初期測定では、Gemini 3.8 Flash(high)のIntelligence Indexにおける費用は、1タスク当たり0.58ドルでした。3.7 Flashと比べて約40%高く、同社は主な要因として、1タスク当たりの出力トークンが約30%増えたことや、エージェント評価でターン数が増えたことを挙げています。
つまり「単価据え置き」は料金表上の話であり、「同じ成果を得る費用も据え置き」という意味ではありません。ただし、0.58ドルという数字はArtificial Analysis独自の評価セットをhigh設定で測定した結果です。一般的なチャット利用や、すべてのサービスに共通する平均料金ではありません。
月10万件なら、試算上の差額は約1万6,600ドルになる
Artificial Analysisが示した「3.8 Flashは0.58ドル、3.7 Flash比で約40%増」という測定値から逆算すると、同じ評価における3.7 Flashの推定費用は次のようになります。
0.58ドル ÷ 1.40 = 約0.414ドル/タスク
| 月間タスク数 | 3.7 Flash推定 | 3.8 Flash測定値ベース | 月間差額 |
|---|---|---|---|
| 1,000件 | 約414ドル | 580ドル | 約166ドル |
| 1万件 | 約4,143ドル | 5,800ドル | 約1,657ドル |
| 10万件 | 約4万1,429ドル | 5万8,000ドル | 約1万6,571ドル |
同じトークン消費量が続いたまま2027年の価格改定を迎えれば、3.8 Flashは同条件で単純計算約1.16ドル/タスクになります。月10万件なら約11万6,000ドルです。
もちろん、この試算には為替、個別の割引、キャッシュ利用、実際のプロンプト構成などを含めていません。あくまで予算規模を把握するための目安です。
出力が30%増えただけでは、総費用40%増にはならない
計算してみると、出力トークンが30%増えただけで、総費用が自動的に40%増えるわけではありません。たとえば、入力1万トークン、出力2,000トークンの単発処理を考えます。
| 条件 | 入力費 | 出力費 | 合計 |
|---|---|---|---|
| 従来:入力1万、出力2,000 | 0.0075ドル | 0.0075ドル | 0.0150ドル |
| 出力だけ30%増:入力1万、出力2,600 | 0.0075ドル | 0.00975ドル | 0.01725ドル |
この条件では、総費用の上昇率は15%です。40%まで増えるには、内部思考の増加に加えて、ツール結果の再入力、追加ターン、長いコンテキストの再処理など、複数の要因が重なっていると考えるのが自然です。
【推定】これは公開された測定値から推測したものであり、Googleが費用増の内訳を公表したわけではありません。
性能向上は、長期コーディングと専門エージェントで目立つ
3.8 Flashの性能向上はすべての領域で同じではなく、特に長期コーディングと専門分野のエージェント評価で伸びが目立ちます。Google公表値では、DeepSWE v1.1が3.7 Flashの65.3%から3.8 Flashの73.7%へ8.4ポイント上昇しました。Vals Finance Agent v2は59.0%から61.4%、Harvey’s Legal Agent Benchmarkは8.8%から10.0%へ改善しています。
| 評価 | Gemini 3.8 Flash | Gemini 3.7 Flash | 主な競合 |
|---|---|---|---|
| DeepSWE v1.1 | 73.7% | 65.3% | Claude Opus 5:74.0%、GPT-5.6 Sol:72.7%、Claude Sonnet 5:53.8% |
| Vals Finance Agent v2 | 61.4% | 59.0% | Claude Opus 5:58.6%、GPT-5.6 Terra:54.4%、Claude Sonnet 5:53.9%、GPT-5.6 Sol:53.8% |
| Harvey’s Legal Agent Benchmark | 10.0% | 8.8% | Claude Opus 5:6.7%、Claude Sonnet 5:5.0%、GPT-5.6 Sol:2.5% |
| HLE-Verified | 54.9% | ― | 複数段階の幅広い専門推論を評価 |
ただし、Harveyの法務評価は競合を上回っていてもスコアは10.0%です。ベンチマークで首位になったことと、実務を無監督で任せられることは分けて考える必要があります。特定の試験で高い順位を取ったという事実だけでは、法務判断の自動化を正当化できません。
APIの表示単価だけを見ると、Gemini 3.8 Flashの0.75ドル/3.75ドルは安価です。Claude Sonnet 5は2ドル/10ドル、Claude Opus 5は5ドル/25ドル、Claude Fable 5.1は10ドル/50ドルです。
ただし、モデルごとにトークナイザー、思考量、キャッシュ割引、タスク成功率が異なります。料金表上の倍率を、そのまま「仕事1件を終えるための価格差」とみなすことはできません。
成功1件当たりで計算すると、費用増は約24%まで縮まる
長期コーディングの成功率と1タスク当たりの費用を組み合わせると、見え方は変わります。3.8 Flashの費用が3.7 Flash比で1.4倍、DeepSWEの成功率が65.3%から73.7%へ上がったと仮定し、「成功1件当たり費用」の比率を計算します。
1.40 ×(65.3 ÷ 73.7)= 約1.24
この条件では、1タスク当たりの費用が40%増えていても、成功1件当たりの費用増は約24%です。成功率の向上が、追加費用の一部を相殺するためです。
【要注意】ここではArtificial Analysisの総合評価における費用と、Googleが公表したDeepSWEの成功率という別々の試験結果を組み合わせています。実際のROIを測定した数字ではありません。
別の見方もできます。3.7 Flashでは平均1.4回以上の実行が必要だった仕事を、3.8 Flashが1回で終えられるのであれば、1回当たりの費用が40%高くても総額は同等以下です。初回失敗後の修正、人による確認、処理待ちの時間まで含めれば、高性能モデルのほうが業務全体のコストを下げる可能性もあります。
トークンを多く使っても、再試行が減れば業務コストは下げられる
トークン消費が増えること自体を、性能低下や改悪とみなすことはできません。追加の計算によって、再試行や人手での修正がどれだけ減るかを見る必要があります。短い回答を返して失敗するモデルより、長く検証して一度で仕事を終えるモデルのほうが、業務全体では安く済むケースがあります。
Artificial Analysisが示した約40%増という数字も、high設定と特定の評価群で測った結果です。簡単な分類、短文生成、定型的な抽出処理では推論量の差が小さく、3.7 Flashと近い費用に収まる可能性があります。
反対に、ブラウザー操作やコード修正を何度も繰り返すエージェントでは、費用差が40%を超えることも考えられます。
そのため、3.8 Flashへ全面移行するか、3.7 Flashを残すかをモデル名だけで決めるのは難しいでしょう。タスクごとに完了率、消費トークン、ターン数、処理時間、人手での修正時間まで測る必要があります。
20日前後でモデルが変わるなら、半年ごとの選定では追いつかない
短期間でのモデル更新は今回に限った話ではありません。Gemini 3.7 Flashも3.6 Flashの約3週間後に登場し、3.8 FlashはGoogleにとって6週間で3つ目のFlashとなりました。
モデル名が20日前後で更新される環境では、半年や1年ごとにモデルを選び直す運用では変化に追いつけません。自社タスクを使った回帰テストを継続的に回し、新モデルが出るたびに品質とコストを比較できる仕組みが必要になります。
競合でも、単価だけでは費用変化を判断しにくい例があります。AnthropicはClaude Sonnet 5の移行文書で、新しいトークナイザーでは同じ文章でも約30%多くのトークンになるため、単価低下がそのまま費用低下につながらないケースを説明しています。
Claude Opus 5でも、思考機能が標準で有効になったことで、同じ単価でも従来の非思考ワークロードより出力課金が増える可能性があると案内しています。
生成AIの価格を「100万トークン当たり何ドルか」だけで比べる方法は、実態とずれ始めています。企業が本当に比較したいのは、タスク完了1件、正答1件、修正済みコード1件といった成果にいくらかかったかです。
高速なモデル更新で問われるのは、性能より運用の仕組み
3週間前後でモデルが更新される状況は、Googleの開発速度を示す一方で、利用企業の運用負担も増やします。
- 評価結果がすぐ古くなる:モデル選定を終えた直後に次のモデルが出るため、評価を手作業で続けるのは難しくなります。
- モデル名を固定するリスクが高まる:最新版へ自動で切り替えると、品質だけでなく、拒否率、出力量、レイテンシーまで同時に変わる可能性があります。
- 予算を読みづらくなる:料金表の単価が同じでも、思考量やターン数が変われば請求額は動きます。
モデルカードには、3.8 Flashの多言語安全性指標が3.7 Flashより5.4ポイント悪化したとも記載されています。総合性能が上がったからといって、すべての評価軸が改善するわけではありません。
日本語サービスで利用するなら、英語中心のベンチマークだけを見るのでは足りません。日本語での拒否、誤検知、指示への追従、出力形式の安定性を、自社データで改めて確認する必要があります。
Gemini 3.8 Flashが示した変化は、単に「安くて高性能なモデルが出た」という話にとどまりません。モデル更新そのものを、ソフトウェア更新と同じように継続的に監視し、検証する運用が必要になっています。
3.7と3.8を実データで並行評価してから切り替える
企業や開発者が取るべき対応は、いきなり全面移行することではありません。まず3.7 Flashと3.8 Flashに同じ実データを与え、並行して評価するほうが安全です。
少なくとも、次の数値は記録しておきたいところです。
- 入力、出力、思考を含む課金トークン数
- 1件を完了するまでのモデル呼び出し回数とツール呼び出し回数
- 初回完了率、再試行率、人手修正率
- 初回応答時間とタスク全体の完了時間
- 成果1件当たりのAPI料金と人件費
- 日本語での誤回答、過剰拒否、形式違反
簡単な要約や分類は3.7 Flashや軽量モデルに残し、複雑なコード修正や複数ツールを使う仕事だけ3.8 Flashへ振り分ける構成も考えられます。
比較時には3.8 Flashのeffortを固定し、最大出力、反復回数、タイムアウト、総予算に上限を設けます。長い共通指示や資料を繰り返し使うならコンテキストキャッシュを使い、即時性が不要な処理はBatch APIへ回すことで、モデル性能を維持しながら費用を抑えられる可能性があります。
Gemini 3.8 Flash Cyberは、防御用途に限定された別モデル
同時に発表されたGemini 3.8 Flash Cyberは、一般向け3.8 Flashの単純な上位版ではありません。安全制限と提供対象が異なる、防御者向けのモデルです。
脆弱性の発見や自動パッチ生成に特化しており、政府機関、重要インフラ運営者、ソフトウェア保守者など、審査を通過した利用者にFairwind Program経由で提供されます。
Googleによると、20言語にまたがる社内脆弱性評価で成功率70%超、CWE-Benchのパッチ生成ではpass@1が47.2%でした。
一般版の3.8 FlashにはCBRNや攻撃的なサイバー利用に対する制限があります。Cyber版では防御用途を前提に、その制限範囲が調整されています。通常のAPI利用者が自由に切り替えて使えるモデルではありません。
判断基準は「トークン単価」から「仕事1件の総コスト」へ移る
Gemini 3.8 Flashは、3.7 Flashと同じトークン単価でも、より長い推論や反復的なツール利用によって、タスク単位の費用が増える可能性があります。Artificial Analysisが測定した約40%増という数字は、その変化を考えるうえで参考になります。ただし、すべての用途で一律に40%高くなるわけではありません。
長期コーディングではDeepSWE v1.1が65.3%から73.7%へ伸び、金融・法務エージェントでも高い公表値が出ています。再試行や人手修正を減らせる仕事なら、追加のトークン代を払っても総コストが下がる可能性があります。
一方、短く定型的な処理では、3.7 Flashを残したほうが合理的な場合もあります。
利用者が見るべきなのは、「100万トークン当たり何ドルか」だけではありません。自社の仕事1件を終えるまでに、何トークンを使い、何ターン処理し、何回やり直し、人間が何分修正したのか。そこまで含めて初めて、モデルの本当の費用が分かります。
さらに、2027年1月1日には現在の導入価格が2倍になります。3.8 Flashを本番導入するなら、現在の単価だけで採算を計算せず、価格改定後の予算まで含めて判断する必要があります。
よくある質問
Gemini 3.8 Flashは3.7 Flashより値上げされた?
2026年末までの標準API単価は同じです。入力100万トークン当たり0.75ドル、出力100万トークン当たり3.75ドルです。ただし、3.8 Flashで消費トークンや実行ターンが増えれば、1タスク当たりの請求額は高くなります。
なぜ「3週間で再更新」といえる?
Gemini 3.7 Flashは2026年8月13日、3.8 Flashは9月2日に発表されました。間隔は20日で、約2.9週間です。
すぐに3.8 Flashへ移行すべき?
長期コーディングや、複数のツールを使う仕事では試す価値があります。ただし、全面移行する前に自社の実データで3.7 FlashとA/Bテストを行い、完了率、総トークン数、再試行回数、人手修正まで比較したほうが安全です。
2027年にはいくらになる?
2027年1月1日から、標準料金は入力100万トークン当たり1.50ドル、出力100万トークン当たり7.50ドルになります。現在の導入価格の2倍です。
主な参考情報
- Google:Introducing Gemini 3.8 Flash and 3.8 Flash Cyber
- Google AI for Developers:Gemini Developer API pricing
- Google DeepMind:Gemini 3.8 Flash Model Card
- Google:Introducing Gemini 3.7 Flash
- Google DeepMind:Gemini 3.8 Flash performance
- Artificial Analysis:Gemini 3.8 Flash analysis
- Anthropic:Claude models overview and pricing
- Anthropic:What’s new in Claude Sonnet 5



コメントを送信