Googleは2026年8月13日、生成AIモデル「Gemini 3.7 Flash」を発表した。前世代のGemini 3.6 Flashが公開されたのは7月21日で、更新間隔はわずか約3週間だ。
単なる小刻みなバージョンアップに見えるが、公開されたベンチマークと料金を比較すると、今回の更新にはもう少し大きな意味が見えてくる。
Gemini 3.7 Flashは、コーディング、Web開発、AIエージェント、企業の業務自動化を中心に性能を高めながら、2026年末までは100万入力トークンあたり0.75ドル、出力3.75ドルという価格で提供される。Googleが3.6 Flashを発表した当初の価格の半額だ。
Gemini 3.7 Flashで注目すべきなのは「3週間で新モデルが出たこと」そのものではなく、Googleが巨大モデルを長期間かけて更新するだけでなく、実際の利用データや開発者のフィードバックを短期間で主力モデルへ反映する開発方式を強めている点だ。
本記事では公式資料を基に、Gemini 3.6 Flashとの性能差、Claude Sonnet 5やGPT-5.6 Terraとの比較、料金を実際の利用量に当てはめた試算、そしてGoogleがこれほど短期間でモデルを更新する理由まで読み解く。
Gemini 3.7 Flashとは
Gemini 3.7 Flashは、Google DeepMindが開発するGemini 3シリーズの高速・高効率モデルだ。
GoogleはFlashシリーズを、最高性能だけを狙うモデルではなく、性能・速度・コストのバランスを取りながら大量処理する「workhorse(主力実務モデル)」と位置付けている。
主な仕様は以下の通りだ。
| 項目 | Gemini 3.7 Flash |
|---|---|
| モデルID | gemini-3.7-flash |
| 入力 | テキスト、画像、動画、音声、PDF |
| 出力 | テキスト |
| 最大入力 | 1,048,576トークン |
| 最大出力 | 65,536トークン |
| Thinking | low / medium / high |
| Function Calling | 対応 |
| Code Execution | 対応 |
| Computer Use | Preview対応 |
| Google検索グラウンディング | 対応 |
| Google Mapsグラウンディング | 対応 |
| URL Context | 対応 |
| Context Caching | 対応 |
| 提供状況 | GA(一般提供) |
100万トークンを超える入力コンテキストを持つため、大規模なコードベース、長いPDF資料、複数の文書などをまとめて処理する用途にも向いている。
Gemini 3.7 Flashは単なる高速チャットモデルではなく、「大量の情報を読み、考え、ツールを呼び出しながら複数ステップの仕事を完了させる」用途を強く意識したモデルになっている。
Gemini 3.6 Flashから何が変わったのか
3.7という数字だけを見ると3.6からの小規模アップデートに思えるが、Google DeepMindが公開した評価では一部の項目でかなり大きな改善が確認できる。
同社のモデルカードを基に比較すると以下の通りだ。
| ベンチマーク | 3.6 Flash | 3.7 Flash | 差 |
|---|---|---|---|
| FrontierCode 1.1 Main | 34.4% | 43.6% | +9.2ポイント |
| DeepSWE v1.1 | 48.6% | 65.3% | +16.7ポイント |
| Code Arena | 1538 Elo | 1588 Elo | +50 |
| Terminal-bench 2.1 | 78.0% | 85.8% | +7.8ポイント |
| Terminal-bench 3.0 | 5.4% | 14.9% | +9.5ポイント |
| AutomationBench | 17.0% | 30.4% | +13.4ポイント |
| GDP.pdf | 22.0% | 34.0% | +12.0ポイント |
| OSWorld-2.0 | 33.8% | 47.9% | +14.1ポイント |
特に目立つのが、長時間にわたるソフトウェア開発能力を評価するDeepSWE v1.1だ。
48.6%から65.3%への上昇は、絶対値では16.7ポイント、相対的には約34%の改善となる。
企業業務の自動化を測るAutomationBenchも17.0%から30.4%へ上昇した。単純な質問応答より、複数の操作を連続して行うタスクで改善幅が大きい。
3.7 Flashの改善は「知識量が少し増えた」というより、コードを書き、ツールを使い、途中で失敗しても修正しながら仕事を続けるエージェント能力に集中している。
3週間で新モデルを投入したのは本当か
GoogleがGemini 3.6 Flashを発表したのは2026年7月21日だった。
Gemini 3.7 Flashは8月13日発表なので、その間隔は23日しかない。Google自身も「3.6 Flashからわずか3週間」と説明している。
時系列にすると分かりやすい。
| 日付 | 出来事 |
|---|---|
| 2026年7月21日 | Gemini 3.6 Flash発表 |
| 2026年7月22日 | Alphabet決算でFlashシリーズへの強い需要を説明 |
| 2026年7月28日 | Managed Agentsで3.6 Flashを標準モデル化 |
| 2026年8月13日 | Gemini 3.7 Flash発表 |
Googleは3.6 Flashについても「開発者や顧客からのフィードバックを直接反映した」と説明していた。そして3.7についても同様に、開発者からのフィードバックとアルゴリズム上の革新による成果としている。
つまり、3週間ですべてをゼロから学習し直した新世代モデルを作ったと考えるより、すでに存在するGemini 3系の基盤へアルゴリズム改善や実運用で得られた知見を高速に反映したモデルと見るほうが自然だ。
Googleは「巨大な世代更新」と「短周期の改善」を分離している可能性
ここからは公開情報を基にしたcodebeatの分析となる。
Googleは3.6 Flashを発表した7月の時点で、次世代となるGemini 4について「これまでで最も野心的なpre-training runを開始した」と明らかにしている。
一方でGemini 4の完成を待つことなく、3.6 Flash、3.7 Flashと既存世代のモデルを短期間で改良している。
ここから、
長期間・大規模な事前学習による世代交代
と、
既存モデルへのアルゴリズム改善や実運用フィードバックの反映
を並行して進める戦略が見えてくる。
従来の生成AI競争では「GPT-4からGPT-5」のような大きな世代番号の更新が注目されやすかった。
しかしAIエージェントが実際の業務で使われるようになると、重要になるのはモデルの最高スコアだけではない。
- 途中で同じ処理を繰り返さないか
- ツール呼び出しに失敗しないか
- 必要以上に長い回答を生成しないか
- コード修正を一度で成功できるか
- 1つの仕事を完了するまでに何トークン消費するか
といった実運用上の効率が重要になる。
Googleが3週間という短周期でFlashを更新した背景には、「モデルを何年かに一度完成させる製品」から「利用データを基に継続改善する実行基盤」へ生成AIが変化していることがあると考えられる。
実は「性能向上」以上に料金が大きく変わった
3.7 Flashでもう一つ重要なのが料金だ。
Gemini 3.6 Flashは2026年7月の発表時、
- 入力:100万トークンあたり1.50ドル
- 出力:100万トークンあたり7.50ドル
だった。
Gemini 3.7 Flashでは2026年12月31日までの導入価格として、
- 入力:0.75ドル
- 出力:3.75ドル
となった。
つまり半額である。新料金は3.6 Flashにも適用された。2027年1月1日からは1.50ドル/7.50ドルになる予定だ。
| モデル | 入力100万token | 出力100万token |
|---|---|---|
| 3.6 Flash 発表時 | $1.50 | $7.50 |
| 3.7 Flash 導入価格 | $0.75 | $3.75 |
| 3.7 Flash 2027年以降予定 | $1.50 | $7.50 |
したがって「GeminiのAPI料金が恒久的に半額になった」と解釈するのは正確ではない。
現時点では2026年末までのプロモーション価格だ。
実際のAIエージェントではいくら違う?codebeat独自試算
料金表だけでは差が分かりにくいため、月間で次のトークンを消費するAIエージェントを想定して試算する。
- 入力:1,000万トークン
- 出力:200万トークン
検索やComputer Useなどの追加料金は含めず、純粋なトークン料金だけを比較する。
Gemini 3.7 Flash
入力:
1,000万 ÷ 100万 × 0.75ドル = 7.50ドル
出力:
200万 ÷ 100万 × 3.75ドル = 7.50ドル
合計は15ドルとなる。
同じ利用量について、2026年8月時点のClaude Sonnet 5とGPT-5.6 TerraのAPI単価を当てはめると以下のようになる。
| モデル | 月額試算 |
|---|---|
| Gemini 3.7 Flash | $15 |
| Claude Sonnet 5 | $40 |
| GPT-5.6 Terra | $44 |
この条件ならGemini 3.7 Flashは、
- Claude Sonnet 5より約62.5%安い
- GPT-5.6 Terraより約65.9%安い
計算になる。
もちろん実際のAIエージェントではキャッシュ、検索、ツール利用、再試行回数などによって総額は変わるため、この数字だけで実運用コストを断定することはできない。
それでも、大量のタスクを処理するサービスでは100万トークン当たり数ドルの差が、最終的には大きなインフラ費用差になる。
GoogleがFlashで狙っているのは「最も賢いAI」という称号だけではなく、高性能モデルを大量のエージェントへ配置できる価格帯を取ることだと考えられる。
Claude Sonnet 5・GPT-5.6 Terraと性能を比較
Google DeepMindはGemini 3.7 Flashのモデルカードで、Claude Sonnet 5やGPT-5.6 Terraなど複数の競合モデルとの評価を公開している。
同じ表から代表的な項目を抜き出すと次のようになる。
| 評価 | Gemini 3.7 Flash | Claude Sonnet 5 | GPT-5.6 Terra |
|---|---|---|---|
| Artificial Analysis Intelligence Index | 56 | 55 | 57 |
| FrontierCode 1.1 | 43.6% | 42.7% | 41.3% |
| DeepSWE v1.1 | 65.3% | 53.8% | 69.6% |
| Code Arena | 1588 | 1541 | 1523 |
| Terminal-bench 2.1 | 85.8% | 80.4% | 87.4% |
| AutomationBench | 30.4% | 10.7% | 23.6% |
| GDPval-AA v2 | 1525 | 1598 | 1578 |
| Harvey LAB-AA | 90.7% | 90.1% | 85.2% |
| GDP.pdf | 34.0% | 28.0% | 24.7% |
ここから重要なのは、Gemini 3.7 Flashがすべての評価で最も高いわけではないことだ。
長時間のソフトウェア開発を測るDeepSWEではGPT-5.6 Terraが上回り、一般的なナレッジワークを評価するGDPval-AAではClaude Sonnet 5とTerraが上回る。
一方でWeb開発、企業業務自動化、PDF理解、法律業務などでは3.7 Flashが高いスコアを記録している。
したがって、
「Gemini 3.7 Flashが競合モデルより全面的に優れている」
という結論にはならない。
より正確には、
競合する中位~高性能モデルに近い性能を、一段低いトークン価格で提供している
ことが3.7 Flashの特徴だ。
なお、これらはGoogleが掲載している評価結果であり、実際の業務における性能を保証するものではない。モデルやベンチマークの設定、推論強度、ツールの有無によって順位は変わるため、自社の代表タスクで比較する必要がある。
「Flashだから低性能」という位置付けも崩れ始めている
従来、「Flash」「mini」「Haiku」といった軽量モデルは、高性能モデルよりかなり能力を落とす代わりに高速・低価格にしたモデルという印象が強かった。
3.7 Flashではその境界が曖昧になっている。
Artificial Analysis Intelligence IndexではGemini 3.7 Flashが56、Claude Sonnet 5が55、GPT-5.6 Terraが57となっており、少なくとも公開された比較では同じ性能帯に集まっている。
モデル単体の性能だけではなく、
1回の仕事を完了させるためのコスト
が重要になりつつある。
モデル単価が安くても何度も失敗すれば総費用は増える。
逆に少し単価が高くても一度で仕事が終われば安くなる。
3.7 FlashではGoogle自身も、手動での監視や再試行を減らすことにつながる改善を強調している。
今後のAIモデル比較では「100万トークン何ドルか」だけでなく、「1件の仕事を成功させるまで何ドルか」が重要な指標になる。
なぜGemini 3.5 Proより3.7 Flashが先なのか
もう一つ興味深い点がある。
Googleは7月21日の3.6 Flash発表時点で、Gemini 3.5 Proをパートナー企業とテストしており、準備ができ次第広く提供すると説明していた。
ところが、その3.5 Proより先に3.7 Flashが公開された。
これは「GoogleがProを軽視している」とまでは言えない。
ただし、Googleの事業上、Flashの重要度が非常に高くなっていることは読み取れる。
Alphabetの2026年第2四半期決算では、Sundar Pichai CEOがFlashシリーズについて、性能とコストのバランスが取れているため非常に強い需要があると説明している。
企業が数百万回、数千万回の処理をAIへ任せる場合、最高性能モデルをすべての処理に使うのは高コストになりやすい。
そのため、
- 難しい判断だけ上位モデル
- 大量の通常処理はFlash
- 単純処理はさらに低価格なFlash-Lite
といったモデルの使い分けが現実的になる。
AIがチャットサービスから企業インフラへ移るほど、利用回数が圧倒的に多い「主力モデル」の経済的価値は、最上位モデル以上に大きくなる可能性がある。
Gemini 3.7 Flashが向いている用途
公開された性能から考えると、特に適しているのは次のような用途だ。
コーディングエージェント
リポジトリを読み、問題を特定し、複数ファイルを修正してテストするような処理だ。
DeepSWEやTerminal-benchで改善しているため、単発のコード生成より継続的なソフトウェア作業で恩恵が大きい可能性がある。
Webアプリ・UI生成
Code Arenaでは3.6 Flashの1538 Eloから1588 Eloへ改善した。
Googleはスクリーンショットやデザインシステムから、より忠実なWebアプリを生成できるようになったとしている。
社内業務の自動化
AutomationBenchは17.0%から30.4%へ大きく改善した。
メール、資料、Web、社内システムなど複数の情報源を行き来するエージェント用途との相性が重要になる。
大量のPDF・資料分析
最大約100万トークンを入力でき、PDFも直接扱える。
GDP.pdfも22.0%から34.0%へ改善しているため、決算資料、契約文書、調査資料などを扱う用途にも適する。
逆に3.7 Flashを選べばよいとは限らない
価格性能比が高いからといって、すべて3.7 Flashへ置き換えればいいわけではない。
例えばGoogleの比較でも、DeepSWEではGPT-5.6 Terra、GDPval-AAではClaude Sonnet 5が上回る。
また、Gemini 3.7 Flashの最大出力は65,536トークンであり、GPT-5.6 Terraの最大128,000出力トークンより短い。
さらにGemini 3.7 Flashでは、
- 画像生成
- 音声生成
- Live API
など、一部機能には対応していない。
そのためモデル選定では、
性能 → 価格 → 必要機能 → 実際のタスク成功率
の順で総合的に比較する必要がある。
開発者への影響――モデル名より「移行速度」が問題になる
3週間で新モデルが出る時代には、開発者側にも別の問題が生じる。
モデル更新が速すぎることだ。
AIサービスを本番運用している企業では、新モデルが登場するたびに、
- 代表的なプロンプトを実行する
- 正解率を比較する
- レイテンシを計測する
- トークン消費量を測る
- ツール呼び出しの成功率を見る
- 安全性を確認する
- 問題がなければ段階的に移行する
といった作業が必要になる。
3.6から3.7への更新が23日しかなかったことを考えると、半年に一度モデルを評価する運用では追いつかなくなる可能性がある。
生成AIを業務利用する企業では、「どのモデルを選ぶか」と同じくらい「新モデルを自動評価して安全に切り替える仕組み」を作ることが重要になりつつある。
これは3.7 Flashそのものより、今回の3週間更新から見える大きな変化だ。
Googleの狙いは「AIエージェントの標準エンジン」か
以上の情報を組み合わせると、Gemini 3.7 Flashについて単純に、
「Googleがまた高性能AIを出した」
とだけ理解するのは不十分だ。
Googleは、
- コーディング性能を改善
- AIエージェント性能を改善
- Computer Useを提供
- Function Callingを提供
- 検索やMapsとのグラウンディングを提供
- 最大100万トークンを入力可能
- 価格を期間限定で半額
- 3週間という短期間で更新
という施策を同時に進めている。
これは、ユーザーが時々質問するAIというより、大量の仕事を継続的に処理するAIエージェントの基盤を狙った構成だ。
Googleにはさらに検索、Maps、Workspace、Cloudなど、エージェントが接続できる巨大なサービス群がある。
モデル単体の性能競争で1位になることだけではなく、それらを組み合わせたAI実行基盤を企業へ広げることがGoogleにとって重要になる。
これはcodebeatによる分析であり、Google自身が「標準エンジンになる」と表明したものではない。
しかしFlashシリーズへの強い需要をCEO自身が説明していることや、3.7でコーディングとエージェント性能が重点的に改善されたことを考えると、その方向性には合理性がある。
まとめ
Gemini 3.7 Flashは、Gemini 3.6 Flashからわずか約3週間で登場した。
表面的には小さなバージョンアップだが、公開データを見ると、DeepSWE、AutomationBench、Web開発、PDF理解、Computer Useなど実際のエージェント運用に近い項目で改善が目立つ。
さらに2026年末までは入力0.75ドル、出力3.75ドル/100万トークンという価格が設定された。
codebeatの試算では、月間1,000万入力・200万出力トークンを利用するケースで15ドルとなり、同じ条件ならClaude Sonnet 5の40ドル、GPT-5.6 Terraの44ドルより大幅に低い。
一方、すべてのベンチマークで競合を上回るわけではなく、2027年からはプロモーション価格の終了も予定されている。用途別の実測評価は欠かせない。
Gemini 3.7 Flashが示している最大の変化は、生成AIの競争が「次の巨大モデルを誰が先に出すか」から、「実際の仕事で使うモデルを、どれだけ速く改善し、低コストで大量展開できるか」へ広がっていることだ。
3週間という更新間隔は、その変化を象徴する数字と言える。
参考資料
Google「Introducing Gemini 3.7 Flash」
https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-gemini-3-7-flash/
Google AI for Developers「Gemini 3.7 Flash」
https://ai.google.dev/gemini-api/docs/models/gemini-3.7-flash
Google DeepMind「Gemini 3.7 Flash Model Card」
https://deepmind.google/models/model-cards/gemini-3-7-flash/
Google「Introducing Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber」
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-6-flash-3-5-flash-lite-3-5-flash-cyber/
Google AI for Developers「Gemini Developer API pricing」
https://ai.google.dev/gemini-api/docs/pricing
Anthropic「Claude Sonnet 5」
https://www.anthropic.com/research/claude-sonnet-5
OpenAI「GPT-5.6 Terra」
https://developers.openai.com/api/docs/models/gpt-5.6-terra



コメントを送信