中国のAI企業DeepSeekは2026年9月10日、「DeepSeek-V4.1-Flash」を公開しました。文章だけでなく画像も扱え、最大100万トークンの長い情報を読み込めるAIです。
最大の変化は、安価なFlashが旧V4 Proの後継を一時的に担う点です。DeepSeekはV4 Proの提供を終了する方向へ進めており、9月14日から旧Pro宛てのAPI通信をV4.1 Flashへ転送します。
ただし、安くて速いからといって、すべての用途で旧Proより正確とは限りません。公式の評価表でも、難問を扱う一部のテストでは旧Proを下回っています。
ここでは、新しい仕組みや料金、競合モデルとの違いを整理します。あわせて、公式発表だけでは見えにくい費用と運用リスクも計算しました。
DeepSeek V4.1 Flashの要点
V4.1 Flashは、5520億パラメータのMoEモデルです。MoEとは、質問に応じて必要な部分だけを動かす仕組みです。
| 項目 | DeepSeek V4.1 Flashの仕様 |
|---|---|
| 公開日 | 2026年9月10日 |
| モデル全体 | 5520億パラメータ |
| 入力時に動く部分 | 80億パラメータ |
| 出力時に動く部分 | 160億パラメータ |
| 最大コンテキスト | 100万トークン |
| 入力形式 | テキスト、画像 |
| 事前学習データ量 | 45兆トークン |
| APIのモデル名 | deepseek-flash |
| ライセンス | MIT License |
100万トークンは、一度に保持できる情報量の上限です。長いコード群や大量の資料を、会話履歴と一緒に渡しやすくなります。
ただし、100万トークンを入力したからといって、正答率が保たれるとは限りません。「入力できる量」と「必要な情報を正しく探し出せる量」は別の性能です。
旧V4 Proの終了方針はどう変わったのか
DeepSeekは、上位版だったV4 Proを残す方針から、V4.1 Flashへ置き換える方針に転じました。新モデルが性能、費用、速度、処理完了までの時間で上回ったためだと説明しています。
2026年9月14日12時(北京時間)以降、deepseek-v4-pro宛ての通信はV4.1 Flashへ転送されます。日本時間では同日13時です。
| 従来のモデル名 | 変更後 | 開始時期 |
|---|---|---|
deepseek-v4-flash | V4.1 Flashへ転送 | 実施済み |
deepseek-v4-flash-vision-exp | V4.1 Flashへ転送 | 実施済み |
deepseek-v4-pro | V4.1 Flashへ転送 | 9月14日13時(日本時間) |
この状態は、将来V4.1 Proが登場するまで続きます。V4.1 Proの公開日は発表されていません。
旧モデル名がすぐに使えなくなるわけではありません。接続先の名前は変わらず、内部で動くAIだけが切り替わります。
「終了」より「別モデルへの転送」に近い
利用者から見ると、エラーにならない代わりに、気付かないうちに回答傾向が変わる可能性があります。通常のサービス終了とは、この点が異なります。
同じAPI名を使っていても、9月14日の前後で同じ出力になる保証はありません。JSONの形式、指示への従い方、文章量などを改めてテストする必要があります。
100万トークンを支える新しい仕組み
V4.1 Flashの中核は、入力と出力で使う計算量を変える「Causal Encoder-Decoder」です。入力を読む部分と、回答を書く部分を分けています。
モデルは40層で構成され、前半20層が入力を整理します。後半20層は、その情報を使って回答を作ります。
従来型では、回答を作る各層が大きな記憶領域を持ちます。新しい構造では、入力側の最終結果をもとに共通の記憶を作ります。
実際に動くのは全体の1.45~2.90%
本稿の計算では、入力時に動く80億は全体の約1.45%です。出力時の160億でも約2.90%にとどまります。
計算式は「80億÷5520億×100」です。巨大な倉庫の中から、必要な棚だけを開けるような仕組みと考えると分かりやすいでしょう。
AIエージェントは、資料やツールから得た結果を何度も読み込みます。そのため、入力側の処理を軽くする設計は、費用を抑えやすいと考えられます。
KVキャッシュは100万トークンで約890MB
技術資料の890バイト/トークンを使うと、100万トークン時のKVキャッシュは約890MBです。2進数で換算すると約849MiBになります。
KVキャッシュとは、AIが読み終えた内容を一時的に保持する領域です。会話が長くなるほど、必要な容量も増えていきます。
旧V4 Flashの4分の1という説明から逆算すると、旧モデルは約3.56GBです。新モデルでは、単純計算で約2.67GB減ります。
DeepSeekは、初代モデルと比べて437分の1まで小さくしたとも説明しています。同じ条件で逆算すると、初代相当は約389GBです。
ただし、これはKVキャッシュだけを比べた数字です。モデル本体や画像処理、実行ソフトなどには別途メモリが必要です。
CSA2と再生処理で保存量を減らす
V4.1 Flashは、重要そうな位置だけを見る疎な注意機構を使います。すべての文字を毎回同じ重さで見直すのではなく、見る範囲を絞って計算量を抑えます。
「CSA2」では、複数の層で検索用データや候補位置を共有します。「SWA Bounded Replay」は、必要な直近部分だけを再計算する仕組みです。
記憶データには、FP4という小さな形式も使います。これらを組み合わせることで、長い入力ほど増えやすい保存量を抑えています。
画像理解と補助記憶も統合
画像は後付け機能ではなく、文章と一緒に事前学習されています。画像を細かく分け、文章と同じ流れの中で処理します。
「Engram」と呼ばれる1960億パラメータの補助記憶も備えています。文字の並びを手掛かりに、必要な知識だけを読み出す仕組みです。
さらに、DSparkという投機的デコードを採用しました。先の文章を仮に生成し、確認しながら採用することで出力を速めます。
旧V4 Proから料金はどれだけ下がるか
旧V4 ProからV4.1 Flashへ移ると、通常入力は約77%、出力は約70%安くなります。同じ時間帯の料金を比べた場合の数字です。
| 100万トークン当たり | V4.1 Flash 閑散時 | V4.1 Flash ピーク時 | 旧V4 Pro 閑散時 | 旧V4 Pro ピーク時 |
|---|---|---|---|---|
| キャッシュ済み入力 | 0.003ドル | 0.006ドル | 0.022ドル | 0.044ドル |
| 通常入力 | 0.15ドル | 0.30ドル | 0.66ドル | 1.32ドル |
| 出力 | 0.60ドル | 1.20ドル | 1.98ドル | 3.96ドル |
DeepSeekは平日に時間帯別の料金を採用しています。閑散時の料金はピーク時の半額です。
入力1000万・出力200万トークンの独自試算
ピーク時に通常入力1000万、出力200万トークンを使う例では、21.12ドルから5.40ドルへ下がります。削減額は15.72ドル、削減率は約74.4%です。
旧Proは「1.32ドル×10+3.96ドル×2」です。V4.1 Flashでは「0.30ドル×10+1.20ドル×2」となります。
同じ処理を閑散時に行うと、10.56ドルから2.70ドルへ下がります。急がない大量処理なら、利用時間をずらす効果も大きくなります。
キャッシュが多い処理ほど差が広がる
ピーク時のキャッシュ済み入力は、旧Proの0.044ドルから0.006ドルへ約86.4%下がります。長時間動かすAIエージェントでは、この差が効いてきます。
同じ指示や資料を繰り返し読む処理では、キャッシュ済み入力の割合が増えます。そのため、通常の入力単価だけを見ても、実際の請求額までは比べきれません。
V4.1 Flashは本当に旧Proを全面的に超えたのか
コーディングやAIエージェントでは強い一方、難しい知識推論では旧Proを下回る項目があります。「全面的に超えた」といっても、すべてのテストで勝っているわけではありません。
| 評価項目 | V4.1 Flash | 旧V4 Pro | 差 |
|---|---|---|---|
| GPQA Diamond | 90.9 | 92.4 | -1.5ポイント |
| HLE・文章のみ | 39.1 | 42.7 | -3.6ポイント |
| Codeforces | 3471 | 3348 | +123 |
| Terminal-Bench 2.1 | 90.6 | 87.9 | +2.7ポイント |
| DeepSWE v1.1 | 74.2 | 62.7 | +11.5ポイント |
| CyberGym | 88.1 | 83.3 | +4.8ポイント |
GPQA Diamondは大学院レベルの科学問題です。HLEは、現在のAIでも解くのが難しい幅広い問題を集めた評価です。
実際のソフト修正に近いDeepSWEでは、大幅に成績が伸びています。旧Proの終了を決めた背景には、エージェント用途を重視する判断があったと読み取れます。
なお、この比較値はDeepSeekが公開した評価結果です。第三者が同じ条件で再現した独立評価ではありません。
Opus 5・GPT-5.6 Sol・中国勢との比較
V4.1 Flashは一部の実務系テストで競合の上位モデルに並びますが、総合的にすべてを上回っているわけではありません。用途によって順位は大きく変わります。
| 評価項目 | V4.1 Flash | Opus 5 | GPT-5.6 Sol | Kimi K3 | GLM-5.3 |
|---|---|---|---|---|---|
| GPQA Diamond | 90.9 | 93.4 | 94.1 | 92.9 | 88.1 |
| Terminal-Bench 2.1 | 90.6 | 89.1 | 88.8 | 88.3 | 88.2 |
| DeepSWE v1.1 | 74.2 | 74.0 | 73.0 | 67.5 | 66.9 |
| ProgramBench | 20.3 | 37.0 | 23.0 | 17.5 | 19.0 |
| Agent’s Last Exam | 31.8 | 28.6 | 26.7 | 27.6 | 28.5 |
DeepSWEではOpus 5を0.2ポイント上回りました。ただし、ProgramBenchではOpus 5に16.7ポイントの差を付けられています。
同じ公式表の中でも、得意分野と不得意分野がはっきり分かれています。価格が安いことと、すべての仕事で高い精度を出せることは別です。
実行基盤だけで最大8.7ポイント変わる
DeepSWEの成績は、組み合わせるエージェント基盤により65.5~74.2まで動きました。同じモデルでも8.7ポイントの差が出ています。
旧Proに対するV4.1 Flashの差は11.5ポイントです。実行基盤による8.7ポイントの差は、その約76%に相当します。
モデル名を替えるだけで最高成績が出るとは限りません。指示文やツール、試行回数まで含めた全体設計が成績を左右します。
過去のDeepSeekと比べて何が違うか
DeepSeekは2026年4月にV4 ProとFlashを公開し、7月にはFlashがProのプレビュー版を複数評価で上回りました。8月には正式版V4 Proが再び上位に立っています。
旧V4 Proは、当時のFlashより入力が最大9倍、出力が最大14倍高いモデルでした。価格差に見合う性能を売りにした上位版です。
ところが約1カ月後、V4.1 Flashがその役割を置き換えました。上位版と廉価版の序列が、短期間で二度入れ替わったことになります。
今回は、性能を更新しただけではなく、新しい構造も採用しています。画像対応、100万トークン、キャッシュ圧縮を一つのモデルにまとめました。
反証:安さと100万トークンだけでは判断できない
V4.1 Flashを「旧Proより常に高性能」と受け取るのは早計です。公式データを見るだけでも、次の注意点があります。
- GPQA DiamondとHLEでは旧V4 Proを下回る
- 競合に負けるコーディング評価もある
- 評価値は主に開発元が測定したもの
- 100万トークンでの情報検索精度は用途により変わる
- 旧API名への自動転送で回答傾向が変わり得る
- 自社運用には大規模なGPUと保存設備が必要
DeepSeek自身も、大規模展開の例として2000基規模のGPUとストレージ群を挙げています。MIT Licenseだからといって、一般的なPCで簡単に全規模を動かせるわけではありません。
APIを利用する場合は、自前で設備を用意する必要はありません。ただし、機密情報の扱いや応答の安定性、提供地域などは別途確認が必要です。
読者と開発者への影響
一般利用者には高速化と画像対応が利点となり、開発者には費用の低下とモデルの入れ替えが影響します。特に旧Proを使っている場合は、事前の確認が必要です。
一般の利用者
長い資料や複数の画像を使う作業が、安価なモデルでも行いやすくなります。大量の文書整理やコード確認にも使いやすくなりそうです。
ただし、医療、法律、投資などの重要な判断を任せるべきではありません。長い資料を読み込めても、誤った回答をする可能性は残ります。
APIを使う開発者
9月14日までに、旧Pro向けの独自テストをV4.1 Flashで再実行する必要があります。接続できることを確認するだけでは不十分です。
deepseek-v4-proを使う設定場所を洗い出す- JSON出力、ツール呼び出し、文章量を比較する
- 正答率だけでなく処理時間とトークン数も記録する
- 重要な処理には別モデルへの切り替え先を用意する
- モデル名と実際の提供モデルをログに残す
旧名がそのまま動き続けるため、変更に気付きにくい点には注意が必要です。モデル名は固定された製品番号ではなく、転送先を示す別名として扱う必要があります。
企業のAI担当者
費用予測は下方修正できますが、品質を確認する手順は増やす必要があります。単価が下がった分だけ利用量が増えれば、請求総額が下がらないこともあります。
たとえば単価が約74%下がっても、利用量が4倍になると総額はほぼ元に戻ります。安くなったからといって、無制限に使ってよいわけではありません。
本稿独自の分析:Flashは「廉価版」ではなく基盤モデルになる
V4.1 Flashの本当の狙いは、廉価版の強化より、次の大型モデルを支える共通構造の実証にあると考えられます。ここからは、公開資料をもとにした本稿の分析です。
DeepSeekはV4.1 Flashを「新しい構造系列で最小」と表現しました。この説明からは、今後、同じ構造を大きくしたV4.1 Proが登場する可能性も読み取れます。
入力1.45%、出力2.90%という非対称な構成は、AIエージェントと相性がよい設計です。読む量が多く、書く量が比較的少ない処理ほど効果が出ます。
旧Proからの転送には、利用者を新しい構造へまとめる効果もあります。大量の実利用データを得ながら、V4.1 Proが登場するまで製品を一本化できます。
その一方で、利用者は一時的にモデルを選ぶ自由を失います。コスト効率の向上と、選択肢の縮小が同時に起きる変更です。
まとめ
DeepSeek V4.1 Flashは、100万トークン対応よりも、巨大モデルの読み込み費用を削った点が重要です。入力時に動くのは全体の約1.45%にすぎません。
旧V4 Proから移る代表例では、費用が約74%下がります。コーディングやエージェントの評価でも、大きな改善が見られました。
ただし、難しい知識問題では旧Proに負ける項目があります。公式の「全面的に上回る」という説明も、すべてのテストで勝ったという意味ではありません。
旧ProのAPI名は残りますが、内部で動くモデルは9月14日に変わります。開発者は料金表を更新するだけでなく、出力品質も改めて確認する必要があります。
出典・参考資料
仕様と提供方針はDeepSeekの一次情報を優先し、報道と比較しました。価格やモデル構成は今後変わる可能性があります。



コメントを送信