「100万トークン対応」と聞くと、本を何冊も丸ごと読み、その内容をすべて覚えてくれそうに思えます。しかし実際には、大量の資料を一度に渡せるという意味です。正確に処理できる情報量や、回答できる長さを保証する数字ではありません。
コンテキスト長は、AIが回答を作るときに参照できる情報の枠です。長文の比較や、大規模なプログラムの調査に役立ちます。ただし、費用や応答時間、情報の見落としについては別に確認する必要があります。
この記事では、2026年9月21日時点の公式資料を比較します。さらに、文書を何本入れられるのか、料金がどう変わるのかを独自に計算します。
コンテキスト長とは「一度に広げられる作業机」の広さ
コンテキスト長が大きいほど、AIは一度の処理で多くの資料や会話を参照できます。机が広ければ、複数の資料を同時に広げられるのと似ています。ただし、机に置いた資料をすべて正しく読み比べられるとは限りません。
情報量は「トークン」という単位で数えます。トークンとは、文字や単語の一部などに分割された、AIが処理する単位です。単語数や日本語の文字数とは一致しません。
同じ内容でも、英語、日本語、表、プログラムでは必要なトークン数が変わります。Googleが示す「約4文字で1トークン」は、主に英語を考える際の目安です。Googleのトークン解説でも、利用前に実際の入力を数える方法が案内されています。
コンテキスト長は、学習した知識の量や長期記憶の容量を表す数字でもありません。会話が長くなって枠を超えれば、古い部分の整理や削除が必要になります。
主要モデルのコンテキスト長を比較
2026年9月時点では、OpenAI、Anthropic、GoogleのAPIに100万トークン級のモデルがあります。ただし、入力上限と出力上限の表し方は各社で異なります。
| モデル・提供形態 | 公表された長さ | 最大出力 | 比較時の注意 |
|---|---|---|---|
| GPT-5.6 Sol/OpenAI API | コンテキスト枠105万 | 12万8000 | 長い入力では料金区分が変わる |
| Claude Sonnet 5/Claude API | コンテキスト枠100万 | 12万8000 | 会話履歴や回答も枠を使う |
| Gemini 3.8 Flash/Gemini API | 入力上限104万8576 | 6万5536 | 公式表は入力と出力を別々に表示 |
| Claude Haiku 4.5/Claude API | コンテキスト枠20万 | 6万4000 | 同じClaudeでもモデルごとに異なる |
出典はOpenAIのモデル仕様、Anthropicのモデル一覧、Googleのモデル仕様です。ここに示した数値はAPIの仕様であり、一般向けのチャット画面で一度に添付できる量を示しているわけではありません。契約プランや製品側の制限も確認してください。
例えば、最大出力が6万5536トークンのモデルに、100万トークン分の原稿を一度に書かせることはできません。大量の資料を読み込める量と、書き出せる量は分けて考える必要があります。
100万トークンでできることを具体的に試算
資料の比較、矛盾の発見、広い範囲のコード調査が現実的な使い道です。Googleは100万トークンの例として、標準的な80文字のコードを約5万行、平均的な英語の小説を8冊と説明しています。これは英語やコードを使った目安であり、日本語の本を8冊入れられると保証する数字ではありません。詳しくはGoogleの長文入力ガイドを参照してください。
日本語の実務では、使う資料をあらかじめトークン数で測るほうが確実です。以下は実測値ではなく、1件2万トークンの資料を使う場合の計画例です。
| 使う枠 | 仮定した量 | 用途 |
|---|---|---|
| 資料 | 80万 | 2万トークンの資料40件 |
| 指示・前提 | 5万 | 比較条件、用語、出典の指示 |
| 会話履歴・追加質問 | 10万 | やり取りの継続分 |
| 回答用に空ける枠 | 5万 | 表、説明、根拠の書き出し |
| 合計 | 100万 | 計画用の配分 |
計算は「100万-5万-10万-5万=80万」です。80万÷2万なので、資料は40件入ります。実際の上限は、モデルや内部処理、利用する機能によって異なります。この配分は保証値ではなく、余白を残して使うための編集上の目安です。
例えば、製品マニュアル40件を横断して、条件に合う記述を探す作業に使えます。複数年の規約改定を比較し、変更箇所を一覧にする用途にも向いています。画像、音声、動画を含める場合もトークンを消費するため、同じ件数を入れられるとは限りません。
会話を続けると、なぜ枠が早く埋まるのか
同じ資料を参照しながら質問を重ねると、会話履歴も枠に加わります。100万トークン分の資料を最初に入れたからといって、その後も同じだけ自由に使えるわけではありません。
仮に資料が60万トークンで、1往復ごとに質問と回答が合計1万トークン増えるとします。10往復後には、履歴を含めて約70万トークンになります。さらに余白を確保しておかなければ、新しい資料や長い回答を追加しにくくなります。
実際のアプリには、過去の会話を自動で短くまとめるものもあります。その場合、会話を続けられたとしても、初期の細かい内容が全文のまま残っているとは限りません。Anthropicの説明でも、履歴、指示、資料、回答が枠を使うと明記されています。
長く入れば、長い資料を正確に理解できるのか
100万トークンを受け付けることと、100万トークンの内容を漏れなく理解することは別です。Google自身も、一つの情報を探す試験と、複数の情報を同時に探す試験では精度が異なると説明しています。
長文処理の弱点は以前から研究されています。2023年の「Lost in the Middle」では、重要な情報が文章の中央にあると成績が落ちる場合があることを示しました。2024年の「RULER」も、単純に一つの情報を探す試験だけでは、長文処理の実力を十分に測れないと指摘しています。
ただし、これらの研究結果を2026年のすべてのモデルにそのまま当てはめることもできません。OpenAIは過去のGPT-4.1について、100万トークン内の単純な情報検索で高い精度を示したと公表しています。OpenAIの発表とGoogleの注意点を合わせると、実際に使う作業ごとに精度を確かめるのが現実的です。
一つの番号を探す試験に通ったとしても、「全契約の例外を集める」「古い規約と新しい規約の食い違いを説明する」といった作業まで正確にこなせるとは限りません。長い資料を使うときは、回答に資料名と該当箇所を添えてもらい、人が原文と照合してください。
独自試算:入力が5万トークン増えただけで料金はどう変わる?
コンテキスト長を使い切る前に、料金の境目によって費用が大きく変わる場合があります。OpenAIのGPT-5.6 Solでは、入力が27万2000トークンを超えると、そのリクエスト全体の入力単価が2倍、出力単価が1.5倍になります。公式料金表に基づく計算です。
| 入力・出力の仮定 | 入力分 | 出力分 | 合計 |
|---|---|---|---|
| 入力25万、出力5000トークン | 25万÷100万×4ドル=1.00ドル | 5000÷100万×20ドル=0.10ドル | 1.10ドル |
| 入力30万、出力5000トークン | 30万÷100万×8ドル=2.40ドル | 5000÷100万×30ドル=0.15ドル | 2.55ドル |
入力は1.2倍に増えただけですが、合計料金は約2.32倍になります。これは2026年9月21日時点の通常API単価を使った、キャッシュなしの試算です。税、為替、追加のツール料金は含めていません。料金や条件は変わるため、利用直前に公式表を確認してください。
だからといって、常に資料を削ればよいわけではありません。重要な一文を削れば、料金は下がっても誤った判断につながるおそれがあります。まずは重複した資料や古い版、関係のない添付ファイルを除くほうが安全です。
全文投入と検索型AIは、どちらがよい?
資料同士の関係を広く調べるなら全文投入が便利です。決まった情報を繰り返し探すなら、検索型が有力です。検索型とは、質問に関連する部分だけを探してAIに渡す方法で、「RAG」とも呼ばれます。
| 方法 | 向いている作業 | 弱点 |
|---|---|---|
| 長いコンテキストへ全文投入 | 数十件の資料を横断して比較 | 不要な部分も読み、費用や待ち時間が増える |
| 検索して一部だけ渡す | 大量の資料から決まった事実を何度も探す | 検索で拾えなかった資料は回答に使えない |
| 検索後に重要資料をまとめて渡す | 候補を絞ってから改定や矛盾を比較 | 検索と資料整理の工程が必要 |
Googleも、長いコンテキストがあれば検索の工夫が不要になるとは説明していません。公式ガイドでは、用途によって検索や要約が今も有効だとしています。資料が毎月増えていく場合は、全文を毎回送る運用にどれだけ費用がかかるかも確認しておきましょう。
独自の確認法:中央の情報と「ない情報」を試す
自分の資料を使って、拾える情報と拾えない情報の両方を試すと、モデルを選びやすくなります。公表された最大値だけで比べるより、自分の仕事でどこまで正しく答えられるかを確かめるほうが実用的です。
- 資料の冒頭、中央、末尾に、答えが分かっている質問を各2問ずつ作る。
- 資料を2件以上またぐ質問を2問作る。
- 資料内に答えが存在しない質問を2問作る。
- 各回答に資料名と該当箇所を求め、人が原文で照合する。
計10問のうち、正しい根拠を示せた件数を記録します。資料を半分にした場合や、検索型で必要な部分だけを渡した場合とも比較します。答えが存在しない質問に対して、正しく「ない」と答えられるかも採点してください。もっともらしい誤答を見つけるのに役立ちます。
この10問は、公開ベンチマークの代わりになるものではありません。編集部が自分たちの用途を試すための、小規模な確認手順です。回答が実際の業務に影響する場合は、この試験に合格しても最終確認を人が行います。
読者は何を基準にモデルを選べばよい?
最初に必要な資料の量を調べ、そのうえで正答率、料金、待ち時間を比べてください。長いコンテキストに対応したモデルを選ぶ前に、対象の文書を各社のトークン計測機能で測ります。PDFのページ数やファイル容量だけでは判断できません。
個人が1本の記事や数件の資料を読む程度なら、100万トークンを使い切る場面はほとんどありません。多くの資料を何度も照合する作業では、長文対応の利点が出てきます。APIの仕様と、普段使うチャット製品の上限は分けて確認してください。
コード全体を調べる場合は、関連ファイルを広く渡せます。ただし、テスト結果や更新履歴まで含めると、どの資料を優先するかが重要になります。誤ったコード変更を防ぐには、根拠となるファイル名と行を示させたうえで、実際にテストして確かめます。
まとめ:100万トークンは容量であり、正確さの保証ではない
100万トークン級のモデルは、大量の資料を一度に比較できる範囲を広げます。その一方で、回答の最大長、長文中の見落とし、利用料金には別の制約があります。
まず実際に使う資料のトークン数を測り、回答用の余白を残しましょう。そのうえで、資料の中央にある情報や、複数資料にまたがる質問を使って精度を確かめます。必要な部分だけを検索して渡す方法とも比較すると、自分の用途に合った使い方を判断しやすくなります。
関連ページ
- 生成AIの学習と推論の違いとは?必要なGPU・電力・コストまで解説:長い入力が推論の負荷にどう関わるか。
- AIエージェントとは?生成AIとの違い・仕組み・できることを初心者向けに解説:会話履歴や外部ツールを使う仕組み。
- AIデータセンターとは?GPU・CPU・HBM・ネットワークの仕組みを図解:長文処理を支える計算設備。



コメントを送信