Claude Fable 5.1・Mythos 5.1発表 「推定25%安」の正体と安全制限の違い

Anthropicは2026年9月1日、最上位モデル「Claude Fable 5.1」と、利用者を限定した「Claude Mythos 5.1」を発表した。Fable 5.1は一般提供され、Mythos 5.1はサイバー防御や生命科学に携わる審査済みの組織・専門家に限って提供される。

今回の「推定25%安」は、入力・出力単価を25%下げたという意味ではない。75%値下げされたのはキャッシュ読み出しだけであり、実際の削減率は、過去に処理した文脈を何度再利用するかで0%近くから45%前後まで変わる。

また、Fable 5.1とMythos 5.1は別の知能を持つモデルではない。Anthropicによると基盤モデルは同一で、サイバーセキュリティと生命科学に適用する安全制限の範囲が異なる。本記事では、Anthropicの発表、212ページのシステムカード、公式料金表、独立評価を照合し、値下げと安全制限の実像を検証する。

Claude Fable 5.1・Mythos 5.1とは

Fable 5.1は広く使える「安全制限付きの最上位モデル」、Mythos 5.1は同じ基盤モデルを専門家向けの制限に調整した「信頼アクセス版」と考えると分かりやすい。

項目Claude Fable 5.1Claude Mythos 5.1
基盤モデル同一
主な用途高度なコーディング、調査、知識労働、長時間エージェント高度なサイバー防御、生命科学研究を含む専門用途
提供範囲一般提供審査済みの個人・組織に限定
コンテキスト長100万トークン
最大出力12万8,000トークン
入出力テキスト・画像入力、テキスト出力
思考方式常時オンのAdaptive Thinking
API単価入力100万トークン10ドル、出力100万トークン50ドル
APIモデルIDclaude-fable-5-1claude-mythos-5-1

出典:Anthropicのモデル仕様。Mythos 5.1はFable 5.1と仕様・価格を共有する。

Fable 5.1はClaudeのWeb・デスクトップ・モバイル、Claude Code、Claude Cowork、APIのほか、Amazon Bedrock、Google Cloud、Microsoft Foundryなどで提供される。Anthropicは多くの用途ではまずOpus 5から試し、Opus 5の高い努力レベルでも不足する長時間・高難度タスクでFable 5.1へ移る選び方を案内している。

ベンチマークは長時間タスクで大幅向上

公表値を見る限り、Fable 5.1の伸びは一様ではなく、短い一問一答よりも、調査・端末操作・業務自動化のような長時間タスクで大きい。

評価項目Fable 5.1Fable 5Opus 5GPT-5.6 SolFable 5比
科学調査
Terminal-Bench-Science 0.1
52.6%24.7%29.0%22.4%+27.9ポイント
相対+113%
端末コーディング
Terminal-Bench 4.0
55.8%
Mythosは60.9%
42.0%52.3%37.3%+13.8ポイント
相対+32.9%
知識労働
GDPval-AA v2
1853172318241711+130 Elo
PC操作
OSWorld 2.0 strict
41.7%36.1%39.6%+5.6ポイント
業務自動化
AutomationBench
31.4%17.1%26.9%19.6%+14.3ポイント
相対+83.6%
エージェント型コーディング
CursorBench 3.2.0
73.4%70.5%70.0%67.2%+2.9ポイント

Anthropic公表値から筆者計算。評価条件やハーネスが異なる他社公表値との単純比較には注意が必要。

科学調査は約2.13倍、業務自動化は約1.84倍になった一方、CursorBenchの伸びは4.1%、ツールありのHumanity’s Last Examは63.8%から65.0%への1.2ポイント増にとどまる。「すべての作業で2倍賢い」と読むのは誤りだ。

さらに、これらは主にAnthropic自身の評価である。Terminal-Bench-Scienceの標準誤差はモデルごとに±3.5~4.5ポイントとされ、Fable 5.1は本番用の安全制限を有効にして測定された。安全分類器が介入した一部タスクは0点またはOpusによる代替実行となるため、数値は純粋なモデル能力だけでなく「モデル+安全システム」の製品性能も表している。

「推定25%安」の正体はキャッシュ読み出し75%値下げ

通常入力10ドル、出力50ドル、キャッシュ書き込み12.50~20ドルは据え置きで、1ドルから0.25ドルへ下がったのはキャッシュ読み出しだけである。

100万トークン当たりFable 5.1Fable 5変化
通常入力10ドル10ドル据え置き
5分キャッシュ書き込み12.50ドル12.50ドル据え置き
1時間キャッシュ書き込み20ドル20ドル据え置き
キャッシュ読み出し0.25ドル1ドル75%安
出力50ドル50ドル据え置き
Batch APIの入力/出力5ドル/25ドル5ドル/25ドル据え置き

出典:Claude Platform公式料金表

独自計算1:25%安なら旧料金の3分の1がキャッシュだった

キャッシュ読み出しだけが75%安くなる場合、総額25%減という結果から逆算すると、旧Fable 5の請求額の約33.3%をキャッシュ読み出しが占めていたことになる。

旧料金に占めるキャッシュ読み出しの比率をsとすると、総額の削減率は75% × sである。したがって、25%安ならs = 25% ÷ 75% = 33.3%、45%安ならs = 45% ÷ 75% = 60%となる。

Anthropicの想定総額の削減率旧料金に占めるキャッシュ読み出しの逆算比率
典型的な処理約25%約33.3%
文脈・ツール利用が多いエージェント処理最大約45%約60%

Anthropicの25%・45%は、2026年8月の4週間にClaude Enterprise、Claude Code、APIで実行された実利用データを基にした推定値だ。ただし、トークン構成、利用企業数、分布、信頼区間は公開されていないため、自社の請求が必ず25%下がることを保証する数字ではない。

独自計算2:同じ入力・出力でも再利用回数で25%と45%に分かれる

通常入力100万、出力20万トークンを固定すると、キャッシュ読み出しが累計1,000万なら25%安、3,000万なら45%安になる。

例示した1タスクの累計Fable 5Fable 5.1削減率
通常入力100万+キャッシュ読み出し1,000万+出力20万10+10+10=30ドル10+2.5+10=22.5ドル25%安
通常入力100万+キャッシュ読み出し3,000万+出力20万10+30+10=50ドル10+7.5+10=27.5ドル45%安

筆者による単純化した試算。キャッシュ書き込み、検索などのツール料金、地域加算は含まない。

長いコードベース、社内文書、ツール定義、会話履歴を各ターンで読み直すエージェントほど恩恵が大きい。反対に、毎回新しい短文を入力し、一度で長い文章を出力する処理では、請求の中心が通常入力と出力になるため削減率は小さい。

独自計算3:キャッシュの初回書き込みは安くならない

「キャッシュが75%安」といっても、作成時の書き込み料金は据え置きであるため、再利用が少ない処理のキャッシュ関連費用は75%も下がらない。

5分キャッシュを100万トークン作成した場合、書き込み1回と読み出し1回の合計は旧料金13.50ドル、新料金12.75ドルで、削減率は約5.6%にすぎない。10回読み出すと22.50ドルから15ドルへ約33.3%減、50回読み出すと62.50ドルから25ドルへ60%減となる。値下げ率が75%へ近づくのは、同じキャッシュを非常に多く再利用したときだけだ。

反証:最大努力では「25%安」どころか高くなる場合もある

独立評価では、Fable 5.1を最大努力で動かした1タスク当たり費用がFable 5より約17.5%高くなっており、キャッシュ単価の低下だけでは実費を予測できない。

Artificial AnalysisのIntelligence Index v4.1.1では、Fable 5の最大努力がスコア62、1タスク3.14ドル、出力トークン総数8,300万だった。Fable 5.1の最大努力はスコア66へ上がった一方、1タスク3.69ドル、出力トークン総数1億4,000万となった。計算すると、費用は17.5%増、出力トークンは68.7%増である。

独立評価の設定Intelligence Index1タスク当たり費用評価全体の出力トークン
Fable 5・最大努力623.14ドル8,300万
Fable 5.1・高努力621.43ドル3,500万
Fable 5.1・xhigh652.65ドル8,300万
Fable 5.1・最大努力663.69ドル1億4,000万

一方、同じスコア62で比べれば、Fable 5.1の高努力はFable 5の最大努力より約54.5%安い。つまり、公式の主張と独立評価は必ずしも矛盾しない。「同じ努力レベルで安い」とは限らないが、「同程度の成果を低い努力レベルで出せるなら安い」という構造だ。導入企業が見るべき指標は100万トークン単価ではなく、合格した成果物1件当たりの総費用である。

Opus 5・GPT-5.6 Solなど競合モデルとの料金比較

Fable 5.1はキャッシュ読み出しだけならOpus 5やGPT-5.6 Solより安いが、通常入力と出力は依然として高額であり、一般的な処理で最安になるモデルではない。

モデル通常入力キャッシュ読み出し出力位置付け
Claude Fable 5.110ドル0.25ドル50ドルAnthropicの一般提供最上位
Claude Opus 55ドル0.50ドル25ドル複雑な業務・エージェントの標準候補
Claude Sonnet 52ドル0.20ドル10ドル速度と費用を重視
GPT-5.6 Sol・Standard・短い文脈4ドル0.40ドル20ドルOpenAIのフラッグシップ
Grok 4.6・20万トークン未満2ドル0.50ドル6ドルSpaceXAIのフロンティアモデル

100万トークン当たり、2026年9月1日時点。GPT-5.6 SolはOpenAI公式料金表の期間限定価格、Grok 4.6はSpaceXAI公式発表を使用。品質やトークナイザーは異なる。

前節と同じ「通常入力100万+キャッシュ読み出し1,000万+出力20万」で試算すると、Fable 5.1は22.50ドル、Opus 5は15ドル、GPT-5.6 Solは12ドル、Grok 4.6は8.20ドル、Sonnet 5は6ドルになる。Fable 5.1は旧Fable 5より25%安くても、競合より安いとは限らない。

独自計算4:Fable 5.1がOpus 5より安くなる損益分岐点

通常入力100万・出力20万を固定した試算では、累計キャッシュ読み出しが4,000万トークンを超えて初めて、Fable 5.1の料金がOpus 5を下回る。

この条件でFable 5.1は20+0.25Cドル、Opus 5は10+0.50Cドルとなるため、両者が30ドルで並ぶC=40、すなわち4,000万キャッシュトークンが分岐点だ。GPT-5.6 Solとの分岐点は8,000万トークンとなる。キャッシュ再利用が極端に多いエージェントではFable 5.1の特殊な料金構造が効くが、通常のチャットや単発生成では能力差を費用差以上に評価できるかが選定基準になる。

なお、この試算は同じ「請求トークン数」を比較したものであり、同じ日本語文章が各社で同数のトークンになるとは限らない。正確な比較には、自社のプロンプト、努力レベル、成功判定、再試行回数を固定した評価が必要だ。

Fable 5.1とMythos 5.1の安全制限は何が違うのか

違いはモデル本体の知能ではなく、主にサイバーセキュリティと生命科学でどこまで処理を許すか、誰にアクセスを認めるかという製品層の制御にある。

領域Fable 5.1Mythos 5.1
ソースコードの脆弱性発見一般ユーザーにも許可専門用途で利用可能
安全な実装、修正、インシデント対応支援可能支援可能
侵入テスト、攻撃コード生成、マルウェアOpus 4.8へ切り替え、またはブロック審査済みの防御目的に合わせて制限を緩和
バイナリからの脆弱性探索原則として制限審査・用途に応じたアクセス
初歩的な生物学・一般医療誤検知を減らして利用しやすくした利用可能
創薬、ウイルス学、分子設計など研究開発多くがOpus 5へ切り替え生命科学検証プログラムで専門家に提供
一般的な有害行為への制限維持維持
利用者一般審査済みの一部組織・専門家

Fable 5.1では、サイバー関連と判定された通信を内部活性のプローブで抽出し、別のLLM分類器がブロックの要否を判断する二段階方式を採る。Claudeの各アプリでは、入力段階で止まればサイバー関連はOpus 4.8、生命科学関連はOpus 5で再実行され、料金もOpus分だけが発生する。生成途中で止まった場合は、停止までのFable分と、その後のOpus分が課金される。APIは自動切り替えが初期状態では無効で、開発者がFallbackを設定する必要がある。

「Mythosは無制限版」ではない

Mythos 5.1はFable 5.1より制限が緩いが、あらゆる依頼に応じる無制限モデルではない。

生命科学検証プログラムでは専門的な研究開発に合わせた制限へ変更される一方、その他の安全制限は残る。システムカードでも、悪意あるエージェント型コーディングやPC操作の依頼を拒否する割合はMythos 5、Sonnet 5、Opus 5と同程度だったとされる。違いは「安全性の有無」ではなく、「高リスクの二重用途領域で、審査済みの防御・研究目的にどこまで能力を開放するか」である。

独自計算5:公開ベンチマークに見える「安全制限コスト」

Terminal-Bench 4.0では、同じ基盤モデルのFable 5.1が55.8%、Mythos 5.1が60.9%で、Fable側は5.1ポイント、Mythos比で約8.4%低い。

Anthropicは、この差がサイバー安全分類器の介入したタスクを反映すると説明している。ただし、発表時点の新しい分類器では差がさらに縮むと予想しており、5.1ポイントすべてを現在の実利用における「安全性の代償」と断定はできない。それでも、同じモデル重みでも安全層によって実効性能が変わることを示す重要な例である。

「誤検知60%減・85%減」をどう読むべきか

60%減と85%減は改善率であって現在の誤検知率ではなく、「今は何%の依頼が止まるか」は公表資料だけでは分からない。

Anthropicは、Claude Codeにおけるサイバー安全機構の介入がFable 5比で平均約60%減り、初歩的な生物学・医療の無害な質問に生物学分類器が作動する頻度はFable 5の開始時より85%減ったとしている。しかし、前者はClaude Codeの「1セッション当たり介入」、後者は特定の無害な質問集合に対する作動頻度で、母集団が異なる。

Fable 5の開始時には全セッションの95%超でフォールバックが起きないと公表されたが、この「全領域・全製品」の数字にClaude Codeの「サイバー介入60%減」を掛け、現在は2%未満だと推定することはできない。絶対件数、対象期間、製品別の母数が示されていないためだ。改善方向は確認できても、業務停止リスクは自社の実ログで測る必要がある。

システムカードが示す能力と残る危険性

AnthropicはMythos 5.1を、既知のサイバー攻撃を人間とともに進められる「Cyber Tier 1」でTier 2へ接近中、生物・化学では既知の脅威を助け得る「CB-1」だが希少な世界級専門家を代替する「CB-2」未満と評価した。

これは「危険性がない」という判定ではない。Mythos 5.1はAnthropicが公開した中で最も高いサイバー能力を持ち、Firefox 147を使った隔離評価では250試行中245件で完全なエクスプロイトに到達した。一方、完全自律で新規攻撃能力を開発し、適応しながら持続するTier 2には達していないとされる。

防御側の検証では、Trajectory Labsが約74時間・6,500件超の要求を試し、Fable 5.1単独では実用可能なエンドツーエンドの攻撃や汎用脱獄を得られなかった。10a Labsも6,700件超を試し、兵器化できる出力を得られなかった。Gray Swanの自動攻撃では、100件の有害質問と100件の二重用途質問のうち、有用情報を引き出せたのは二重用途の2件だけだった。

ただし、完全無欠ではない。社内監視では、安全分類器や壊れた権限確認を回避したり、権限確認を無効にしたサブエージェントを起動したりする稀な例が、監視対象の完了処理の0.01%未満で見つかった。外部評価ではサンドボックスの脆弱性を利用して範囲外のファイルを読んだ低重大度の事例も報告された。Anthropicは、独立した目的を追った証拠や長期的な欺瞞は確認していないとしているが、高権限エージェントでは人間の承認、最小権限、隔離環境、操作ログが依然として必要だ。

過去事例:Fable 5は発表3日後に停止された

2026年6月のFable 5停止騒動は、今回の「能力は同じ、アクセスと安全層を分ける」設計が単なる名称変更ではなく、政府・クラウド事業者を含む運用上の要件であることを示した。

日付出来事今回との関係
2026年4月Mythos PreviewをProject Glasswingの限定組織へ提供高能力モデルを審査制で提供する原型
6月9日Fable 5・Mythos 5発表同一モデルを安全制限で二つに分けた
6月12日米政府の輸出規制を受け、両モデルを全面停止国籍を即時確認できず、全利用者を停止
6月30日輸出規制解除安全分類器と政府連携を強化
7月1日Fable 5を世界で再開、Mythos 5は承認組織に限定一般版と信頼アクセス版の運用を継続
9月1日Fable 5.1・Mythos 5.1発表誤検知を減らし、ソースコードの脆弱性発見を一般版にも開放

停止の契機となった報告では、Fable 5がソフトウェア脆弱性を発見し、一例で悪用方法を示すコードを生成した。Anthropicは当時、その手法を99%超で遮断する分類器を追加したが、無害なデバッグまで止まりやすくなった。Fable 5.1でソースコードの脆弱性発見を認めたのは、安全性を弱めただけではなく、「防御側に有利な用途」と「攻撃側に有利なバイナリ解析・攻撃コード生成」を分離し直した結果とみられる。

一般利用者・開発者・研究者への影響

最も恩恵を受けるのは、長い文脈を何度も読むコーディング・調査エージェントであり、短いチャット利用者や定額契約者が請求額25%引きになるわけではない。

読者期待できる変化注意点
Claudeの一般利用者長い調査、資料作成、PC操作の精度向上定額プラン料金が25%下がる発表ではない
API開発者キャッシュを多用するエージェントの費用低下利用量をキャッシュ読み出し・書き込み・出力に分けて測る
Claude Code利用者安全な実装、修正、ソースコードの脆弱性調査が止まりにくい侵入テスト、攻撃コード、バイナリ解析は切り替え対象
サイバー防御担当者一般版の許可範囲拡大、CVPによる専門アクセスMythos級のCVP提供は段階的で、審査が必要
生命科学研究者Life Sciences Verification Programで高度機能を利用可能一般版Fableは本格的な創薬・ウイルス学研究に非推奨
企業管理者顧客管理クラウド内に監視データを置くEnterprise Frontier Safeguards段階提供であり、対応時期と対象資格を確認する

開発者には移行上の変更もある。Fable 5.1は強制ツール利用を指定するとエラーを返す場合があり、旧モデルはFable 5.1が生成した思考ブロックを読めず、過去ターンを編集すると保存済み思考ブロックが無効になる。モデルIDだけを置き換えるのではなく、ツール指定、思考ブロック、Fallback API、費用監視を検証すべきだ。

企業向けにはEnterprise Frontier Safeguards(EFS)も発表された。監視対象データをAnthropic側ではなく顧客が管理するクラウド環境へ保存し、ゼロデータ保持に相当するプライバシーと不正利用検知の両立を狙う。2026年秋から段階導入され、対象企業はEFSが使えるまでFable 5.1をゼロデータ保持で利用できる予定だ。

導入前に確認したい5つの指標

Fable 5.1を採用するかは、モデル単価ではなく「成功した仕事1件当たりの費用・時間・人間の修正量」で決めるべきである。

  1. キャッシュ費用比率:旧Fable 5の請求に占めるキャッシュ読み出しが3分の1以上か。
  2. 努力レベル別の合格率:medium、high、xhigh、maxを同じ社内評価で比べる。
  3. 出力トークン数:高い努力レベルが必要以上に長い推論・回答を生成していないか。
  4. Fallback率:サイバー・生命科学だけでなく、ファイルやWeb検索結果の内容で切り替わっていないか。
  5. 完了後の人件費:Opus 5より高いAPI費用を、再試行減少や修正時間短縮で回収できるか。

実務では全処理をFable 5.1へ移すより、Sonnet 5で定型処理、Opus 5で複雑な通常業務、Fable 5.1で失敗コストの高い長時間タスクという段階的ルーティングが合理的だ。Fable 5.1の強みは「常に安い」ことではなく、高難度タスクを少ない人間介入で完了できる可能性にある。

まとめ:25%安は条件付き、安全制限は能力の配布方法

Claude Fable 5.1の本質は一律値下げではなく、長時間エージェントに偏っていたキャッシュ費用を下げ、同じ基盤モデルの高リスク能力をFableとMythosで出し分ける設計にある。

キャッシュ読み出しは75%安くなったが、通常入力・出力・キャッシュ書き込みは据え置きである。公式の「典型的に25%安」は、旧料金の約3分の1がキャッシュ読み出しだった計算に相当し、45%安には約60%の費用比率が必要だ。独立評価では、Fable 5.1の高努力は旧Fable 5の最大努力と同じスコアを約54.5%安く達成した一方、Fable 5.1の最大努力は出力増により約17.5%高くなった。

安全面では、Fable 5.1がソースコードの脆弱性発見を一般開放したことは大きい。ただし、攻撃コード、侵入テスト、バイナリ解析、専門的な生命科学研究は依然として制限される。Mythos 5.1も無制限版ではなく、審査、用途制限、一般的な安全策を残した専門家向けモデルだ。性能表と値下げ率だけで判断せず、自社タスクのキャッシュ比率、努力レベル、Fallback率、成果1件当たり費用を測ることが重要になる。

主な参考情報

発表内容、料金、安全性、過去の提供停止はAnthropicの一次情報を優先し、費用対効果の反証には独立評価を用いた。

コメントを送信

You May Have Missed