OpenAI「Agents API」とは?Codexの実行基盤をAPIとして開放

Agents APIは「AIモデル」そのものではなく、AIに長時間の仕事を任せるための仕組み一式を外部に開くサービスです。

OpenAIは2026年9月10日、「Agents API」のパブリックベータを公開しました。ChatGPTやCodexで使われている実行基盤を、開発者が1回のAPI呼び出しから利用できます。

大きな違いは、単にAIへの質問機能が増えたことではありません。計画、道具の利用、作業の保存、複数AIへの分担まで、OpenAI側がまとめて運用します。

ただし、「追加のAPI利用料なし」は「無料」という意味ではありません。モデルのトークン料、Web検索料、実行環境の料金は別に発生します。

この記事の要点

  • Agents APIは、Codexを支える「エージェント・ハーネス」をAPI化したもの。
  • 数日規模の処理、複数AIの分担、作業再開を標準で扱える。
  • 実行環境はOpenAI、自社基盤、外部事業者から選べる。
  • 独自試算では、同じ処理でもモデル選びで総額が約8.5倍変わる。
  • 競合のAnthropicも、近い仕組みをすでにベータ提供している。

Agents APIとは何か――「賢い頭脳」ではなく「仕事場」を貸す

Agents APIの本質は、AIの頭脳に加えて、道具や作業環境、進捗管理まで一つにまとめた点にあります。

従来のAPIは、モデルに質問し、回答を受け取る使い方が中心でした。長時間の仕事を任せるには、開発者が周辺の仕組みまで用意する必要がありました。

たとえば、会話の保存、ファイル管理、コード実行、失敗時の再開といった仕組みです。複数のAIに仕事を分ける制御も、開発側で用意しなければなりませんでした。

Agents APIでは、こうした周辺機能をOpenAIの管理サービスとして利用できます。OpenAIはこれを「Codexと同じハーネスと基盤」と説明しています。

ハーネスとは、AIを実際に働かせるための制御部分です。車に例えると、モデルがエンジンで、ハーネスは運転手とナビに当たります。

選択肢主な役割進捗の保存運用の負担向く用途
Agents APIOpenAIがエージェントを管理標準で保存低い長時間・非同期の仕事
Agents SDK自社アプリ内で制御開発者が保存中程度細かく作り込みたい業務
Responses APIモデルと道具を直接呼ぶ開発者が設計高い短い処理や独自構成

この3つは、単純な新旧関係ではありません。手軽さを取るか、細かな制御を取るかで選択が変わります。

何ができるのか――長い仕事を止めずに進める5つの機能

大きな変化は、数分で終わる応答ではなく、数時間から数日続く仕事を前提にしたことです。

1.途中経過を保存し、あとから再開できる

セッションに指示、履歴、生成物を残せるため、作業を最初からやり直す場面を減らせます。

長い仕事では、AIが読んだ資料や作ったファイルが増えます。Agents APIは、それらを一つのセッションとして管理します。

会話が長くなりすぎると、自動で短く整理されます。この処理は「コンパクション」と呼ばれ、文脈の上限超えを防ぎます。

2.複数のAIへ仕事を分担できる

親役のAIが子役のAIを呼び、調査や実装を並行して進められます。

たとえば、1体が競合を調べ、別の1体がコードを確認できます。親役はそれぞれの結果を集め、最終的な判断につなげます。

OpenAIの公開例では、並列に動かす子エージェント数も設定できます。ただし、並列に動かすほど利用量も増えます。

3.コード実行やWeb検索を組み込める

AIは答えを書く前に、検索、ファイル操作、コマンド実行を行えます。

標準機能にはWeb検索やMCP、独自関数の呼び出しがあります。MCPは、外部サービスとAIをつなぐ共通の接続方式です。

道具が多い場合でも、必要なものだけを探して読み込めます。すべての説明を最初から渡す必要がないため、トークン消費を抑えやすくなります。

4.実行環境を選べる

OpenAIのサンドボックスだけでなく、自社環境や提携各社の環境も選択できます。

サンドボックスとは、AIが安全にコードを動かす隔離環境です。OpenAI管理版は、PythonやNode.js、各種コマンドを使えます。

公式発表には、Cloudflare、E2B、Vercelなど9社が掲載されました。独自のコンテナや社内ネットワークが必要な場合は、自社運用も選べます。

5.実行状況を追跡できる

親AIと子AIの動き、使った道具、処理量をダッシュボードで確認できます。

何時間も動く処理で問題が起きたとき、原因を追いやすくなります。ただし、ベータ時点では詳細なトレース取得はダッシュボード中心です。

APIが返す利用量はあくまで参考値で、最終的な請求額ではありません。予算管理では、請求画面との照合が欠かせません。

過去事例から見る位置づけ――4段階で「部品」から「完成品」へ

Agents APIは突然登場した製品ではなく、OpenAIが約1年半かけて積み上げてきた流れの第4段階に当たります。

時期発表開発者が得たもの残った負担
2025年3月Responses APIモデルと検索などの道具長期運用の設計
2025年3月Agents SDK複数AIを組む部品基盤の運用と保存
2025年5月Codexクラウド上で働く製品他サービスへの組み込み
2026年9月Agents APICodex型の実行基盤業務設計と安全管理

Responses APIは、モデルと道具を呼ぶ土台でした。Agents SDKでは、開発者が複数AIの流れを自分で組めるようになりました。

Codexは、その仕組みを完成品として提供した例です。専用のクラウド環境で、複数の開発作業を並行して進めました。

今回のAgents APIは、その完成品を支える仕組みを再利用できる形にしたものです。用途はプログラミングに限らず、調査や資料作成にも広がります。

導入事例の数字を再計算――「改善率」の中身は同じではない

公式事例は有望ですが、評価点、時間、費用、失敗率は性質が異なるため、単純に一つの順位表では比べられません。

OpenAIは、先行利用企業の成果を4例公開しました。ここでは元の数字を100基準に置き換え、それぞれ何が変わったのかを分けて見ます。

企業公式発表の結果本稿の独自計算読み方の注意
Ciridae評価値0.71→0.85、待ち時間4分の1(0.85−0.71)÷0.71=約19.7%改善評価方法の一般化はできない
SafetyKit1件当たり費用を60%削減以前を100とすると40元の金額は非公開
Hypha失敗応答を86%削減以前を100件とすると14件失敗の定義に依存する
Dwelly数百体を並列実行倍率は元の構成がなく算出不能品質や総費用は別の指標

Ciridaeの「4倍高速」は、処理時間が75%減ったことを示します。一方、SafetyKitの60%は削減率であり、実際の金額そのものではありません。

導入時は、「採用できる成果1件当たりの総額」で比べるのが現実的です。速く大量に作れても、確認作業が増えれば節約になりません。

独自試算①――1回30分の処理はいくらかかる?

同じ仕事でも、選ぶモデルだけで総額は約8.5倍変わる試算になりました。

ここでは、料金の仕組みが分かるように試算します。実際の平均利用量ではなく、比較用の仮定です。

  • 1回の処理時間は30分。
  • 4GBのOpenAI管理サンドボックスを使う。
  • 入力20万、出力3万トークンを消費する。
  • Web検索を20回行う。
  • キャッシュ、再試行、税、為替は含めない。
費目GPT-6 AstraGPT-5.6 Luna
入力20万トークン20万÷100万×10ドル=2.00ドル20万÷100万×0.20ドル=0.04ドル
出力3万トークン3万÷100万×50ドル=1.50ドル3万÷100万×1.20ドル=0.036ドル
Web検索20回0.20ドル0.20ドル
4GB環境を30分0.18ドル0.18ドル
1回の合計3.88ドル0.456ドル
月1,000回3,880ドル456ドル

3.88÷0.456は約8.5です。月1,000回なら、差は3,424ドルになります。

もちろん、Lunaで同じ品質や成功率が得られるとは限りません。安いモデルで再試行が増えれば、差は小さくなります。

逆に、簡単な分類までAstraへ任せると割高です。仕事を小分けにし、難しい判断だけ高性能モデルへ任せる設計の方が効率的です。

独自試算②――並列化は「時間を買う」仕組み

子エージェントを増やせば無料で処理能力が増えるわけではありません。利用量と引き換えに、待ち時間を縮める仕組みです。

親1体と子3体が、同じ量のトークンを使うと仮定します。Astraのトークン料3.50ドルは、単純計算で14ドルになります。

一方、4つの仕事が完全に並行できれば、理論上の待ち時間は4分の1です。先行利用のCiridaeも、待ち時間を4分の1にしたと報告しました。

構成トークン料の単純例理論上の時間向く仕事
1体で順番に処理3.50ドル1前後関係が強い仕事
親1体+子3体最大14ドルの単純例最短で約4分の1独立した調査や検証

実際には、親役による整理や重複した調査も発生します。費用も時間も、きれいに4倍、4分の1にはなりません。

それでも、障害対応や締め切り直前の調査では役立つ場面があります。Agents APIは、計算量を増やして待ち時間を短縮する選択肢を、標準機能として扱えるようにしたとも考えられます。

競合比較――Anthropic「Managed Agents」と何が違う?

OpenAIが最初ではなく、Anthropicも長時間動く管理型エージェントを提供しています。

AnthropicのManaged Agentsも、非同期の長い処理を扱います。ファイル、コマンド、Web、MCP、文脈の自動整理に対応します。

そのため、「管理型ハーネスのAPI化」自体がOpenAIだけの発明というわけではありません。違いは、公開された中核と実行環境の選択肢にあります。

比較点OpenAI Agents APIAnthropic Managed Agents
提供状況パブリックベータベータ
長時間・非同期処理対応対応
作業状態の保存セッションで保存セッションで保存
複数AIの分担標準機能として明記サブエージェント機能あり
実行環境OpenAI、自社、提携9社Anthropic管理、自社など
中核ハーネスCodex由来でオープンソース管理サービスとして提供
料金の考え方追加API料なし。モデルと道具は別モデル、道具、環境の利用に応じる
データ上の注意保持期間と環境設定を要確認ZDRやHIPAA BAAの対象外

OpenAIの強みは、Codexで使われている構成を利用できる点です。ハーネスの中核が公開され、自社環境へ移す道もあります。

Anthropicも、定期実行や状態を保持する処理を管理型サービスとして提供しています。ただし管理型サービスは、ゼロ保持やHIPAA BAAの対象外です。

料金表の数字だけで優劣は決められません。Claudeは世代により同じ文章でもトークン数が変わるため、実ジョブで比べる必要があります。

反証――「革命」ではなく、既存部品の再包装では?

今回の発表は、新しいAI能力の発明というより、実績のある運用機能を一つのサービスにまとめたものです。

Responses APIとAgents SDKを組み合わせれば、以前から似た仕組みは作れました。自社のKubernetesなどで、長期処理を動かす企業もあります。

また、Anthropicは近いManaged Agentsを先に公開しています。この意味で、OpenAIだけの未踏分野とは言えません。

それでも今回の発表には意味があります。仕組みを作ることと、それを何日も安定して動かすことは別の難しさがあるためです。

復旧、保存、文脈整理、複数AIの制御を標準化できれば、試作品から本番への距離は縮まります。OpenAIは、モデル性能だけでなく、運用基盤でも競う段階へ進んだと見られます。

独自分析――便利さの代わりに生まれる3つの新しい課題

Agents APIで減らせるのは基盤作りの手間です。業務上の責任や安全確認までなくなるわけではありません。

課題1.「計算環境の移動」と「サービスからの移行」は別

サンドボックスを選べても、セッション設計や動作はAgents APIへ依存します。

OpenAI管理版から自社環境へ変えられるのは利点です。しかし、保存した状態やイベント形式まで他社APIへ移せるとは限りません。

計算する場所は変えやすくても、制御部分ではAgents APIへの依存が残ります。重要業務では、成果物を標準形式で外部保存すべきです。

課題2.自動要約は「完全な記憶」ではない

長い文脈を短くする処理では、細かな条件が落ちる可能性があります。

コンパクションは長時間処理を続けるうえで必要です。ただし、何を残すかにはシステム側の判断が入ります。

契約条件や数値などは、会話だけに置かない方が安全です。チェックポイント用のファイルへ明示して残す必要があります。

課題3.基盤の更新が結果を変える

管理されたハーネスは便利ですが、更新により同じ指示の結果が変わる可能性があります。

OpenAIは、ハーネスを継続改善し、版を指定できると説明しています。保守の手間を減らせる反面、更新によって動作が変わる可能性もあります。

本番では版を固定し、更新前に自社の評価問題を再実行すべきです。モデルだけでなく、ハーネスも評価対象になります。

安全性――初期設定のまま外部接続させない

OpenAI管理サンドボックスでは外向き通信が標準で有効です。業務で使うなら、接続先を必要な範囲に絞る設計が欠かせません。

公式資料では、通信を無効化するか、許可したホストだけに制限できます。許可リストは1件から100件まで設定できます。

OpenAIのAPIキーは、サンドボックス内へ入れないよう案内されています。外部サービスの認証情報を使う場合も、権限と有効期限は必要最小限に抑えるべきです。

管理版の環境は、操作が止まってから約1時間で削除される場合があります。残したい成果物は、専用の出力領域へ保存する必要があります。

メール送信、購入、削除などの操作には、人の承認を挟むべきです。処理時間が長くなるほど、1回の誤判断による影響も広がりやすくなります。

導入前の最低チェック

  • 外部通信を無効、または必要な接続先だけにする。
  • APIキーや個人情報を作業環境へ直接置かない。
  • 削除、送信、支払いには人の承認を入れる。
  • 成果物と根拠を、会話とは別の場所へ保存する。
  • 時間、費用、成功率を1件単位で記録する。

読者への影響――何が変わり、誰が得をするのか

利用者自身がAPIを触らなくても、調査や事務作業を代行するAIサービスが増える可能性があります。

立場期待できる変化注意点
一般利用者途中で止まりにくいAIサービス自動操作の範囲を確認する
開発者基盤作りを減らし、機能開発へ集中API依存と費用を測る
中小企業専任の基盤チームなしで試しやすい個人情報と承認手順を決める
大企業自社環境と管理型機能を組み合わせる監査、保持、地域要件を確認する

特に導入しやすくなるのは、AI基盤を担当する人が少ない組織です。一方、定型処理だけなら従来のAPIの方が安く、単純です。

最初に試すなら、失敗しても元に戻せる業務が向いています。市場調査、テスト作成、社内文書の下書きなどが候補です。

今後の焦点――ベータ版で確認すべき4項目

正式導入を判断するときは、派手なデモよりも、成功率、総費用、復旧時間、監査可能性を見る必要があります。

  1. 正式版の品質保証:稼働率や障害時の扱いがどう定義されるか。
  2. 料金の予測しやすさ:子エージェントや再試行を含む総額を抑えられるか。
  3. 監査機能:詳細な実行履歴をAPIから取得できるようになるか。
  4. 版の更新管理:古いハーネスをいつまで固定できるか。

企業は、1回の成功例だけで判断すべきではありません。失敗したケースも含めて50件から100件ほど試し、採用できる成果1件当たりの単価を測ると判断しやすくなります。

まとめ――Agents APIは「AIを使うAPI」から「AIを雇うAPI」への一歩

Agents APIによって、Codex型の長時間実行を他のサービスにも組み込みやすくなりました。

大きな価値は、新しいモデルではなく、面倒な運用部分をまとめて任せられることにあります。これにより、小さな開発チームでも複雑なAI機能を試しやすくなります。

ただし、追加のAPI利用料がないからといって、総費用まで安いとは限りません。モデル、検索、実行環境、再試行、確認作業まで足して比べる必要があります。

また、OpenAIがこの分野の最初の企業ではありません。今後はモデル性能に加えて、費用を予測しやすいか、安全に運用できるかも競争の軸になりそうです。

関連記事

AIエージェントの能力と安全性を、関連する事例から続けて確認できます。

一次情報・参考資料

製品仕様と料金は更新されるため、導入時は必ず公式ページで再確認してください。

※記事内の独自試算は、2026年9月11日に確認した公開料金を使った比較例です。実際の請求額、品質、処理時間を保証するものではありません。

コメントを送信

You May Have Missed