Agents APIは「AIモデル」そのものではなく、AIに長時間の仕事を任せるための仕組み一式を外部に開くサービスです。
OpenAIは2026年9月10日、「Agents API」のパブリックベータを公開しました。ChatGPTやCodexで使われている実行基盤を、開発者が1回のAPI呼び出しから利用できます。
大きな違いは、単にAIへの質問機能が増えたことではありません。計画、道具の利用、作業の保存、複数AIへの分担まで、OpenAI側がまとめて運用します。
ただし、「追加のAPI利用料なし」は「無料」という意味ではありません。モデルのトークン料、Web検索料、実行環境の料金は別に発生します。
この記事の要点
- Agents APIは、Codexを支える「エージェント・ハーネス」をAPI化したもの。
- 数日規模の処理、複数AIの分担、作業再開を標準で扱える。
- 実行環境はOpenAI、自社基盤、外部事業者から選べる。
- 独自試算では、同じ処理でもモデル選びで総額が約8.5倍変わる。
- 競合のAnthropicも、近い仕組みをすでにベータ提供している。
Agents APIとは何か――「賢い頭脳」ではなく「仕事場」を貸す
Agents APIの本質は、AIの頭脳に加えて、道具や作業環境、進捗管理まで一つにまとめた点にあります。
従来のAPIは、モデルに質問し、回答を受け取る使い方が中心でした。長時間の仕事を任せるには、開発者が周辺の仕組みまで用意する必要がありました。
たとえば、会話の保存、ファイル管理、コード実行、失敗時の再開といった仕組みです。複数のAIに仕事を分ける制御も、開発側で用意しなければなりませんでした。
Agents APIでは、こうした周辺機能をOpenAIの管理サービスとして利用できます。OpenAIはこれを「Codexと同じハーネスと基盤」と説明しています。
ハーネスとは、AIを実際に働かせるための制御部分です。車に例えると、モデルがエンジンで、ハーネスは運転手とナビに当たります。
| 選択肢 | 主な役割 | 進捗の保存 | 運用の負担 | 向く用途 |
|---|---|---|---|---|
| Agents API | OpenAIがエージェントを管理 | 標準で保存 | 低い | 長時間・非同期の仕事 |
| Agents SDK | 自社アプリ内で制御 | 開発者が保存 | 中程度 | 細かく作り込みたい業務 |
| Responses API | モデルと道具を直接呼ぶ | 開発者が設計 | 高い | 短い処理や独自構成 |
この3つは、単純な新旧関係ではありません。手軽さを取るか、細かな制御を取るかで選択が変わります。
何ができるのか――長い仕事を止めずに進める5つの機能
大きな変化は、数分で終わる応答ではなく、数時間から数日続く仕事を前提にしたことです。
1.途中経過を保存し、あとから再開できる
セッションに指示、履歴、生成物を残せるため、作業を最初からやり直す場面を減らせます。
長い仕事では、AIが読んだ資料や作ったファイルが増えます。Agents APIは、それらを一つのセッションとして管理します。
会話が長くなりすぎると、自動で短く整理されます。この処理は「コンパクション」と呼ばれ、文脈の上限超えを防ぎます。
2.複数のAIへ仕事を分担できる
親役のAIが子役のAIを呼び、調査や実装を並行して進められます。
たとえば、1体が競合を調べ、別の1体がコードを確認できます。親役はそれぞれの結果を集め、最終的な判断につなげます。
OpenAIの公開例では、並列に動かす子エージェント数も設定できます。ただし、並列に動かすほど利用量も増えます。
3.コード実行やWeb検索を組み込める
AIは答えを書く前に、検索、ファイル操作、コマンド実行を行えます。
標準機能にはWeb検索やMCP、独自関数の呼び出しがあります。MCPは、外部サービスとAIをつなぐ共通の接続方式です。
道具が多い場合でも、必要なものだけを探して読み込めます。すべての説明を最初から渡す必要がないため、トークン消費を抑えやすくなります。
4.実行環境を選べる
OpenAIのサンドボックスだけでなく、自社環境や提携各社の環境も選択できます。
サンドボックスとは、AIが安全にコードを動かす隔離環境です。OpenAI管理版は、PythonやNode.js、各種コマンドを使えます。
公式発表には、Cloudflare、E2B、Vercelなど9社が掲載されました。独自のコンテナや社内ネットワークが必要な場合は、自社運用も選べます。
5.実行状況を追跡できる
親AIと子AIの動き、使った道具、処理量をダッシュボードで確認できます。
何時間も動く処理で問題が起きたとき、原因を追いやすくなります。ただし、ベータ時点では詳細なトレース取得はダッシュボード中心です。
APIが返す利用量はあくまで参考値で、最終的な請求額ではありません。予算管理では、請求画面との照合が欠かせません。
過去事例から見る位置づけ――4段階で「部品」から「完成品」へ
Agents APIは突然登場した製品ではなく、OpenAIが約1年半かけて積み上げてきた流れの第4段階に当たります。
| 時期 | 発表 | 開発者が得たもの | 残った負担 |
|---|---|---|---|
| 2025年3月 | Responses API | モデルと検索などの道具 | 長期運用の設計 |
| 2025年3月 | Agents SDK | 複数AIを組む部品 | 基盤の運用と保存 |
| 2025年5月 | Codex | クラウド上で働く製品 | 他サービスへの組み込み |
| 2026年9月 | Agents API | Codex型の実行基盤 | 業務設計と安全管理 |
Responses APIは、モデルと道具を呼ぶ土台でした。Agents SDKでは、開発者が複数AIの流れを自分で組めるようになりました。
Codexは、その仕組みを完成品として提供した例です。専用のクラウド環境で、複数の開発作業を並行して進めました。
今回のAgents APIは、その完成品を支える仕組みを再利用できる形にしたものです。用途はプログラミングに限らず、調査や資料作成にも広がります。
導入事例の数字を再計算――「改善率」の中身は同じではない
公式事例は有望ですが、評価点、時間、費用、失敗率は性質が異なるため、単純に一つの順位表では比べられません。
OpenAIは、先行利用企業の成果を4例公開しました。ここでは元の数字を100基準に置き換え、それぞれ何が変わったのかを分けて見ます。
| 企業 | 公式発表の結果 | 本稿の独自計算 | 読み方の注意 |
|---|---|---|---|
| Ciridae | 評価値0.71→0.85、待ち時間4分の1 | (0.85−0.71)÷0.71=約19.7%改善 | 評価方法の一般化はできない |
| SafetyKit | 1件当たり費用を60%削減 | 以前を100とすると40 | 元の金額は非公開 |
| Hypha | 失敗応答を86%削減 | 以前を100件とすると14件 | 失敗の定義に依存する |
| Dwelly | 数百体を並列実行 | 倍率は元の構成がなく算出不能 | 品質や総費用は別の指標 |
Ciridaeの「4倍高速」は、処理時間が75%減ったことを示します。一方、SafetyKitの60%は削減率であり、実際の金額そのものではありません。
導入時は、「採用できる成果1件当たりの総額」で比べるのが現実的です。速く大量に作れても、確認作業が増えれば節約になりません。
独自試算①――1回30分の処理はいくらかかる?
同じ仕事でも、選ぶモデルだけで総額は約8.5倍変わる試算になりました。
ここでは、料金の仕組みが分かるように試算します。実際の平均利用量ではなく、比較用の仮定です。
- 1回の処理時間は30分。
- 4GBのOpenAI管理サンドボックスを使う。
- 入力20万、出力3万トークンを消費する。
- Web検索を20回行う。
- キャッシュ、再試行、税、為替は含めない。
| 費目 | GPT-6 Astra | GPT-5.6 Luna |
|---|---|---|
| 入力20万トークン | 20万÷100万×10ドル=2.00ドル | 20万÷100万×0.20ドル=0.04ドル |
| 出力3万トークン | 3万÷100万×50ドル=1.50ドル | 3万÷100万×1.20ドル=0.036ドル |
| Web検索20回 | 0.20ドル | 0.20ドル |
| 4GB環境を30分 | 0.18ドル | 0.18ドル |
| 1回の合計 | 3.88ドル | 0.456ドル |
| 月1,000回 | 3,880ドル | 456ドル |
3.88÷0.456は約8.5です。月1,000回なら、差は3,424ドルになります。
もちろん、Lunaで同じ品質や成功率が得られるとは限りません。安いモデルで再試行が増えれば、差は小さくなります。
逆に、簡単な分類までAstraへ任せると割高です。仕事を小分けにし、難しい判断だけ高性能モデルへ任せる設計の方が効率的です。
独自試算②――並列化は「時間を買う」仕組み
子エージェントを増やせば無料で処理能力が増えるわけではありません。利用量と引き換えに、待ち時間を縮める仕組みです。
親1体と子3体が、同じ量のトークンを使うと仮定します。Astraのトークン料3.50ドルは、単純計算で14ドルになります。
一方、4つの仕事が完全に並行できれば、理論上の待ち時間は4分の1です。先行利用のCiridaeも、待ち時間を4分の1にしたと報告しました。
| 構成 | トークン料の単純例 | 理論上の時間 | 向く仕事 |
|---|---|---|---|
| 1体で順番に処理 | 3.50ドル | 1 | 前後関係が強い仕事 |
| 親1体+子3体 | 最大14ドルの単純例 | 最短で約4分の1 | 独立した調査や検証 |
実際には、親役による整理や重複した調査も発生します。費用も時間も、きれいに4倍、4分の1にはなりません。
それでも、障害対応や締め切り直前の調査では役立つ場面があります。Agents APIは、計算量を増やして待ち時間を短縮する選択肢を、標準機能として扱えるようにしたとも考えられます。
競合比較――Anthropic「Managed Agents」と何が違う?
OpenAIが最初ではなく、Anthropicも長時間動く管理型エージェントを提供しています。
AnthropicのManaged Agentsも、非同期の長い処理を扱います。ファイル、コマンド、Web、MCP、文脈の自動整理に対応します。
そのため、「管理型ハーネスのAPI化」自体がOpenAIだけの発明というわけではありません。違いは、公開された中核と実行環境の選択肢にあります。
| 比較点 | OpenAI Agents API | Anthropic Managed Agents |
|---|---|---|
| 提供状況 | パブリックベータ | ベータ |
| 長時間・非同期処理 | 対応 | 対応 |
| 作業状態の保存 | セッションで保存 | セッションで保存 |
| 複数AIの分担 | 標準機能として明記 | サブエージェント機能あり |
| 実行環境 | OpenAI、自社、提携9社 | Anthropic管理、自社など |
| 中核ハーネス | Codex由来でオープンソース | 管理サービスとして提供 |
| 料金の考え方 | 追加API料なし。モデルと道具は別 | モデル、道具、環境の利用に応じる |
| データ上の注意 | 保持期間と環境設定を要確認 | ZDRやHIPAA BAAの対象外 |
OpenAIの強みは、Codexで使われている構成を利用できる点です。ハーネスの中核が公開され、自社環境へ移す道もあります。
Anthropicも、定期実行や状態を保持する処理を管理型サービスとして提供しています。ただし管理型サービスは、ゼロ保持やHIPAA BAAの対象外です。
料金表の数字だけで優劣は決められません。Claudeは世代により同じ文章でもトークン数が変わるため、実ジョブで比べる必要があります。
反証――「革命」ではなく、既存部品の再包装では?
今回の発表は、新しいAI能力の発明というより、実績のある運用機能を一つのサービスにまとめたものです。
Responses APIとAgents SDKを組み合わせれば、以前から似た仕組みは作れました。自社のKubernetesなどで、長期処理を動かす企業もあります。
また、Anthropicは近いManaged Agentsを先に公開しています。この意味で、OpenAIだけの未踏分野とは言えません。
それでも今回の発表には意味があります。仕組みを作ることと、それを何日も安定して動かすことは別の難しさがあるためです。
復旧、保存、文脈整理、複数AIの制御を標準化できれば、試作品から本番への距離は縮まります。OpenAIは、モデル性能だけでなく、運用基盤でも競う段階へ進んだと見られます。
独自分析――便利さの代わりに生まれる3つの新しい課題
Agents APIで減らせるのは基盤作りの手間です。業務上の責任や安全確認までなくなるわけではありません。
課題1.「計算環境の移動」と「サービスからの移行」は別
サンドボックスを選べても、セッション設計や動作はAgents APIへ依存します。
OpenAI管理版から自社環境へ変えられるのは利点です。しかし、保存した状態やイベント形式まで他社APIへ移せるとは限りません。
計算する場所は変えやすくても、制御部分ではAgents APIへの依存が残ります。重要業務では、成果物を標準形式で外部保存すべきです。
課題2.自動要約は「完全な記憶」ではない
長い文脈を短くする処理では、細かな条件が落ちる可能性があります。
コンパクションは長時間処理を続けるうえで必要です。ただし、何を残すかにはシステム側の判断が入ります。
契約条件や数値などは、会話だけに置かない方が安全です。チェックポイント用のファイルへ明示して残す必要があります。
課題3.基盤の更新が結果を変える
管理されたハーネスは便利ですが、更新により同じ指示の結果が変わる可能性があります。
OpenAIは、ハーネスを継続改善し、版を指定できると説明しています。保守の手間を減らせる反面、更新によって動作が変わる可能性もあります。
本番では版を固定し、更新前に自社の評価問題を再実行すべきです。モデルだけでなく、ハーネスも評価対象になります。
安全性――初期設定のまま外部接続させない
OpenAI管理サンドボックスでは外向き通信が標準で有効です。業務で使うなら、接続先を必要な範囲に絞る設計が欠かせません。
公式資料では、通信を無効化するか、許可したホストだけに制限できます。許可リストは1件から100件まで設定できます。
OpenAIのAPIキーは、サンドボックス内へ入れないよう案内されています。外部サービスの認証情報を使う場合も、権限と有効期限は必要最小限に抑えるべきです。
管理版の環境は、操作が止まってから約1時間で削除される場合があります。残したい成果物は、専用の出力領域へ保存する必要があります。
メール送信、購入、削除などの操作には、人の承認を挟むべきです。処理時間が長くなるほど、1回の誤判断による影響も広がりやすくなります。
導入前の最低チェック
- 外部通信を無効、または必要な接続先だけにする。
- APIキーや個人情報を作業環境へ直接置かない。
- 削除、送信、支払いには人の承認を入れる。
- 成果物と根拠を、会話とは別の場所へ保存する。
- 時間、費用、成功率を1件単位で記録する。
読者への影響――何が変わり、誰が得をするのか
利用者自身がAPIを触らなくても、調査や事務作業を代行するAIサービスが増える可能性があります。
| 立場 | 期待できる変化 | 注意点 |
|---|---|---|
| 一般利用者 | 途中で止まりにくいAIサービス | 自動操作の範囲を確認する |
| 開発者 | 基盤作りを減らし、機能開発へ集中 | API依存と費用を測る |
| 中小企業 | 専任の基盤チームなしで試しやすい | 個人情報と承認手順を決める |
| 大企業 | 自社環境と管理型機能を組み合わせる | 監査、保持、地域要件を確認する |
特に導入しやすくなるのは、AI基盤を担当する人が少ない組織です。一方、定型処理だけなら従来のAPIの方が安く、単純です。
最初に試すなら、失敗しても元に戻せる業務が向いています。市場調査、テスト作成、社内文書の下書きなどが候補です。
今後の焦点――ベータ版で確認すべき4項目
正式導入を判断するときは、派手なデモよりも、成功率、総費用、復旧時間、監査可能性を見る必要があります。
- 正式版の品質保証:稼働率や障害時の扱いがどう定義されるか。
- 料金の予測しやすさ:子エージェントや再試行を含む総額を抑えられるか。
- 監査機能:詳細な実行履歴をAPIから取得できるようになるか。
- 版の更新管理:古いハーネスをいつまで固定できるか。
企業は、1回の成功例だけで判断すべきではありません。失敗したケースも含めて50件から100件ほど試し、採用できる成果1件当たりの単価を測ると判断しやすくなります。
まとめ――Agents APIは「AIを使うAPI」から「AIを雇うAPI」への一歩
Agents APIによって、Codex型の長時間実行を他のサービスにも組み込みやすくなりました。
大きな価値は、新しいモデルではなく、面倒な運用部分をまとめて任せられることにあります。これにより、小さな開発チームでも複雑なAI機能を試しやすくなります。
ただし、追加のAPI利用料がないからといって、総費用まで安いとは限りません。モデル、検索、実行環境、再試行、確認作業まで足して比べる必要があります。
また、OpenAIがこの分野の最初の企業ではありません。今後はモデル性能に加えて、費用を予測しやすいか、安全に運用できるかも競争の軸になりそうです。
関連記事
AIエージェントの能力と安全性を、関連する事例から続けて確認できます。
- OpenAI由来とみられるAIエージェント、外部Wikiを「連絡板」にしたか
- OpenAI Astraとは?初の「Critical」サイバーAIが公開制限される理由
- AIがAIの安全性を改善 Anthropicの「自動研究者」は何を達成したのか
- Claude Fable 5.1・Mythos 5.1発表 価格と安全制限の違い
一次情報・参考資料
製品仕様と料金は更新されるため、導入時は必ず公式ページで再確認してください。
- OpenAI「Introducing the Agents API」(2026年9月10日)
- OpenAI API Docs「Agents」
- OpenAI API Docs「OpenAI-hosted environment」
- OpenAI API Docs「Observability」
- OpenAI API Pricing
- OpenAI「New tools for building agents」(2025年3月11日)
- OpenAI「Introducing Codex」(2025年5月16日)
- Anthropic Docs「Managed Agents overview」
- Anthropic Docs「Pricing」
※記事内の独自試算は、2026年9月11日に確認した公開料金を使った比較例です。実際の請求額、品質、処理時間を保証するものではありません。



コメントを送信