AIが、自分より新しいAIを作る仕事にも関わり始めています。
Anthropicは2026年9月17日、Claudeが同社のAI研究開発の26%を「主導」していると発表しました。2月時点では1%未満でした。
ただし、Claudeが人間の手を離れて次のClaudeを完成させたわけではありません。26%とは、人が監督する前提でAIが作業の大半を進めた割合です。
Claudeが人と「協働」する段階まで含めると、90%を超えます。Anthropicでは、AIを使わずに進める研究の方が少なくなっています。
- Claudeが大まかな指示から作業の大半を進める「主導」は26%
- 人の細かな指示を受けて進める「協働」以上は90%超
- 人が関与しない完全自動の研究は、測定範囲では0%
- 約3万体のAIエージェントが研究や開発で同時稼働
- 数値はAnthropicによる自己評価で、第三者検証は今後の課題
この記事では、26%という数字が何を意味するのかを整理します。OpenAIやGoogleの事例とも比べながら、期待できる点と注意すべき点を考えます。
Anthropicが発表した「26%」とは
26%は研究成果への貢献率ではありません。AIが作業の大半を最後まで進める「AL4」に分類された仕事の割合です。
Anthropicは、AI研究の自動化をAL0からAL5までの6段階で評価しました。この尺度はAI研究機関のEpoch AIが提案したものです。
| 段階 | AIの役割 | 人の関わり方 |
|---|---|---|
| AL0 | AIを使わない | 人がすべて進める |
| AL1 | 最低限の利用 | 中心は人 |
| AL2 | 人を補助 | 人が作業を管理する |
| AL3 | 人と協働 | 人が近くで細かく指示する |
| AL4 | AIが主導 | 人は大まかな指示を出して監督する |
| AL5 | 完全自動 | 人が途中で関わらない |
たとえば、夜間のデータ処理で障害が起きた場合を考えてみます。AL3では、人がログを確認し、原因の候補をClaudeに伝えます。
AL4では、人は「直してほしい」と大まかな指示を出します。Claudeが原因の調査から修正、テスト、報告まで進め、最後に人が公開するかどうかを決めます。
AL5になると、Claude自身が障害を見つけ、修正から本番反映まで人を待たずに進めます。
Anthropicによると、今回の測定対象にAL5はありません。見出しの「次のClaudeを開発」はこうした流れを表したもので、完全な自己開発を意味するわけではありません。
「Epoch AIが26%と測定した」は正確ではない
26%を算出したのはAnthropicです。Epoch AIが提供したのは、AL0からAL5までの評価尺度です。
Anthropicは社内記録をもとに、独自の「R&D Automation Index」を作成しました。Epoch AIがAnthropic社内に入り、26%という数字を監査したわけではありません。
第三者が提案した評価方法を使っていても、調査対象の選定から証拠の収集、評価、集計までを行ったのはAnthropicです。
Anthropicは今後、複数の外部評価機関を社内へ受け入れる方針です。ただし、今回の26%は外部監査を受けた数字ではありません。
26%はどのように計算されたのか
単純に仕事の件数を数えた数字ではありません。約1万5,000件の作業を分類し、人が使った時間に応じて重み付けしています。
Anthropicは2026年7月、モデル研究に関わる各部門から毎週20%の社員を無作為に抽出しました。Slackや社内資料をClaudeに調べさせ、約1万5,000件の細かな仕事を集めています。
集めた仕事は542個の項目に整理されました。そのうち378個は「評価基盤の不具合調査」など、最も細かな末端の項目です。
各項目をClaudeが調査し、別のClaudeがAL0からAL5までのどこに当たるかを判定しました。最後に、人がその仕事へ使った時間を重みとして集計しています。
| 工程 | 方法 | 注意点 |
|---|---|---|
| 仕事の抽出 | 各部門の20%を毎週抽出 | Slackと社内資料をClaudeが読む |
| 仕事の整理 | 約1万5,000件を542項目へ分類 | 分類にもClaudeを利用 |
| 自動化の判定 | 別のClaudeがAL0~AL5を付ける | 境界には主観が残る |
| 集計 | 人が使った時間で重み付け | 成果の重要度とは一致しない |
AIと人の判定が完全に一致した割合は59%でした。人同士の完全一致は35%で、1段階以内まで含めると97%です。
人同士でも判断が割れるほど、分類が難しいことが分かります。「協働」と「主導」の境界には、どうしても一定の誤差が残ります。
独自計算1:実態は「26%自動化」より3層に近い
公開値を分けて見ると、完全自動は0%、AI主導は26%、人との協働が中心の仕事は少なくとも64%です。
「協働以上」が90%超で、その中には「主導」の26%も含まれます。単純に差を取れば、AL3に当たる部分は少なくとも64%です。
| 仕事の状態 | 割合 | 読み方 |
|---|---|---|
| 完全自動 | 0% | 人を外して研究する段階ではない |
| AIが主導 | 26% | 大まかな指示から大半を進め、人が監督 |
| AIと人が協働 | 少なくとも64% | 人の細かな指示や判断が必要 |
| 協働未満 | 10%未満 | 人が中心、またはAIを使わない |
Anthropicの研究現場が「AIだけの研究所」になったわけではありません。ほぼ全員がAIと組んで研究し、その一部でAIが主担当を務めるようになった状態です。
自動運転にたとえるなら、26%は無人タクシーの段階ではありません。運転の多くをAIが担っていても、最後の責任者は人に残っています。
独自計算2:半年で26倍超、ただし年末予測には使えない
2月の1%未満から8月の26%へ増えたため、AI主導の比率は半年で少なくとも26倍になりました。
増加幅は25ポイント超です。仮に2月を1%として複利で計算すると、月平均の伸び率は約72%になります。
ただ、この72%をそのまま将来へ当てはめることはできません。割合には100%という上限があり、自動化しにくい難しい研究ほど最後まで残るためです。
Anthropicの図では、現在の傾向が続けば2026年末に80%へ達する可能性も示されています。ただし、確定した予測ではありません。
この指数は2026年7月時点の仕事を基準にしています。AIが既存の作業を引き受ければ、人は新しい研究へ移る可能性があります。
その場合、既存作業の自動化率が上がっても、研究全体から人が消えるとは限りません。表計算ソフトが普及しても、経理で人の判断が不要にならなかったのと同じです。
3万体のAIエージェントは何をしているのか
Anthropicでは2026年8月、最も利用の多い社内基盤だけで約3万体のAIエージェントが同時に研究・開発を進めていました。
AIエージェントは、与えられた目標に向けて道具を使いながら作業を進める仕組みです。質問に答えることが中心のチャットAIとは役割が異なります。
Anthropicのエージェントには、それぞれ識別情報が割り当てられています。どのAIが、いつ、どの資料やコードを作ったのかを追跡できます。
エージェント同士のやり取りも共有記録に残ります。別のAIから受け取った内容をそのまま「事実」とせず、確認が必要な主張として扱うためです。
構造は人間の研究チームに似ていますが、動く速さと数は大きく異なります。それだけに、結果だけでなく途中の行動まで監視する仕組みが必要です。
独自計算3:「4万7,000回に1回」は月2万件規模になる
監視によって操作が止められる割合は0.002%でも、10億回を超える判断を母数にすると、月約2万件の規模になります。
Anthropicは8月、10億回を超えるエージェントの判断を分析しました。実行前の監視によって止められた割合は0.002%で、約4万7,000回に1回です。
10億回に0.002%を掛けると2万回です。4万7,000回に1回として計算すると、約2万1,300回になります。
もちろん、2万件の不正行為があったという意味ではありません。監視には誤検知もあり、危険につながる前に予防的に止めたケースも含まれます。
発生率が低くても、母数が大きくなれば無視できません。AIを大量に並列実行すると、「まれな失敗」でも日常的に起こる問題へ変わります。
独自分析:人の確認は「2,000分の1」まで絞られる
事後監視で週約10万件を検知しても、最優先として人へ送られるのは約50件で、検知数の約0.05%です。
Anthropicの事後監視では、毎週約10万件の会話記録が検知されます。その後、複数の分類AIが誤検知などを取り除きます。
最終的に高優先度として人へ送られるのは、週約50件です。単純計算すると、最初に検知した2,000件のうち1件まで絞られます。
人が10万件すべてを直接読む必要がなくなるのは利点です。ただし、分類AIが重大な問題を見落とせば、人の目には届きません。
Anthropic自身も、監視技術の研究歴は数年ではなく数カ月だと認めています。すべてを監視していることと、すべての危険を見つけられることは別の話です。
安全研究へ使う計算資源は6%、AI主導部分では12%
Anthropicでは、AI主導の研究に限ると、安全分野へ回す計算資源の割合は研究全体の約2倍でした。
同社は7月13日から20日までの1週間を調べました。AI研究に使った計算資源のうち、安全研究に使われた割合は約6%でした。
AIが進めたAI研究だけを見ると、安全研究は約12%です。能力向上と安全性の両方に役立つ処理は、安全側には数えていません。
ただし、計算量だけで安全への取り組み全体を測れるわけではありません。安全研究には、人が実験設計に長い時間を使う一方、計算量は少ない仕事もあります。
調査期間も1週間に限られています。毎月同じ割合を維持しているとは限らず、他社と比較するための基準もまだそろっていません。
OpenAI・Googleと比べて何が違うのか
Anthropicが先行したのは、AIをAI開発に使ったことではありません。社内研究全体のうち、AIがどこまで担っているかを割合で公開した点です。
| 企業 | AIがAI開発を支えた事例 | 公開した数字 | 比較上の注意 |
|---|---|---|---|
| Anthropic | Claudeが調査、修正、評価などを担当 | 主導26%、協働以上90%超 | 自己評価で、完全自動は0% |
| OpenAI | 初期版Codexが学習の監視や不具合調査を支援 | 全社的な割合は未公表 | 具体例はあるが26%と直接比較できない |
| Google DeepMind | AlphaEvolveがAI学習用の処理を最適化 | Geminiの学習時間を1%短縮 | 特定の最適化成果であり、研究全体の比率ではない |
OpenAIは2026年2月、GPT-5.3-Codexを「自らの作成に大きく関わった最初のモデル」と説明しました。初期版は、学習の監視や配備、評価結果の分析を支えています。
Google DeepMindのAlphaEvolveは2025年、Geminiの学習に使う計算処理を23%高速化しました。その結果、モデル全体の学習時間は1%短縮されています。
AlphaEvolveは、自らを支えるAIモデルの学習も改善しています。AIがAI開発を助け、その成果が次のAI開発に戻る流れは、Anthropicだけで起きているわけではありません。
ただし、OpenAIとGoogleはAnthropicと同じ基準で社内研究全体を測っていません。26%が他社より高いのか低いのかは、現時点では比較できません。
過去事例から見える変化
これまでと大きく違うのは、AIが一つの部品を改善する段階から、研究工程そのものを広く担当する段階へ進んだことです。
初期のAI活用では、人が決めた問題に対してAIが最適な答えを探す使い方が中心でした。並べ替えや行列計算の高速化などが代表例です。
AlphaEvolveはコードを書くだけでなく、自動評価を使って改善を繰り返しました。それでも主な対象は、正解を機械的に検証しやすい問題です。
GPT-5.3-Codexでは、学習中の異常調査や評価結果の分析まで対象が広がりました。Claudeの26%は、さらに社内業務全体を分類して測った数字です。
ただし、研究テーマを選ぶ力や結果の意味を判断する力まで、完全にAIへ移ったとは確認されていません。担当範囲が広がったことと、人を超えたことは別です。
反証:これは「再帰的自己改善」の始まりなのか
AIが次のAI作りを助ける循環は始まっています。ただ、人を外して能力向上を繰り返す「再帰的自己改善」にはまだ達していません。
再帰的自己改善とは、AIが後継モデルを作り、そのモデルがさらに強い後継モデルを作る流れを、人の細かな介入なしで繰り返す状態です。
今回の測定では、研究の目的、利用できる道具、権限、公開するかどうかを人が管理しています。AL5に分類された仕事もありません。
AIが大量のコードを書けるようになっても、学習用GPU、電力、データ、半導体の製造能力まで自動的に増えるわけではありません。現実の資源も開発速度を左右します。
難しい研究の中には、正解を自動判定できない問題もあります。「何を研究すべきか」という判断は、修正コードを書く仕事よりも評価が難しい領域です。
それでも、26%という数字を軽視はできません。AI開発が速くなれば次のモデルが早く完成し、そのモデルがさらに研究を速める可能性があるためです。
反証:26%は過大評価されていないか
26%が実態より高く出ている可能性はあります。ただし、測定方法を公開し、人との一致率まで示している点は検証材料になります。
最大の弱点は、Claudeの仕事をClaudeが調べ、Claudeが評価していることです。同じ種類のAIであれば、共通する見落としを抱える可能性があります。
仕事の重み付けには、人が使った時間を採用しています。しかし、時間がかかる仕事ほど重要とは限りません。短時間の判断が研究全体の方向を変えることもあります。
基準となる仕事の一覧も固定されています。AIの導入によって新しい仕事が生まれれば、古い一覧だけでは変化を捉えにくくなります。
それでも、Anthropicは約1万5,000件の仕事を542項目に分類しました。単発の成功例だけを紹介する企業発表より、測定方法を検証しやすくなっています。
今後は、第三者が同じ資料から同じ結果を再現できるかが焦点になります。他社も同じ尺度を採用しなければ、業界全体の比較には使えません。
独自分析:今後見るべきは26%より「最後の承認点」
安全性を見るなら、自動化率だけでは足りません。AIが本番反映、権限変更、モデル公開まで単独で決められるのかを確認する必要があります。
同じAL4でも、ログを整理する仕事と学習方法を変える仕事では、失敗したときの影響が違います。問題が起きたときに元へ戻せるかどうかも確認したい点です。
| 確認すべき点 | 安全寄りの状態 | 危険が高まる状態 |
|---|---|---|
| 研究テーマ | 人が目的を決める | AIが目的まで変更する |
| 実行権限 | 隔離環境と限定権限 | 本番環境へ広くアクセス |
| 結果の確認 | 別の仕組みと人が確認 | 作業したAIが自分で合格判定 |
| 公開判断 | 人が最終承認 | AIが配備や公開まで行う |
| 停止手段 | 即時停止と記録が可能 | 行動を追えず、停止が遅れる |
Anthropicが示したAL4の例では、Claudeは修正を本番環境へ反映しません。人が報告を読み、公開するかどうかを決めます。
26%という比率が増えても、この最後の承認点を人が握っている限り、人の統制は残ります。逆に、自動化率が低くても重大な公開判断をAIへ任せれば、リスクは高まります。
企業や開発者への影響
AI開発が速くなれば、一般企業にも新機能が早く届くようになる一方、モデルや仕様の更新頻度も上がる可能性があります。
AI企業は、不具合調査や評価用コードの作成を短時間で進められるようになります。同じ人数でも、試せる実験の数を増やせる可能性があります。
利用企業には、モデルの性能向上や料金低下として還元されるかもしれません。ただ、更新が速すぎれば、昨日まで動いていた指示が通らなくなるといった問題も増えます。
開発者の仕事も、コードを直接書く時間から、AIへ目的を伝えて結果を評価する時間へ移っていく可能性があります。監視や権限管理の比重も高まります。
企業が社内AIを導入するときは、成功率だけを見ても十分ではありません。人が確認に使う時間、失敗時の損失、停止率、問題が起きたときに元へ戻せる割合も測る必要があります。
一般利用者への影響
利用者から見ると、AIの進歩が速くなる一方で、新しいモデルを十分に評価する時間が短くなる可能性があります。
ClaudeなどのAIは、より長い作業を少ない指示で進められるようになると考えられます。特に調査、資料作成、プログラミングでは影響が大きくなりそうです。
ただし、AIが作った評価方法を別のAIが確認する仕組みでは、同じ弱点を見落とす恐れがあります。性能が高いという説明だけでは、安全性までは判断できません。
利用者側も、モデル名や性能だけでなく、何を自動実行できるのかを見る必要があります。送信、削除、購入、本番反映のように影響の大きい操作には、人の確認を残すべきです。
まとめ:Claudeは「単独の研究者」ではなく「主担当」へ近づいた
Claudeが次のClaudeを単独で開発しているわけではありません。ただ、Anthropicの研究現場では、補助役から主担当へ急速に近づいています。
AIが主導する研究は26%で、人との協働以上まで含めると90%を超えます。一方、完全自動とされた仕事はありません。
半年で26倍超という伸びは急速で、AIがAI開発を速める循環はすでに始まっています。OpenAIやGoogleでも似た事例が出ています。
ただし、26%はAnthropicによる自己評価です。Claudeが証拠を集め、別のClaudeが判定する仕組みには、独立性の課題が残ります。
今後注目したいのは、数字が50%や80%へ増えるかどうかだけではありません。第三者による検証が進むか、そして最後の承認を人が握り続けられるかも重要です。
関連ページ
AIエージェントの仕組みや、競合するOpenAIの開発基盤もあわせて読むと、今回の26%がどの程度の自動化を指すのか理解しやすくなります。
- AIエージェントとは?生成AIとの違い・仕組み・できることを初心者向けに解説
- OpenAI「Agents API」とは?Codexの実行基盤をAPIとして開放
- Microsoftが「AI憲法」案を公開 停止命令に逆らわないAIはどう作られる?
- AI開発減速論で半導体株が急落 なぜAdobeやServiceNowは逆に上がったのか
出典
中心となる数値はAnthropicの発表をもとにし、評価尺度、競合事例、外部の能力測定についても確認しました。



コメントを送信