Claudeが自社AI開発の26%を「主導」、完全自律はゼロ——「9割超」は一段下の「協働以上」の数字

Claudeが主導するAnthropicのAI研究開発業務の割合が2026年2月の1%未満から8月の26%へ推移したことを示す公式チャート
目次

この記事のポイント

  • いつ:2026年9月17日、Anthropicが開発ペースを測る3つの指標と、自社のスナップショットを公表しました
  • 何が:自社のAI研究開発のうち26%を、Claudeが「主導する」水準(AL4)で担っていると示しました
  • 誰に:AIの開発動向を追っている人、Claudeなど生成AIの更新ペースを読む材料が欲しい人向け
  • なぜ重要:「26%」「9割超」「ゼロ」は同じ6段階尺度の別の段を指す数字です。取り違えると「AIが完全に自律してAIを作っている」と誤読しかねませんが、完全自律(AL5)に達した業務はゼロです
  • 読者は何をすべきか:いま必要な操作はありません。数字の大きさではなく「何を測り、何を測れていないか」——自己測定であること、測定対象の作業が2026年7月時点で凍結されていること——を押さえて読むのが実利的です

Anthropicが、自社のAI開発がどこまで自動化されているか、その自動化をどう監督しているか、計算資源をどこに割いているかという3点を公表しました。「26%」だけを切り出すと「9割超」「ゼロ」と混同しやすいため、本稿では発表の全体像と数字の階層・測り方の限界を整理します。

「開発ペースを外から見える化する」——Anthropicが9月17日に示した3つの物差し

Anthropicは“Measurements for understanding the pace of AI development inside frontier labs”で、frontier lab(最先端のAI開発を担う研究所)の開発ペースを外部から見えるようにする3指標を提案しました。①AIがAIのR&Dをどれだけ自動で担うか②AIエージェントの行動をどれだけ監督できているか③compute(計算資源)の配分、の3本です。

目的は、モデルが人間の関与なしに後継モデルを作る「recursive self improvement(再帰的自己改善)」にどれだけ近いかを外部が理解できるようにすることです。複数組織の独立した第三者評価者を社内に常駐させる計画も示されていますが、現時点は計画段階です。

指標名測定したもの代表的な数字
Anthropic R&D Automation IndexAIがAIのR&Dをどれだけ担うかClaudeが仕事の26%を「主導」
エージェント監督(oversight)エージェントの行動をどれだけ監督できているか全行動の100%がオンライン監視を通過、ブロックは0.002%
compute配分計算資源が安全側にどれだけ配分されているかAI R&D全体で約6%、AI主導のR&Dでは約12%(2026年7月13〜20日の1週間)

AL0からAL5、Claudeが届いているのは「主導」までで「完全自律」はゼロ

「26%」は、Epoch AI開発の”Automation Level”(AL)という6段階尺度で測られています。AL0(AIの関与なし)からAL5(AIが完全自律で、human in the loop=人間が途中で関与する余地がない状態)まであり、この尺度を使う「Anthropic R&D Automation Index」自体、Anthropicは”プロトタイプ”の指標と位置づけています。

2026年8月時点、測定対象のどの部分集合でもAL5(完全自律)には達していません。Claudeが「主導する(leads)」水準にあるのはAI R&D業務の26%で、2026年2月時点では1%未満で、約半年でこの水準になりました。

AL3「協働する(collaborates)」以上の水準は9割超です。3つの数字は同じ物差しの別の段を指す点に注意してください。

段名称(原典)定義Claudeの現在位置(2026年8月)
AL0no AI involvementAIの関与がない状態–
AL1minimal AI involvement本稿では定義を確認できていません–
AL2AI assists本稿では定義を確認できていません–
AL3collaborates(協働する)人間の緊密な指示のもと大きな塊の作業をこなす9割超がこの水準以上
AL4leads(主導する)高レベルの指示からタスクの大半を完遂し人間は監督する26%がこの水準
AL5is autonomous(完全自律)human in the loopなしで完全自律的に完遂するゼロ

判定役もClaude自身——人間同士の一致率は35%だった

測定はAnthropic自身が行います。Claudeエージェントが証拠を集め、別の独立したClaudeジャッジがAL段位を評定する仕組みです。

妥当性を確かめるため、担当領域を持つ自社スタッフに、モデルの証拠・判定を知らせずに自領域の自動化度を評価させました。結果は下表のとおりで、モデルと人間の判定は食い違いうる一方、人間同士の一致率はそれよりさらに低くなっています。Anthropicも「”協働”と”主導”の境界事例には本物の見解の相違の余地がある」と認めています。

比較対象完全一致率
モデルの判定 対 人間の評価59%
人間 対 人間(別スタッフ同士)35%
1段階以内に収まった割合97%

3万体のエージェントを全行動100%監視、10億件のうちブロックは0.002%

oversight指標も同じ発表に含まれます。2026年8月時点、最も使われている社内基盤1つに限ると、研究・エンジニアリング用エージェントが同時に約3万体稼働していました。この範囲はAnthropic自身が明記した限定です。

監督にはonline monitor(実行前にリアルタイム検査しその場でブロック・是正)とoffline monitor(事後にログを読み緩やかな兆候を追う)の2種があります。両方とも全行動の100%を検査対象にし(onlineは通常数秒以内)、ブロック行動は1週間以内に人間が確認します。offlineは週約10万件をフラグし、分類器で偽陽性を絞り込んだ最優先の約50件だけが人間のレビューに上がります。

人間の目をどこに残すかという設計は、Claude Codeの権限確認が自動審査に切り替わった取り組みにも表れています。

項目内容
対象規模(2026年8月)最も使われている社内基盤1つで、エージェントが同時に約3万体稼働
coverage(検査の対象範囲)online・offlineとも全行動の100%を検査対象にする
review latency(確認までにかかる時間)ブロックは1週間以内に人間が確認。offlineは週約10万件をフラグし最優先約50件が人間へ
ブロック率2026年8月の10億件超の判断のうち0.002%(約47,000件に1件)をonline監視がブロック

「昔の仕事の自動化」は測れても「人間が移った新しい仕事」は測れない

「26%」の測り方にも限界があります。タスク一覧は、2026年7月の各週に各部門からスタッフの20%をランダムサンプリングし、Claudeのリサーチエージェントが各人の1週間をSlackや社内ドキュメントでレビューして作成しました。約15,000個の細かいタスクを、Claudeが542ノード(うち378が葉=それ以上枝分かれしない末端の具体的な作業)の階層ツリーに整理しています。

各ノードの重みは、その作業に費やされた人の時間(person-time)を代理指標にしています。1人1週あたり1単位を、その週に関わった作業へ均等配分する方式です(4作業なら各0.25、10作業なら各0.10)。Anthropicはこれを自ら「粗い近似(crude approximation)」と認めています。

このツリーは凍結(frozen)されており、毎回同じ仕事のバスケットで測ります。つまりインデックスの上昇は、2026年7月時点で人間がやっていた仕事の自動化度を示すだけで、人間がその後移った新しい種類の仕事が生まれているかどうかは分かりません。2026年1月データで別版ツリーを作り新規タスクを検証していますが、その粒度では増加は見られませんでした。

Anthropicもこの指標を”プロトタイプ”と呼び、自社モデルで自社システムを評価しているため判定役が検査対象と同種の誤りを犯しうる限界を認めています。他社比較や将来予測にそのまま使える数字ではありません。

まとめ

3点にまとめます。

  1. 「26%」「9割超」「ゼロ」は同じAutomation Levelの別の段を指す数字で、単純比較はできません。
  2. 測定と判定もAnthropic自身・Claude自身が担い、人間同士の完全一致は35%にとどまります。
  3. 測定のタスクバスケットは2026年7月時点で凍結されており、仕事の自動化は追えても、そこから生まれた新しい仕事までは追えません。

数字の大きさより、何を測り何を測れていないかを踏まえて受け止めることが大切です。AL4(主導)が26%、AL5(完全自律)がゼロという現在地を踏まえると、人間の監督が完全に外れた工程はまだ無く、「AIが勝手に次のAIを作っている」という受け取り方は現時点では過剰です。

Anthropicはこれらの指標を今後も公表し続けるとしており、各指標について「どの開発者でも今日から公表できる」と他社にも同じ形での報告を促しています。読者にとっては、「26%が次に何%になったか」が製品更新のペースを読む定点として使えます。ただし自己測定である以上、他社比較にそのまま使える数字ではない点は留保しておく必要があります。

編集後記

「26%」という数字だけを見て、AIがAIを作り始めたと早合点しそうになりました。ですが人間同士の判定一致率が35%にとどまるという記述を読むと、境界線を引く難しさの方が本質なのだと私は感じます。粗い近似と言い切ってしまう誠実さも、地味ですが好きな部分です。

— CODE. 編集部

シェアいただけると励みになります!m(_ _)m
  • URLをコピーしました!
目次