今日の知識を装備する

ビジネス

アンソロピックの研究開発の26%をClaudeが主導。 人間はどこで確認しているのか

Photo: Anthropic(発表ページ掲載の画像)

アンソロピックは9月17日(米国時間)、自社のAI研究開発のうち、AIアシスタント「Claude」が「主導」する仕事の割合が2026年8月時点で26%だと公表した。主導とは、大まかな指示を受けて仕事の大半を最後までこなし、人間が監督している状態を指す。人間がまったく関わらずにAIだけで進めている仕事は、測った範囲ではゼロだった。

では、人間はどの段階で確認しているのか。アンソロピックは、AIエージェントの行動を実行前と実行後に監視する仕組みも公表した。同社によると、8月時点で、最もよく使う社内基盤では常時およそ3万のAIエージェントが研究開発の作業をしている。すべての行動は実行前に自動の監視を通る。8月にエージェントが下した判断は10億件を超え、監視が実行を止めたのはその0.002%だった。実行後の監視では、週に約10万件の記録が確認対象として抽出される。そのうち、優先度が最も高い約50件が人間の確認に回る。

アンソロピックはこの26%を、調査機関Epoch AIが作った、AIの関わり方を6段階に分ける尺度で算出した。この尺度には「補助」「協働」「主導」などの段階がある。アンソロピックの研究開発では、AIが「協働」以上の役割を担う仕事が全体の9割を超えた。その中でも、AIが大まかな指示を受けて仕事の大半をこなす「主導」は、全体の26%を占める。人間が一切関わらない「自律」に当たる仕事はなかった。

アンソロピックは測定にあたり、2026年7月の各週に社員の20%を無作為に選んだ。ClaudeがSlackや社内文書から対象者の仕事を洗い出し、約1万5000件の作業を集めた。同社がこの作業の一覧を固定したうえで、別のClaudeが作業ごとに、8月時点でAIがどこまで関わっているかを判定した。

同社はその作業を担当する社員にも同じ評価をしてもらい、Claudeの判定と照合した。Claudeと人間の判定が一致した割合は59%で、人間同士の一致率は35%だった。Claudeと人間の判定の差が1段階以内に収まった割合は97%だった。

アンソロピックは自社のAIで自社の仕事を評価しているため、評価する側とされる側が同じ誤りをする可能性がある。同社はこれを限界として認め、第三者や他社のモデルによる検証が必要だとしている。

同社は現在、複数の外部組織から評価者を受け入れる準備を進めている。評価者が独立した立場で検証できるよう、同社は社内のリスク評価チームと同等の情報を提供する計画だ。

出典