AIToday
大規模言語モデルAIコーディングAIビジネス・産業THE DECODER掲載日時: 2026年9月19日 1:00

Anthropic開発業務26%AL4

LINEで送る
Anthropic開発業務26%AL4

3つのポイント

  1. 何が起きたか

    Anthropicが自社の開発業務を採点した指標を公表し、26%がAL4(Epoch AIの「AIが主導」)に達したと発表。2月時点では1%未満だった。

  2. なぜ重要か

    AL4でも作業は人間が引き渡し、人間が出荷するため、26%という数字は人間の工数を数えたもので、エンジニアから判断を奪ったわけではない。

  3. 注目点

    この数字が持ちこたえるかは採点次第だ。Anthropicによれば採点は自社モデルが行い、公式スコアが人間の判断と一致したのは59%だった。

誰に効くか採点される側なのはAnthropic自身のエンジニアと研究者であり、この報告書を読む人々(規制当局や競合ラボを含む)は、AI研究のどれだけをモデルが既に回しているかを示す企業公表の数字を手にしたことになる。

わからないところ、AIに聞けます

こういう要約が、毎朝あなたのメールに届きます。

よくある質問
AnthropicにおけるAL4とは具体的に何を意味しますか?
Epoch AIの尺度はAL0(AIなし)からAL5(完全自律)まであり、AL4には「AIが主導」というラベルが付く。Anthropicの例では、エンジニアがバグ報告をClaudeに渡すと、Claudeは質問せずに分析・修正・テストまで行うが、出荷するかどうかは依然として人間が決める。
その業務がAL4に当たるかどうかは誰が判定したのですか?
Claudeだ。エージェントがSlackや社内文書から証拠を集め、別のClaudeモデルがレベルを割り当てた。Anthropicも、検証対象のシステムと同じ過ちを繰り返す可能性があると認めている。
Anthropicの計算資源のうち安全性業務にはどれだけ割かれていますか?
7月のとある1週間のサンプルでは、AI研究向け計算資源の約6%だ。Anthropicは、安全性業務の多くが研究者の時間を消費する実験設計であり、チップを消費しないため低く出ていると説明する。
LINEで送る

「大規模言語モデル」の最新ニュースを、毎朝7時にお届けします

たとえば、いま届くならこの3本です

  • KDEの会議でKadai構想 貢献者2人が発表The Register (AI/ML) · 2時間前
  • Meta株24%反発 Museが首位Yahoo Finance AI · 2時間前
  • GitHubポッドキャスト、AIの通説5つに反論GitHub Blog (AI) · 2時間前

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。

関連記事

次の記事へGitHubポッドキャスト、AIの通説5つに反論