
AI agents による自動化の進捗を測定する Remote Labor Index で、フリーランス案件の完遂率が 8 ヶ月間で 2.5% から 16.1% に急上昇しました。
最先端モデルの Fable 5 が記録を更新しましたが、それでも大多数の案件は専門家水準に達しておらず、専門ソフトウェア操作など実務作業の制限が顕在化しています。
一方、AI 評価者は人間より大幅に甘い判定をするため、進捗の検証には人間の評価が不可欠となっています。
何が起きたか
AI agents の自動化率(専門家水準で案件を完遂する割合)が、ベンチマーク立ち上げ時の 2.5% から 16.1% に跳ね上がりました。Fable 5 がこの最高記録を達成し、2 位の Opus 4.8(8.3%)のおおよそ 2 倍となっています。
なぜ重要か
リモートワークの自動化が実質的に進んでいることを示す数値です。Remote Labor Index は 3D・CAD、建築、グラフィック設計、動画・音声制作など実務的なフリーランス案件 240 件(総額 $144,000)で測定されており、単なる理論値ではなく、顧客が実際に受け入れる品質水準での達成率です。
注目点
ただし Fable 5 は 240 件中 218 件しか評価でき、残り 22 件すべてで失敗した場合でも自動化率は 14.6% に留まるため、スコアの堅牢性が確認されています。一方、人間の評価者は置き換えられない状況が明らかになりました。AI 評価者は新しいモデルを過度に高く評価し、GPT-5.5 ではほぼ 3 倍高い点数をつけていました。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
Googleの研究者が、AIエージェントに過去の失敗や成功した戦略を永続的に記憶させるフレームワーク「WikiSkill」を発表した

2026年7月30日から8月4日にかけて実施されたYouGovの調査(米国の労働者1,250人対象)で、2023年以降にAIが原因で失職したと答えた人はわずか約3%だった

MetaやGoogleなど大手が公開する大規模言語モデル(LLM、テキストを理解・生成するAI)の多くが、今や無料でダウンロードでき、自分のパソコン上で動かせる

8月24日、Virtuals ProtocolはSolana上でAIエージェントの作成・所有ツールの新スイートを展開し、投資家がエージェント連動トークンを購入できるようにした

AIが現在、いわゆるヤコビアン予想を含む長年の数学問題の解決を支援しており、トップ数学者たちはこれが最終的に良いことなのか悪いことなのか深く迷っている

15の言語モデルを対象に、出典付きの2件の依頼でベンチマークを実施
