AIToday
大規模言語モデルTHE DECODER掲載日時: 2026年10月2日 22:01

AIが会計士を逆転、APEX会計ベンチマーク

LINEで送る
AIが会計士を逆転、APEX会計ベンチマーク

3つのポイント

  1. 何が起きたか

    Mercorは公認会計士(CPA)12人に簡略版APEX会計ベンチマークの課題を解かせた。最高性能のモデルは今やほぼ完璧に解く。18カ月前は会計士の平均約37%を下回っていた。

  2. なぜ重要か

    調査によると、AIモデルは構造化された記帳業務で人間の会計士より速く、正確で、はるかに安い。18カ月前は会計士がモデルを上回っていた逆転だ。

  3. 注目点

    Mercorは、課題がAIの得意分野(細部の追跡と指示の厳密な遵守)を試すものだと認め、顧客との通話や同僚との確認、長年の文脈を除外。AIが監督なしで決算を締められるかは未決着だ。

誰に効くか最も直接的に影響を受けるのは、構造化された規則ベースの元帳業務を担う企業のスタッフ会計士や記帳チームだ。調査自身の数字は、そうした課題でAIが速度・正確性・コストで優位に立つことを示す一方、顧客対応や文脈依存の業務は対象外のままだ。

わからないところ、AIに聞けます

質問と回答はこのページに公開されます。

こういう要約が、毎朝あなたのメールに届きます。

背景と解説

Mercorの調査が注目されるのは、AIが会計士を上回るというトップラインよりも、差が縮まる速さだ。18カ月前、最高性能のモデルはAPEX会計ベンチマークから抜粋した簡略課題で会計士の平均約37%を下回っていた。今日、同じ課題はほぼ完璧に解かれる。

しかし完全版ベンチマークは簡略版とは異なる姿を示す。10の模擬企業にまたがる160の課題で、Claude Opus 5.5が採点基準の61.8%で首位、Fable 5.1が61.0%、GPT-6 Astraが57.9%で続き、Mercorはほぼ60%の課題をどのモデルも完全には解けなかったとしている。Mercorはまた、調査の課題がAIの得意分野、つまり細部の追跡と指示の厳密な遵守を試すものだと認めている。顧客との対話や同僚との確認、長年蓄積された文脈を活用する仕事の部分は完全に除外された。

狭い課題でのほぼ完璧な性能と、より広い課題群での大きな差——この組み合わせこそ、Mercorが業界全体での大幅な生産性向上を見込みつつも、会計士は代替できないと述べる理由だ。読み取れるのは、AIが自律的な決算担当者ではなく、構造化された記帳業務の強力なアシスタントになりつつあるということ。ベンチマーク自体の設計は、その境界がモデルの能力だけでなく、課題が何を除外しているかにも関わることを示唆している。

よくある質問
完全版APEX会計ベンチマークで最も成績が良かったAIモデルは?
MercorによるとClaude Opus 5.5が採点基準の61.8%で首位、Fable 5.1が61.0%、GPT-6 Astraが57.9%で続く。
Mercorが会計士はまだ代替できないとする理由は?
Mercorは、調査の課題がAIの得意分野(細部の追跡と指示の厳密な遵守)を試すもので、顧客との会話や同僚との確認、長年蓄積された文脈を除外したと認めている。
完全版APEX会計ベンチマークの規模は?
10の模擬企業にまたがる160の課題で、平均11年の経験を持つ40人以上の専門家が作成した。
LINEで送る

あなたの仕事に関係するAIニュースを、毎朝お届けします。

業界と使っているAIツールを選ぶと、仕事に関係するニュースが毎朝届きます。

登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。AIはこの記事・AIToday の過去記事・Wikipedia を読み、出典を付けて答えます。Q&Aはこのページに公開され、他の読者も読めます。

質問と回答はこのページに公開されます。

関連記事

次の記事へAIと量子が資本主義を社会主義へ、論文が主張