
何が起きたか
Mercorは公認会計士(CPA)12人に簡略版APEX会計ベンチマークの課題を解かせた。最高性能のモデルは今やほぼ完璧に解く。18カ月前は会計士の平均約37%を下回っていた。
なぜ重要か
調査によると、AIモデルは構造化された記帳業務で人間の会計士より速く、正確で、はるかに安い。18カ月前は会計士がモデルを上回っていた逆転だ。
注目点
Mercorは、課題がAIの得意分野(細部の追跡と指示の厳密な遵守)を試すものだと認め、顧客との通話や同僚との確認、長年の文脈を除外。AIが監督なしで決算を締められるかは未決着だ。
誰に効くか最も直接的に影響を受けるのは、構造化された規則ベースの元帳業務を担う企業のスタッフ会計士や記帳チームだ。調査自身の数字は、そうした課題でAIが速度・正確性・コストで優位に立つことを示す一方、顧客対応や文脈依存の業務は対象外のままだ。
こういう要約が、毎朝あなたのメールに届きます。
Mercorの調査が注目されるのは、AIが会計士を上回るというトップラインよりも、差が縮まる速さだ。18カ月前、最高性能のモデルはAPEX会計ベンチマークから抜粋した簡略課題で会計士の平均約37%を下回っていた。今日、同じ課題はほぼ完璧に解かれる。
しかし完全版ベンチマークは簡略版とは異なる姿を示す。10の模擬企業にまたがる160の課題で、Claude Opus 5.5が採点基準の61.8%で首位、Fable 5.1が61.0%、GPT-6 Astraが57.9%で続き、Mercorはほぼ60%の課題をどのモデルも完全には解けなかったとしている。Mercorはまた、調査の課題がAIの得意分野、つまり細部の追跡と指示の厳密な遵守を試すものだと認めている。顧客との対話や同僚との確認、長年蓄積された文脈を活用する仕事の部分は完全に除外された。
狭い課題でのほぼ完璧な性能と、より広い課題群での大きな差——この組み合わせこそ、Mercorが業界全体での大幅な生産性向上を見込みつつも、会計士は代替できないと述べる理由だ。読み取れるのは、AIが自律的な決算担当者ではなく、構造化された記帳業務の強力なアシスタントになりつつあるということ。ベンチマーク自体の設計は、その境界がモデルの能力だけでなく、課題が何を除外しているかにも関わることを示唆している。
業界と使っているAIツールを選ぶと、仕事に関係するニュースが毎朝届きます。
登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。AIはこの記事・AIToday の過去記事・Wikipedia を読み、出典を付けて答えます。Q&Aはこのページに公開され、他の読者も読めます。
AirbnbのCTO Ahmad Al-Dahleは、社内AIツール「Everest」により食料品配送は8~9ヶ月、空港送迎は約6週間で開発できたと述べ、コードの60%をAIが作成していると明かした

Booking HoldingsのCFO、Ewout Steenbergen氏がFortuneのAIQ Summitで、LLM開発に数百億ドルを投じるハイパースケーラーでもROIを把握せず仮定や仮説に頼ると述べた

GartnerはAIエージェント案件の40%超が2027年末までに中止されると予測

PwC Japanの2026年春の6カ国調査で、生成AIで「期待を大きく上回る」効果を得た日本企業は9%のみ

GitHubがGwen Davis氏のキャリア助言を公開

Googleは9月、1-million-tokenのコンテキストウィンドウを持つ新フロンティアモデル「Gemini 4 Argon」を発表した
