AIToday
大規模言語モデルAIコーディングVercel AI Blog掲載日時: 2026年8月22日 4:015分で読める

OraがVercel上の主要AIエージェントをベンチマーク、eveが競合を上回る

LINEで送る
OraがVercel上の主要AIエージェントをベンチマーク、eveが競合を上回る

要点

  • Oraはライブウェブサイト上ですべての主要AIエージェントフレームワークをテストし、VercelのeveがClaude Codeを上回ることを発見した。

  • Eveはステップで7%削減し、顧客サイト上で2倍のネイティブ成功率を達成した。

  • スタートアップはウェブの99%がサインアップと支払いを行うエージェントに対応できないと推定しており、採用のためのベンチマークを重要にしている。

3つのポイント

  1. 何が起きたか

    Oraはライブウェブサイト上でAIエージェントの動作と取引能力をテストするプラットフォームで、Claude Code、ChatGPT、Gemini、Hermes、OpenClaw、Vercelのeveというすべての主要エージェントフレームワークを並行ベンチマークした。Eveはゴール達成までのステップで7%削減、2倍のネイティブ成功率(顧客のサイト上で完了したタスクが2倍)、9%多くの有効なエンドポイントでClaude Codeを上回った。

  2. なぜ重要か

    Oraの推定では、ウェブの99%はサインアップ、統合、支払いを行うエージェントにまだ対応できていない。Oraはエージェントをライブサイトで実行し、どこでなぜ失敗するかを記録することで、企業が何を修正すべきかを示す—これはエージェントが実際のワークフローで頻繁に躓くため重要だ。ベンチマークは重要である。なぜなら2つのエージェントフレームワークも同じインフラを使用していないからだ。Oraは各フレームワーク用に別々のランタイムを構築し、すべてのステップをトレースしており、顧客は正確にどのステップが停止したか、エージェントが何を試みたかを確認できる。

  3. 注目点

    Oraはeveをテスト対象として扱うのではなく、eve上に独自の製品を構築し始めている。チームは1日に数百のコミットを配信している16人のエンジニアを擁し、コーディングエージェントがVercel上の日常的なインフラ作業を担当している。Oraはプラットフォームをマイクロサービスに分割しており、すべてVercel上にあるため、新しいサービスと内部eveエージェントは追加設定なしでデプロイできる。

この記事についてAIに質問する →

背景と解説

Oraの創業は、Assaf Elovicが前職のTavilyで発見したギャップに根ざしている。Tavilyは今年初めにNebiusに買収された。Tavilyはエージェント向けウェブ検索エンジンを構築し、問題の半分を解決した。しかし製品を見つけたエージェントはそれを実際に使用する必要があります。ElovicとCo-founderのLiad Yosefはウェブがエージェント対応の程度を測り、対応していない部分を修正するためにOraを開始した。

Oraが解決したコアの課題はインフラの断片化だ。Claude Code、ChatGPT、Gemini、その他のすべての主要エージェントフレームワークは独自の環境を期待し、ステップを異なる方法で公開している。それらを並行実行には、各ハーネスのための別々のランタイムが必要で、完全なステップトレースがある。このレベルの詳細さはIdo Finderが「oraが顧客にもたらす最も価値のあるもの」と呼ぶもの。トレースがなければ、ベンチマークスコアは意味がない。エージェントが停止したとき、顧客はどのステップが失敗したか、そしてエージェントが何を試みたかを正確に確認できる。

OraがVercel全体で実行することを決定—フロントエンド、バックエンド、エージェントランタイムが同じデプロイメントパス、ログ、認証を共有—はテストと内部運用の両方の基礎となった。その統合はOra独自のエンジニアリングにフィードバックされる:16人が1日に数百のコミットを配信し、コーディングエージェントがeve上の日常的なインフラ作業を担当している。Finderはこのセットアップから週に数時間節約している。ElovicはコーディングエージェントがVercelのライブラリでどのようにうまく構築するかについて同様の節約を認めている。Oraがスケールするにつれて、プラットフォームをマイクロサービスに分割しており、すべてVercel上にあるため、内部eveエージェントは追加設定なしで1つのサービスとしてデプロイされる。

よくある質問

Oraはどのエージェントをテストし、比較結果はどうだったのか?
OraはClaude Code、ChatGPT、Gemini、Hermes、OpenClaw、eveをベンチマークした。初期の詳細な比較はeveとClaude Codeの間で、数百の実際のジャーニーにわたって同じモデル(Claude Fable 5とHaiku 4.5)を実行した。Eveはステップで7%削減、2倍のネイティブ成功率、9%多くの有効なエンドポイントでClaude Codeを上回った。
Oraのコア知見—ウェブのエージェント対応状況について
Oraの推定では、ウェブの99%はエージェント対応されていない。プラットフォームは顧客に対し、エージェントがサイト上でどこで失敗するか、そして動作させるために何が必要かを示す。
Oraはテスト後、なぜeveで構築することを選んだのか?
EveはNext.jsパラダイムに従い、設定がほとんど不要で、サンドボックスオーバーライド機能によってOraは計装された環境に交換して、何も新しく構築せずにすべてのステップをトレースできる。OraのAIリードであるIdo Finderはeveを「経験した中で最も簡単なセットアップ」と呼んだ。
Vercel AI Blog元記事を読む

「大規模言語モデル」の最新ニュースを、毎朝7時にお届けします

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・30秒で完了・いつでも解除できます

AIに質問

この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。

関連記事

次の記事へモトローラ、15億ドルでD-Fend買収完了 ドローン対策技術を公安事業に統合

AIニュースの要点を毎朝1分で。

無料で登録