
Artificial Analysisが、一般的なベンチマークに依存する代わりに、ユーザーが独自のデータとワークフローに対してAIモデルをテストできるベンチマーク作成プラットフォーム「Optima」をリリースした。
早期ユーザーはこれを使用して、金融・会計タスクのコストを大幅に削減するモデル、および法務業務での特定の文体にマッチするモデルを見つけた。
このプラットフォームは実際のトークン使用量と評価コストに基づいて課金し、個々のユースケースの特性を捉えられないことが多い公開ベンチマークの既知の制限に対応している。
何が起きたか
独立したLLM評価で知られるArtificial Analysisが、ユーザー独自のデータとワークフローを使用してAIモデルを比較するカスタムベンチマークを構築できるプラットフォーム「Optima」を立ち上げた。ユーザーはデータセットをアップロードしたり、ユースケースを説明したり、サンプル入力を提供して、品質、タスクあたりのコスト、タスクあたりの時間についてモデルをテストできる。このプラットフォームは現在利用可能。
なぜ重要か
公開ベンチマークは定義済みのタスクを使用するが、特定のビジネスニーズを反映していない場合がある。Optimaは組織が実際のワークフローに対してモデルをテストできるようにしてこれに対応する。金融チームは品質に大きな低下なしにコストを10分の1に削減するモデルを発見し、法務チームはどのモデルが彼らの文体に最も合致するかをテストした。エージェント型アプリケーションでは、より安いモデルでも失敗の頻度が高い場合はより高額になる可能性があるため、生のトークン価格よりも完了したタスクあたりのコストが重要なことが多い。
注目点
Optimaは実際のトークンコストのみを請求し、マークアップはない。ルーブリックベースの評価は基準あたり1モデルあたり0.125ドル、ペアワイズ評価は比較あたり0.375ドル。ただし、プラットフォームの有用性は、機能がどの程度正確に定義されているか、テストケースがどの程度代表的であるかに依存する。安く高速な出力でも、ビジネス価値をほとんど追加しない場合は大幅な手直しが必要になる可能性がある。
GDPval-AAおよびAA-Briefcaseを含むよく知られたLLM評価を運営するArtificial Analysisは、AIモデルの比較でギャップを埋めるために設計された新しいプラットフォーム「Optima」をリリースした。公開ベンチマークは定義済みのタスクでモデルをテストするが、特定の組織のニーズに対して実際にどのモデルが最適に機能するかをしばしば示していない。Optimaを使用すると、ユーザーは特定のデータとワークフローを使用してカスタムベンチマークを構築し、主流のモデル全体でテストを実行して、品質、タスクあたりのコスト、タスクあたりの時間について結果を比較できる。
プラットフォームは、カスタムベンチマークの構築への3つのアプローチを提供している。ユーザーは独自ファイルまたはHugging Faceから既存の評価データセットをアップロードするか、Arize、Braintrust、またはLangfuseなどのプラットフォームからエージェントトレースを提供するか、コーディング環境と過去のセッションから情報を収集するスキルをインストールできる。レディメイドのデータがない場合、Optimaは意図されたユースケースの説明をサンプル入力と出力とともに受け入れ、ユーザーが確認および改善するための推奨テスト入力、評価基準、およびタスク例を生成する。2つのスコアリングアプローチが利用可能である。客観的な基準に対するルーブリックベースの評価、またはArtificial AnalysisがGDPval-AAおよびAA-Briefcaseなどのベンチマークに使用するアプローチと一致するペアワイズ比較方法。ユーザーはレスポンスペアのサンプルを評価し、どの回答を好むかを示してから、Optimaがテストデータセット全体でのランキングを導出する。
料金は単純である。Optimaは使用されたモデルの実際のトークンコストのみを請求し、マークアップはない。ルーブリックベースの評価は基準あたり1モデルあたり0.125ドル、ペアワイズ評価は比較あたり0.375ドル。ベンチマークの作成時、各ベンチマーク実行、および各評価ラウンドの開始時に、プラットフォームはコスト見積もりに基づいて残高を保持し、実際の使用量と発生した評価コストに基づいて請求する。
汎用的なAI評価における既知の欠点は、カスタムベンチマーク化の必要性を反映している。Epoch AIの研究では、ベンチマーク結果は、ほとんど開示されない実装の詳細に大きく依存することが示された。異なるプロンプト表現と温度設定により同じモデルのスコアが著しく異なり、SWE-benchなどのエージェント型ベンチマークではエージェントの制御ソフトウェアとツール環境を入れ替えると最大15ポイントの差が生じた。有名なAI学会から445本のベンチマーク論文の広範な調査では、ほぼすべてが定義の不明確さ、非代表的なサンプル、統計検証の欠落など、少なくとも1つの領域に方法論的な弱点を持つことが判明した。実際のアプリケーションシナリオを反映した完全な実世界タスクを使用したのは約10パーセントだけであった。Optimaの早期テスターはすでに価値を見出している。金融・会計チームはどのモデルが品質に大きな低下なしにコストを10分の1に削減できるかを発見するためにベンチマークを構築し、弁護士の文体に最も合致するモデル、または独自のイメージデータセットの要素を最も正確に特定するモデルをテストするチームもある。
OptimaはAI評価における、よく文書化された問題に対応している。公開ベンチマークは、特定のビジネスニーズに最適なモデルがどれであるかを予測できないことが多い。Epoch AIの研究では、異なるプロンプト表現、温度設定、エージェントの制御ソフトウェアの変更などの実装の小さな詳細が、モデルのスコアを著しく変えることが示された。有名な学会から445本のベンチマーク論文の広範な調査では、ほぼすべてが方法論的な弱点を持っており、実際のアプリケーションシナリオを反映した完全な実世界タスクを使用したのは約10パーセントだけであることが判明した。
ユーザーが独自のデータとワークフローでモデルをテストできるようにすることで、Optimaはこのギャップを回避する。早期ユーザーは具体的な価値を見出している。金融・会計チームは品質に大きな低下なしにコストを10分の1に削減できるモデルを発見し、法務チームはどのモデルが弁護士の文体に最も合致するかを特定した。完了したタスクあたりのコストと時間に焦点を当てることは、より安いモデルが失敗の頻度が高く、追加の後処理作業が必要になった場合、より高額で信頼できるモデルより全体的なコストが高くなる可能性があるエージェント型アプリケーションに特に関連している。
しかし、Optimaはベンチマーク自体のより深い課題を排除しない。プラットフォームの有用性は、対象機能がいかに正確に定義されているか、テストケースがいかに代表的であるか、そして評価がいかに実装されているかに依存する。提供物が高速で安価であっても、提供するプロセスにビジネス価値をほとんど追加しない場合は、大幅な手直しが必要になる可能性がある。
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できます
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
NvidiaやMicron、TSMCなど主要AI半導体メーカーの株価が過去3年で300%以上上昇しました

Microsoft南欧担当バイスプレジデントのCharles Calestroupatがギリシャ、ポルトガル、イタリアなど南欧地域は、単なるAIツール導入から地域イノベーションエコシステムの構築へとシフトしていると述べた

OpenAIは7月末にPreparednessチームを解散した

Amazon Web Services は第3四半期に37%の売上成長を記録し、過去数年の約20%から加速

アナリストがAmazonの目標株価を320~365ドル(一部390ドルまで)の範囲に引き上げています

Epoch AIとIpsosが実施した米国就業成人1,106人を対象とした調査(2026年7月10~19日実施)によると、働くアメリカ人の20%が、従来は人間の同僚や請負業者が行っていたタスクを少なくとも1つAIに委譲し…

AIニュースの要点を毎朝1分で。
無料で登録