AIToday

エンタープライズAIエージェントはシステム課題

MIT Technology Review AI5時間前LINEで送る
エンタープライズAIエージェントはシステム課題

要点

Intel による数千件のエージェント AI 実験の分析から、エンタープライズの成功は AI モデルのパフォーマンスに焦点を当てるだけでなく、CPU 容量、データアクセス、ガバナンス、可観測性といった正しいシステムインフラストラクチャを構築することに依存することが明らかになりました。組織は、タスク遅延やエージェント密度(vCPU あたりのエージェント数)などの実用的な指標を測定して、ワークフローが本当に本番環境で機能しているかどうかを理解し、単一マシンの計算を増やすのではなく、より多くのシステムを追加することで水平スケーリングする必要があります。

こういう要約が、毎朝あなたのメールに届きます。

無料で登録 →

3つのポイント

  • 何が起きたか

    Intel は数千件のエージェント AI ワークロード実験を実施し、エンタープライズ導入に向けた5つの実践的な教訓を特定しました。主な発見は、エージェント AI の成功は言語モデルそのものではなく、CPU 容量、データアクセス、ツール使用ガバナンス、可観測性、メモリ管理に依存するということです。

  • なぜ重要か

    大多数のエンタープライズエージェント AI 実装は言語モデルのパフォーマンスのみに注力していますが、真のビジネス価値は人、システム、データ全体にわたるエンドツーエンドのワークフロー自動化から生まれます。企業は、タスク成功率、タスク当たりのコスト、タスク当たりの時間、タスク スループット、エージェント密度(vCPU あたりのエージェント数)、遅延を測定する必要があります。これらの指標は、AI モデルがどれだけ優秀かではなく、本当にシステム全体が本番ワークフローで機能するかどうかを明らかにします。

  • 注目点

    3つのデプロイメント原則が浮かび上がりました。エージェント数の絶対値ではなくエージェント密度(vCPU あたりのエージェント数)を使用して容量計画を行う。平均 CPU 使用率ではなくタスク遅延(P95)を監視する。エージェントがバースト的に動作するため、平均値では性能問題が隠れてしまうためです。スケールアップ(1つのシステムにコアを追加)ではなく、スケールアウト(システムを追加)をデフォルトとする。これにより、通常、より優れたパフォーマンスとコストが得られます。

詳細

エージェント AI ワークロードの Intel による広範なテストから、多くのエンタープライズ実装が期待に応えられない理由が明らかになります。これらの実装はエージェント AI を主に推論の問題として扱いますが、実際には、インフラストラクチャ、可観測性、および運用上の規律を必要とするシステム課題です。

エージェント AI のパフォーマンスを包括的に理解するために、Intel は AI エージェント評価用のオープンソース ベンチマーク ハーネスである Terminal-Bench を拡張しました。拡張により、プロファイリング、テレメトリ、リプレイ機能が追加され、言語モデル推論以外にエージェントが時間を費やした場所を測定することが可能になりました。ベンチマークは決定論的なレコード リプレイ アプローチを使用しました。LLM レスポンスは一度記録され、実行全体で同一に再生されます。これにより、実行間の差異が減少し、エージェント パフォーマンスが LLM 変動性から分離され、より信頼性の高い比較基盤が作成されました。タスク ミックスは意図的に広範で、コンパイル、テスト、データベース操作、ブール論理、解釈、レイ トレーシング、圧縮、線形代数、ビデオ トランスコード、機械学習トレーニングが含まれています。その多様性により、発見は実際のエンタープライズ環境に関連があるものになりました。

Intel の分析により、5つのコア レッスンが生み出されました。第1に、エージェント AI は根本的にはシステム問題であり、単なる推論の問題ではありません。計画、ツール オーケストレーション、データ アクセス、タスク実行、遅延管理、スケーラブル インフラストラクチャが必要です。第2に、ほとんどの既存のエージェント AI 実装には、全体的なシステム パフォーマンスを測定しない限定的なハーネスがあります。第3に、容量計画は、エージェント数の絶対値ではなく、vCPU あたりのエージェント密度を主要な指標として使用する必要があります。これにより、異なるハードウェア世代とインスタンス タイプを超えてサイジングがポータブルになります。第4に、エンタープライズは平均 CPU 使用率ではなく、エージェント タスク遅延(特に P95 パーセンタイル)を監視する必要があります。エージェントはバースト的に動作するため、平均指標だけでは性能低下が隠れる可能性があるためです。第5に、チームはスケールアップ(単一システムへのコアの追加)ではなくスケールアウト(複数システムの追加)をデフォルトにする必要があります。これにより、通常、全体的に優れたパフォーマンス、コスト、可用性が得られます。

調査は、タスク成功率、タスク当たりのコスト、タスク当たりの時間、タスク スループット、エージェント密度、遅延という6つの実用的なエンタープライズ指標も定義しています。これらの指標は、エンタープライズ AI オペレータが実際に気にかけている質問に答えます。システムは期待どおりに機能しているか?システムは何個のエージェントをサポートできるか?より多くのエージェントをサポートするためにどのようにスケーリングすべきか?異なるビジネス ユース ケースは、異なるエージェント密度を目標とすべきです。インタラクティブ コパイロットとユーザー向けアシスタントは、応答時間が重要であるため、低密度を優先すべきです。一方、IT ワークフローなどのバッチ ワークロードは、高密度で実行できます。Intel は、本番レベルの結果を達成している組織が、既にコード化されたルールと測定可能なサービス レベルを持つワークフローの周囲に自動化をラップしていることを発見しました。コード作成、リグレッション テスト ファーム、チケット トリアージ、市場分析、セキュリティ レビューなどです。エージェント AI の理想的なエンタープライズ顧客は、新規性を追い求める実験的なユーザーではなく、サイクル時間の改善、サービス品質の保護、ポリシー適用、コスト を念頭に置いたスケーリングに焦点を当てた責任あるリーダーです。

背景と解説

Intel の発見は、エージェント AI の成功は主に機械学習の問題であるという一般的な仮定に異議を唱えています。オープンソースのベンチマーク ツールである Terminal-Bench の拡張版を使用して数千件のワークロード実験を実行することで、Intel はエージェント パフォーマンスを言語モデル の変動性から分離しました。LLM レスポンスを決定論的に記録して再生することで、これを実現しました。この厳密なアプローチから、エンタープライズ価値は CPU 容量、回復力のあるデータ アクセス、ポリシー対応のツール使用、可観測性、メモリ管理を含むフルスタック インフラストラクチャに依存していることが明らかになりました。

研究は、ほとんどの組織がエージェント AI を評価する方法における重大なギャップを特定しています。既存のハーネスと指標は言語モデルの品質に焦点を当てていますが、完全な全体像を見落としています。タスク遅延、スループット、タスク当たりのコスト、特定のインフラストラクチャが持続的にサポートできるエージェント数です。このギャップが重要なのは、エージェントは単純なチャットボットとは根本的に異なるためです。マルチステップ ワークフローを実行し、外部ツールを呼び出し、結果を読み取り、失敗時に再試行します。そのバースト的で割り込み駆動の実行パターンは、平均 CPU 使用率が誤った信号であることを意味します。タスク遅延(特に P95 パーセンタイル)は、ユーザー エクスペリエンスが低下する前にボトルネックを明らかにします。

Intel が推奨する3つのデプロイメント原則は、実際のトレードオフを反映しています。エージェント数の絶対値ではなくエージェント密度によって容量を正規化することで、異なるハードウェア世代とインスタンス サイズ全体で予測可能にスケーリングしやすくなります。スケールアップ(コアの追加)ではなくスケールアウト(複数のシステムの追加)をデフォルトにすることは、エージェントが通常、控えめなエージェント単位の計算バースト で半独立プロセスとしてどのように動作するかに沿っています。ビジネス ケースは実用的です。スケールアウトは通常、総コストを低下させ、可用性を向上させ、採用の成長に伴ってターゲット サービス レベルを維持しやすくします。

よくある質問

エンタープライズはエージェント AI のパフォーマンスを測定するためにどのような指標を使用すべきか?
エンタープライズは6つの指標を追跡すべきです。タスク成功率、タスク当たりのコスト、タスク当たりの時間、タスク スループット、エージェント密度(vCPU あたりのエージェント数)、遅延です。これらは、システムが期待どおりに機能しているか、何個のエージェントをサポートできるか、どのようにスケーリングすべきかを示します。
容量計画ではエージェント数よりもエージェント密度の方が優れているのはなぜか?
エージェント密度(vCPU あたりのエージェント数で測定)は飽和の主要な信号であり、インスタンスサイズとプロセッサ世代を超えて容量を比較する方法を提供します。たとえば、8vCPU システム上の10エージェントと16vCPU システム上の20エージェントは、密度が同じであれば同様に動作します。
現在、どのビジネスがエージェント AI から最高の結果を得ているか?
本番レベルの結果を得ている組織は、コード化されたルールと測定可能なサービスレベルを持つワークフローの周囲に自動化をラップしています。コード作成、リグレッション テスト ファーム、チケット トリアージ、市場分析、セキュリティ レビューなどです。

「大規模言語モデル」の最新ニュースを、毎朝7時にお届けします

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・30秒で完了・いつでも解除できます

ディスカッション

まだコメントがありません。最初のコメントを投稿しましょう!

ログインして議論に参加

関連記事

AIニュースを毎日お届け

200以上のソースから厳選したAIニュースを毎日無料でお届けします。

無料で始める

登録無料・30秒で完了・いつでも解除できます