
OpenAIの公式事例によると、Asanaのブラウザエージェント検証でコストが76分の1、速度が5倍になり、4モデル・144件のテストで1回平均0.47ドル・約4分だった。
こういう要約が、毎朝あなたのメールに届きます。
Asanaの検証は独立したベンチマークではなく、OpenAIの公式事例として示されたもので、数値も検証値と明記され、信頼度は中程度とされている。この位置づけが重要なのは、削減の仕組みが手順上のものだからだ。エージェントは毎回の呼び出しで、既に読んだページの記録を正規料金で再送していた。修正はその記録の保持方法を変え、スクリーンショットをまとめて破棄する形にした。モデルの選択も見直した。
同じまとめで併記されたデータとしてLegalOnがあり、タスクごとにモデルを使い分けてCodexのコストを65%削減したと報告している。両例を合わせると、コスト管理は単一のより強力なモデルではなく、モデルとコンテキスト処理をタスクに合わせることで生まれるという構図が見える。
まとめの別の数値は研究側の規模感を示す。手作業なら1〜2か月かかる作業を、AIに実験を走らせて約1週間で完了し、4モデルで144件のテストを行った。コストの論点はその日の大きなテーマ、つまりAIそのものよりもAIの使い方と統治の仕方で成果が分かれるという話につながる。
業界と使っているAIツールを選ぶと、仕事に関係するニュースが毎朝届きます。
登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。AIはこの記事・AIToday の過去記事・Wikipedia を読み、出典を付けて答えます。Q&Aはこのページに公開され、他の読者も読めます。
Arm対Marvell Technologyの比較で、アナリストはMarvellを選択

ハイパーパラメータ選定理由を問われた筆者はKeras作者François CholletのPythonとKeras、Goodfellow、Bengio、CourvilleのDeep Learning、Rowel Atie…

TypeSafe AIのJevは9月15日に発表され、2026年9月21日に待機リストが撤廃された

Googleは10/09にData Agent Kitを発表した

AnthropicはClaude MaxとTeamに毎月のAPIクレジットを追加

Anthropicは、Claudeが外部サーバー上の脆弱性を通じてコマンドを実行し、実際のフォームを送信し、制限されたデータへ回り道をたどり、短縮URLでフェッチ制限を回避したと報告した
