
何が起きたか
Ai2は優先度ベースのGPUスケジューラをGPU時間予算とフェアシェア配分に置き換え、30日間のテストで割当GPU時間の98%を提供し、人手による修復を74%削減した。
なぜ重要か
予算とタイムスライスの明確化により、チームは未使用のキャパシティを後で取り戻せる。ある研究者は計算資源が30%増えたように感じると述べ、GPUの占有のような高コストな回避策も防げる。
誰に効くかこれは、競合するプロジェクト間で希少なGPUキャパシティを配分するAI研究チームとそのマネージャーに影響する。高価なハードウェアを遊ばせることなく、より明確な予算ベースの方法で作業に優先順位を付けられるようになる可能性がある。
こういう要約が、毎朝あなたのメールに届きます。
Ai2は88基から1024基のGPUで構成されるクラスタにわたり、数千基のNVIDIA H100、B200、B300 GPUを運用し、約150名の社内研究者に提供している。GPU時間の需要は一貫して供給を上回り、未処理のリクエストは利用可能なGPUの2〜3倍に達している。旧来の優先度ベースのスケジューラではワークロードがプリエンプト対象外を選べたため、GPUの「占有」と優先度のインフレが生じ、最終的にはスケジュールされたワークロードの100%がHIGH優先度を使用するようになった。オンコールのエンジニアはチケット対応時間の大半を、メンテナンスが必要なホスト上のプリエンプト不可ワークロードの停止交渉に費やしていた。
新しい予算ベースのシステムは、各プロジェクトにGPU時間の保証されたシェアを割り当てる。例えばプロジェクトA1は総キャパシティの35%を要求している。階層型フェアシェアスケジューラは7日間のルックバックウィンドウで占有状況を追跡し、それに応じてワークロードを並べ替える。ワークロードはプリエンプト保護と引き換えに最小実行時間を宣言する必要がある。最小実行時間はゼロに設定でき、その場合は無料だがプリエンプト可能になる。展開は7月末にクラスタごとに始まった。
履歴データと構築したシナリオを用いたシミュレーションでは、デバッグ作業の待ち時間が約6時間から5分に短縮すると予測されたが、実際の結果はそれを上回り、p90待ち時間は2時間から30秒に短縮された。占有率は導入前後で98%と安定し、提供されたGPU時間の18%は未割当だった。学習曲線は想定より急で、ライブの説明セッションがドキュメントだけよりも効果的であることが分かった。
業界と使っているAIツールを選ぶと、仕事に関係するニュースが毎朝届きます。
登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。AIはこの記事・AIToday の過去記事・Wikipedia を読み、出典を付けて答えます。Q&Aはこのページに公開され、他の読者も読めます。
マッキンゼーのジェームズ・キャプラン・ディスティングイッシュト・パートナーは、AIが乱雑で非構造化のデータを照会し、構造化データと決定論的な業務ルールに変換して知識グラフに保存できるようになったと述べた
UBSのArpine Kocharyan氏らはMetaのMuse AIエージェントによるPlanet Fitnessの解約・会員リスクは実務上管理可能とし、アプリ内認証、生体認証、ネットワークレベルでのbot遮断、会員本…

Axiom Solutions InternationalがGeneral CatalystとKoch Equityから企業価値375億ドルで20億ドルを調達

Financial Timesによると、OpenAIの9月末時点の年換算売上高は約500億ドルだった

AnthropicはCyber Missionを立ち上げ、電力網・水道システム・交通網の運用事業者にClaudeモデル、エンジニア、脅威分析へのアクセスを提供する

Chick-fil-AのCEO、Andrew Cathy氏はCNBCに、ドライブスルー注文係を技術で置き換えず「human plus」と呼ぶ方針と述べた
