
AWSとNVIDIAがMPSでASRのGPU需要を75%削減。
インスタンスは16から4に減少。
レイテンシは650ms未満、1GPUあたり92.1 RPSを維持。
何が起きたか
AWS、NVIDIA、Heidi Healthが、自動音声認識(ASR)推論のGPUインフラを75%削減するソリューションを公開。Amazon EC2上でNVIDIA CUDA Multi-Process Service(MPS)とTriton Inference Serverを組み合わせ、GPUインスタンスを16から4に削減した。
なぜ重要か
通常、ASRリクエスト1件が使うGPUコンピューティング容量は15〜20%に過ぎず、デフォルトのタイムスライシングでは最大80%がアイドル状態になる。このソリューションではGPUを並列実行のインスタンスに分割し、1GPUあたり毎秒92.1リクエスト(RPS)を維持しつつ、サブ秒レベルのレイテンシを実現。高スループットの音声サービスの運用コスト削減につながる。国内の音声認識サービスを運用する企業は、GPUリソースの効率化により運用コストを抑えられる可能性がある。
注目点
ソリューションはAmazon EC2のg6e.4xlargeおよびg7e.4xlargeインスタンス(NVIDIA L40S、48GB)で実装され、CUDA 12.x対応のNVIDIAドライバ535以上が必要。コードはオープンソースリポジトリで公開されており、3つのコマンドで導入できる。
この記事では、190カ国で週間240万件以上の臨床相談を処理するAIケアパートナーであるHeidi Healthが、GPU利用効率の低さによる高いGPUコストに直面していた状況を説明。リクエストごとのGPU使用率が低く、厳しいレイテンシ要件があったため、16インスタンスの運用を余儀なくされていた。AWSとNVIDIAとの連携により、CUDA MPSを使ってGPUを分割するソリューションを実現し、サブ秒のレイテンシを維持しながらインフラを75%削減した。
この最適化は、Parakeet TDT 0.6B V2モデルのファインチューニングに関する以前の投稿を基にしている。今回の取り組みは、そのモデルの効率的な推論に焦点を当てている。MPSとTritonの動的・シーケンスバッチ処理を組み合わせることで、文字起こしとダイアライゼーションのワークロード特有のボトルネックに対処している。オープンソースのリポジトリは、同様の課題を抱える他社にとって実用的な道筋を示しており、AWS上でのASRの大規模導入のハードルを下げる可能性がある。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
エヌビディアがHugging Faceを130億ドルで買収すると報じられた

Beatportは、全体または大部分をAIで制作されたトラックを禁止した

消防庁は2027年度に119番通報のAI活用に関するモデル事業を始める計画だ

Anthropic PBCは、AIエージェントが顕微鏡などの科学機器を制御できるようにする統一インターフェース「Model Hardware Standard(MHS)」を発表した
NVIDIAがAIプラットフォームのHugging Faceを2兆ドルで買収することで合意したと記事は報じている

AWSは、エージェント型AIワークスペース「Amazon Quick」が、Model Context Protocol(MCP)を通じてfalの生成メディアプラットフォームと連携する統合を発表した
