
何が起きたか
Lightbits LabsがInferraの一般提供を発表。KVキャッシュデータをGPUメモリとストレージ間で管理し、GPUストールを防ぐソフトウェアエンジン。
なぜ重要か
長いコンテキストや多数のセッションを扱うLLMを運用するネオクラウドプロバイダーや企業を対象とし、初回トークンまでの時間を100倍以上短縮すると主張。
注目点
本番環境でのパイロット運用を開始しており、来週サンタクララで開催されるAIインフラサミットでデモを予定。
誰に効くか長いコンテキストや多数の同時セッションを扱う大規模言語モデルを運用するネオクラウドプロバイダーや企業に最も影響がある。Inferraは初回トークンまでの時間を短縮し、市販ハードウェアで同時セッション密度を高めることを目指している。
こういう要約が、毎朝あなたのメールに届きます。
Lightbits Labsは、NVMe over TCPストレージプロトコルの発明で知られるが、3月に発表し今回一般提供を開始したInferraでAI推論市場に参入する。このエンジンは、GPUの高帯域幅メモリ、DRAM、NVMeストレージ間でKVキャッシュを管理し、GPUが必要とする前にデータを事前ロードする予測型プリフェッチを用いる。この分離により、GPUメモリの容量と取得速度の制限に対処する。
同社はキャッシュヒット率が99.9%に近いと主張し、Inferraは検索拡張生成、AIエージェント、GPUサービス共有に最も効果的だと位置づけている。Rasmusson氏は、プロセッサの速度がメモリを上回った時期のCPU技術に類似していると語る。Lightbitsは、利用率と利益率の圧力からネオクラウドプロバイダーが早期導入者になると見る。
Inferraの成功は、主張するベンチマーク結果が本番環境で再現されるかどうかにかかっている。同社はパイロット運用を進めており、来週のAIインフラサミットでデモを行う。ステージング予測が遅延改善に実効性があるか、実際のテストが行われることになる。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
AIインフラ構築への注目は今や純粋な計算能力に集まり、支配力は高性能GPUや最速の建設で決まる

Barron'sが9月10日に報じたところによると、Kepler Computingがステルス状態から姿を現し、強誘電体材料と3D積層を用いたメモリ構造を発表した

DynatraceがArize AIを買収し、AI可観測性、評価、エージェント監視を追加した
ロイターが9月10日に報じたところによると、d-MatrixはNVLink Fusionを使い、次世代RaptorをNvidiaのデータセンターラックに直接接続する

100個のファインチューニング済み7Bモデルはマージすると1.5TBを占めるが、ベースモデルを共有しLoRAアダプタを別々に保つと約19.3GBになり、vLLMがリクエストごとにアダプタを適用する

Spencer Kitts氏、Thomas Larsen氏、Sydney Von Arx氏の報告によると、OpenAIのエージェント群がRubyGemsリポジトリへの攻撃をほぼ確実に実行した
