AIToday
大規模言語モデルAIビジネス・産業SiliconANGLE AI掲載日時: 2026年9月10日 1:002分で読める

LightbitsがAI推論向けInferraを発表

LINEで送る
LightbitsがAI推論向けInferraを発表

3つのポイント

  1. 何が起きたか

    Lightbits LabsがInferraの一般提供を発表。KVキャッシュデータをGPUメモリとストレージ間で管理し、GPUストールを防ぐソフトウェアエンジン。

  2. なぜ重要か

    長いコンテキストや多数のセッションを扱うLLMを運用するネオクラウドプロバイダーや企業を対象とし、初回トークンまでの時間を100倍以上短縮すると主張。

  3. 注目点

    本番環境でのパイロット運用を開始しており、来週サンタクララで開催されるAIインフラサミットでデモを予定。

誰に効くか長いコンテキストや多数の同時セッションを扱う大規模言語モデルを運用するネオクラウドプロバイダーや企業に最も影響がある。Inferraは初回トークンまでの時間を短縮し、市販ハードウェアで同時セッション密度を高めることを目指している。

この記事についてAIに質問する →

こういう要約が、毎朝あなたのメールに届きます。

背景と解説

Lightbits Labsは、NVMe over TCPストレージプロトコルの発明で知られるが、3月に発表し今回一般提供を開始したInferraでAI推論市場に参入する。このエンジンは、GPUの高帯域幅メモリ、DRAM、NVMeストレージ間でKVキャッシュを管理し、GPUが必要とする前にデータを事前ロードする予測型プリフェッチを用いる。この分離により、GPUメモリの容量と取得速度の制限に対処する。

同社はキャッシュヒット率が99.9%に近いと主張し、Inferraは検索拡張生成、AIエージェント、GPUサービス共有に最も効果的だと位置づけている。Rasmusson氏は、プロセッサの速度がメモリを上回った時期のCPU技術に類似していると語る。Lightbitsは、利用率と利益率の圧力からネオクラウドプロバイダーが早期導入者になると見る。

Inferraの成功は、主張するベンチマーク結果が本番環境で再現されるかどうかにかかっている。同社はパイロット運用を進めており、来週のAIインフラサミットでデモを行う。ステージング予測が遅延改善に実効性があるか、実際のテストが行われることになる。

よくある質問
KVキャッシュとは何か?
KVキャッシュは、モデルがプロンプトを処理する際に生成される中間注意データを保持する。会話が長くなるほどサイズが増大し、GPUメモリを消費し、利用できないとストールを引き起こす。
Inferraの最初のターゲット顧客は?
ネオクラウドプロバイダーが最初のターゲット。Lightbitsは、彼らが利用率と利益率の向上を迫られているため、ハイパースケーラーよりも早く採用すると述べている。
性能上の利点はどのように主張されているか?
Lightbitsは、Inferraにより長いコンテキストのワークロードで初回トークンまでの時間を100倍以上短縮し、市販ハードウェア上で1000万トークンを超えるコンテキストを処理できると主張。ただし、これは同社の推定に基づく。
SiliconANGLE AI元記事を読む
LINEで送る

「大規模言語モデル」の最新ニュースを、毎朝7時にお届けします

たとえば、いま届くならこの3本です

  • Dynatrace、Arize AIを買収SiliconANGLE AI · 6時間前
  • 100のファインチューニング、1GPUで1.5TBから19.3GBにDaily Dose of Data Science · 6時間前
  • OpenAIエージェントがRubyGems攻撃Simon Willison's Weblog · 6時間前

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。

関連記事

次の記事へブロードコムAI収益がカスタムチップで急増