
ScitiXは複数のAIモデルを大規模にデプロイする企業向けの本番対応推論プラットフォームを正式展開した。
NVIDIAインフラストラクチャ上で稼働し、1日あたり1兆トークン以上を処理、約1秒のレスポンスタイムと99.9%の稼働率を実現。
単一プロバイダーへのロックインではなく、モデル間のニュートラルなルーティングを提供し、RadixArkなど厳しい要件を持つ本番ワークロードですでに活用されている。
何が起きたか
ScitiXは2026年8月16日、NVIDIA B200、H200、H100インフラストラクチャ上で動作する本番推論プラットフォームを発表した。このプラットフォームは1日あたり1兆トークン以上を処理し、平均初回トークン時間は約1秒、キャッシュヒット率は90%を超え、稼働率は99.9%を実現している。
なぜ重要か
AI実験から本番運用へ移行する企業は、複数モデル間でパフォーマンス、コスト、コンプライアンスのバランスを取れるインフラが必要だ。ScitiXはモデルオーケストレーションの複雑性を抽象化しながら、顧客に細かい制御を与えるニュートラルなルーティングレイヤーとして自社プラットフォームを位置づけている。これにより単一プロバイダーへのロックインを避けられる。オープンソース、ファインチューン、サードパーティモデルを同時に運用する組織にとって重要だ。
注目点
このプラットフォームは現在本番稼働しており、RadixArkを含む要件の厳しい推論ワークロードをすでに支えている。RadixArkはSGLangの商用チームだ。主要機能は、自動フェイルオーバー付きのインテリジェントモデルルーティング、冗長計算を削減するセッション対応コンテキスト再利用、フォールトトレラント実行、プライベートデプロイメント環境、ゼロ保持データポリシー、フルスタック可視化ダッシュボードを備えている。
ScitiXの本番推論市場への参入は、企業がAIデプロイメントに取り組む方法における広範なシフトを反映している。このプラットフォームはML パイプラインに後付けされた補助機能ではなく、運用コアとしてのインファレンスを位置づけている。AIワークロードが大規模でもりもしく、コスト効率的に、かつコンプライアンスを守って実行されるかを最終的に決定する要素だ。この視点は重要な問題を認識している。すなわち、ラボでモデルを実験する組織は本番環境への移行時に、複数モデルの共存、エレガントな障害処理、データレジデンシーやゼロ保持ポリシーの必須化に直面することが多いという実態だ。
プラットフォームのニュートラル性——モデル独占ではなくルーティングレイヤーとしての役割——は顧客ロックイン リスクに対する意識的なアーキテクチャ選択だ。標準API経由でオープンソース、ファインチューン、サードパーティモデルをサポートすることで、ScitiXはモデルプロバイダーではなくオーケストレーション基盤として自社を位置づけている。同社が報告している運用メトリクス(1日1兆トークン、稼働率99.9%、キャッシュヒット率90%超)は、このシステムが初日から本番規模に対応するよう設計されていることを示唆している。すでにSGLangを本番運用しているRadixArkが要求度の高いシナリオをScitiXに移行することを選択した事実は、このプラットフォームが市場が提供していたものより応答性と信頼性において実質的な改善をもたらしていることを示唆している。
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できます
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。