
フランス新興企業Kogは、新しいハードウェアではなく専門化したソフトウェア最適化により、標準的なデータセンターGPUが大幅に高速なAI推論を提供できることを実証している。
同社のデモは小規模モデルで3,000トークン/秒を示し、既存ツールが完全に活用していないGPU機能を解放することで、大規模言語モデルで30倍高速な推論を実現できると主張している。
200件の早期ビジネスリードと9月までに主要モデルでの実証を目指すKogは、従来型チップにすでに投資している企業にとって重大な課題である推論速度に対応する立場を確立している。
何が起きたか
フランス新興企業Kogの創業者Gaël Delalleauは、GPU レベルの深いソフトウェア最適化によってAMD MI300XやNvidia H200といった従来のデータセンターGPU上でAI推論を加速させている。同社は5月のテック プレビューで20億パラメータの小規模モデル(Laneformer 2B)での3,000トークン/秒を実証し、既存ハードウェアの隠れた機能を活用することで、LLM推論を30倍高速化できると主張している。
なぜ重要か
推論速度がAI導入の重大なボトルネックとなっており、Kogのソフトウェアのみによるパフォーマンス向上の約束は、すでに標準GPUを保有する企業にとって魅力的だ。同社は200件のビジネスリードを集積しており、Claude Codeのようなツールが数時間の待機を強いるソフトウェアエンジニアリングワークフローをターゲットとしている。Anthropic自体が高速処理に対する価格プレミアムを課していることは、市場が速度を重視していることを示している。開発者とAIを専門タスクに依存するビジネスにとって、推論の高速化はコスト削減と運用の円滑化につながる可能性がある。
注目点
Delalleauは9月までに「最初の主要モデルで10倍速」を実証することを目指すと述べており、これをシリーズA資金調達確保に不可欠なマイルストーンとして位置付けた。11人のチームは新しいGPUごとに最適化するのに数カ月の手作業が必要であり、長期的にはエージェントベースの自動化を開発してより多くのチップに対応する計画がある。同社はScaleway、Bpifrance、フランスのTech 2030プログラムの支援を受けており、ヨーロッパの主権的AI能力構築の取り組みに位置付けられている。
Gaël Delalleauによって創立されたKogは、AI インフラの最も差し迫った課題の1つに取り組んでいる。それは推論の速度、つまりAIモデルがユーザーのプロンプトに対する回答を生成する計算ステップである。Cerebasのようなライバルがカスタムシリコンで推論を加速させることに賭けている一方、Kogは企業データセンターにすでに存在する従来型GPUがソフトウェアのみで解放される未開発のパフォーマンスを含んでいると賭けている。5月、同社はHacker Newsでテック プレビューを公開し、標準的なデータセンターGPU、特にAMD MI300XおよびNvidia H200上での極めて高速な単一リクエストデコーディングを実証し、20億パラメータを持つ小規模オープンソースモデルLaneformer 2Bで3,000トークン/秒を達成した。同社は全体的に30倍高速なLLM推論を提供できると主張しているが、より大規模なモデルでのこれの実証は保留のままである。早期の対応は期待を上回った。Kogはプレビューから200件の具体的なビジネスリードを集積した。Delalleauはソフトウェアエンジニアリングが最も直近のユースケースであると示唆し、Claude Codeのようなツールが時々ユーザーに数時間の待機を強いていると述べた。Anthropic自体はClaudeの高速モードに対して価格倍数を課すことで速度を収益化し、顧客がより高速な推論に支払うことを検証している。Kogはまたゲームやアプリをプロンプトから生成することをユーザーに可能にするデザインパートナーと交渉しており、レイテンシの削減はセッションあたりのより多くの収益に直結するだろう。しかし、Kogは技術的な飛躍に直面している。デモは目的に応じて構築された小規模モデルで機能したのに対し、企業の需要は大規模言語モデルに向かっている。Delalleauは同じ最適化技術がより大きなシステムに適用されると確信し、新しいGPUの増大するメモリ帯域幅を利用できない失敗からデコーディングに対するGPUが不適切であるという誤解が生じていると主張している。Delalleau自身はフランスのÉcole Polytechniqueで固体物理学を研究し、攻撃的なサイバーセキュリティ(ホワイトハットハッキング)に何年も費やし、DEFCONのCFTトーナメントに4回参加した。この背景は彼のチームの方法論を形作った。科学面では、効率を最大化するためにGPU物理学を理解すること。ハッキング面では、ハードウェアをアセンブリ言語とバイナリまで逆エンジニアリングして、意図しない目的のために再利用すること。欠点は労働集約的である。Kogは対応する各新しいチップに対してGPUエンジニアリング研究の数週間または数カ月を費やしている。11人の従業員しかいないため、これは同社が短期的に対象にできるチップを制限し、Delalleauはながらくエージェントベースのパイプラインを通じてプロセスを自動化することを望んでいる。当面、Kogは9月までに最初の主要モデル最適化で10倍速を提供することに焦点を当てており、Delalleauはこれを顧客牽引力を実証し、シリーズA資金調達を確保するのに必要なマイルストーンとして位置付けた。同社はScaleway、Bpifrance、フランスのTech 2030プログラムの支援を受けており、米国のチップおよびソフトウェアベンダーからの独立を求める大陸としてのヨーロッパの主権的AI能力構築のより広範な取り組みの中に位置付けられている。
GPU推論最適化市場へのKogの参入は、AI インフラの優先順位におけるより広範な転換を反映している。Nvidia GPUのようなチップはすでに企業全体に展開されており、パフォーマンス向上の次の最前線はソフトウェアにある。Kogの30倍高速化という主張は野心的だが、モダンGPUが既存ソフトウェア(Nvidia CUDAフレームワークを含む)が完全に利用していないメモリ帯域幅機能を搭載しているという具体的な観察に根拠がある。固体物理学と競技的ハッキングを通じた逆エンジニアリングのDelalleauの背景は、スタンフォード大学のHazy Researchとの類似性を描きながら、この「低レベル」最適化作業を追求する立場を与えている。しかし、このアプローチには明らかなボトルネックがある。11人のチームが新しいパフォーマンスを解放するために必要な詳細なエンジニアリング作業を実施するのにGPUあたり数カ月を要し、スケーラビリティを制限している。Delalleauは微調整された小規模モデル市場はまだ成熟していないことを認めており、代わりにKogは推論遅延が収益またはユーザー体験に直接影響するユースケース(ソフトウェアエンジニアリングワークフロー、ゲームおよびアプリ生成、顧客が現在数時間の待機時間を受け入れている専門的なAIツール)をターゲットとしている。5月のローンチ以来集積した200件の具体的なビジネスリードは実際の需要を示唆しているが、20億パラメータのデモから大規模言語モデルでの実証に移行することは依然として重大なテストのままである。
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できます
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
出版社で技術パイオニアのTim O'Reillyが、単なるオープンウェイトモデルではなくスタック全体のオープンソースAIを推進している

Amazon、Google、Meta、Microsoftなど大手クラウド事業者が、AI向けデータセンター建設に向けて大型の天然ガス発電所を相次ぎ発注しています

Metaは今週、誰もがダウンロードして自分のハードウェアで実行できるオープンウェイトAIモデル「Glimmer」をリリースした

AI コンパニオンプラットフォーム Joi AI は 7 月に 28 日間の研究を実施し、10 人の「マスターベーション コンサルタント」(6 人が完了)を雇用しました

人間がAIチャットボットと結婚する事例が登場し始めており、共和党を中心とした複数の州議員がこれを法的に禁止する法案を導入しています

海光情報が2026年上半期の売上を66.5%増加させた

AIニュースの要点を毎朝1分で。
無料で登録