AIToday
大規模言語モデルオープンソースAIQiita 機械学習掲載日時: 2026年10月9日 13:00

ax-engineがデコード76tok/s超

LINEで送る
ax-engineがデコード76tok/s超

Apple Silicon Mac向けオープンソースのax-engineが、特定のM5 Max構成でデコード76 tok/s超を計測。mlx-lmの約2.4〜2.7倍の速度となった。

わからないところ、AIに聞けます

質問と回答はこのページに公開されます。

こういう要約が、毎朝あなたのメールに届きます。

背景と解説

このプロジェクトの出発点はApple Silicon Macのハードウェア上の特性にある。GPUとCPUが同一のUnified Memory Architectureを共有するため、ローカルLLMの実行は生の演算能力ではなく、モデルの重みとKVキャッシュを読み出す速度であるメモリ帯域に制限されることが多い。実際、モデルは問題なく読み込めても、トークン生成が想定より遅くなることがある。

ax-engineは、チャットUIやクラウドサービスではなく実行と配信に焦点を当てることで、この差を埋めようとしている。設計上の狙いには、補助的な予測ヘッドが数トークン先を提案し本体モデルがそれを検証するMTPデコード、Prefix再利用、単一プロセスからの複数モデル配信がある。開発者は、MTPの効果は一定ではなく、モデルアーキテクチャ、MTP対応の有無、量子化形式、プロンプトとコンテキスト長、生成トークン数、Apple Siliconの世代、Unified Memory容量によって変わると強調する。だからこそ、同じモデル、同じ量子化、同じプロンプトで比較するよう促している。

ベンチマーク表自体はプレースホルダー値で示されているため、再現可能な公開値は、報告されているM5 Maxでの76 tok/s超という結果と、mlx-lmに対する約2.4〜2.7倍の優位だ。開発者はこれらが固定値ではなく、構成によって大きく変わると明言している。範囲を広げるため、M1からM5までのマシン、16 GBから64 GB以上までのメモリ、各種量子化形式での結果を、チップとメモリ容量、macOSとax-engineのバージョン、モデル名、コンテキスト長、デコードとプリフィルの速度、メモリ使用量、発生したエラーと併せて求めている。既知の制限には、モデル対応のばらつき、モデルと設定に依存するMTP、インストールとモデル変換の問題、すべてのOpenAI互換クライアントとの互換性が保証されないことがある。

よくある質問
ax-engineとは具体的に何か。
Apple Silicon Mac向けのオープンソースLLM推論・モデルサービングエンジンだ。OpenAI互換APIを備え、1つのプロセスから複数モデルを配信でき、対応モデルではMTPとPrefix再利用をサポートする。
mlx-lmよりどの程度速いのか。
mlx-lmのデコード速度の約2.4〜2.7倍を計測し、特定のM5 Max構成では76 tok/s超だった。開発者によれば固定値ではなく、モデル、量子化、コンテキスト長、プロンプト、MTP設定によって変わる。
既存のOpenAI互換ツールは使えるのか。
使える。ax-engineはOpenAI互換APIを公開しているため、OpenAI互換のBase URLを設定できるアプリなら、クラウドAPIの代わりにローカルのax-engineを指定できる。
Qiita 機械学習元記事を読む
LINEで送る

あなたの仕事に関係するAIニュースを、毎朝お届けします。

業界と使っているAIツールを選ぶと、仕事に関係するニュースが毎朝届きます。

登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。AIはこの記事・AIToday の過去記事・Wikipedia を読み、出典を付けて答えます。Q&Aはこのページに公開され、他の読者も読めます。

質問と回答はこのページに公開されます。

関連記事

次の記事へAnthropicがClaude虐待禁止を明記