
Apple Silicon Mac向けオープンソースのax-engineが、特定のM5 Max構成でデコード76 tok/s超を計測。mlx-lmの約2.4〜2.7倍の速度となった。
こういう要約が、毎朝あなたのメールに届きます。
このプロジェクトの出発点はApple Silicon Macのハードウェア上の特性にある。GPUとCPUが同一のUnified Memory Architectureを共有するため、ローカルLLMの実行は生の演算能力ではなく、モデルの重みとKVキャッシュを読み出す速度であるメモリ帯域に制限されることが多い。実際、モデルは問題なく読み込めても、トークン生成が想定より遅くなることがある。
ax-engineは、チャットUIやクラウドサービスではなく実行と配信に焦点を当てることで、この差を埋めようとしている。設計上の狙いには、補助的な予測ヘッドが数トークン先を提案し本体モデルがそれを検証するMTPデコード、Prefix再利用、単一プロセスからの複数モデル配信がある。開発者は、MTPの効果は一定ではなく、モデルアーキテクチャ、MTP対応の有無、量子化形式、プロンプトとコンテキスト長、生成トークン数、Apple Siliconの世代、Unified Memory容量によって変わると強調する。だからこそ、同じモデル、同じ量子化、同じプロンプトで比較するよう促している。
ベンチマーク表自体はプレースホルダー値で示されているため、再現可能な公開値は、報告されているM5 Maxでの76 tok/s超という結果と、mlx-lmに対する約2.4〜2.7倍の優位だ。開発者はこれらが固定値ではなく、構成によって大きく変わると明言している。範囲を広げるため、M1からM5までのマシン、16 GBから64 GB以上までのメモリ、各種量子化形式での結果を、チップとメモリ容量、macOSとax-engineのバージョン、モデル名、コンテキスト長、デコードとプリフィルの速度、メモリ使用量、発生したエラーと併せて求めている。既知の制限には、モデル対応のばらつき、モデルと設定に依存するMTP、インストールとモデル変換の問題、すべてのOpenAI互換クライアントとの互換性が保証されないことがある。
業界と使っているAIツールを選ぶと、仕事に関係するニュースが毎朝届きます。
登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。AIはこの記事・AIToday の過去記事・Wikipedia を読み、出典を付けて答えます。Q&Aはこのページに公開され、他の読者も読めます。
AnthropicはClaudeモデル、オンサイトエンジニア、脅威リサーチを提供するAnthropic Cyber Missionを始動

OpenAIのDecisions APIでgpt-6-lunaを使い「おもちゃが見えるか」「左か中央か右か」に答えるパイプラインを構築しSO-101アームを動かした

Claude Codeを4時間おきに無人起動し、各作業場のgit statusで未commitの変更を持ち主別に分け、完成ならcommit、壊れていればgit restoreで戻す

SKILL.mdは6月17日から2,116バイト(1.2.0)のまま更新されず、20:05のTelegramリクエストで20:08までに1.3.0、4,513バイトが生成された

OpenAIはロシアの「Dark Clark」作戦関与アカウントを無効化と発表

Opperは、JevやGPT-6 Luna Decisionsを含む6つのAIモデルをパックマンで各100回プレイさせ、スコア等で順位付けするベンチマーク「jevman」を公開した
