
何が起きたか
VRAM 32GB環境で4ビット量子化のQwen3.8 27Bを試し、Q4_K_Sに切り替えるとVRAM使用量26GBで推論が高速化、記事要約をトラブルなく完了した。
なぜ重要か
以前はSolar Pro 4が何度も失敗しながら要約していたタスクを、同じQwen3.8 27Bの構成で一発でこなせた点が変わり目とみられる。
注目点
VRAM 32GBあっても推論時はKVキャッシュなどで消費が膨らむため、量子化の選択次第で速度が大きく変わる。次回はBot Modeを試す予定。
誰に効くかローカルAIを自社で動かしたい情シス担当や個人開発者にとって、32GBクラスのGPUで27Bモデルを実用速度で回せるかどうかの判断材料になる。量子化の違いでVRAM使用量と速度が変わる点は、モデル選定の際に確認すべき条件とみられる。
こういう要約が、毎朝あなたのメールに届きます。
GIGAZINEはこれまでHermes Agentをインストールし、GIGAZINEの記事を取得して要約する作業を任せてきた。最初の試行ではNous ResearchのHermes 4 70BやSolar Pro 4を使い、Solar Pro 4は最終的に目的を達成したものの、ブラウザの起動に失敗して別の方法へ切り替えたり、途中で違う記事を開いたりと試行錯誤が目立った。
今回、VRAM 32GBの環境が整ったことで、Qwen3.8 27Bを以前より品質を保った量子化設定で動かせるようになった。まずQ8_K_XLを試したが通常のRAMにロードされ、標準のQwen3.8 27B(Q4_K_M)でもバックエンドがCPUモードになっていた。Vulkanを指定する設定変更を経てVRAMへロードされたが、KVキャッシュなどで使用量が30GB近くになり4GB超がRAMに退避、速度は毎秒1桁トークン程度だった。そこで1GB小さいQ4_K_Sに切り替えたところ、推論に使う部分がVRAMに収まり、Solar Pro 4が苦戦した記事の取得・要約を迷わず完了した。
この結果は、VRAM 32GBあってもモデルの量子化の違いで実用速度が大きく変わることを示す。ローカルAIを業務で使いたい担当者にとっては、モデルサイズだけでなく量子化方式と推論時のメモリ消費を確認する必要があるとみられる。
業界と使っているAIツールを選ぶと、仕事に関係するニュースが毎朝届きます。
登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。AIはこの記事・AIToday の過去記事・Wikipedia を読み、出典を付けて答えます。Q&Aはこのページに公開され、他の読者も読めます。