
開発者がShrike liteマイコンの264KBのRAMで拡散モデルを訓練・実行し、32×32ピクセルの画像を生成した。
FPGAで独自のハードウェアアクセラレーションを追加したが、メモリI/Oボトルネックでアクセラレータ版がCPU単体版より遅くなり、メモリ帯域幅が制約された環境での計算性能とメモリ帯域幅のトレードオフが浮き彫りになった。
何が起きたか
開発者がShrike liteマイコンで拡散モデル(画像生成AI)を訓練し、264KBのSRAMのみで32×32ピクセルの画像を生成した。同デバイスに搭載されたFPGA(再構成可能なチップ)を使い、演算を高速化するため16ビット積算機能を持つ2つの並列INT8 MACエンジンを構築した。
なぜ重要か
メモリ制約が厳しいハードウェア上でAIモデルを実行することで、通常は高い計算量を必要とする画像生成がエッジデバイス(センサー、IoTハードウェア)で動作可能であることが実証された。クラウドサーバーへのモデルダウンロードが実用的でない、または望ましくない環境でのAI推論の道を開く可能性がある。
注目点
並列アクセラレータは、大量のI/O操作によるメモリボトルネックのため、実際にはCPU単体版(約70秒/画像)より性能が低下した(約220秒/画像)。ハードウェアの高速化だけでは、メモリ帯域幅が制約になるとエンドツーエンドの改善につながらないことを示唆している。量子化とメモリ制限により画像品質は低下したが、利用可能な出力もあった。
メモリ制約が厳しいハードウェアでAIモデルを実行することは通常は現実的でないと考えられているが、このプロジェクトは264KBのマイコンでさえ訓練済み拡散モデルをホストできることを実証した。実験は基本的なハードウェア設計の教訓を明らかにしている。並列MACエンジンで演算性能を追加しても、システムがメモリ帯域幅ではなくCPU速度でボトルネックになっていないため、全体的なパフォーマンスは改善されなかった。開発者がFPGAアクセラレーションを追加した選択は、実際には性能を約70秒から約220秒/画像に低下させた。これは極めて小さいSRAMとの間でデータをやり取りするのに必要な高いI/Oオーバーヘッドの直接的な結果である。このトレードオフはエッジデバイスAIでよく見られる。理論的には高速なハードウェアも、メモリアーキテクチャで制約されると遅くなる可能性がある。大量の量子化とメモリ圧力により画像品質は低下し、ノイズが多い、または歪んだ出力が生成されたが、一部の結果は受け入れ可能であると報告されている。エッジデバイス向けの特定のアプリケーションでは、クラウド接続なしでローカルで推論を実行できることと引き換えに、ロッシーな品質が許容されるトレードオフかもしれない。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
開発者が、RAGアプリ(文書を検索して回答を生成するシステム)がユーザーに見せてはいけない文書を返すかどうかを検査するオープンソースツールを公開した

先週末のヘリテージ・オークションズによるディズニーアートの競売は、1,346点の出品で343万ドルを売り上げた

ホビイストが、オートフォーカスカメラ付きのMakerfabs ESP32-P4ボードを使って水道メーターを読み取るシステムを構築した

MetaやGoogleなど大手が公開する大規模言語モデル(LLM、テキストを理解・生成するAI)の多くが、今や無料でダウンロードでき、自分のパソコン上で動かせる

LAIONはAI研究向けの大規模公開動画データセット「Big Video Dataset(BVD)」を公開した

開発者が12層の潜在フロートランスフォーマーによる超小型画像生成モデルを製作し、マイコン上で完全動作させた
