
何が起きたか
Liquid AIがd1-3Bを公開。Decision Index 0.2.1で48.57を記録し、全4B・9BモデルとDecider 35B-A3B(47.11)を上回った。
なぜ重要か
小型オープンモデルが意思決定タスクで大型モデルを上回れるようになり、高額な大型モデルに頼らず自社ハードで動かす選択肢が生まれる。
注目点
エッジ速度の主張は測定した特定のNVIDIAハード次第で、併発表のd1-omni-600Mは速度数値も視覚・音声ベンチも未公表の初期研究版だ。
誰に効くかオンデバイスの意思決定機能(顧客チケットの振り分けや画像チェックなど)を手がける開発者や機器メーカーは、NVIDIAのエッジハードで動く小型オープンモデルを評価できるようになった。特定製品に適合するかは、求められるレイテンシとフットプリント次第だ。
こういう要約が、毎朝あなたのメールに届きます。
Liquid AIはこの2つのモデルを自社のLiquid Foundation Models上に構築したが、ひとつ工夫がある。トークンを生成する生成モデルと違い、意思決定モデルは1回のフォワードパスで回答する。この設計がエッジ速度の数値を可能にしている。d1-3Bはデコーダのみの視覚言語モデルLFM2.5-VL-3Bから、実験版のd1-omni-600Mは双方向エンコーダLFM2.5-Encoder-350Mから訓練され、後者は視覚と音声のエンコーダを加えて3モダリティを扱う。2つのバックボーンは用途の違いを示す。d1-3Bは品質が問われるテキストと画像の意思決定向け、d1-omni-600Mはフットプリントが制約となる場面向けだ。
ベンチマーク結果は、読解、有害性検出、意図分類、医療QA、言語横断理解をカバーする7つの公開データセットの平均スコアでd1-3Bが首位に立つことを示す。同社は視覚・音声のベンチマークを報告しておらず、Decision Index v0.3には非公開の視覚スプリットしか含まれず、音声の意思決定ベンチマークは現時点で未解決の問題だと注記している。この欠落は、マルチモーダルの主張を競合と直接比較したい人にとって重要な意味を持つ。
NVIDIAと共同でGeForce RTX 4090、Jetson AGX Thor、Jetson AGX Orin 64 GB、Jetson Orin Nanoを用いた速度検証では、d1-3Bは測定した全端末で1問を50ms未満で回答する。これが実製品での勝利につながるかは、各チーム固有の意思決定タスクでの性能と、d1-omni-600Mが初期研究版からいつ脱するかにかかっていそうだ。
業界と使っているAIツールを選ぶと、仕事に関係するニュースが毎朝届きます。
登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。AIはこの記事・AIToday の過去記事・Wikipedia を読み、出典を付けて答えます。Q&Aはこのページに公開され、他の読者も読めます。
Nvidia出資のReflection AIとMistralが今週、新たなオープンソースモデル「Beam」と「Le Chonk」を発表し、他を上回ると主張した

OpenAIのdotsとMetaのMuseはまずアシスタントとして動き、他社のサイトやサービスを利用する

MicrosoftはCopilotがローカルファイルにアクセスしOS全体で操作できると披露

OpenAIが10代向けChatGPTに大学出願プランナーを追加

NvidiaのArmベースのRTX Sparkチップ搭載のMicrosoftのSurface Laptop Ultraが2,599ドルから10月16日に発売

Metaは水曜日、Museの専用iPadアプリを公開したと発表した
