
何が起きたか
Liquid AIが10月5日に公開したd1-3Bは、JNLIでAPIのd1を10.8ポイント、JCommonsenseQAで8.4ポイント下回った。ライブドアでは0.7ポイント差だった。
なぜ重要か
同じ「d1」の名前でも公開版とAPI版で精度に差があるとみられ、APIの裏ではd1-3Bより大きなモデルが動いている可能性がある。Liquid AIはAPIの中身の大きさを示していない。
注目点
d1-3Bの測定は10月8日、API版d1は10月1日と1週間の開きがあり、APIの中身が変わっていても反映されていない。
誰に効くか自社システムにAPI経由でd1を組み込む情報システム担当や、コスト削減のため手元のGPUでd1-3Bを動かそうと検討する開発者は、同じモデル名でも精度が異なる点を前提に検証する必要があるとみられる。
こういう要約が、毎朝あなたのメールに届きます。
Liquid AIは判断専用モデルd1をこれまでAPIでしか提供していなかったが、10月5日に重みをd1-3BとしてHugging Faceで公開した。手元のGPUで動かせるようになったことで、API版と同じ精度が出るかが利用者の関心になる。今回の測定では、d1 APIの数字はd1-3B公開前の10月1日に別の記事向けに測った結果を流用しており、d1-3Bは10月8日に測っている。両者の測定には1週間の開きがある。d1-3Bには選択肢を説明なしの辞書で渡しており、説明を付けると結果が変わる可能性がある。Liquid AIはAPIの中身の大きさを示しておらず、重みが公開されているのはd1-3Bとより小さいd1-omni-600Mだけである。APIの裏でより大きなモデルが動いている可能性や、公開版と別の版である可能性、入力の扱いの違いが考えられるが、いずれも今回の測定では確かめられていない。
業界と使っているAIツールを選ぶと、仕事に関係するニュースが毎朝届きます。
登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。AIはこの記事・AIToday の過去記事・Wikipedia を読み、出典を付けて答えます。Q&Aはこのページに公開され、他の読者も読めます。