AIToday
大規模言語モデルオープンソースAIQiita 機械学習掲載日時: 2026年10月8日 16:00

d1-3B、API版d1に2ベンチで劣後

LINEで送る
d1-3B、API版d1に2ベンチで劣後

3つのポイント

  1. 何が起きたか

    Liquid AIが10月5日に公開したd1-3Bは、JNLIでAPIのd1を10.8ポイント、JCommonsenseQAで8.4ポイント下回った。ライブドアでは0.7ポイント差だった。

  2. なぜ重要か

    同じ「d1」の名前でも公開版とAPI版で精度に差があるとみられ、APIの裏ではd1-3Bより大きなモデルが動いている可能性がある。Liquid AIはAPIの中身の大きさを示していない。

  3. 注目点

    d1-3Bの測定は10月8日、API版d1は10月1日と1週間の開きがあり、APIの中身が変わっていても反映されていない。

誰に効くか自社システムにAPI経由でd1を組み込む情報システム担当や、コスト削減のため手元のGPUでd1-3Bを動かそうと検討する開発者は、同じモデル名でも精度が異なる点を前提に検証する必要があるとみられる。

わからないところ、AIに聞けます

質問と回答はこのページに公開されます。

こういう要約が、毎朝あなたのメールに届きます。

背景と解説

Liquid AIは判断専用モデルd1をこれまでAPIでしか提供していなかったが、10月5日に重みをd1-3BとしてHugging Faceで公開した。手元のGPUで動かせるようになったことで、API版と同じ精度が出るかが利用者の関心になる。今回の測定では、d1 APIの数字はd1-3B公開前の10月1日に別の記事向けに測った結果を流用しており、d1-3Bは10月8日に測っている。両者の測定には1週間の開きがある。d1-3Bには選択肢を説明なしの辞書で渡しており、説明を付けると結果が変わる可能性がある。Liquid AIはAPIの中身の大きさを示しておらず、重みが公開されているのはd1-3Bとより小さいd1-omni-600Mだけである。APIの裏でより大きなモデルが動いている可能性や、公開版と別の版である可能性、入力の扱いの違いが考えられるが、いずれも今回の測定では確かめられていない。

よくある質問
d1-3Bはどこで入手できますか?
Hugging FaceのLiquidAI/d1-3Bとして公開されており、3.1BのBF16で、RTX 4080 1枚に載せて動かせる。
API版d1とd1-3Bの測定時期は違いますか?
API版d1の測定は10月1日で、d1-3Bの測定は10月8日であり、1週間の開きがある。
d1-3Bは選択肢をリストで渡せますか?
リストでは受け付けず、{"entailment": null, ...} のような辞書で渡す必要がある。
Qiita 機械学習元記事を読む
LINEで送る

あなたの仕事に関係するAIニュースを、毎朝お届けします。

業界と使っているAIツールを選ぶと、仕事に関係するニュースが毎朝届きます。

登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。AIはこの記事・AIToday の過去記事・Wikipedia を読み、出典を付けて答えます。Q&Aはこのページに公開され、他の読者も読めます。

質問と回答はこのページに公開されます。

次の記事へMicrosoft、MAI-Code-1.1-Flash公開