AIToday
大規模言語モデルオープンソースAIQiita 機械学習掲載日時: 2026年10月9日 16:00

Jev互換14構成を自作76問で比較

LINEで送る
Jev互換14構成を自作76問で比較

投稿者がJev形式の76問(noul 38、choice 21、score 17)を自作し、RTX 4090でOpen Weightの14構成を動かした。

わからないところ、AIに聞けます

質問と回答はこのページに公開されます。

こういう要約が、毎朝あなたのメールに届きます。

背景と解説

TypeSafe AIのCEO Diogo Almeidaは元OpenAIでRLHFやInstructGPTに関わり、「チャットは超人的になったのに、なぜ自動化は進まないのか」という問いからJevを作ったと説明している。Jevは学習法にRLCD(Reinforcement Learning for Calibrated Decisions)と呼ぶ独自手法を使い、合成データのみで学習された。ライセンスはプロプライエタリで、重み、アーキテクチャ、論文とも非公開だ。

Jevの外形は「stateと型付き質問を受け、選択肢の確率分布を返す」というもので、これが公開から3週間で互換のOpen Weightモデルが数十種類登場する背景になった。ただし同名の別プロジェクトが多く、「OpenJev」と名の付くものは5つ以上あり、kyegomez/open-jevはランダム重みの研究実装で実用できず、openjev/openjevはCC-BY-NCで商用不可である点には注意が要る。

独立ベンチマークも2つに分かれている。Benchmark Heavenが運営するJevBenchは4軸の等重み調和平均を公式スコアとするため27BクラスはCostで減点され、問題プールと採点法がバージョンごとに変わり順位が大きく入れ替わる。Cloudflareが運営するDecision Indexとは順位が一致しない。投稿者の手元計測でも、公式の弱点リスト(算術、日付比較、多段推論、プロンプトインジェクション)はOpen Weightにも当てはまることが確認された。

よくある質問
Jevは何ができて何ができないのか?
入力(state)と型付きの質問を渡すと、テキストではなく選択肢ごとの確率分布を返す。分類、ルーティング、採点、真偽判定、ガードレールなどコードが直接消費する判断に特化し、チャットやコード生成には使えない。
Open Weightの代替モデルはどう作られているのか?
大半は既存のOpen LLM(Qwen3.5 / Gemma 4)のトルソを流用し、生成ヘッドの代わりに選択肢の確率を読み出す部分を載せたもので、読み出しヘッド置換、選択肢文字のロジット読み出し、エンコーダ+決定ヘッドの3方式に分かれる。
手元の計測でレイテンシはどれくらいだったのか?
GPUのp50は5〜45 msで、Jevの第三者実測(API往復込みで236〜301 ms)より1桁速い結果だった。p95は長文itemでp50の3倍前後まで伸びる。
Qiita 機械学習元記事を読む
LINEで送る

あなたの仕事に関係するAIニュースを、毎朝お届けします。

業界と使っているAIツールを選ぶと、仕事に関係するニュースが毎朝届きます。

登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。AIはこの記事・AIToday の過去記事・Wikipedia を読み、出典を付けて答えます。Q&Aはこのページに公開され、他の読者も読めます。

質問と回答はこのページに公開されます。

関連記事

次の記事へGoogleが業務自動化AI発表