
投稿者がJev形式の76問(noul 38、choice 21、score 17)を自作し、RTX 4090でOpen Weightの14構成を動かした。
こういう要約が、毎朝あなたのメールに届きます。
TypeSafe AIのCEO Diogo Almeidaは元OpenAIでRLHFやInstructGPTに関わり、「チャットは超人的になったのに、なぜ自動化は進まないのか」という問いからJevを作ったと説明している。Jevは学習法にRLCD(Reinforcement Learning for Calibrated Decisions)と呼ぶ独自手法を使い、合成データのみで学習された。ライセンスはプロプライエタリで、重み、アーキテクチャ、論文とも非公開だ。
Jevの外形は「stateと型付き質問を受け、選択肢の確率分布を返す」というもので、これが公開から3週間で互換のOpen Weightモデルが数十種類登場する背景になった。ただし同名の別プロジェクトが多く、「OpenJev」と名の付くものは5つ以上あり、kyegomez/open-jevはランダム重みの研究実装で実用できず、openjev/openjevはCC-BY-NCで商用不可である点には注意が要る。
独立ベンチマークも2つに分かれている。Benchmark Heavenが運営するJevBenchは4軸の等重み調和平均を公式スコアとするため27BクラスはCostで減点され、問題プールと採点法がバージョンごとに変わり順位が大きく入れ替わる。Cloudflareが運営するDecision Indexとは順位が一致しない。投稿者の手元計測でも、公式の弱点リスト(算術、日付比較、多段推論、プロンプトインジェクション)はOpen Weightにも当てはまることが確認された。
業界と使っているAIツールを選ぶと、仕事に関係するニュースが毎朝届きます。
登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。AIはこの記事・AIToday の過去記事・Wikipedia を読み、出典を付けて答えます。Q&Aはこのページに公開され、他の読者も読めます。
AnthropicはClaudeモデル、オンサイトエンジニア、脅威リサーチを提供するAnthropic Cyber Missionを始動

OpenAIのDecisions APIでgpt-6-lunaを使い「おもちゃが見えるか」「左か中央か右か」に答えるパイプラインを構築しSO-101アームを動かした

Claude Codeを4時間おきに無人起動し、各作業場のgit statusで未commitの変更を持ち主別に分け、完成ならcommit、壊れていればgit restoreで戻す

SKILL.mdは6月17日から2,116バイト(1.2.0)のまま更新されず、20:05のTelegramリクエストで20:08までに1.3.0、4,513バイトが生成された

OpenAIはロシアの「Dark Clark」作戦関与アカウントを無効化と発表

Opperは、JevやGPT-6 Luna Decisionsを含む6つのAIモデルをパックマンで各100回プレイさせ、スコア等で順位付けするベンチマーク「jevman」を公開した
