AIToday
大規模言語モデルオープンソースAILobsters AI掲載日時: 2026年9月29日 19:00

MicroLLM lab、135Mモデルをブラウザ比較

LINEで送る
MicroLLM lab、135Mモデルをブラウザ比較

3つのポイント

  1. 何が起きたか

    MicroLLM labが、135Mパラメータモデルを含む小型LLMを客観的チェックで評価するブラウザツールとして登場。速度はtokens/s、精度は合格率で報告し、数値はすべてローカルに保持される。

  2. なぜ重要か

    失敗そのものを測定結果として扱う点が特徴で、135Mモデルの失敗も許容される。文章品質ではなく客観的チェックを用いるため、結果の比較が可能になる。

  3. 注目点

    実行はユーザーのブラウザとハードウェアに限定されるため、端末をまたいだスコアの直接比較はできない。利用時にどのモデルと客観テストが選ばれるかに注目。

誰に効くか小型モデルを自分のノートPCで評価する開発者やAI愛好家は、データを端末外に送らずに客観的ベンチマークを実行できる。結果は各ユーザーのブラウザとハードウェアに依存するため、マシン間の比較には限界がある。

わからないところ、AIに聞けます

質問と回答はこのページに公開されます。

こういう要約が、毎朝あなたのメールに届きます。

背景と解説

MicroLLM labは、文章品質でモデルを評価するベンチマークスイートに対する、ブラウザベースの代替として登場した。チェックが客観的、つまり正規表現か完全一致トークンであるため、135Mモデルがチェックに失敗しても問題ではない。失敗こそがこのツールが生み出す測定結果なのだ。ツールは速度と精度を分けて扱う。速度は持続デコードのtokens/sとスイートの実時間、精度は客観テストの合格率で報告し、グラフには各モデルの最新スイートを用いる。

またユーザーはJavaScriptで独自のベンチマークを書くこともできる。エディタはページオリジン内でeval()され、各チェックはモデルがデコードしたテキストに対して実行される。より大きなLLMにプロンプトを送るオプションもあり、読者の直近のtok/s値があればそれを使った推定も行う。

最大の制約は結果が端末内に留まることだ。データをローカルに保てる一方、スコアは各ユーザーのブラウザとハードウェアに左右される。このツールがどれだけ有用かは、客観的チェックが共通の基準点になるかどうか、そしてユーザーがどのモデルを試すかにかかっている。

よくある質問
MicroLLM labはどのようなチェックを実行するのか?
正規表現や完全一致トークンに基づく客観的チェックで、文章品質の判断は行わない。135Mモデルの失敗も許容され、失敗自体が測定結果となる。
ベンチマークの数値はどこへ保存されるのか?
数値は端末内に留まる。速度は持続デコードのtokens/sとスイートの実時間で、精度は客観テストの合格率で測る。
JavaScriptベンチマークエディタはどう動くのか?
エディタはページオリジン内でeval()され、各チェックはモデルがデコードしたテキストに対して実行される。
LINEで送る

あなたの仕事に関係するAIニュースを、毎朝1分で

業界と使っているAIツールを選ぶと、毎朝7時に仕事に関係するニュースが届きます。

登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。AIはこの記事・AIToday の過去記事・Wikipedia を読み、出典を付けて答えます。Q&Aはこのページに公開され、他の読者も読めます。

質問と回答はこのページに公開されます。

関連記事

次の記事へMicroIP、台湾万博でAIドローンシステム公開