
何が起きたか
cairosvgを使うPythonパイプラインでLLMの返答からSVGを抽出し、script等を静的チェックし800x600 PNGに描画、足とペダルの間隔を測定。
なぜ重要か
LIFTED版がtransformのみでcy値を変えなくても、描画ベース測定は足の浮きを検出した。間隔は後輪の見かけの直径比で異なるサイズも比較できる。
注目点
接触とみなす閾値は、人手でラベル付けしたサンプルで較正するまで判断に使うべきではない。また、パーツIDが欠落または不可視の場合、システムは推測せずuncertainを返す。
誰に効くかこの仕事は、生成されたSVG出力を採点するAIエンジニアや評価者、また視覚タスク向けの自動採点パイプラインを構築する人々にとって重要である。採点を再現可能にし、フォーマット準拠と画像品質を分けて扱う方法を提供する。
こういう要約が、毎朝あなたのメールに届きます。
作者は、ペリカンが自転車に乗っている絵を描かせることでLLMを比較するのが一般的な遊びになったと指摘する。しかし何十枚も画像が集まると、誰がどう採点するかという問題になる。目視は疲れるうえ、基準は日によってぶれる。総合点で8点をつけても、後から理由を説明できない。このパイプラインは、根拠で裏付けられる部分——フォーマット、レンダリング、補助的な幾何測定——を自動化することで、それを解決しようとする。
作者は、circleなどのDOM要素を数えることが視覚的判断の代わりになるかを検証した。同じ2つの車輪をcircle、path、useで描くと、レンダリングされたピクセルは同一だったが、circleの数はそれぞれ2、0、1だった。これは、要素を数えるのがSVGの書かれ方を見るだけで、画面に実際に描かれているものを見ていないことを示す。そのため作者は、要素を削除してどのピクセルが変化するかを確認することで、レンダリング出力から幾何を測定する。
パイプラインは判断をpass、fail、uncertain、not_applicableの4状態で記録する。必須チェックのいずれかが失敗すれば、総合判定はfailになる。失敗はないがuncertainが残る場合、判定はuncertainとなりレビューに回される。結果を集計する際、作者はuncertainのケースを除外することに警告する。それは合格率を水増ししかねない。合格率の真の範囲にはuncertainのケースが含まれ、除外後の率だけを報告すると、誤解を招くほど良い数字になる。作者はまた、採点設計がFolkbenchブログのペリカン採点記事のアイデアに基づくこと、そして自身がFolkbenchの開発に関わっていることを述べている。記事中の測定値は、掲載コードの実行結果または例示であり、実際のモデルやサービスの測定値ではない。
業界と使っているAIツールを選ぶと、仕事に関係するニュースが毎朝届きます。
登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。AIはこの記事・AIToday の過去記事・Wikipedia を読み、出典を付けて答えます。Q&Aはこのページに公開され、他の読者も読めます。
Zennの筆者がClaude Docsの「タスク管理帳」1枚を紹介

投稿者がdots・Claude Code・Codexをつなぐ仕組みを試験運用し、2026-10-06から1日ほどで21件を処理した

9月25日17時44分、Claude Codeに起動させたCeleryのワーカーとbeatが会話を閉じると同時に終了し、翌朝に定期実行が止まっていたことが判明した

Zennの記事で筆者は、AI生成コードのレビューを契約で行い、Hypothesisのようなプロパティベーステストで検証する手法を提案した

Google DeepMindのgoogle/embeddinggemma-2をGoogle Colab無料版で動かし、日本語「猫の写真」で猫画像が2位(0.7149)、「宇宙へ飛んでいくロケット」でrocket画像が2…

ユーザーはNew Yorker風の漫画をChatGPTに頼んだだけだが、Brendan Loperの「BLoper」署名が自動で追加された
