
何が起きたか
開発者がJevをCloudflare Workers AIで実行し、架空求人30件で法定労働条件14項目を判定。一致率97.8%、保留6.9%、重大な誤検知ゼロ。600回で0.05ドル。
なぜ重要か
較正された信頼度のみを返すモデルは、最も深刻な誤りを全体の精度と別に数える限り、狭くhigh-stakesな検査で信頼できると開発者の手法は示す。
注目点
閾値は州ごとに変える必要があり、Workers AIのフォールバックが挙動を変えるため、モデル版をjev-1.13.0に固定し呼び出し回数を制限するのが前提だ。
誰に効くか日本の求人票を確認するコンプライアンス担当者や人事チーム、規制下のワークフローにAIチェックを組み込む開発者にとって、較正された信頼度、州別のカットオフ、人手で検証したラベルという信頼性のひな型となる。
こういう要約が、毎朝あなたのメールに届きます。
この検証は特定のコンプライアンス上の必要性から生まれた。日本の介護職求人票は職業安定法により労働条件14項目の明示が求められ、開発者は各項目を「記載あり/曖昧/記載なし」に分類するチェッカーを作った。AIに別のAIを採点させるのではなく、開発者はサンプル求人30件(ハローワーク形式10件、民間求人サイト10件、意図的に破損させたもの10件)に手作業でラベルを付け、最も深刻な誤りの種類を別に扱った。この用途では、記載があるのに「記載なし」と返すのが最も高くつく誤りだからだ。
他の実務的な知見は、こうしたモデルを実際のパイプラインにどう組み込むかを示している。Jevは信頼度が閾値を下回ると判断を保留し、較正された信頼度の挙動は州ごとに異なるため、カットオフは州別に設定して設定ファイルで公開し、運用担当者が調整できるようにした。本番ではさらにモデル版を固定し、1回あたりの呼び出し回数に上限を設けた。版管理されていない第三者のモデルが予告なく挙動を変えうるという懸念の表れだ。
より広い傾向は2つ目のプロジェクトから見えてくる。イベント告知の分類では、Jevは文章が大会案内かどうかは信頼性高く判定できたが、新規イベントと別名や移転したイベントの区別はできなかった。過去の台帳との照合が必要だからだ。判断特化AIは、単一文書で決まる狭い検査に向き、外部記録が必要なものはルールベースのシステムと人間のレビューが担うのが適切だと考えられる。
業界と使っているAIツールを選ぶと、仕事に関係するニュースが毎朝届きます。
登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。AIはこの記事・AIToday の過去記事・Wikipedia を読み、出典を付けて答えます。Q&Aはこのページに公開され、他の読者も読めます。
AIのAtaraxosが、Strategoで最も実績のあるNiemeijerを3週間で実効勝率85%で破った

差分85件に対し99回のレビューを行い、確定した重大な指摘138件のうち72件は1本のレーンだけが指摘した

山田喜三郎氏が論理IDE「LogicStudio」、そのチェッカー「LLint」、.worldモデル形式「.wm」を構想

Cocos2d-x 3.17.2のC++とLuaを無改変で動かし、Cocos2d-x API互換ランタイムをUnreal Engine 5.8上に構築

Zennの記事が、話した内容から要件定義書(SPEC.md)と実装計画(PLAN.md)を仕上げるClaude専用のAIスキル「requirements-interview」を解説した

著者がClaude Code 2.1.170と2.1.278で6条件ずつ計12試行を実施し、@AGENTS.md取り込みは両版でA・Cを返したが、AGENTS.md単独配置は両版ともNONEだった
