AIToday
大規模言語モデルAIコーディングZenn AI/ML掲載日時: 2026年10月1日 22:00

Jev求人票チェック、正解率97.8%を検証

LINEで送る
Jev求人票チェック、正解率97.8%を検証

3つのポイント

  1. 何が起きたか

    開発者がJevをCloudflare Workers AIで実行し、架空求人30件で法定労働条件14項目を判定。一致率97.8%、保留6.9%、重大な誤検知ゼロ。600回で0.05ドル。

  2. なぜ重要か

    較正された信頼度のみを返すモデルは、最も深刻な誤りを全体の精度と別に数える限り、狭くhigh-stakesな検査で信頼できると開発者の手法は示す。

  3. 注目点

    閾値は州ごとに変える必要があり、Workers AIのフォールバックが挙動を変えるため、モデル版をjev-1.13.0に固定し呼び出し回数を制限するのが前提だ。

誰に効くか日本の求人票を確認するコンプライアンス担当者や人事チーム、規制下のワークフローにAIチェックを組み込む開発者にとって、較正された信頼度、州別のカットオフ、人手で検証したラベルという信頼性のひな型となる。

わからないところ、AIに聞けます

質問と回答はこのページに公開されます。

こういう要約が、毎朝あなたのメールに届きます。

背景と解説

この検証は特定のコンプライアンス上の必要性から生まれた。日本の介護職求人票は職業安定法により労働条件14項目の明示が求められ、開発者は各項目を「記載あり/曖昧/記載なし」に分類するチェッカーを作った。AIに別のAIを採点させるのではなく、開発者はサンプル求人30件(ハローワーク形式10件、民間求人サイト10件、意図的に破損させたもの10件)に手作業でラベルを付け、最も深刻な誤りの種類を別に扱った。この用途では、記載があるのに「記載なし」と返すのが最も高くつく誤りだからだ。

他の実務的な知見は、こうしたモデルを実際のパイプラインにどう組み込むかを示している。Jevは信頼度が閾値を下回ると判断を保留し、較正された信頼度の挙動は州ごとに異なるため、カットオフは州別に設定して設定ファイルで公開し、運用担当者が調整できるようにした。本番ではさらにモデル版を固定し、1回あたりの呼び出し回数に上限を設けた。版管理されていない第三者のモデルが予告なく挙動を変えうるという懸念の表れだ。

より広い傾向は2つ目のプロジェクトから見えてくる。イベント告知の分類では、Jevは文章が大会案内かどうかは信頼性高く判定できたが、新規イベントと別名や移転したイベントの区別はできなかった。過去の台帳との照合が必要だからだ。判断特化AIは、単一文書で決まる狭い検査に向き、外部記録が必要なものはルールベースのシステムと人間のレビューが担うのが適切だと考えられる。

よくある質問
Jevの検証にかかったコストは?
開発者が測定したところ、600回の呼び出しで0.05ドル、約122万トークンを処理した。Jev1回あたり約0.0001ドルとなる。
Jevが得意な質問と苦手な質問は?
「この文章は大会案内か」のように、1つの文書を読めば答えが決まる場合はうまく機能する。過去データや台帳と照合が必要な場合、例えば新規イベントと名称変更されたイベントの区別は苦手だ。
Jevに求人票を送る前、個人情報はどう扱われるか?
氏名、電話番号、メールは送信前に正規表現で[NAME]、[TEL]、[MAIL]に置換される。記録されるのは置換回数のみで、貼り付けたテキスト自体は保存されない。
LINEで送る

あなたの仕事に関係するAIニュースを、毎朝お届けします。

業界と使っているAIツールを選ぶと、仕事に関係するニュースが毎朝届きます。

登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。AIはこの記事・AIToday の過去記事・Wikipedia を読み、出典を付けて答えます。Q&Aはこのページに公開され、他の読者も読めます。

質問と回答はこのページに公開されます。

関連記事

次の記事へOllaya、255選択肢のモデルをローカル実行