
何が起きたか
ETH Zurich、New Economic School、Imperial College Londonの研究者たちが、パキスタンの118裁判所に所属する1559人の裁判官(全パキスタン地方裁判官の約半数)を対象とした無作為化試験を実施した。OpenAIのGPT-4に基づくAIアシスタント「JudgeGPT」へのアクセスと標的化した研修(3週間にわたる6回の90分講義)を提供された裁判官は、年間約1848件多くの事件を解決し、6.3パーセントの増加となった。研修を受けた裁判官は、一般的な技術セミナーのみを受けた裁判官と比べ、ツールの使用頻度が4倍だった。
なぜ重要か
研究は上訴率と判決の質が維持または改善され、司法言語における性別または宗教的バイアスの増加がないことを示した。研究者たちは追加の裁判官を雇用して同等の成果を出すコストに基づいて、投資1ドルあたり38.50ドルの利益を見積もった。保守的な推定でも1ドルあたり少なくとも10ドルの利益が見込まれる。この結果は、標的化した研修と組み合わされた場合、AIが公共部門の生産性を向上させることができることを示唆しており、AIへのアクセスのみでは大きな効果がないため、研修が重要であることが明らかになった。
注目点
研修を受けた裁判官は、言語モデルがより信頼性の高い編集と要約などの限定的な支援業務に誘導された。一方、幻覚リスクが高い広範な法的質問にはAIアクセスのみに限定された。請求の約5分の1のみが、裁判官がツールに判決を評価させるよう指示する「実質的なAI委譲」を伴う。研究者らは、現在の推論モデルはGPT-4よりも「より良く書き、幻覚が少なく、複雑なタスクにより確実に対応できる」ため、本研究の生産性向上は下限ではなく上限である可能性があることを指摘している。
こういう要約が、毎朝あなたのメールに届きます。
本試験は、公共部門におけるAI導入の複雑な全体像を明らかにする。生のAIツールへのアクセス(この場合、GPT-4に基づき129235件の文書データベース(128292件の裁判例および943件のパキスタン法)を検索するJudgeGPT)は、最小限の成果しかもたらさなかった。研修を受けなかった裁判官は40週間でわずか約20回のログインと50未満のプロンプトのみを平均した。決定的な要因は、標的化した研修プログラムであり、これは使用量(研修を受けた裁判官は平均約60回のログインと200以上のプロンプト)と使用パターン(テキスト編集などの信頼性の高いタスクへ、危険な広範な法的質問から遠ざかる)の両方をシフトさせた。この行動的な誘導は重要であった。研修を受けた裁判官は著しく多くの事件を解決した(平均して地区あたり年間1848件の追加事件、最下位四分位地区でも約616件の追加事件)一方、判決の質を維持または改善し、バイアスのドリフトを回避した。
経済的な根拠は顕著である。投資1ドルあたり38.50ドルの利益(または保守的には少なくとも1ドルあたり10ドル)は、同等の成果を達成するための新しい裁判官雇用を回避するコスト削減を反映している。注目すべきは、収益が司法制度を低下させることなく達成されたことである。1000件の解決事件あたりの上訴率はわずかに低下し、裁判官は同じ時間働き、ワークライフバランスは変わらなかった。研究者たちは、これらの知見はAIで裁判官を置き換えることをサポートしていないが、むしろ適切に配置されたAIと適切な研修が制約のある公共システムにおいて人間の生産性を増幅できることを示していることを強調している。訓練がユーザーを適切で幻覚が少ないタスクに向かわせる一方で人間の意思決定を維持するという含意は、高いリスクを伴う設定で言語モデルを配置する他のセクターを超えて適用されるかもしれない。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。