
パキスタンの裁判官を対象とした無作為化試験により、AIへのアクセスと標的化した研修の組み合わせが大幅な成果をもたらすことが示された。研修を受けた裁判官はJudgeGPTを4倍以上使用し、彼らの管轄区では年間約1848件の追加事件が解決され、6.3パーセントの増加となった。判決の質は維持または改善され、投資利益率は1ドルあたり38.50ドルと推定された。重要な知見は、研修が極めて重要であり、AIへのアクセスのみではほとんど効果がないということである。
こういう要約が、毎朝あなたのメールに届きます。
無料で登録 →何が起きたか
ETH Zurich、New Economic School、Imperial College Londonの研究者たちが、パキスタンの118裁判所に所属する1559人の裁判官(全パキスタン地方裁判官の約半数)を対象とした無作為化試験を実施した。OpenAIのGPT-4に基づくAIアシスタント「JudgeGPT」へのアクセスと標的化した研修(3週間にわたる6回の90分講義)を提供された裁判官は、年間約1848件多くの事件を解決し、6.3パーセントの増加となった。研修を受けた裁判官は、一般的な技術セミナーのみを受けた裁判官と比べ、ツールの使用頻度が4倍だった。
なぜ重要か
研究は上訴率と判決の質が維持または改善され、司法言語における性別または宗教的バイアスの増加がないことを示した。研究者たちは追加の裁判官を雇用して同等の成果を出すコストに基づいて、投資1ドルあたり38.50ドルの利益を見積もった。保守的な推定でも1ドルあたり少なくとも10ドルの利益が見込まれる。この結果は、標的化した研修と組み合わされた場合、AIが公共部門の生産性を向上させることができることを示唆しており、AIへのアクセスのみでは大きな効果がないため、研修が重要であることが明らかになった。
注目点
研修を受けた裁判官は、言語モデルがより信頼性の高い編集と要約などの限定的な支援業務に誘導された。一方、幻覚リスクが高い広範な法的質問にはAIアクセスのみに限定された。請求の約5分の1のみが、裁判官がツールに判決を評価させるよう指示する「実質的なAI委譲」を伴う。研究者らは、現在の推論モデルはGPT-4よりも「より良く書き、幻覚が少なく、複雑なタスクにより確実に対応できる」ため、本研究の生産性向上は下限ではなく上限である可能性があることを指摘している。
ETH Zurich、New Economic School、Imperial College Londonの多国籍研究チームは、パキスタンの司法制度に関する大規模なフィールド実験を実施し、118裁判所に所属する1559人の裁判官(全パキスタン地方裁判官の約半数)を登録した。本研究はOpenAIのGPT-4に基づくAIアシスタント「JudgeGPT」をテストした。このツールは129235件の文書(128292件の裁判例および943件のパキスタン法)のデータベースを検索するために検索拡張生成を使用する。裁判官がクエリを入力すると、ツールは最も関連性の高い10件の文章を検索し、引用された回答を生成する。
研究者たちは裁判官を3つのグループに分けた。第1グループはJudgeGPTアクセスと標的化した研修を受けた。ETH教授Elliott Ashが裁判所の営業後に3週間にわたって6回の90分講義を実施した。カリキュラムは、ツールに適したタスク、欠点、および出力の検証方法を裁判官に教えた。第2グループは同じAIアクセスを受けたが、法律とテクノロジーに関する一般的なセミナーのみを受講した。対照グループはAIアクセスなしでテクノロジーセミナーに参加した。40週間後、対比は顕著であった。研修を受けた裁判官は平均約60回のログインと200以上のプロンプトを記録し、一方AIアクセスのみで一般的なセミナーのみの比較グループは約20回のログインと50未満のプロンプトのみを記録した。AIへのアクセスのみでは、最小限の使用をもたらした。
事件解決に関する結果は実質的であった。より多くの研修を受けた裁判官がいる地区は、著しく多くの事件を解決した。適度な露出レベルでは、研修を受けた裁判官の地区は地区あたり年間約1848件の追加事件を解決し、6.3パーセントの増加となった。最下位四分位地区でさえ(研修を受けた裁判官への最も少ない露出)、依然として年間約616件のより多くの事件を解決した。重要なことに、これらの成果は質やワーキング条件を損なうことなく実現された。1000件の解決事件あたりの上訴率はわずかに低下し、裁判官は同じ時間働き、ワークライフバランスは変わらなかった。約4000件の裁判例の判断の分析により、AI由来のテキストがより頻繁に表示される傾向が示されたが(予想通り)、可読性、長さ、および法的論拠の数は一定であった。パキスタンの弁護士2人によって検証されたLLMベースの品質チェックでは、わずかな改善が示された。研修を受けた裁判官の判決は、ペアワイズ比較で59パーセントがより良いと評価され、対照群の42パーセントから上昇した。重要なことに、本研究ではAI使用が司法言語における性別または宗教的バイアスを増加させたという証拠は発見されなかった。
約1500人の裁判官からの匿名化されたチャットログの分析により、法的調査、テキスト編集、およびテキスト生成が最も一般的なタスクであることが明らかになり、クエリの約60パーセントが法律、手続き、または法的概念に関する情報を求めた。研修は行動を著しくシフトさせた。研修を受けた裁判官はJudgeGPTをテキスト編集と要約の方が多く使用し(言語モデルが信頼性の高いタスク)、幻覚リスクが高い広範な法的質問をより少なく質問した。請求の約5分の1のみが、研究者たちが「実質的なAI委譲」と呼ぶ形式を伴い、裁判官がツールに独立して判決を評価したり推論を起案するよう指示した。研修により、裁判官自らが事件を決定し、AIはその判決を書き上げるためのみ使用する傾向が高まった。経済的には、研究者たちは追加の裁判官を雇用して同じ成果を出すコストに基づいて、投資1ドルあたり38.50ドルの利益を見積もった。保守的な見積もりでも1ドルあたり少なくとも10ドルの利益が示された。研究者たちは、彼らの知見はAIで裁判官を置き換えることをサポートしていないが、むしろAIが標的化した研修と組み合わされた場合に公共部門の生産性を向上させることができることを示していることを強調している。JudgeGPTはGPT-4(プロジェクトに利用可能であった当時の最良の推論前モデル)で実行され、現在の推論モデルはGPT-4よりも「より良く書き、幻覚が少なく、複雑なタスクにより確実に対応でき」るため、本研究の生産性向上は天井ではなく下限である可能性があることを研究者たちは指摘している。
本試験は、公共部門におけるAI導入の複雑な全体像を明らかにする。生のAIツールへのアクセス(この場合、GPT-4に基づき129235件の文書データベース(128292件の裁判例および943件のパキスタン法)を検索するJudgeGPT)は、最小限の成果しかもたらさなかった。研修を受けなかった裁判官は40週間でわずか約20回のログインと50未満のプロンプトのみを平均した。決定的な要因は、標的化した研修プログラムであり、これは使用量(研修を受けた裁判官は平均約60回のログインと200以上のプロンプト)と使用パターン(テキスト編集などの信頼性の高いタスクへ、危険な広範な法的質問から遠ざかる)の両方をシフトさせた。この行動的な誘導は重要であった。研修を受けた裁判官は著しく多くの事件を解決した(平均して地区あたり年間1848件の追加事件、最下位四分位地区でも約616件の追加事件)一方、判決の質を維持または改善し、バイアスのドリフトを回避した。
経済的な根拠は顕著である。投資1ドルあたり38.50ドルの利益(または保守的には少なくとも1ドルあたり10ドル)は、同等の成果を達成するための新しい裁判官雇用を回避するコスト削減を反映している。注目すべきは、収益が司法制度を低下させることなく達成されたことである。1000件の解決事件あたりの上訴率はわずかに低下し、裁判官は同じ時間働き、ワークライフバランスは変わらなかった。研究者たちは、これらの知見はAIで裁判官を置き換えることをサポートしていないが、むしろ適切に配置されたAIと適切な研修が制約のある公共システムにおいて人間の生産性を増幅できることを示していることを強調している。訓練がユーザーを適切で幻覚が少ないタスクに向かわせる一方で人間の意思決定を維持するという含意は、高いリスクを伴う設定で言語モデルを配置する他のセクターを超えて適用されるかもしれない。
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できます
まだコメントがありません。最初のコメントを投稿しましょう!
ログインして議論に参加200以上のソースから厳選したAIニュースを毎日無料でお届けします。
無料で始める登録無料・30秒で完了・いつでも解除できます
毎朝1分、AIの要点だけ。
200媒体以上・Email/LINE/Slack 対応