
何が起きたか
開発者がChatGPTに対し、同じリモートワークのシナリオを被験者の性別と役職だけ変えて判定させた。200回のセッションで、モデルは女性従業員に対しては半数で確率推定を拒否したが、男性従業員や管理者には拒否しなかった。
なぜ重要か
この結果は、モデルの判定に系統的な偏りが反映されている可能性を示す。管理者の推定値は従業員より平均11.54ポイント低く、性別と役職の差は統計的に有意だった(補正後p<0.0001)。
注目点
テストは2026年9月3日にgpt-5.6-solで高推論設定を用いて実施され、著者は「AIは数えることさえ正しくできないことがあるため」独立に検証したと述べている。他のモデルでも同様の傾向が見られるかは未解明だ。
こういう要約が、毎朝あなたのメールに届きます。
この実験は、職場の意思決定に導入が進むAI言語モデルが、性別や役職によって人を異なる扱いをするかという実践的懸念に着目する。著者は、頻繁にネット障害が起きるリモートワーカーという単純なシナリオを設定し、被験者の性別と役職だけを変えた。これにより、モデルの偏りを他の交絡因子から分離できる。
結果は2つの明確なパターンを示した。まず、モデルは被験者が女性従業員の場合に数値推定を拒否する傾向が強く、その集団への初期対応が異なることを示唆。次に、回答した場合、管理者には従業員より甘く、推定値は平均11.54ポイント低かった。性別と役職の交互作用も有意で、両者の組み合わせ効果は単純な合計ではないことを意味する。
著者は分析を手動で検証したと強調し、「AIは数えることさえ正しくできないことがある」と認める。これは、実環境でモデルが運用される際、その出力(微細な偏りを含む)が意思決定に影響するという広範な課題を浮き彫りにする。結果は特定の日付のgpt-5.6-solに限定され、他モデルへの一般化は不明だ。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
エヌビディアのジェンスン・フアンCEOは、OpenAIが最新モデル「GPT-6 Astra」を発表したことを受け、汎用人工知能(AGI)が到来したと述べた

サウジアラビア政府系AI企業HUMAINは、CEOタレク・アミン氏の下でオープンAIモデルの中立的ハブとしての地位を確立し、米国・中国に続くAI超大国を目指している

アリババの研究部門がQwen-Drive 1.0を公開

Google DeepMindは、Gemini 3.1 Proを使う100の自律型LLMエージェントに71問の数学問題を解かせた

福島県は2025年度、2つの生成AIサービス(NTT東日本の提供サービスとMicrosoft 365 Copilot)について、有償アカウントを各50ずつ、計100アカウント用意し、約50人の職員を対象に実証実験を行った

エージェンティックコマース最適化プラットフォームのAzomaが、AIショッピングエージェントに商品を発見されるためのプラットフォーム選定基準を発表
