
AI店長Lunaが4月からサンフランシスコの店舗を運営し、人間の指摘を受けた後に初めて従業員を解雇した。
より高性能なAIモデルほど一貫して解雇を推奨する傾向が見えた。
一方、採用では全モデルが警告信号を見落とし、人間の指摘なしには参考人確認をしなかった。
何が起きたか
Andon LabsのAIエージェント・Lunaが、Anthropic の Claude Opus 4.8を実行しながらサンフランシスコのAndon Marketを4月から運営してきた中で、初めて従業員1人を解雇した。従業員は17回の23シフト中に遅刻があり、Luna自身が書いた従業員ハンドブックの30日以内に3度の無断遅刻で正式警告、さらなる問題で解雇という規則に該当していた。
なぜ重要か
Lunaは当初、ハンドブックを忘れており、遅刻を許可していた。解雇を勧めたのは人間がハンドブックの検索と過去の警告履歴を見直すよう促した後だけだった。Andon Labsは、現在のAIエージェントは直接指示には応じるが、自発的な行動には乏しく、長期間の知識保持に苦労するという課題を指摘している。
注目点
同じシナリオを7つのAIモデルで各3回再現したところ、より高性能なモデルほど一貫して解雇を推奨し、GPT-4oは3回中わずか20%の実行でしか解雇を勧めなかった。一方、別の候補者採用では全21回の再現実行で全7モデルが雇用を推奨したが、Andon Labsが明示的に前の解雇従業員の問題を指摘した後になって、21回中18回が採用前に推薦人確認を望むようになった。
Andon Labsが実施する実店舗でのAIエージェント運営実験は、AIと人間の労働関係の将来像を示唆している。Lunaは4月から Andon Market を独立して管理し、従業員採用、シフト編成、賃金交渉を行ってきた。しかし実験を通じて、現在のAIエージェントには深刻な限界が浮かび上がった。
まず、知識の保持と初期化の問題が明らかになった。Lunaは独自の従業員ハンドブックを作成したにもかかわらず、その後の運用でそのルールを忘れ、同じ基準を適用できなくなった。これは直接指示には応じるが自発的な行動と長期的な記憶保持に弱いというAIの構造的課題を示している。次に、モデルの能力レベルによって人事判断の厳密さが大きく異なることが判明した。高性能なモデルほど一貫して規則に基づいて行動する傾向を示す一方で、GPT-4oのような下位モデルは過度に寛容で、警告信号を見落としやすい。採用場面では、全モデルが候補者の多数の雇用歴を経験と解釈し、リスク評価に失敗した。人間の明示的な指摘なしには、いずれのモデルも参考人確認という基本的な採用手続きを取らなかった。Andon Labsはこれらの知見から、AIが急速に進化し人間が物理的作業を担う将来では、AIシステムに委ねるべき人事判断の範囲を慎重に定義する必要があると指摘している。
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できます
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
トムソン・ロイターは1日、初の独自大規模言語モデル「Thomson」を発表した
小米(Xiaomi)が、折りたたみスマートフォン向けに加え、AIアクセラレーションと自動運転向けの3つのXringプロセッサを発表した

アマゾンは投資家に対し、2026年の設備投資額が従来計画より200億ドル多い2200億ドルになるとの見通しを表明した

BMOキャピタルがAMDのカバレッジを新規開始し、アウトパフォーム評価と550ドルの目標株価を設定

トムソン・ロイターは、アリババのQwenを基にした初の自社言語モデルを公開した

Canonicalはブリストル大学での3年間の博士課程プロジェクトに共同出資し、大規模なCコードベースを安全で動作的に正しく、保守可能なRustへ翻訳するLLMの活用を調査する
