AIToday
大規模言語モデルAI安全性・アラインメントAIビジネス・産業THE DECODER掲載日時: 2026年8月30日 22:012分で読める

AIは成績向上に寄与、学習には疑問

LINEで送る
AIは成績向上に寄与、学習には疑問

要点

  • GPT-4oはボッコーニ大学の学生の成績を有意に向上させた。因果推論の授業はアイデアの多様性を高めたが成績は上げなかった。

  • AIが学習を改善するかは依然不明。

  • 1,053人の新入生が2025年11月に参加した。

3つのポイント

  1. 何が起きたか

    ボッコーニ大学の新入生1,053人を対象にした無作為化実験で、GPT-4oを使った学生はビジネス課題で有意に高い成績を収め、1〜5点満点で約1点近く上回った。

  2. なぜ重要か

    この研究は、現在の採点制度が理解ではなく、洗練された体裁や構成を評価していることを示唆する。AIが専門家並みの成果物を生み出せる以上、成績だけでは学生の実際の学びを反映しない可能性がある。

  3. 注目点

    因果推論に関する短い授業は従来の成績を上げなかったが、多様なアイデアと深い思考を促した。GPT-4oとの併用で成績がさらに上がることはなく、学習内容の定着を測る追跡テストも実施されなかった。

この記事についてAIに質問する →

背景と解説

この研究は、AIが基礎的なスキルを向上させずに課題のパフォーマンスだけを改善し得るという、増えつつある証拠に加わるものだ。ChatGPT登場後の米国の大学成績50万件以上を分析した先行研究では、宿題中心の作文・プログラミング科目で最高評価が最も増加していた。管理された実験では、AIを外すと利用者は対照群よりも成績が悪化し、特にGPTを直接解答に使った層で顕著だった。中国の2万6千人を対象にした30ヶ月の研究では、宿題の成績は改善したが試験の点数は下がり、長期的には入学試験の結果が18〜24%低下した。

ボッコーニの実験は教育におけるジレンマを浮き彫りにする。現行の採点は独創性や深い思考ではなく、型にはまった洗練された解答を評価する。著者らは、独創性と推論を明示的に評価する採点基準への変更を提唱する。ただし、記事が指摘するように、それには制度全体の変更が必要だろう。この研究には限界もある。単一大学の新入生のみを対象とし、無作為化はクラス単位で行われ、一部の評価はOpenAIを含むAIモデルによって行われた(OpenAIは研究に関与)。GPTの優位性が実際の学習を反映するのか、それとも単に出力の質の高さを反映するのかは、未解決の問いだ。

よくある質問

因果推論の授業は成績を改善したか?
いいえ、従来の成績は上がらなかった。実際、その授業を受けた学生の成果物は平均でやや低い評価だったが、より多様なアイデアを生み出し、推論の説明も丁寧だった。
成績以外にどのような指標を測定したか?
議論の質、アイデア数、アイデアの多様性、テキスト特性も測定した。採点ルーブリックはアイデアの多さと一貫性を高く評価する一方、反証可能性や他者との差異には低い評価を与えていた。
LINEで送る

「大規模言語モデル」の最新ニュースを、毎朝7時にお届けします

たとえば、いま届くならこの3本です

  • AIエージェントに時間感覚なし、研究で判明THE DECODER · 3時間前
  • OpenAI・METR、HF侵害最終報告書を公表ITmedia AI+ · 6時間前
  • Anthropic、Claude Codeの週間利用上限を17%削減THE DECODER · 6時間前

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・30秒で完了・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。

関連記事

次の記事へ韓国の高齢化、AI好況の富を蝕む