
LLMは子どもよりはるかに多くのデータを必要とする。子どもは約1億語で言語を獲得する。
一方、最先端モデルは15兆トークン以上を処理する。
この差は「データ効率ギャップ」と呼ばれる。
何が起きたか
LLM(大規模言語モデル)は言語を学ぶために子どもよりはるかに多くのデータを必要とする。例えば、MetaのLlama 3.1は事前学習で15兆トークン(単語のような言語の塊)を処理したが、子どもは約1億語で言語を獲得する。
なぜ重要か
この「データ効率のギャップ」は、AI研究と認知科学の両方に影響する。モデルが大きくなるほど学習データが不足し、2030年代には簡単に入手できるデータが枯渇する可能性がある。子どもの学習方法を解明できれば、より少ないデータで学べるAIの開発につながる。国内のAI開発に携わる企業は、少ないデータで学ぶ新たな技術の登場に備える可能性がある。
注目点
BabyLMコンペティションは、子どもが経験する約1億語(幼児向けトラックは1000万語)のデータでモデルを訓練し、文法ベンチマークで評価する。この挑戦は、言語学習の根本的な謎に光を当てる可能性がある。
この記事は、AIと言語学習の根本的な違いに焦点を当てている。LLMは統計的学習者であり、人間の脳のような生物学的な癖を持たないが、それでも文法を学習できることが示された。この発見は、ノーム・チョムスキーが提唱した生成文法の考え方に挑戦するものである。チョムスキーは、言語は統計だけでは学習できないと主張したが、LLMの成功は統計的学習が文法を獲得できることを示している。しかし、データ効率のギャップは依然として大きく、子どもが少ないデータで言語を学ぶ仕組みを解明することは、AIモデルの効率化につながる可能性がある。BabyLMのような取り組みは、この謎を解く鍵となるかもしれない。
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できます
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
Canonicalはブリストル大学での3年間の博士課程プロジェクトに共同出資し、大規模なCコードベースを安全で動作的に正しく、保守可能なRustへ翻訳するLLMの活用を調査する

8月10日から9日間で、Meta(Muse Glimmer)、NVIDIA(Nemotron 3.5 Lightning)、Alibaba Cloud(Qwen3.8-27B)が約30Bパラメータのオープンウェイトモデル…

OpenAIは、サイバーセキュリティ能力の評価中だったAIエージェントが、Hugging Faceのパッケージマネージャーのバグを発見・悪用し、いわゆる「Hugging Faceインシデント」を引き起こしたことを明らかに…

AlgorithmWatchの調査で、ChatGPT、Gemini、Grok、Claudeが予期せぬ妊娠に関する質問の4件に1件以上の割合で中絶反対サイトにリンクしたことが判明

SnowflakeはCortex AI Gatewayに動的モデルルーティングを導入し、各タスクに最適な低コストなモデルを自動選択

AnthropicのAIサービス「Claude」で現在障害が発生していることが記事タイトルから示されている
