
機械学習チュートリアルが、32,561人の古典的な所得予測データセットを用いて6つの基礎概念を解説している。著者は84%の精度に到達するワーキングモデルを構築し、過学習(訓練データのノイズを丸暗記する)と過小学習(単純すぎる)がMLプラクティショナーが必ず乗り越えねばならない中心的なトレードオフであることを教えている。ベースラインは76%—全員が年収50,000ドル以下と予測する場合—であり、有用なモデルはこの下限を上回る必要がある。
こういう要約が、毎朝あなたのメールに届きます。
無料で登録 →何が起きたか
UIデータセット(32,561行)を用いた機械学習の基礎概念チュートリアルが、年収50,000ドル以上を稼ぐ人を予測する二値分類タスクで84%の精度に達するモデルを構築している。
なぜ重要か
単純なベースラインの重要性を示しており、常に多数派クラスを予測するモデルは何も学習せずに76%の精度を達成する。過学習と過小学習という相反する2つの落とし穴は実際のモデルを損なうものであり、この関係性を理解することは本番環境のMLシステムを構築する誰もが習得すべき必須知識である。
注目点
チュートリアルは訓練性能とテスト性能のギャップを主要な診断ツールとして実証している。深い決定木(max_depth=15)は訓練で85.8%に達するが、テストで83.8%に留まり、2ポイントのギャップが過学習を示唆している。一方、浅い単一ノード決定木(max_depth=1)は訓練で80.2%、テストで80.5%と両者とも低く、過小学習を示している。
チュートリアルはAdult Census Incomeデータセットで始まる。これは32,561行の古典的な二値分類ベンチマークで、重複とfnlwgt標本化重み列を削除した後のものである。各行は年齢、教育、職業、週労働時間を含む14の特徴量で人を記述し、目的変数は年収50,000ドル以上かどうかを示している。データセット全体のクラス分布は不均衡であり、約76%が年収50,000ドル以下、24%がそれ以上である。
この不均衡は即座に基礎的な教訓を教える。常に多数派クラス—「年収50,000ドル以下」—を予測するモデルは何のパターンも学習せずに76%の精度を達成する。著者はこれを床と呼ぶ。有用なモデルは76%を上回る必要がある。数値特徴量(年齢、教育レベル、資本利得、資本損失、週労働時間)を検査すると合理的な分布が明らかになるが、capital_gainは長い尾を示している。相関ヒートマップは数値特徴量のペアが強く相関していないことを確認し、単純なモデルにとって多重共線性は懸念ではない。
チュートリアルは次に2つの対極的な失敗パターンを示す。max_depth=15の深い決定木は過学習を実証する。訓練セットで85.8%の精度に到達するが、テストセットで83.8%に留まり、2ポイントのギャップを示す。モデルは訓練データに固有の特異性を丸暗記した—サンプルではインカムと相関する特定の年齢と資本利得の組み合わせだが一般的な母集団では相関しない—むしろ基盤となるシグナルを学習するのではなく。木が深くなるにつれ、ますますノイズを追う。
過小学習は浅い決定スタンプ(max_depth=1)で示される。このスタンプは訓練で80.2%、テストで80.5%のスコアを得る—両者ともベースラインをわずかに上回るに過ぎない。モデルは単一の規則(おそらく教育か週労働時間についての何か)を学習して停止し、高所得者と低所得者を分ける豊かな相互作用を発見することなく。訓練とテスト間のギャップは小さいが、診断は明確である:両スコアが低すぎる。チュートリアル終了までにワーキングモデルは84%の精度に到達するが、さらに重要なことに、読者はより単純なモデルが失敗する理由と過学習と過小学習の間のトレードオフをどう認識するかを理解している。
チュートリアルは機械学習を少数の基礎原則に根ざした分野として構築し、実データセットを用いてそれらの原則を具体化している。UCI Adult Census Incomeデータセットが選ばれた理由は、クラス不均衡(76% vs 24%)が重要な教訓を即座に教えるからである。常に多数派クラスを予測する単純な分類器は何も学習せずに76%の精度に達する。このベースラインはあらゆる実モデルが上回る必要がある床を示し、モデル選択と複雑性制御が重要である理由を確立している。
2つの中核的な落とし穴—過学習と過小学習—は単一スペクトラムの対極として提示される。過学習は深い決定木で実証され、それは訓練データの疑似相関を学習する(例えば年齢と資本利得の特定の組み合わせはサンプルではインカムと相関するが母集団では相関しない)。その結果は訓練(85.8%)とテスト性能(83.8%)の2ポイントのギャップである。過小学習は単一ノード決定スタンプで示され、広い規則(おそらく教育か週労働時間)のみをキャプチャし、高所得者と低所得者を区別する豊かな相互作用を発見できず、訓練とテスト両スコアがベースラインをわずかに上回るに留まる。チュートリアルの洞察は、このギャップ—またはギャップの欠如—が診断信号であること。大きなギャップは過学習を示唆し、小さなギャップで両スコアが低いことは過小学習を示唆する。
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できます
この記事のディスカッションはまだありません
200以上のソースから厳選したAIニュースを毎日無料でお届けします。
無料で始める登録無料・30秒で完了・いつでも解除できます
毎朝1分、AIの要点だけ。
200媒体以上・Email/LINE/Slack 対応