AIToday

Apple TV検索、視聴履歴で個人化ランキング

Apple Machine Learning6日前
Apple TV検索、視聴履歴で個人化ランキング

要点

Appleの研究者らがApple TV検索の個人化システムを構築した。テキスト埋め込みとユーザー操作埋め込みを組み合わせ、ユーザーの入力に応じてランキングを改善する。オフラインテストでNDCG@10が2.99%、MRRが3.30%改善。3週間のライブ実験ではタップスルーレートが1.14%、コンバージョン率が1.23%向上した。短く曖昧なクエリ(1~3文字のプリフィックスなど、NDCG 8.63%向上)と視聴履歴が長いユーザーで特に効果が大きく、デフォルトランカーが確実でない場面でシステムが最大の価値を付加することを示唆している。

こういう要約が、毎朝あなたのメールに届きます。

無料で登録 →

3つのポイント

  • 何が起きたか

    Appleの研究者らがApple TV検索の個人化システムを構築した。テキストベースとIDベースの埋め込み表現を組み合わせ、キー入力のたびに検索結果をランク付けする。ユーザーの視聴履歴から学習し、XGBoostランカーに類似度信号を注入する。オフラインテストではNDCG@10が2.99%、MRRが3.30%改善。3週間のオンライン実験では、タップスルーレートが1.14%、コンバージョン率が1.23%向上した。

  • なぜ重要か

    このシステムは入力初期段階で最も価値がある。短く曖昧なクエリ(1~3文字のプリフィックス)ではNDCG@10が8.63%向上するのに対し、長くて完全に形成されたクエリではわずか1.46%の向上にとどまる。視聴履歴が長いユーザーほど大きな改善が見られる(51~100件の履歴があるユーザーで4.37%対、1~5件のユーザーで2.13%)。ランキングアルゴリズムが意図を推測するのに苦労する場面で、個人化が最も役立つことを示唆している。

  • 注目点

    ユーザーの意図がまだ形成中の検索では、テキストと行動信号を組み合わせたハイブリッド戦略が有効であることを実証している。システムはコンバート対象項目のランク位置を2.91%改善し、ランキング向上がキー入力の初期段階という重要な時間帯でユーザーが目的のコンテンツを素早く見つけられることにつながることを示している。

詳細

Apple TVの検索体験は、ユーザーが視聴履歴を持ち、システムが学習できるときより速く、より正確になる。Appleの研究者らはハイブリッドランキングシステムを構築した。特定の問題に対処するためのものだ。キー入力のたびに、ユーザーがわずか1~3文字しか入力しておらず、その意図がまだ明確でない場合でも、ビデオをランク付けしなければならない。

システムは相補的な2つの埋め込みを学習する。TextEmbは多言語テキストエンコーダで、共同視聴トリプレット(ユーザーが一緒に視聴したビデオのペア)でコントラスティブ学習により訓練される。言語に関係なく、類似コンテンツが埋め込み空間で互いに近くに配置されるようにする。IdEmbは協調フィルタリング埋め込みで、ユーザーが視聴し、クリックしたもののみで訓練され、テキストは含まれない。検索時、システムはユーザーの最近の視聴履歴を取得し、両方のモデルから彼らの嗜好表現を生成し、その表現と各候補ビデオの間の類似度スコアを計算し、それらのスコアを他の特徴と共にXGBoostランカーに入力する。

時間的に分割したデータに対するオフライン評価は明確な成果を示した。視聴履歴を持つセッションでは、NDCG@10が2.99%改善、MRRが3.30%改善された。しかし、スライス分析は真の価値がどこにあるかを明かにした。非常に短いクエリ(1~3文字)では、NDCG@10が8.63%向上した。一方、より長いクエリ(意図がより明確)では、向上はわずか1.46%だった。より深い視聴履歴を持つユーザーはより恩恵を受けた。51~100件の過去項目を持つユーザーはNDCG 4.37%の向上が見られたのに対し、1~5件のみのユーザーは2.13%だった。注目すべきは、システムはデフォルトランカーが最も弱かったコーホートで正確にパフォーマンスを改善した。履歴の長いユーザーはベースラインNDCG@10が低かった(0.680対新規ユーザーの0.733)。しかし、個人化は彼らをより向上させた。テキストのみのアプローチが苦労する場面でユーザー信号を追加することが最も役立つことを示している。

3週間のオンライン管理実験はオフラインの成果を検証した。治療グループは統計的に有意な1.14%のタップスルーレート向上と1.23%のコンバージョン率向上を見た。コンバート対象項目のランク位置が2.91%改善された。ユーザーが求めるものを見つけ、リスト内のより高い位置でそれをタップした。ランキング品質が本当に改善されたことを示す。研究者はさらに、各信号を個別にアブレーション(カバレッジ-精度トレードオフを測定するため)し、保持されたコーパスに対するLLM判定類似度ラベルを使用して埋め込み品質を評価しながらクリックデータからのバイアスを軽減することで、埋め込みを検証した。

背景と解説

Appleの個人化アプローチは検索の根本的な課題に対処する。ユーザーが数文字しか入力していない場合、意図は本来曖昧であり、従来のテキストマッチング単独ではユーザーが何を望んでいるかを予測するのに苦労する。テキスト埋め込み(クエリが何を意味するかの意味理解)と協調フィルタリング埋め込み(この特定ユーザーが過去に何に反応したか)を組み合わせることで、システムはリスクを分散できる。クエリとユーザーの過去の行動の両方から学習する。

オフライン分析はこのハイブリッドアプローチの真の力を明らかにする。最大の改善はベースラインシステムが最も悪い場面で発生する。視聴履歴が豊富なユーザーと短いプリフィックスクエリではNDCGの向上が8.63%に達する。その場面では、ランカーの確信度が最も低いからだ。逆に、より長いクエリとスパースな履歴のユーザーは恩恵が少ない。ベースラインが既に何をランク付けするかを知っているからだ。このパターン―個人化が最大のROIを生むのはデフォルトランキングが最も弱い場面―こそが、ユーザー信号を追加することが最も正当で効果的な時機である。

よくある質問

システムはどのようにして何をより高くランク付けするかを決定するのか?
2つの埋め込み空間を組み合わせる。TextEmbは、共同視聴トリプレットでコントラスティブ学習によってファインチューニングされたテキストベースの多言語エンコーダ。IdEmbは、相互作用から導出されたポジティブで訓練されたID ベースの協調フィルタリング埋め込み。配信時、最近の視聴履歴から構築されたユーザー表現がテキストベースとID ベースの類似度スコアを生成し、XGBoostランカーに他の特徴と共に入力される。
個人化がいつ最も役立つのか?
短く曖昧なプリフィックスクエリ(1~3文字)で、NDCG@10が8.63%向上するのに対し、より長くて指定が完全なクエリではわずか1.46%。視聴履歴が長いユーザーもより恩恵を受ける。51~100件の過去項目を持つユーザーではNDCGの向上が4.37%に達するのに対し、1~5件のみのユーザーでは2.13%。
実際の結果は?
3週間のオンライン管理実験で、システムはタップスルーレートが1.14%、コンバージョン率が1.23%、コンバート対象項目のランク位置が2.91%向上した。

「動画生成」の最新ニュースを、毎朝7時にお届けします

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・30秒で完了・いつでも解除できます

ディスカッション

まだコメントがありません。最初のコメントを投稿しましょう!

ログインして議論に参加

関連記事

AIニュースを毎日お届け

200以上のソースから厳選したAIニュースを毎日無料でお届けします。

無料で始める

登録無料・30秒で完了・いつでも解除できます

毎朝1分、AIの要点だけ。

200媒体以上・Email/LINE/Slack 対応

無料で受け取る →