AIToday
大規模言語モデルAI安全性・アラインメントオープンソースAIApple Machine Learning掲載日時: 2026年9月19日 1:00

Apple、DSASで活性化ステアリングを適応的に調整

LINEで送る
Apple、DSASで活性化ステアリングを適応的に調整

3つのポイント

  1. 何が起きたか

    Appleの研究者がDynamically Scaled Activation Steering(DSAS)を発表。既存のステアリング変換の強度を適応的に変調し、望ましくない挙動検出時のみ介入する。

  2. なぜ重要か

    DSASは必要なときだけ生成モデルをステアリングできるため、全入力に一律に介入した場合に生じる性能劣化を抑えられる可能性がある。

  3. 注目点

    毒性緩和と有用性維持のトレードオフ改善が、さまざまなステアリング手法やモデルで保たれるかが試される。コードはGithubで公開予定。

誰に効くか顧客向けのテキストや画像生成に生成モデルを導入している企業のAIチームは、ステアリングが不要なときに不要な干渉を減らせる可能性がある。モデルの安全性やアラインメントに取り組む研究者は、既存のステアリングパイプラインに手法に依存しない追加要素としてDSASを採用できる。

わからないところ、AIに聞けます

こういう要約が、毎朝あなたのメールに届きます。

背景と解説

活性化ステアリングは、毒性緩和など望ましい結果に向けて生成モデルの挙動を導く既知の手法となっている。しかし研究者らによれば、既存の手法の多くは全入力に一律に介入するため、ステアリングが不要な場合にモデル性能が劣化する。DSASはこの限界に対処することを狙い、「いつステアリングするか」と「どうステアリングするか」を切り離すことで、手法に依存しない設計としている。

論文はDSASを、既存のステアリング手法を置き換えるものではなく補完するものとして位置づけている。生成時にDSASは文脈依存のスケーリング係数を計算し、任意のステアリング手法の強度を選択的に調整する。研究者らはさらに、ステアリング関数とともにエンドツーエンドで同時に最適化できることも示している。言語モデルだけでなく、テキストから画像を生成する拡散モデルでも特定の概念を変調できることを示し、汎用性を実証した。この研究は、どのトークンにどれだけステアリングが必要かを特定することで解釈性を高めつつ、計算オーバーヘッドは最小限だと報告している。

実用上の意義は、毒性緩和と有用性維持のトレードオフ改善が、さまざまなステアリング手法やモデルで頑健に保たれるかどうかにかかっている。すでに活性化ステアリングを使っているチームにとって、DSASは現在のアプローチを捨てずに不要な介入を減らす手段になりうるが、コードはまだ公開されていない。

よくある質問
DSASは既存の活性化ステアリング手法と何が違うのか?
既存の手法の多くは全入力に一律に介入するため、ステアリングが不要な場合に性能が劣化しうる。DSASは既存のステアリング変換の強度を層や入力に応じて適応的に変調し、望ましくない挙動が検出されたときだけ強く介入する。
DSASは大規模言語モデル以外のモデルにも適用されているのか?
はい。研究者らはテキストから画像を生成する拡散モデルにDSASを適用し、適応的ステアリングによって特定の概念を変調できることを示して、その汎用性を実証した。
この研究はどこで発表されたのか?
論文はNeurIPS 2025のWorkshop on Unifying Representations in Neural Models(UniReps)に採択された。
Apple Machine Learning元記事を読む
LINEで送る

「大規模言語モデル」の最新ニュースを、毎朝7時にお届けします

たとえば、いま届くならこの3本です

  • KDEの会議でKadai構想 貢献者2人が発表The Register (AI/ML) · 2時間前
  • Meta株24%反発 Museが首位Yahoo Finance AI · 2時間前
  • Anthropic開発業務26%AL4THE DECODER · 2時間前

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。

関連記事

次の記事へ中国の計画、AIチップ冷却に合成ダイヤモンドを注目