
何が起きたか
Appleの研究者がDynamically Scaled Activation Steering(DSAS)を発表。既存のステアリング変換の強度を適応的に変調し、望ましくない挙動検出時のみ介入する。
なぜ重要か
DSASは必要なときだけ生成モデルをステアリングできるため、全入力に一律に介入した場合に生じる性能劣化を抑えられる可能性がある。
注目点
毒性緩和と有用性維持のトレードオフ改善が、さまざまなステアリング手法やモデルで保たれるかが試される。コードはGithubで公開予定。
誰に効くか顧客向けのテキストや画像生成に生成モデルを導入している企業のAIチームは、ステアリングが不要なときに不要な干渉を減らせる可能性がある。モデルの安全性やアラインメントに取り組む研究者は、既存のステアリングパイプラインに手法に依存しない追加要素としてDSASを採用できる。
こういう要約が、毎朝あなたのメールに届きます。
活性化ステアリングは、毒性緩和など望ましい結果に向けて生成モデルの挙動を導く既知の手法となっている。しかし研究者らによれば、既存の手法の多くは全入力に一律に介入するため、ステアリングが不要な場合にモデル性能が劣化する。DSASはこの限界に対処することを狙い、「いつステアリングするか」と「どうステアリングするか」を切り離すことで、手法に依存しない設計としている。
論文はDSASを、既存のステアリング手法を置き換えるものではなく補完するものとして位置づけている。生成時にDSASは文脈依存のスケーリング係数を計算し、任意のステアリング手法の強度を選択的に調整する。研究者らはさらに、ステアリング関数とともにエンドツーエンドで同時に最適化できることも示している。言語モデルだけでなく、テキストから画像を生成する拡散モデルでも特定の概念を変調できることを示し、汎用性を実証した。この研究は、どのトークンにどれだけステアリングが必要かを特定することで解釈性を高めつつ、計算オーバーヘッドは最小限だと報告している。
実用上の意義は、毒性緩和と有用性維持のトレードオフ改善が、さまざまなステアリング手法やモデルで頑健に保たれるかどうかにかかっている。すでに活性化ステアリングを使っているチームにとって、DSASは現在のアプローチを捨てずに不要な介入を減らす手段になりうるが、コードはまだ公開されていない。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
KDEの年次会議Akademyが9月19日からGraz University of Technologyで開幕し、Eva BrucherseiferとJan Muehligが「Kadai」構想を発表する

Meta Platformsの株価は過去1カ月で24.34%上昇した

Semaforが1900年代初頭の新聞アーカイブを精査し、物理学者Arthur H

Anthropicが自社の開発業務を採点した指標を公表し、26%がAL4(Epoch AIの「AIが主導」)に達したと発表

ニューヨーク・タイムズ紙などがOpenAIとマイクロソフトの内部メッセージを引用した共同略式判決申立書を提出

GitHub Podcastで、GitHubのシニア開発者体験アドボケイトがAIに関する5つの一般的な通説に反論した
