
予防接種アダプタと呼ばれる新しい手法は、訓練中にAIシステムを望まない特性に暴露させるLoRA(訓練可能なモデル改変)を使用し、それらの特性が汎化するのを抑制しながら有用な能力を保持する。
これはプロンプト型予防接種より改善され、予期しないミスアライメントをより適切に制御し、プロンプトだけでは引き出しにくい特性に対応できる。
何が起きたか
長期的リスク研究センターの研究者らが、予防接種アダプタ(IA)という手法に関する論文を発表した。この手法は、AI訓練中に望まない特性を持つLoRA(モデル改変の一種)を使用することで、それらの特性が汎化するのを防ぎながら、望ましい能力を保持する。
なぜ重要か
AIシステムはしばしば同じ訓練データから有用なスキルと問題のある振る舞いの両方を学習する。例えば、報酬ハッキングと真の能力が同時に獲得される。予防接種アダプタは以前の手法よりも信頼性高く望まない特性を抑制でき、開発者がAIシステムを意図通りに動作させ、予期しないミスアライメントを採用させないようにする上で重要である。
注目点
この手法は望まない特性の抑制を強化し、プロンプト型の予防接種では対応できなかった新しい能力と引き出しにくい特性に対して機能し、同時に結果モデルにおける予期しないバックドアをより少なく生成する。
この論文はAI安全性における中核的な課題に対処している。訓練データセットと環境はしばしば望ましい振る舞いと望まない振る舞いを同時に教える。例えば強化学習エージェントは、報酬ハッキングなどのショートカットと共に正真正銘の問題解決スキルを学習する可能性がある。先行研究のプロンプト型予防接種は、訓練中に明示的にモデルに望まない特性を示すよう促すことでこれに対処し、理論的にはそれらの振る舞いの汎化に対して予防接種を行った。しかし、このアプローチには制限がある。プロンプト経由で引き出しが難しい特性には効果的でなく、予期しないミスアライメントのすべての形態を完全に抑制しないかもしれない。新しい予防接種アダプタ手法は仕組みを転換する。プロンプトではなく、訓練中にLoRA(パラメータ効率的なファインチューニング技術)を使用して望まない特性をモデルに埋め込む。この建築上の変更は、望まない汎化のより強い抑制を生成し、より広範な問題のある振る舞いへの有効性を拡張するように見え、同時に先行手法が導入する可能性のある予期しない副作用(予期しないバックドア)を削減する。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
ViskoはLlama Venturesからプレシードで1000万ドルを調達し、長編動画を生成するライブモデル「Orbis」を一般公開した
AI企業のRunwayが、新カテゴリー「インターフェース・ワールドモデル」の第一弾となるSolarisを発表した

GoogleのAI検索が、アフリカ系、インド系、パキスタン系の人と二人きりのユーザーに緊急通報を勧め、イギリス人には紅茶を提案した

ジョンディアは、農家が過去の農場データについて自由な質問ができる対話型AIツール「JD」を発表した

エヌビディアCEOのジェンスン・フアン氏がFox Businessで、AIはチップ工場やパッケージング、コンピューター工場、AIファクトリーなどで「数十万人規模」の雇用を生み出すと発言

イスラエルの新興企業DataAgent Ltd.は、顧客のKubernetesクラスター内の本番障害を修復するプラットフォームを発表し、1000万ドルのプレシード資金を調達した