AIToday
大規模言語モデルAI安全性・アラインメントarXiv cs.AI掲載日時: 2026年4月15日 13:001分で読める

大規模言語モデルのツール使用エージェントが組織環境で実行する際の行動パターンを測定する新しい評価手法が提案される

LINEで送る
大規模言語モデルのツール使用エージェントが組織環境で実行する際の行動パターンを測定する新しい評価手法が提案される

3つのポイント

  1. LLMベースのツール拡張エージェントが実行層でどのように振る舞うかを測定する新しいアプローチを導入

  2. A-R空間(行動率と拒否信号の2次元空間)を使用し、言語シグナルと実行可能な動作の構造的関係を分析

  3. 4つの規範的制度(制御、グレーゾーン、ジレンマ、悪意)と3つの自律性設定(直接実行、計画、省察)でモデルを評価

  4. 集約的な安全スコアではなく、文脈的枠組みとスキャフォルディングの深さに応じて実行と拒否がどのように変わるかを特性化

この記事についてAIに質問する →

LINEで送る

「大規模言語モデル」の最新ニュースを、毎朝7時にお届けします

たとえば、いま届くならこの3本です

  • 有料俳優とAI脚本、反民主党動画ネットワーク発覚Semafor Tech · 1時間前
  • ICRAパネルが論文氾濫に警鐘Robohub · 1時間前
  • Gemini動画分析、トークン88%削減THE DECODER · 1時間前

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・30秒で完了・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。

関連記事

次の記事へニューヨーカー誌のイラストレーター、AI記事のアイキャッチにAI画像を使用しないよう主張