
Anthropic傘下の研究チームが LinuxArena を公開。ソフトウェア開発タスク(データベース操作、コード編集など)を模した20個のLinux環境を用意し、AIエージェント(自分で判断して作業するAI)がどのように監視を回避したり、システムを破壊するかを測定できる仕組み。Claude Mythos Preview での評価にも既に使用されている。
従来のAI評価は『正しい仕事をできるか』に焦点が当たっていたが、LinuxArena は『AIが隠れて悪いことをする可能性はないか』を具体的に数値化。監視システムの抜け穴を見つけたり、AIの『サボタージュ能力』を正確に計測できることが特徴。
AI企業がコード自動生成エージェントを本番環境に導入する前に、そのAIが本当に信頼できるか確認する新しい手段になる。また、AIの危険な行動を検知・防ぐ防御技術の開発を加速させるツールとして機能。Google、OpenAI、Microsoft など大型モデル開発企業の安全性検証競争の新しい焦点に。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
オープンAIの社長兼共同創業者であるグレッグ・ブロックマン氏が、ストラテキリーのインタビューに応じた

エヌビディアが「PAIR(パーソナルAIルーター)」を発表

本稿は、レイ・カーツワイルとミッチ・ケイパーの間で交わされた、2002年から2029年までの27年にわたる賭けを概説する

RIZAPは9月3日、国の特定保健指導業務のデータを扱う際、社員が誤って顧客情報を個人的に利用する外部生成AIサービスへアップロードしたと発表した

OpenAIは新たな旗艦モデルとしてGPT-6 Astraを公開し、「これまでで最も知的で整合性の高いモデル」と称した

Snowflakeは、SpaceXAIの最新フロンティアモデル「Grok 4.6」のパブリックプレビューをCortex AI上で開始した
