AIToday
大規模言語モデルAI安全性・アラインメントAIビジネス・産業The Rundown AI掲載日時: 2026年9月11日 1:002分で読める

Anthropic退社のJacob Coxon、安全性を告発

LINEで送る
Anthropic退社のJacob Coxon、安全性を告発

3つのポイント

  1. 何が起きたか

    AnthropicのJacob Coxonが退社し、同社とOpenAIが自己改善型AIへ突き進み「我々の命を賭けている」と非難した。

  2. なぜ重要か

    Hubingerは今後10年でAIが全人類を殺す確率を10%超と推定し、超知能を制御する計画がまだないと認めた。安全性を売りにする企業の内部から、この懸念が補強された形だ。

  3. 注目点

    Coxonは能力改善の一時禁止を含む協調的な減速を求めたが、誰が合意し、何を対象とし、どう執行するかは未定である。実効性のある枠組みを設計できるかが焦点となる。

誰に効くか最先端AIの安全性を評価する立場の研究者や、AIの導入判断を迫られる情報システム部門・政策担当者に影響が及ぶ。Anthropicの安全性主張を前提に調達や規制対応を進めてきた企業は、その根拠を再確認する必要が出てくるとみられる。

この記事についてAIに質問する →

こういう要約が、毎朝あなたのメールに届きます。

背景と解説

Anthropicは以前からAI安全研究の不確実性を認めてきた。2023年3月の声明では、強力なシステムを確実に安全にすることが未解決だとし、競争が危険な展開を促す可能性や、自社の研究が失敗する可能性にも言及していた。Hubingerの率直な発言はこの立場の延長線上にある。

2026年8月14日公表のRisk Reportは、対象モデルが意図に反して大災害を起こすリスクを低いと判断した。根拠の一部は、モデルが監視を欺くほど強力でないという前提に置かれている。この前提は、より高能力な後継モデルでは再検証が必要になる。能力が監視回避に及べば、その前提に基づく安心は弱まるためだ。

Anthropicは、意味のある安全研究には最先端モデルへのアクセスが必要だと主張して開発を続ける。研究と開発を両立させるこの方針が機能するかは、Coxonが求めた協調的減速の実効性にかかっている。一時禁止に誰が合意し、何を対象とし、どう執行するかは未定であり、顧客と政策担当者は能力増強を正当化する証拠と減速の引き金を明確にするよう迫られるとみられる。

よくある質問
Anthropicの内部では何が起きたのですか?
研究者のJacob Coxonが退社し、AnthropicとOpenAIが自己改善型AIへ競争していると非難した。これに対し、アラインメント研究責任者のEvan Hubingerが、AIが全人類を殺す可能性を本当に信じていると応じた。
Hubinger氏は具体的に何を心配しているのですか?
同氏は今後10年でAIが全人類を殺す確率を10%超と推定した。現在のモデルは低リスクとしつつ、自己改善を繰り返してはるかに高能力になる将来のAIを懸念している。
Anthropicの安全性評価はどうなっていますか?
2023年3月の声明では、強力なシステムを確実に安全にすることは未解決だと認めていた。2026年8月14日公表のRisk Reportは、対象モデルが意図に反して大災害を起こすリスクを低いと判断したが、その根拠の一部はモデルが監視を欺く能力を持ちにくいことに依存している。
The Rundown AI元記事を読む
LINEで送る

「大規模言語モデル」の最新ニュースを、毎朝7時にお届けします

たとえば、いま届くならこの3本です

  • Dynatrace、Arize AIを買収SiliconANGLE AI · 4時間前
  • 100のファインチューニング、1GPUで1.5TBから19.3GBにDaily Dose of Data Science · 4時間前
  • OpenAIエージェントがRubyGems攻撃Simon Willison's Weblog · 4時間前

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。

関連記事

AI時代における防御境界とサプライチェーン再考

Digitimesの記事は、ネットワーク入口のファイアウォール、メールゲートウェイ、アンチウイルスといった企業サイバーセキュリティの境界モデルがAI時代に向けて再考を要すると論じている

NEWDIGITIMES Asia1時間前

コロッサス、冗長性がSpaceXの拡張を左右か

AIインフラ構築への注目は今や純粋な計算能力に集まり、支配力は高性能GPUや最速の建設で決まる

NEWDIGITIMES Asia1時間前

Intel出資のKepler、HBM超えを主張

Barron'sが9月10日に報じたところによると、Kepler Computingがステルス状態から姿を現し、強誘電体材料と3D積層を用いたメモリ構造を発表した

NEWYahoo Finance AI1時間前

Dynatrace、Arize AIを買収

DynatraceがArize AIを買収し、AI可観測性、評価、エージェント監視を追加した

NEWSiliconANGLE AI4時間前

d-Matrix、Nvidiaラックに2027年搭載へ

ロイターが9月10日に報じたところによると、d-MatrixはNVLink Fusionを使い、次世代RaptorをNvidiaのデータセンターラックに直接接続する

NEWYahoo Finance AI4時間前

100のファインチューニング、1GPUで1.5TBから19.3GBに

100個のファインチューニング済み7Bモデルはマージすると1.5TBを占めるが、ベースモデルを共有しLoRAアダプタを別々に保つと約19.3GBになり、vLLMがリクエストごとにアダプタを適用する

NEWDaily Dose of Data Science4時間前
次の記事へOpenAI、GSAと契約 政府向けChatGPTを$0に