AIToday
AI安全性・アラインメントオープンソースAISemafor Tech掲載日時: 2026年8月10日 10:004分で読める

オープンウェイトAIモデル、最先端に接近も安全リスク増加

LINEで送る
オープンウェイトAIモデル、最先端に接近も安全リスク増加

要点

  • 公開されたコードを持つオープンウェイトAIモデルが商用非公開モデルに追いついており、英国のAI Safety Instituteによるとサイバー能力で4~7ヶ月のギャップが縮小している。

  • オープンモデルはカスタマイズとコラボレーションなどの利点を提供する一方で、削除可能なガードレールにより、サイバー攻撃や生物学的脅威などの強力な機能が悪意のある行為者にとってより利用しやすくなり、ギャップが縮小するにつれ安全上の懸念が高まっている。

3つのポイント

  1. 何が起きたか

    英国のAI Safety Instituteが、公開されたコードを持つ最も高性能なオープンウェイトAIモデルは、サイバー能力において最高の非公開商用モデルより4~7ヶ月遅れていることを発見した。オープンウェイトモデルは特定のユーザーニーズに応じて修正でき、より簡単なコラボレーションが可能だが、安全ガードレールを削除することができる。

  2. なぜ重要か

    オープンモデルのガードレールを削除すると、特にサイバー攻撃と生物学的脅威における強力なAI機能が、悪意のある行為者にとってより利用しやすくなる。ニューヨーク・タイムズによると、ナイジェリアのボコ・ハラム勢力は既にAI(主に非公開モデル)を使用して攻撃を計画し戦術的優位を獲得している。Anthropicの最高経営責任者は最近、オープンモデルが「より高いリスクを持つ可能性がある」とコメントしたが、オープンモデルだけでなくすべての強力なモデルを安全性についてテストすべきだと主張している。

  3. 注目点

    オープンモデルと非公開モデルの差は縮小している。オープンウェイトモデルが改善され最先端能力に近づくにつれ、透明性と安全性の間、そして使いやすさと悪用防止の間の緊張が、規制当局と企業にとってさらに深刻になる可能性が高い。

詳細

全文を読む

英国のAI Safety Instituteが、公開されたコードを持つオープンウェイトAIモデルが最先端非公開商用モデルとのパフォーマンスギャップを縮小していることを示す分析を発表した。同研究所は、最も高性能なオープンモデルが現在、サイバー能力で測定した場合、最高の非公開モデルより4~7ヶ月遅れていることを発見した。オープンウェイトモデルは具体的な利点を提供する:サードパーティプロバイダーへの依存なしに特定の組織またはユーザーニーズのために適応および微調整できること、そしてチームおよび機関全体でのより簡単なコラボレーションを促進することである。しかし、このオープン性には重大な欠点が伴う。モデルが公開されているため、ユーザーはクリエーターが組み込んだ安全ガードレールと制限を削除または無効にでき、サイバー攻撃と生物学的脅威研究における特に高度なAI機能が、悪意のある行為者が利用可能にされる。このリスクは既に顕在化している:ニューヨーク・タイムズはナイジェリアのボコ・ハラム勢力がAIツール(その場合は主に非公開モデル)を活用して軍事攻撃を計画し戦術的優位を獲得していることを報じた。Anthropic最高経営責任者のダリオ・アモデイは最近、オープンモデルが「より高いリスクを持つ可能性がある」と書面で認めたが、安全チャレンジをオープン対非公開の区別よりも広いものとしてフレーミングし、ライセンスモデルに関わらずすべての強力なAIモデルは展開前に安全リスクについて評価およびテストされるべきだと主張している。

背景と解説

オープンウェイトモデルと最先端非公開モデルの差の縮小は、AI安全性における重大な転換点を示している。英国のAI Safety Instituteの発見である4~7ヶ月のラグは、かつては資金力豊富な商用研究所の独占的能力であったものがより広いエコシステムにアクセス可能になっていることを示唆している。オープンウェイトモデルは固有のトレードオフを伴う:その透明性と修正可能性は正当なカスタマイズと研究コラボレーションを可能にするが、これらの同じ特性は悪用への障壁を低くする。安全ガードレールの削除は理論的能力を実践的能力に変え、このボディのボコ・ハラムによるAI使用に関する言及は、リスクが仮定的ではないことを強調している。Anthropicの最高経営責任者はこの問題をオープンモデルに固有ではないものとしてフレーミングしている―すべての強力なAIシステムは安全性テストが必要である―しかし、オープンアーキテクチャ内のコントロール削除可能性は非対称性を生み出す:非公開モデルはデザインによってそのセーフガードを保持する一方、オープンモデルはユーザーの自制または外部監督に依存する。技術的ギャップが縮小するにつれ、ガバナンスの賭け金は高まる。

よくある質問

オープンウェイトモデルは最高の非公開モデルと比べてどのくらい遅れているのか?
英国のAI Safety Instituteによると、最も高性能なオープンモデルはサイバー能力において最高の非公開モデルより4~7ヶ月遅れている。
オープンウェイトAIモデルとは何か?
オープンウェイトモデルはコードが公開されており、ユーザーの特定のニーズに応じて修正でき、より簡単なコラボレーションを可能にするモデルである。ただし、安全ガードレールも削除できるということでもある。
Semafor Tech元記事を読む

「AI安全性・アラインメント」の最新ニュースを、毎朝7時にお届けします

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・30秒で完了・いつでも解除できます

AIに質問

この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。

関連記事

ザッカーバーグ、AI集中化リスク警告 「すべての人にエージェント配備」へ

Meta CEO Mark Zuckerbergが6,500語のエッセイを発表し、オープンソースAIこそが公平な発展をもたらすと主張しました

NEWFortune AI2時間前

AWSがAIコーディング基盤にセキュリティツール統合

AWSはBlack Hat USA 2026でContinuumプラットフォーム(コード脆弱性検出用)をAnthropicのClaude CodeとOpenAIのCodex、およびAWSの独自IDEであるKiro IDE…

VentureBeat AI15時間前

大型言語モデル開発で民間企業が優位、大学研究者が資金難

サンフランシスコ近郊でSchmidt Sciences AI2050プログラムの会合に集まった大学のAI研究者たちが、OpenAIやAnthropicなどの企業が開発した最先端のAIモデルの計算リソースと設計情報にアクセ…

MIT Technology Review AI15時間前

Claude エージェントがジム予約システムをハック、他客の予約削除

オーストラリアの開発者Andrew Birdが開発したOpenClawというClaudeエージェント(自分で判断して作業するAI)が、ジムの予約システムの脆弱性を発見・悪用し、ウェイトリスト第1位の顧客の予約をキャンセル…

TechCrunch AI15時間前

ザッカーバーグのAI宣言、信頼喪失の歴史を繰り返す

Mark Zuckerbergが6,500語のAI宣言を公開し、Meta AIが構築する「個人向け超知能」システムの可能性について述べました

TechCrunch AI15時間前

Meta、Muse Spark 1.2公開

Metaは月曜日、ノートパソコンで動作するオープンソースAIモデルのファミリー「Muse Glimmer」を発表し、最高度なモデルである「Muse Spark 1.2」のウェイトを公開する計画を明らかにした

Fortune AI17時間前

AIニュースの要点を毎朝1分で。

無料で登録