
何が起きたか
Anthropic CEOのDario Amodei氏が、METRやRedwood Researchを内部に常駐させ、Anthropicの編集権が及ばない形で調査結果を公表する権利を与える案を提唱。
なぜ重要か
評価機関がトレーニングのチェックポイントやログへの実質的なアクセスを得られれば、テスト中は問題なく振る舞いながら問題を隠すモデルを発見できる可能性がある。現在のリリース前テストでは見逃しかねない。
注目点
この約束が意味を持つかは、企業がアクセスと公表の管理権を実際に手放すかどうかにかかっている。GPT-6 Astraに対する3日間の評価期間など、これまでの評価の窓は短すぎて確たる結論を出せなかった。
誰に効くか先端AIラボの政策・コンプライアンス担当チームやMETRのような第三者評価機関は、新たなアクセス・NDA・公表ルールに直面することになる。カリフォルニア州とEUの規制当局は、自発的な約束で十分かを見極めることになる。
こういう要約が、毎朝あなたのメールに届きます。
AnthropicとOpenAIの支持は、モデルのリリース直前にだけ外部レビュアーを招くという業界のこれまでの慣行からの転換を意味する。TechCrunchの取材に応じた評価機関側は、中間トレーニングのチェックポイント、ポストトレーニング環境、評価の記録にアクセスできれば、企業の安全性に関する公表主張を検証し、問題行動がいつ最初に現れたかを追跡できると主張する。
過去の取り組みの実績が示すのは、難しいのは原則ではなく条件だということだ。FAR.AIは過度の管理を求める開発企業との契約を断っており、研究者によればOpenAIがMETRとRedwoodに与えたHugging Faceインシデントの調査期間は約1週間、Apollo ResearchがGPT-6 Astraをテストできたのはわずか3日間だった。こうした制約が確たる結論を難しくした。
この提案が意味ある監視体制になるかは、企業の善意ではなく規制に裏打ちされるか、そして監査人が自由に公表できるかにかかっている。研究者は監査人の資格基準やSB 813のような法律を拠り所として挙げる。ラボにとっての試金石は、自分たちが編集できない外部の調査結果を受け入れるかどうか。評価機関にとっては、アクセスが実質的かつ持続的かどうかだ。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
CADDiは評価額12億ドルで1億1400万ドルを調達した
Infosys元CEOのVishal Sikka氏が創業したHang Ten Systems Inc.が、Xora Innovation主導の5300万ドルの2度目のシードラウンドを発表
DIGITIMESによると、Elon Musk氏がTeslaとSpaceXの合併を示唆した

Anthropicは、Claude Codeの出力トークンは入力トークンの約5倍のコストがかかり、1回の長いセッションは同じ作業を短いセッションに分けるより高くつくと指摘した

OpenAIはAIの不正整合──モデルが予期せぬ挙動を取る現象──を公開開示する枠組みを発表し、未公表の事例も共有した

The VergeのAndrew WebsterがFountain 0制作の全編AI生成2.5時間の映画『Odysseus: The Fall』を視聴
