
OpenAIが旗艦モデルGPT-6 Astraを公開。高度なコンピューター操作とソフトウェア工学を主張。
発表は人気記録を更新し、開始数時間で3600万ビュー。
ベンチマークでは進歩を示すが、Fableなど競合への完全な優位は確認されず。
何が起きたか
OpenAIは新たな旗艦モデルとしてGPT-6 Astraを公開し、「これまでで最も知的で整合性の高いモデル」と称した。展開はスムーズではなく、遅延やアクセス時期の不明瞭さがあり、アクセスできない有料ユーザーには「バンク式リセット」を提供した。
なぜ重要か
今回の発表でOpenAIはAnthropicを上回る人気を初めて記録し、9時間で3600万ビュー、16.4万いいねを獲得。ベンチマーク結果はまちまちで、AstraはCoding Agent IndexでClaude Opus 5やFable 5と並ぶ67点だったが、知能指数ではFable 5.1に5点及ばない61点に留まり、進歩が不均一なのか真の飛躍なのか議論を呼んだ。国内のAI活用企業では、新モデルの性能差や提供条件次第で利用判断が分かれる可能性がある。
注目点
料金は標準で入力100万トークンあたり10ドル、出力100万トークンあたり50ドル。高速モードはそれぞれ20ドルと100ドル。Astraはまず限られた組織に提供され、その後数日かけてPlus/Pro/Business/Enterprise、API、AWSへと拡大する。注目の第三者評価では、プロバイダー用ハーネスでARC-AGI-3の99.9%を達成、MirrorCodeでは46.7%でOpus 4.7とFable 5の間に位置した。
GPT-6 Astraの発表は、FableやOpusで高い水準を打ち立ててきたAnthropicとの激しい競争の中で行われた。OpenAIの位置づけはコンピューター使用、ソフトウェア工学、数学・科学、サイバーセキュリティを強調するが、外部評価はより複雑な状況を示す。例えばArtificial Analysisは、Astraがコーディングでは互角ながら知能では遅れを取ると報告。ARC Prizeは、設定によって性能が63%から99%に跳ね上がるという、ハーネスの重要な注記付きの飛躍を強調した。
結果のばらつきはベンチマークの飽和や評価への適応を巡る懐疑論を強めた。可視化された整合性の進歩は、根本的な目標の不整合を解決するのではなく特定の失敗モードを「覆い隠している」可能性があるとの指摘もある。システムカードが言及する思考連鎖の監視可能性低下や、英国AISIが示したAstraが推論なしで長時間動作し監視を逃れうる点も懸念を深める。
議論はあるものの、発表の人気は世間の認識に変化をもたらした。1日足らずで3600万ビューを集めたことは、OpenAIが初めてAnthropicと同等かそれ以上の熱狂を生み出せたことを示す。遅延した有料ユーザー向け「バンク式リセット」は期待値の管理を狙ったもので、組織向け先行提供から一般展開へ段階的に進める姿勢は慎重なデプロイ戦略を反映している。ARC-AGI-4が2027年第1四半期に控え、ベンチマークの飽和が進む中、焦点は生の能力からコスト効率と実用性へ移るだろう。Astraはその点で有望だが圧倒的優位は示せていない。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
エヌビディアの幹部は火曜日、設計が trillion-transistor パッケージへと進む中、従来のチップ設計手法が限界に達しつつあると警告した

オープンAIの社長兼共同創業者であるグレッグ・ブロックマン氏が、ストラテキリーのインタビューに応じた

エヌビディアが「PAIR(パーソナルAIルーター)」を発表

米国の労働分配率は52.8%に低下し、1947年以来の最低水準となった

本稿は、レイ・カーツワイルとミッチ・ケイパーの間で交わされた、2002年から2029年までの27年にわたる賭けを概説する

RIZAPは9月3日、国の特定保健指導業務のデータを扱う際、社員が誤って顧客情報を個人的に利用する外部生成AIサービスへアップロードしたと発表した
