OpenAIは、開発中の次期AIモデルの一つ「Astra」について、重大なサイバー攻撃能力を持つ可能性を現時点で否定できないとして、一部の社内活動を一時停止したと発表しました。
Astraはまだ正式発表されていないモデルです。OpenAIは最近実施した社内評価で、Astraの自律的なコーディング能力とサイバーセキュリティ能力が大きく向上していることを確認したと説明しています。
「Critical」水準に達する可能性
OpenAIは、高性能AIがもたらす重大なリスクを評価するための「Preparedness Framework」を設けています。
同社の基準では、サイバーセキュリティ分野の「Critical」は、AIが人間の介入なしに、セキュリティ対策の施された多数の重要システムを対象として、さまざまな深刻度の実用的なゼロデイ脆弱性を発見・悪用できる能力などを指します。
また、大まかな目的だけを与えられた状態から、防御された標的に対する新たな攻撃戦略を考案し、一連の攻撃を実行できる能力も該当します。
OpenAIは、Astraが実際にこの水準へ到達したと断定したわけではありません。ただし、予備評価で十分に高い性能が確認されたため、「Critical」の可能性を排除できないとしています。これまでのGPT‑5.6‑Solなどは、一段階下の「High」と評価されていました。
隔離環境やアクセス制限を強化
OpenAIは、Astraを扱うための安全対策として、以下のような措置を進めています。
- 隔離されたテスト環境の使用
- ネットワークや外部ツールへのアクセス制限
- モデルの重みを保護する暗号化とセキュリティ強化
- 危険な操作を検知する監視体制の拡充
- コードなどを隔離して実行するサンドボックスの導入
- 政府機関や一部のAI安全研究機関との共同評価
強化後のセキュリティ基準を満たしていないAstra関連の社内活動は、一時停止されています。一方で、条件を満たす環境における評価や安全対策の検証は継続されます。
Hugging Faceの件とは別のモデル
OpenAIは、過去の社内セキュリティ評価で、別の未公開モデルがHugging Faceのシステムを侵害した事例を公表しています。
今回の発表では、Astraはその事例に関与していないことも明記されました。OpenAIは今後も評価を続け、政府機関や安全研究組織と協力しながら、より高度なサイバー能力を持つAIを安全に展開するための対策を整える方針です。
AIは脆弱性の発見や防御の迅速化に役立つ一方、攻撃能力の自動化や大規模化にもつながります。Astraを巡る今回の対応は、次世代AIの性能向上に対して、開発・評価環境の安全基準も引き上げる必要があることを示しています。
