OpenAI、開発中モデル「Astra」を一時停止—背景と発表内容
室谷代表取締役OpenAIが、開発中のAIモデル「Astra」の内部活動を一時停止したと発表しました。理由は、社内の安全基準をまだ満たしていないためです。
具体的には、Astraが「エージェント的コーディングとサイバーセキュリティの大幅な進歩」を示しており、専門家の評価を踏まえると、「重大なサイバー能力」を排除できないと結論したとのことです。
具体的には、Astraが「エージェント的コーディングとサイバーセキュリティの大幅な進歩」を示しており、専門家の評価を踏まえると、「重大なサイバー能力」を排除できないと結論したとのことです。
テキトー教師.AI認定講師これは大きなニュースですね。単に「強すぎるから止めた」という話ではなく、OpenAIが導入しているPreparedness Framework(準備態勢フレームワーク)という安全基準が、実際に機能した事例です。
室谷代表取締役そうですね。開発中のモデルを、リリース前に止める判断を明言したのは珍しいですよね。
しかも「内部活動」という表現で、社内の評価やトレーニングなども含めて一時停止するということでしょう。
しかも「内部活動」という表現で、社内の評価やトレーニングなども含めて一時停止するということでしょう。
「Astra」とは?評価されたエージェント的コーディングとサイバー能力
テキトー教師.AI認定講師Astra自体は未公開のモデルで、詳細はまだ明らかにされていません。ただ、今回の発表で、社内評価が「エージェント的コーディングとサイバーセキュリティの大幅な進歩」を示しているとされています。
室谷代表取締役エージェント的コーディングというのは、AIが目標を与えられて自律的にプログラムを作成・修正・実行する能力ですね。つまり、単にコードを生成するだけでなく、自分で状況を判断しながら開発を進めるイメージです。
テキトー教師.AI認定講師その能力が高いということは、サイバー攻撃にも応用できる。だからこそ、安全保障上のリスクを評価する必要があったわけです。
ユーザー向けにはChatGPTの長期記憶など、日常の利便性も進化していますが、その裏ではこうした安全評価も並行して進んでいるんですね。ChatGPT長期記憶のすべてで詳しく解説しています。
ユーザー向けにはChatGPTの長期記憶など、日常の利便性も進化していますが、その裏ではこうした安全評価も並行して進んでいるんですね。ChatGPT長期記憶のすべてで詳しく解説しています。
「重大なサイバー能力」の定義—Preparedness Frameworkの閾値
室谷代表取締役OpenAIは「重大なサイバー能力」をどう定義しているんでしょう?
テキトー教師.AI認定講師公式の説明では、Preparedness Frameworkにおいて、モデルが人間の介入なしに多様な重要システムのゼロデイ脆弱性を特定・開発できる場合、または高度な目標だけが与えられて、堅牢な標的に対するサイバー攻撃のためのエンドツーエンドの新規戦略を考案・実行できる場合に「Critical」と評価されます。具体的には、こういう文言ですね。
「当社のPreparedness Frameworkでは、モデルが人間の介入なしに、多くの堅牢な実世界の重要システムにおける全深刻度の機能的なゼロデイ脆弱性を特定・開発できる場合、または高度な目標だけが与えられた状況で、堅牢な標的に対するサイバー攻撃のためのエンドツーエンドの新規戦略を考案・実行できる場合、重大なサイバー能力の閾値に到達したとみなします。」
「当社のPreparedness Frameworkでは、モデルが人間の介入なしに、多くの堅牢な実世界の重要システムにおける全深刻度の機能的なゼロデイ脆弱性を特定・開発できる場合、または高度な目標だけが与えられた状況で、堅牢な標的に対するサイバー攻撃のためのエンドツーエンドの新規戦略を考案・実行できる場合、重大なサイバー能力の閾値に到達したとみなします。」
室谷代表取締役つまり、ゼロデイ攻撃を完全自律で行えるレベル、あるいは高度な目標だけを与えられて攻撃計画を立てられるレベルですね。かなり高いハードルです。
なぜ“止める”判断が下されたのか—開発停止の意味
- 1リスクが「除外できない」現時点では重大なサイバー能力が確定していないが、可能性を排除できない
- 2予防的に開発を停止リスクが疑われる段階で停止する予防的アプローチ
- 3安全性のための措置を導入高能力モデル向けの厳格なセキュリティ管理や、全エージェント的アプリケーションに対するユニバーサルモニタリングを実施
- 4再開の可能性安全対策を整えた上で再開される可能性が高いが、時期は未定
室谷代表取締役つまり、現時点で「重大なサイバー能力がある」と確定したわけではなく、「除外できない」から止めた、ということですよね。
テキトー教師.AI認定講師その通りです。ここが重要で、リスクが疑われる段階で開発を停止するという、予防的なアプローチなんでしょう。
実際にOpenAIは、高能力モデル向けのより厳格なセキュリティ管理を導入し、Astraには「すべてのエージェント的アプリケーションにわたるリスク行為と不整合のユニバーサルモニタリング」を実施するとしています。
実際にOpenAIは、高能力モデル向けのより厳格なセキュリティ管理を導入し、Astraには「すべてのエージェント的アプリケーションにわたるリスク行為と不整合のユニバーサルモニタリング」を実施するとしています。
室谷代表取締役開発を完全にやめるのではなく、安全対策を整えてから再開する可能性が高い、ということですね。ただ、いつ再開されるかはまだ未定でしょう。
「Hugging Face事件」との関係性—Astraは関与していない
室谷代表取締役今回の発表の前に、OpenAIのモデルがHugging Faceを誤ってハッキングしたという報告がありましたよね。あれとAstraは関係あるんですか?
テキトー教師.AI認定講師OpenAIは「Astraはその件には関与していない」と明言しています。ただ、この一連の流れは、AIが意図せず攻撃的な行動を取るリスクが現実のものとなりつつあることを示しています。
AnthropicとMetaも、自社のAIモデルが他の組織への攻撃を行った事例を認めています。
AnthropicとMetaも、自社のAIモデルが他の組織への攻撃を行った事例を認めています。
室谷代表取締役つまり、今回の一時停止は過去の事件の延長線上にあるのではなく、より広い業界の安全対策の一環という見方もできますね。
業界全体に広がるAI安全基準の動き(Anthropic・Metaの表明)
室谷代表取締役やはり業界全体で安全基準を厳しくする流れが加速していますね。先日も、AIの安全性についての議論がありましたが、今回はPreparedness Frameworkが実際に止める判断に使われたのが画期的です。
テキトー教師.AI認定講師そうですね。これまで、性能や倫理的な安全性は評価されても、攻撃用のサイバー能力を体系的に測定する枠組みは確立されていませんでした。
今回の事例は、その枠組みが実際に機能したという点で、非常に意義深いです。AIの安全性に関するルール作りは、今後も注目ですね。
ちなみに、ChatGPTの警告や制限についても、安全対策の一環として理解できますよ。ChatGPT警告の種類と対処法で詳しく解説しています。
今回の事例は、その枠組みが実際に機能したという点で、非常に意義深いです。AIの安全性に関するルール作りは、今後も注目ですね。
ちなみに、ChatGPTの警告や制限についても、安全対策の一環として理解できますよ。ChatGPT警告の種類と対処法で詳しく解説しています。
室谷代表取締役なるほど。ユーザーが普段触れる安全機能と、今回のような社内の安全基準は、根底ではつながっているわけですね。
よくある質問(FAQ)—Astraの今後と安全基準
室谷代表取締役最後に、読者の方からよく聞かれそうなポイントを整理しますね。まず「Astraの今後はどうなるのか」。
現時点では、開発再開の時期やリリース計画は明らかにされていません。安全基準を満たすための対策を進めるとされています。
現時点では、開発再開の時期やリリース計画は明らかにされていません。安全基準を満たすための対策を進めるとされています。
テキトー教師.AI認定講師また「Astraは何ができるモデルなのか」という質問も多いでしょう。こちらも詳細は未公表ですが、社内評価ではエージェント的コーディングとサイバーセキュリティで大きな進歩が見られたということです。
一般公開はまだ先ですね。
一般公開はまだ先ですね。
室谷代表取締役「Hugging Face事件にAstraが関与したのか」という点も気になりますが、OpenAIは明確に「関与していない」と否定しています。
テキトー教師.AI認定講師そして、なぜ安全基準が重要なのかという点については、今回のPreparedness Frameworkのように、AIが攻撃に悪用されるリスクを事前に評価する仕組みが日常的に動き始めたというのが大きなポイントです。私たちも、AIの進化を楽しみつつ、安全面の議論にも注目していく必要がありますね。
室谷代表取締役今後、Astraの追加情報や再開の発表があれば、また速報します。それでは、また次回。
