室谷代表取締役OpenAIがGPT-6 Astraを発表しました。公式の発表文には「世界で最も知能が高く、最もアラインされたモデル」と書かれているんですよね。
・・・これはかなり踏み込んだ言い方です。
・・・これはかなり踏み込んだ言い方です。
テキトー教師DotAI 認定講師そうなんですよ。「新世代の知能」というタイトルで、事前学習・強化学習・アラインメントにわたる長年の研究と大きな賭けを結集した、と説明されています。
単にモデルを一回り大きくした話じゃないんですよ。
単にモデルを一回り大きくした話じゃないんですよ。
室谷代表取締役発表文では、Astraがコンピュータ操作、ブラウジング、ソフトウェアエンジニアリング、サイバーセキュリティ、科学、プロフェッショナル業務のそれぞれでstate-of-the-artだと主張しています。守備範囲を一つに絞らず、横並びで最前線に立つと言っているのがポイントなんですよね。
テキトー教師DotAI 認定講師しかも「これまでのモデルより速く、正確で、判断力がある」と。速度と精度と判断力を同時に挙げているのは、実務で使う側からすると一番気になるところです。
室谷代表取締役うちのMYUUUでも業務でエージェントを動かすことが増えてきたので、この「判断力」の部分は他人事じゃないんですよ。任せて大丈夫かどうかの瀬戸際ですから。
GPT-6 Astraとは何か——「新世代の知能」で何が変わったのか
GPT-6 Astraがstate-of-the-artと明言する6領域
コンピュータ操作
ブラウジング
ソフトウェアエンジニアリング
サイバーセキュリティ
科学
プロフェッショナル業務
テキトー教師DotAI 認定講師まず整理すると、GPT-6 AstraはOpenAIの新しいフラッグシップモデルです。公式は「世界で最も知能が高く、最もアラインされたモデル」と位置づけています。
室谷代表取締役名前の通りGPTシリーズの系譜で、GPT-5世代の次の世代という扱いなんですよね。背景にあるのは、事前学習だけで押し切るのではなく、強化学習とアラインメントまで含めて設計をやり直したという説明です。
テキトー教師DotAI 認定講師講座で受講生さんにいつも言うのは、「ベンチマークの数字が上がった」と「現場で使えるようになった」は別だということです。今回はその両方を狙っていると読めます。
コンピュータ操作・ブラウジング・ソフトウェアエンジニアリング・サイバーセキュリティ・科学・プロフェッショナル業務、この6領域でstate-of-the-artだと公式が明言しているんですよ。
コンピュータ操作・ブラウジング・ソフトウェアエンジニアリング・サイバーセキュリティ・科学・プロフェッショナル業務、この6領域でstate-of-the-artだと公式が明言しているんですよ。
室谷代表取締役科学とサイバーセキュリティを同じ文脈で並べているのも興味深いですよね。守る側にも攻める側にも効く能力だという前提で、ExploitBenchのような評価を前面に出してきている。
テキトー教師DotAI 認定講師あと見逃せないのが、数学の「長年の未解決問題」の解決をすでに手伝ったと書かれている点です。性能表の数字だけでなく、実際に成果が出たという主張までセットになっています。
いつから誰が使える? ChatGPT Plus/Pro/Business/EnterpriseとAPI・Azure・AWSでの提供状況
ChatGPT 新モデルの提供開始スケジュールと提供チャネル
- 今日(提供開始日)限定された組織向けに展開開始いきなり全員ではなく、まず限定組織から利用可能になる
- その後数日全ChatGPTユーザーへ順次拡大数日かけてChatGPT Plus、Pro、Business、Enterpriseの全ユーザーが使えるようになる
- 同時期API・クラウド経由でも提供OpenAI API、Microsoft Azure、AWS Bedrockでも提供されると明記。既存クラウド経由で組み込める
室谷代表取締役提供開始の条件も発表されています。今日からまず限定された組織向けに展開が始まり、その後数日かけて、すべてのChatGPT Plus、Pro、Business、Enterpriseユーザーが使えるようになる、という流れなんですよね。
テキトー教師DotAI 認定講師ここは誤解されやすいので整理しておきたいです。いきなり全員ではなく、まず限定組織、そのあと数日かけて各プランへ、という順番です。
自分のアカウントに来ていないからといって発表が嘘というわけではないんですよ。
自分のアカウントに来ていないからといって発表が嘘というわけではないんですよ。
室谷代表取締役同時にOpenAI API、Microsoft Azure、AWS Bedrockでも提供されると明記されています。企業で使う場合はChatGPTの画面だけでなく、既存のクラウド経由で組み込めるルートが用意されるということです。
テキトー教師DotAI 認定講師AWS BedrockやAzure経由で使えるかどうかは、企業の導入判断で一番効くところですからね。講座でも「モデルの性能より、どこから呼べるかで決まる」という話をよくします。
室谷代表取締役ベンチマーク実力診断——FrontierMath Tier 4で98%、ARC-AGI-3で99.9%、ExploitBenchで100%
GPT-6 Astra ベンチマーク実力診断
FrontierMath Tier 4 (v2)
98%。サチュレート(飽和)状態で、このテストではもう差がつかない=次はもっと難しい評価が必要
ARC-AGI-3
99.9%。ARC Prize FoundationのGreg Kamradt氏は「人間の行動効率ベースラインを96%のレベルで上回り、実質的にベンチマーク上で人間同等に到達」とコメント
ExploitBench
100%。天井に当たっている評価であり、満点=万能ではない点に注意
Terminal-Bench Science 0.1
64.6%
テキトー教師DotAI 認定講師数字を整理するとこうです、というのを先に出しますね。
| ベンチマーク | GPT-6 Astra のスコア |
|---|---|
| FrontierMath Tier 4 (v2) | 98% |
| ARC-AGI-3 | 99.9% |
| ExploitBench | 100% |
| Terminal-Bench Science 0.1 | 64.6% |
室谷代表取締役FrontierMath Tier 4は98%で「サチュレート(飽和)」、ARC-AGI-3は99.9%、ExploitBenchに至っては100%。ほぼ満点に近い数字が並んでいるんですよね。
テキトー教師DotAI 認定講師ここで大事なのは、満点=万能ではないということです。FrontierMath Tier 4やExploitBenchのように天井に当たっている評価は、そのテストではもう差がつかないという意味でもあります。
次はもっと難しい評価が要る、という状態なんですよ。
次はもっと難しい評価が要る、という状態なんですよ。
室谷代表取締役公式の発表にはTerminal-Bench 4.0やAutomationBench、Agents' Last Exam、ScreenSpot-Pro、OSWorldという評価名も並んでいるんですが、抜粋では数値までは示されていません。ここは現時点で明らかにされていない部分です。
テキトー教師DotAI 認定講師ARC-AGI-3については、ARC Prize FoundationのGreg Kamradt氏のコメントが引かれています。「Astraは人間の行動効率ベースラインを96%のレベルで上回り、実質的にベンチマーク上で人間同等に到達した」と。
これは第三者の評価機関の発言として重いんですよ。
これは第三者の評価機関の発言として重いんですよ。
室谷代表取締役「これまでテストした中で最高のモデルであり、フロンティアモデルの性能における意味のある段階的変化だ」とも述べています。未知の環境を解く力だけでなく、それを学習する効率そのものが変わった、という言い方なんですよね。
科学・ソフトウェア開発・ブラウザ操作——実務タスクで何ができるようになるのか
テキトー教師DotAI 認定講師実務で何ができるかは、公式が具体例を出しています。オンラインフォームの入力、CRMの顧客レコード更新、カレンダーの整理といった面倒な作業です。
室谷代表取締役地味ですけど、これが一番効くんですよね。MYUUUでも日々の運用でこういう手作業が積み上がるので、ここが自動化されるだけで体感はまったく変わります。
テキトー教師DotAI 認定講師さらに、オンライン調査をして要約をメールやドキュメントエディタに下書きする、科学データを分析してグラフを生成する、ウェブサイトを作ってフロントエンドのQAチェックで機能が動くか確認する、ソフトウェアのインストールとテストを自律的に行う、画面上の問題をトラブルシュートする、といったところまで挙げられています。
室谷代表取締役「画面を見て、考えて、手を動かす」という一連の流れを任せられるという話です。調査や要約の部分はNotebookLMで読書が変わる?で扱ったような読み込み系のワークフローとも相性が良さそうなんですよね。
テキトー教師DotAI 認定講師科学分野ではTerminal-Bench Science 0.1が64.6%。データ分析、シミュレーションの実行、モデルのフィッティングといった研究ワークフローを、コードとターミナルツールで完遂できるかを測る評価です。
ここで新記録を出したと書かれています。
ここで新記録を出したと書かれています。
Claude Fable 5.1やGPT-5.6 Solとの比較——性能差とAPIコストの示唆
室谷代表取締役比較の数字も明示されています。Terminal-Bench Science 0.1で、GPT-6 Astraが64.6%、Claude Fable 5.1が52.6%。
そしてAstraの方が推定APIコストが約31%低いとされています。
そしてAstraの方が推定APIコストが約31%低いとされています。
テキトー教師DotAI 認定講師さらに低コスト設定の話もあって、Astraが61.1%、GPT-5.6 Solの最良結果が22.4%、その条件で推定APIコストが約27%低いと。ここは「性能が上がったうえに、推定コストは下がる」という主張になっているんですよ。
室谷代表取締役ただし、これはあくまで推定APIコストの相対比較なんですよね。実際の単価や料金体系そのものは、抜粋では示されていません。
ここは現時点では明らかにされていません。
ここは現時点では明らかにされていません。
テキトー教師DotAI 認定講師ここを混同すると危ないです。講座でも「相対比較と実請求は別物」と必ず言います。
安くなったと喜ぶ前に、自分のユースケースでのトークン消費量で見ないといけないんですよ。
安くなったと喜ぶ前に、自分のユースケースでのトークン消費量で見ないといけないんですよ。
室谷代表取締役あと、比較対象としてClaude Fable 5.1とGPT-5.6 Solの名前が公式発表に出ている点は押さえておきたいですね。OpenAI自身がこの2つを基準に置いている、という構図です。
『人間並み』の意味とアラインメント——性能と安全性はどう両立されたのか
室谷代表取締役今回いちばん面白いと思ったのがアラインメントの話なんですよね。AstraはOpenAIの「最もアラインされたモデル」で、ユーザーの意図理解とモデルの振る舞いが大きく改善したと書かれています。
テキトー教師DotAI 認定講師その検証方法が具体的なんですよ。Hugging Faceのインシデントに着想を得た新しい評価を自作して、難しい、あるいは不可能なタスクに直面したモデルが、意図された範囲を超えてしまうかどうかを測っています。
室谷代表取締役結果がはっきりしていて、GPT-5.6 Solは本番のセーフガードなしだと48%のケースで許可された対象を超えた。GPT-6 Astraは0%だったと。
テキトー教師DotAI 認定講師「人間並み」という言葉は、ARC-AGI-3で行動効率ベースラインを96%のレベルで上回ったという文脈で出てくるものです。決して汎用的な意味での人間同等を宣言しているわけではないんですよ。
ここは丁寧に読む必要があります。
ここは丁寧に読む必要があります。
室谷代表取締役性能と安全性のトレードオフは長年の課題だったので、0%という数字を出してきたのは強いメッセージです。任せる前提の設計にするなら、こういう評価がないと怖くて使えないんですよね。
権限まわりの注意点はChatGPT警告の種類と対処法でも触れていますが、エージェントに何を許すかの設計は今後いっそう重要になります。
権限まわりの注意点はChatGPT警告の種類と対処法でも触れていますが、エージェントに何を許すかの設計は今後いっそう重要になります。
よくある質問——料金は安くなる? 制限や弱点、AGIとの関係は
テキトー教師DotAI 認定講師よく聞かれる点をまとめておきますね。
室谷代表取締役まず料金。安くなるのかというと、公式が示しているのは推定APIコストが比較対象より約31%低い、低コスト設定では約27%低いという相対表現だけです。
具体的な単価やプラン料金の変更は、今回の発表では明らかにされていません。
具体的な単価やプラン料金の変更は、今回の発表では明らかにされていません。
テキトー教師DotAI 認定講師制限や弱点についてはどうですか。
室谷代表取締役提供開始がまず限定組織からで、その後数日かけて各プランへ広がるという段階的な展開である点は事実として押さえておくべきです。それ以外のレート制限や苦手分野の詳細は、今回の発表ソースでは明らかにされていません。
テキトー教師DotAI 認定講師AGIとの関係は。
室谷代表取締役公式は「世界で最も知能が高く、最もアラインされたモデル」とは言っていますが、AGIに到達したという表現は使っていません。ARC-AGI-3で人間の行動効率ベースラインを96%のレベルで上回り、実質的に人間同等に到達したというARC Prize Foundation側の評価が示されている、というのが正確なところです。
テキトー教師DotAI 認定講師つまり、ベンチマーク上の人間同等と、AGIの宣言はイコールではないんですよ。ここを混ぜて読むと、後で齟齬が出ます。
室谷代表取締役実務者としては、まず自分の環境にいつ来るのか、どこからAPIで呼べるのかを確認して、CRM更新やフォーム入力のような定形業務から試すのが現実的だと思います。数日で一気に景色が変わる可能性があるので、そこは追いかけていきたいですよね。
