ARC-AGI-3とは?AIの推論力を測る新たなベンチマーク
室谷代表取締役OpenAIがARC-AGI-3っていうベンチマークで、APIの設定を変えただけでスコアが3倍になったっていう報告なんですよね。
テキトー教師.AI認定講師2次元のパズルゲームみたいなもので、エージェントが明示的な指示なしにゲームのルールを推測しながら動く必要がある。
室谷代表取締役人間は平均で48%のスコアを出すんですが、フロンティアモデルはほとんど解けない。
テキトー教師.AI認定講師
室谷代表取締役「保持推論」と「コンパクション」がもたらした劇的な改善
室谷代表取締役出力トークン数も6分の1に削減された。
テキトー教師.AI認定講師これらはChatGPTやCodexで既に使われている設定だそうで、APIでも有効にできる。
室谷代表取締役
テキトー教師.AI認定講師
室谷代表取締役API設定、ハーネス設計、プロンプトといった目に見えない選択も測定している」と述べています。
公式ハーネスとOpenAI独自ハーネスの違い
室谷代表取締役
テキトー教師.AI認定講師ARC側の論理としては、シンプルなハーネスにすることでモデルの弱点が露呈しやすくなり、モデル間の比較が公平になる。
室谷代表取締役
テキトー教師.AI認定講師
室谷代表取締役だから「ハーネスの違い」がそのままスコア差になっている。
テキトー教師.AI認定講師
室谷代表取締役でもOpenAIのハーネスを使えば、GPT-5.6 Solはすべてのレベルをクリアできる。この差は大きい。
この発見が示すこと:API設定の隠れた影響力
室谷代表取締役
テキトー教師.AI認定講師これは僕の講座でもよく話すんですが、同じモデルでもプロンプトや設定を変えるだけで性能が激変する。今回のケースはそれが極端に出た。
室谷代表取締役2Dパズルが特別苦手なのか、別の原因があるのか。
テキトー教師.AI認定講師
室谷代表取締役
テキトー教師.AI認定講師このあたりは今後の議論が必要ですね。
室谷代表取締役
テキトー教師.AI認定講師よくある質問(FAQ)
室谷代表取締役
テキトー教師.AI認定講師-
Q: ARC-AGI-3とは何ですか? A: ARC-AGI-3は、AIエージェントの学習能力と推論能力を測定するためのベンチマークです。エージェントは未知の2Dゲームを探索し、明示的な指示なしにルールを推測します。25のデモゲームが公開されています。
-
Q: 今回の発表でOpenAIはどのモデルを使いましたか? A: 主にGPT-5.6 SolとGPT-5.5を使いました。GPT-5.6 Solは公式ハーネスで13.3%、独自ハーネスで38.3%のスコアを記録しました。GPT-5.5は公式ハーネスで0.4%でしたが、独自ハーネスでは改善しました。
-
Q: 人間と比べてどうですか? A: 人間の平均スコアは約48%と推定されています。GPT-5.6 Solの独自ハーネスでの38.3%はまだ人間には及びませんが、大きな前進です。
-
Q: 「保持推論」と「コンパクション」とは何ですか? A: 保持推論はモデルが過去の推論ステップを保持し続ける機能、コンパクションは推論過程の冗長トークンを圧縮する機能です。両方を有効にすることで、スコアが3倍、出力トークンが6分の1になりました。
-
Q: この結果は他のベンチマークにも影響しますか? A: 可能性はあります。同様にAPI設定やハーネス設計に依存するベンチマークでは、スコアが変わるかもしれません。今回の発見は、ベンチマーク評価の透明性の重要性を示しています。
室谷代表取締役