2026年10月7日

OpenAI Web Searchとは?検索APIベンチマーク5位の実力

室谷室谷代表取締役
Artificial Analysisが運営する検索APIのベンチマーク「Artificial Analysis Search Index」に、OpenAI Web Searchが初めて登場したんですよね。スコアは74で、26製品中7位タイ。

上位はPerplexity、Octen、Parallel、Braveという並びです。
テキトー教師テキトー教師DotAI 認定講師
これ、単に「OpenAIが検索APIのベンチマークに載った」という話じゃないんですよ。最大のポイントは、これが初の統合型ファーストパーティ検索ツールだという点です。

これまでの検索APIは、エージェントが外部の検索APIを呼び出す方式が主流でした。
室谷室谷代表取締役
そこが面白いんですよね。Artificial Analysisのオープンソース・エージェントハーネス「Stirrup」を使う通常の検索API行では、モデルがweb_searchツールを呼び出すループを回すわけです。

でもOpenAI Web Searchは、GPT-5.6 Luna(medium reasoning)がOpenAI内蔵のweb_searchツールを、1回のResponses API呼び出しで使う。検索のループごとOpenAI側が回してくれる構造なんですよ。
テキトー教師テキトー教師DotAI 認定講師
整理するとこうです。
  • 発表元: Artificial Analysis(検索APIベンチマーク「Search Index」を運営)
  • 対象: OpenAI Web Search(OpenAIのResponses API内蔵の検索ツール)
  • スコア: 74(26製品中7位タイ、26製品中5位相当の評価)
  • 特徴: 初の統合型ファーストパーティ検索ツール
  • 料金: 1,000検索あたり$10+検索内容がモデル入力トークンとして課金
室谷室谷代表取締役
ちなみに「5位」と「7位タイ」が混在して見えるのは、同点の製品が並んでいるからなんですよね。74にはYou.com(highlights)、Nimble(standard)、Exa(auto)も並んでいます。

OpenAI Web Searchとは?Artificial Analysis Search Index初登場の概要

OpenAI Web Search と 通常の検索API行の測定方式
OpenAI Web Search
  • GPT-5.6 Luna(medium reasoning)にOpenAIのweb_searchツールを持たせる
  • search_context_sizeをmediumに設定
  • 1回のResponses API呼び出しで実行
  • Stirrupのループもターン上限も使わない
  • ツールのドメインフィルタで既知の汚染ソースをブロック
通常の検索API行
  • Stirrupハーネスがweb_searchとweb_fetchの2ツールを提供
  • 25ターンの予算内でモデルが自由にツールを呼ぶ方式
  • web_searchの結果をURL・タイトル・スニペットでスクリーニング
  • web_fetchのページ本文も抽出後にスクリーニングして除外
テキトー教師テキトー教師DotAI 認定講師
まず前提を揃えておきたいんですけど、Search Indexって何を測っているんでしょうか。
室谷室谷代表取締役
これは検索APIの品質・コスト・速度を比較するベンチマークで、26の検索API製品を13社にわたって評価しているものです。評価は3つの課題の平均スコアで出していて、DeepSearchQA、BrowseComp、AA-Omniscienceという3本柱なんですよね。
テキトー教師テキトー教師DotAI 認定講師
それぞれ性格が違いますよね。DeepSearchQAは広い調査質問で、回答がリスト形式になるタイプ。

BrowseCompは見つけにくい事実を複数回の検索でたどる必要があるもの。AA-Omniscienceは事実質問600問のプライベートなサブセットで、検索がモデルの内部知識にどれだけ足せるかを見るものです。
室谷室谷代表取締役
で、今回OpenAI Web Searchがどう測られたかというと、GPT-5.6 Luna(medium reasoning)にOpenAIのweb_searchツールを持たせて、search_context_sizeをmediumに設定し、1回のResponses API呼び出しで実行する形なんですよ。Stirrupのループもターン上限も使わない。
テキトー教師テキトー教師DotAI 認定講師
ここ、講座でもよく聞かれるところなんですけど、通常の検索API行はStirrupハーネスがweb_searchとweb_fetchの2ツールを提供して、25ターンの予算内でモデルが自由にツールを呼ぶ方式です。OpenAI Web Searchはその構造自体が違う。

だから比較の土台を揃えるために、全セットアップで同じモデル、GPT-5.6 Luna(medium reasoning)を使っているわけですね。
室谷室谷代表取締役
あと地味に大事なのが汚染対策で、OpenAI Web Searchについてはツールのドメインフィルタで既知の汚染ソースをブロックしていると。Stirrup経由の検索API行では、web_searchの結果をURL・タイトル・スニペットでスクリーニングし、web_fetchのページ本文も抽出後にスクリーニングする形で除外しているんですよね。
テキトー教師テキトー教師DotAI 認定講師
ベンチマークの公平性を保つための設計が、経路ごとに違うやり方で組み込まれているということです。

OpenAI Web Searchのベンチマーク結果――スコア74で5位、強みと弱み

OpenAI Web Searchの強みと弱み(ベンチマーク内訳)
強み:AA-Omniscience(事実回答)
  • 精度72%
  • 26製品中3位
  • 首位Firecrawl(73%)とわずか1点差
  • 単発の事実確認・内部知識の補強に強い
弱み:BrowseComp(多段推論)
  • 73.5%
  • 26製品中13位
  • Perplexity系・Octenの85〜87%に大きく離される
  • 複数回の検索をまたぐ多段調査は他社に分がある
室谷室谷代表取締役
数字を見ていくと、まず検索なしのベースラインが33なんですよ。そこから74まで、41ポイント上がっている。

これが検索を足した効果ですね。
テキトー教師テキトー教師DotAI 認定講師
41ポイントのリフトは大きいですよね。上位の並びを整理するとこうなります。
製品スコア
Perplexity Search (medium)80
Perplexity Search (high)79
Octen Search (highlights)77
Parallel Search (advanced)75
Brave Search (LLM context)75
OpenAI Web Search (medium)74
You.com Search (highlights)74
Nimble Search (standard)74
Exa Search (auto)74
Firecrawl Search73
室谷室谷代表取締役
で、内訳がまた面白いんですよね。AA-Omniscience、つまり事実回答のベンチマークでは72%の精度で、26製品中3位。

首位のFirecrawlが73%なので、わずか1点差なんですよ。
テキトー教師テキトー教師DotAI 認定講師
一方で弱点もはっきり出ていて、BrowseCompは73.5%で26製品中13位。複数回の検索をまたいだ多段推論が必要なタスクでは、Perplexity系やOctenの85%から87%に大きく離されています。
室谷室谷代表取締役
ここは使い分けのヒントになるんですよね。単発の事実確認や、内部知識を補強する用途は強い。

でも「あっちを調べて、その結果からこっちを調べて」という多段の調査は、現時点では他社に分がある。
テキトー教師テキトー教師DotAI 認定講師
受講生さんでも、リサーチ系のエージェントを作るときに「どの検索を選ぶか」で悩む方が多いんですけど、この結果はまさにその判断材料になります。1つのベンチマークだけで優劣を決めず、自分のタスクがどの型に近いかで見るべきなんですよ。
室谷室谷代表取締役
あと時間も見ておくと、タスクあたり約31秒で26製品中14位。ボード全体は約16秒から62秒の幅なので、中位という位置づけです。

OpenAIは検索時間を報告していないため、Artificial Analysisはストリームイベントから計測していて、この時間にはOpenAI側の処理時間も含まれるので、検索部分のバーは上限値になるという注記が付いています。
テキトー教師テキトー教師DotAI 認定講師
そこは正確に押さえておきたいですね。31秒という数字は検索だけの時間ではなく、OpenAI側の処理を含んだ上限値だと。

OpenAI Web Searchの料金とコスト効率――タスクあたり約0.05ドルの内訳

OpenAI Web Searchの料金・コスト効率
OpenAI Web Search
  • タスクあたり約$0.05
  • 検索コスト: 1,000検索あたり$10(約$0.04)
  • モデルコスト: 約$0.009
  • 検索がコストの約80%を占める
  • タスクあたり約40k入力トークン
  • 25製品中17製品より安い
比較対象
  • Parallel(advanced): $0.06
  • Perplexity(medium): $0.07
  • Octen: $0.024(スコアは3点高い)
  • Perplexity(low): 125kトークンでボード内最軽量
  • 検索API全体の中央値: $0.067
  • 検索APIの検索コスト中央値: 74%
室谷室谷代表取締役
コストの話に行きましょう。タスクあたり約$0.05なんですよね。

内訳は、1,000検索あたり$10の検索コストが約$0.04、モデルコストが約$0.009。検索がコストの約80%を占めていて、これは検索API全体の中央値74%に近い構造です。
テキトー教師テキトー教師DotAI 認定講師
比較すると、Parallel(advanced)が$0.06、Perplexity(medium)が$0.07なので、その2つよりは安い。ただOctenが$0.024で、しかもスコアは3点高い。

ここは素直に押さえておくべきポイントです。
室谷室谷代表取締役
ボード全体で見ると、OpenAI Web Searchの約$0.05は25の検索API製品のうち17製品より安くて、中央値は$0.067なんですよ。だから「高い」わけではない。

ただOctenのようにコストフロンティアの下に位置する製品があるのも事実で、Artificial AnalysisもOpenAI Web Searchはコストフロンティアの下に位置すると書いています。
テキトー教師テキトー教師DotAI 認定講師
トークン効率も見逃せないですよね。OpenAI Web Searchは同じタスクで使うトークンが少なくて、検索結果を含めてタスクあたり約40k入力トークン。

ボード内で最も軽量なPerplexity(low)は125kなので、かなり差があります。
室谷室谷代表取締役
MYUUUでもエージェントを組むときにトークン消費は常に気にしているんですけど、40kと125kの差は運用コストにじわっと効いてくるんですよね。モデルコストが約$0.009とボード内でも低水準なのは、このトークン効率の良さが効いているんだと思います。
テキトー教師テキトー教師DotAI 認定講師
料金体系そのものは、1,000検索あたり$10の検索コストに加えて、検索内容がモデル入力トークンとして課金される形です。検索結果の本文が入力トークンに乗るので、検索回数だけでなくコンテキストの大きさもコストに効いてくる。
室谷室谷代表取締役
だからsearch_context_sizeの設定が効いてくるんですよね。mediumでこの数字なので、highにすればコンテキストもコストも増える。

逆にlowにすれば軽くなる。この辺の設計はGPT-5.6 Lunaの値下げの話と合わせて考えると面白いです。

OpenAI Web Searchの使い方――Responses APIでの統合型検索の仕組み

テキトー教師テキトー教師DotAI 認定講師
ここからは実際の使い方です。OpenAIのドキュメントによると、Responses APIのtools配列にweb_searchを指定する形なんですよね。
室谷室谷代表取締役
そうなんですよ。新しいResponses APIの統合では{ "type": "web_search" }を使う。

以前のweb_search_previewもレガシー統合用に残っていますが、フィルタやexternal_web_access、return_token_budgetといった新しい制御には対応していないと。
テキトー教師テキトー教師DotAI 認定講師
コードにするとこうですね。
javascript
import OpenAI from "openai";
const client = new OpenAI();

const response = await client.responses.create({
  model: "gpt-6-astra",
  tools: [{ type: "web_search" }],
  input: "What was a positive news story from today?",
});

console.log(response.output_text);
室谷室谷代表取締役
出力も特徴的で、web_search_callという出力アイテムと、messageアイテムの2つが返るんですよね。web_search_callには検索のIDと、実行されたアクションが入る。

アクションはsearch、open_page、find_in_pageのいずれかで、searchは通常、検索クエリを含みます。
テキトー教師テキトー教師DotAI 認定講師
引用の仕組みも押さえておきたいです。モデルの応答にはデフォルトでインライン引用が含まれて、url_citationアノテーションにURL・タイトル・位置が入る。

エンドユーザーに検索結果を表示するときは、インライン引用をはっきり見える形でクリック可能にしなければならないとドキュメントに書かれています。
室谷室谷代表取締役
あとsourcesフィールドを使うと、その検索で取得した全URLが見られるんですよ。インライン引用が関連度の高い参照だけなのに対して、sourcesはモデルが参照した完全なリストを返す。

ソースの数は引用の数より多いことが多いとされています。
テキトー教師テキトー教師DotAI 認定講師
ドメインフィルタも見逃せないですよね。filtersパラメータで最大100件のallowed_domainsか、最大100件のblocked_domainsを設定できる。

ドメインはHTTPやHTTPSのプレフィックスを外して書く形で、サブドメインも含まれる。ただしドメインフィルタはResponses APIのweb_searchツールでのみ使えると。
室谷室谷代表取締役
search_context_sizeはlow・medium・highの3段階で、検索結果からモデルに渡すコンテキスト量を制御するもの。正確なトークン数を指定するものではなく、ソース数や引用数を保証するものでもないとされています。

今回のベンチマークはmediumで測っているわけです。
テキトー教師テキトー教師DotAI 認定講師
長時間のリサーチにはreturn_token_budgetという制御もあるんですよね。デフォルトでは標準の返却トークン予算が使われ、unlimitedにするとその予算を外す。

ただしGPT-5以降の推論モデルでのホスト型web_searchに限られて、遅延とコストが増えうるので選択的に使うべきだと。
室谷室谷代表取締役
数分かかるレポートならbackground: trueで非同期に走らせる。この辺はChatGPT 5の完全ガイドで整理しているAPIの使い方とも重なる部分ですね。
テキトー教師テキトー教師DotAI 認定講師
ちなみにOpenAIのドキュメントでは、新規のWeb検索統合にはResponses APIとweb_search、既存のChat Completions統合を維持したい場合にはgpt-5-search-apiを使う、という住み分けが示されています。Chat Completionsの検索モデルは応答前に必ず検索するのに対して、Responsesの検索はツールとして扱われる、という違いがあります。

OpenAI Web Searchは日本で使える?提供範囲と課金体系

室谷室谷代表取締役
ここは読者が一番気にするところだと思うんですけど、日本で使えるかどうかについて、今回のソースでは地域ごとの提供範囲は明示されていないんですよね。現時点では明らかにされていません。
テキトー教師テキトー教師DotAI 認定講師
そうですね。確認できるのは課金体系のほうで、1,000検索あたり$10の検索コストと、検索内容がモデル入力トークンとして課金されるという構造です。

日本から使う場合も、この課金体系がそのまま適用されるという前提でコストを見積もることになります。
室谷室谷代表取締役
為替や支払い方法の話はソースにないので触れませんが、コスト設計の考え方としては、検索回数とコンテキスト量の両方を見る必要があるんですよね。1,000検索$10ということは、1検索あたり約$0.01。

タスクあたり約$0.05のうち約$0.04が検索という内訳は、検索が複数回走ることを示しています。
テキトー教師テキトー教師DotAI 認定講師
講座で受講生さんによく言うんですけど、APIのコスト見積もりは「1リクエストいくら」ではなく「1タスクあたり何回検索して、どれだけのコンテキストが乗るか」で見ないとズレるんですよ。今回の数字はまさにその実例です。
室谷室谷代表取締役
あと、OpenAI Web Searchは1回の呼び出しで複数のクエリを送ることがあるため、Artificial AnalysisはOpenAI Web Searchについてタスクあたり・クエリあたりの検索回数指標を表示していないんですよね。ここも「1タスク=1検索」と考えないほうがいい根拠です。

検索API比較で見えたOpenAI Web Searchの位置づけ――Perplexity・Octenとの違い

室谷室谷代表取締役
最後に位置づけを整理しましょう。品質トップはPerplexity(medium)の80、次がPerplexity(high)の79、Octen(highlights)の77。

OpenAI Web Searchは74で、You.com、Nimble、Exaと同点です。
テキトー教師テキトー教師DotAI 認定講師
コストと品質の両面で見ると、Octenが$0.024で77、Perplexity(medium)が$0.07で80。OpenAI Web Searchは$0.05で74なので、コストフロンティアの下に位置するという整理になります。
室谷室谷代表取締役
ただ、これは「OpenAI Web Searchが劣っている」という話ではないんですよね。統合型で1回のAPI呼び出しで完結する手軽さは、Stirrupのようなハーネスを自分で組まなくていいという意味で、開発の工数に直結します。
テキトー教師テキトー教師DotAI 認定講師
まさにそこなんですよ。Artificial Analysisの方法論でも、検索APIベンチはマルチ目的の比較だと書かれていて、検索がベースラインから品質をどれだけ上げたか、その改善にいくらかかったか、どれだけ遅延が増えたか、そしてその利得が複数のベンチマークで頑健かどうか、という観点で見るべきだと。
室谷室谷代表取締役
だから「最高スコアの製品が、自分の用途に最適とは限らない」というのがこのベンチマークの読み方なんですよね。多段の調査タスクが多いならPerplexity系やOcten、単発の事実確認や内部知識の補強が中心で、実装のシンプルさを優先するならOpenAI Web Search、という選び方になる。
テキトー教師テキトー教師DotAI 認定講師
受講生さんがエージェントを作るときも、最初に「自分のタスクはどの型か」を決めてから検索を選ぶと失敗が少ないんですよ。品質・コスト・遅延の3軸で、ベースラインからの差分を見る。

この考え方はGPT-5.1の解説で扱った推論レベルの選び方とも通じます。
室谷室谷代表取締役
あと忘れちゃいけないのが、今回のベンチマークは2026年9月28日時点の最新データだということ。検索APIの世界は動きが速いので、この順位も更新されていく前提で見たほうがいいです。

Artificial Analysisは検索APIプロバイダーからのベンチマーク参加も受け付けていると案内しています。

よくある質問

Q. OpenAI Web Searchとは何ですか?

OpenAI Web Searchは、OpenAIのResponses APIで使える統合型のWeb検索ツールです。tools配列にweb_searchを指定すると、モデルが検索するかどうか・何回検索するかを自分で判断します。Artificial AnalysisのSearch Indexに初登場し、スコア74で26製品中7位タイでした。

Q. ChatGPTのWeb検索とAPIのWeb検索は違うのですか?

今回のベンチマークが対象にしているのはAPI経由のOpenAI Web Searchです。OpenAIのドキュメントでは、Responses APIのweb_searchツール、Chat Completionsのgpt-5-search-api、そして非推論の検索、推論モデルによるエージェント検索、ディープリサーチという複数の方式が説明されています。Chat Completionsの検索モデルは応答前に必ず検索するのに対し、Responsesの検索はツールとして扱われる点が異なります。

Q. OpenAI Web Searchの料金はいくらですか?

1,000検索あたり$10の検索コストに加えて、検索内容がモデル入力トークンとして課金されます。Artificial Analysisの計測では、タスクあたり約$0.05で、内訳は検索が約$0.04、モデルが約$0.009でした。

Q. OpenAI Web Searchは日本で使えますか?

地域ごとの提供範囲について、今回のソースでは明示されていません。現時点では明らかにされていません。

Q. 検索結果の引用はどう表示されますか?

モデルの応答にはデフォルトでインライン引用が含まれ、url_citationアノテーションにURL・タイトル・位置が入ります。エンドユーザーに表示する際は、インライン引用をはっきり見える形でクリック可能にする必要があるとドキュメントに記載されています。またsourcesフィールドで、その検索で参照した全URLを取得できます。

Q. 検索対象のドメインは絞れますか?

はい。filtersパラメータで最大100件のallowed_domainsまたは最大100件のblocked_domainsを設定できます。ドメインはHTTPやHTTPSのプレフィックスを外して指定し、サブドメインも含まれます。この機能はResponses APIのweb_searchツールでのみ利用できます。

Related

関連記事

New Articles

新着記事

ニュース

Replitの「プロジェクト間コンテキスト」とは?複数プロジェクトをまたいでAIが文脈を参照

2026年10月7日
室谷テキトー教師
ニュース

Nano Banana 2.1とは?Googleの最新画像生成モデルを解説

2026年10月7日
室谷テキトー教師
ガイド

Seedance 2.0とは?ByteDanceのAI動画生成の使い方・料金と著作権の注意点

2026年10月7日
室谷テキトー教師
ニュース

Eleven v4 Turboとは?ElevenLabsの新TTSがリーダーボード首位

2026年10月7日
室谷テキトー教師
ニュース

Mistral Large 4とは?1兆パラメータの「Le Chonk」を解説

2026年10月6日
室谷テキトー教師
ガイド

Claude Mythosとは?一般公開されない理由とFable・Opusとの違い

2026年10月6日
室谷テキトー教師
ニュース

Ling 3.1 Flashとは?Ant Groupの560B推論モデルを解説

2026年10月6日
室谷テキトー教師
ガイド

Hermes Agentとは?できること・料金・使い方を公式情報で整理

2026年10月6日
室谷テキトー教師
ガイド

Gamma(ガンマ)AIとは?無料の範囲と料金、資料作成の注意点

2026年10月6日
室谷テキトー教師
ガイド

Geminiの使い方ガイド|PC・スマホの始め方と料金プランの違い

2026年10月6日
室谷テキトー教師

Join

AIプレナーになる。

入会は審査制です。いまの事業と、AIで何を動かしたいのかを聞かせてください。

参加を申請する