室谷代表取締役Perplexityが新しい埋め込みモデルを出してきたんですよね。これ、地味に見えて検索の土台を変えにいく話で、けっこう面白いんですよ。
テキトー教師DotAI 認定講師そうなんですよ。しかも今回は「埋め込みモデル」という、普段は表に出てこない部品の話なのに、中身はかなり攻めてます。
まず何が発表されたのか、整理しましょう。
まず何が発表されたのか、整理しましょう。
室谷代表取締役pplx-embed-v2-lateは、Perplexityが2026年10月7日に公開したlate-interaction方式の埋め込みモデルで、テキスト・画像・レンダリング済みページを1つの共有埋め込み空間で検索できるのが特徴ですね。
テキトー教師DotAI 認定講師発表元はPerplexityです。公式ブログでは「Multimodal embeddings beyond a single vector」というタイトルで、テキストと画像の検索に向けたlate-interactionモデルの新しいファミリーだと説明されています。
両モデルともHugging Faceで公開されていて、フロンティア性能を達成したとされています。
両モデルともHugging Faceで公開されていて、フロンティア性能を達成したとされています。
室谷代表取締役ここで大事なのは、Perplexityが2月にpplx-embed-v1を出していて、直前にpplx-embed-v2-contextを出している、その続編だという位置づけなんですよね。一気に埋め込みモデルのラインナップを厚くしてきている。
テキトー教師DotAI 認定講師そう、単発の発表じゃなくて、シリーズとして積み上げているのがポイントです。
pplx-embed-v2-lateとは?Perplexityが2026年10月に公開した2つの埋め込みモデル
pplx-embed-v2-lateの基本情報と3つの特徴
late-interaction方式の埋め込みモデル
Perplexityが2026年10月7日に公開。テキスト・画像・視覚文書を同一の埋め込み空間で検索できる
モデルサイズは0.6Bと9Bの2種類
Hugging Faceで公開され、Perplexity公式コレクション「pplx-embed-v2」に並ぶ
3つの特徴を初めて組み合わせ
①マルチベクトル表現 ②テキストと画像の両モダリティ対応 ③共有埋め込み空間
共有埋め込み空間が実務的に効く
0.6Bと9Bが同じ埋め込み空間を共有。9Bで作った索引を0.6Bのクエリで検索でき、運用設計が変わる
ライセンスは明記が見当たらない
公式ブログの抜粋には記載がなく、現時点では明らかにされていない扱いが正確
室谷代表取締役あらためて定義からいきますか。pplx-embed-v2-lateは、Perplexityが2026年10月7日に公開したlate-interaction方式の埋め込みモデルで、テキスト・画像・視覚文書を同一の埋め込み空間で検索できるのが売りです。
モデルサイズは0.6Bと9Bの2種類。
モデルサイズは0.6Bと9Bの2種類。
テキトー教師DotAI 認定講師公式ブログによると、このモデルは3つの特徴を初めて組み合わせたとされています。1つ目がマルチベクトル表現、2つ目がテキストと画像の両モダリティ対応、3つ目が共有埋め込み空間です。
室谷代表取締役3つ目が実務的にいちばん効くやつなんですよね。0.6Bと9Bが同じ埋め込み空間を共有しているから、9Bで作った索引を0.6Bのクエリで検索できる。
これ、運用の設計がかなり変わるんですよ。
これ、運用の設計がかなり変わるんですよ。
テキトー教師DotAI 認定講師しかも両モデルはHugging Faceで公開されていて、Perplexityの公式コレクション「pplx-embed-v2」に並んでいます。ライセンスについては、今回の公式ブログの抜粋には明記が見当たらないので、現時点では明らかにされていない、という扱いが正確ですね。
室谷代表取締役そうですね、そこはソースに書いてあることだけを言うのが安全です。
late-interaction方式は従来の単一ベクトル埋め込みと何が違うのか
単一ベクトル埋め込み vs cross-encoder vs late-interaction
dense embedding(単一ベクトル)
- 文書全体を1つの固定長ベクトルに圧縮
- 計算は軽い
- 長文で話題が増えるほど情報が1ベクトルに詰め込まれ細部が失われる(情報のボトルネック)
- チャンク分割で緩和できるが、一緒でないと意味が通らない情報が切り離される問題
- 文書ごとに1ベクトルを保存、候補スコアは内積1回
cross-encoder
- クエリと文書を一緒に処理
- 表現力は高い
- 候補ごとに計算が必要で大規模検索には非現実的
室谷代表取締役ここが今回の核心です。従来のdense embeddingは、文書全体を1つの固定長ベクトルに圧縮する。
計算は軽いけど、長くなって話題が増えるほど情報が1つのベクトルに詰め込まれて、細部が失われるんですよね。
計算は軽いけど、長くなって話題が増えるほど情報が1つのベクトルに詰め込まれて、細部が失われるんですよね。
テキトー教師DotAI 認定講師公式ブログでも「情報のボトルネック」と表現されています。文書が長くなり多くのトピックを扱うほど、同じベクトルに多くの内容を圧縮しなければならず、クエリに関連する情報をすべて保持するのが難しくなる、と。
チャンク分割で緩和できますが、文書が分断されて、一緒にないと意味が通らない情報が切り離される問題も生じます。
チャンク分割で緩和できますが、文書が分断されて、一緒にないと意味が通らない情報が切り離される問題も生じます。
室谷代表取締役で、もう一方の極端がcross-encoder。クエリと文書を一緒に処理するから表現力は高いけど、候補ごとに計算が必要で、大規模検索には非現実的。
そこで間を取るのがlate-interactionなんですよ。
そこで間を取るのがlate-interactionなんですよ。
テキトー教師DotAI 認定講師pplx-embed-v2-lateはColBERTスタイルのアーキテクチャで、入力の各トークンに対して128次元の埋め込みを出力します。スコア計算はMaxSimで、各クエリトークンについて最もスコアの高い文書トークンを選び、トークンごとの最大類似度を合計して最終スコアを出します。
室谷代表取締役これによって、クエリの異なる部分が文書の異なる部分にマッチできる。トークン単位で強い一致がスコアに大きく寄与するわけです。
テキトー教師DotAI 認定講師ただしコストの話も公式ブログにきちんと書かれています。dense検索は文書ごとに1ベクトルを保存して、候補のスコア計算は内積1回。
late-interactionは文書トークンのベクトルを保存して、多数のトークン間類似度を評価します。コストは文書長に比例して増えるので、一ベクトルのANN検索とは違う索引・配信のトレードオフが必要になる、と。
late-interactionは文書トークンのベクトルを保存して、多数のトークン間類似度を評価します。コストは文書長に比例して増えるので、一ベクトルのANN検索とは違う索引・配信のトレードオフが必要になる、と。
室谷代表取締役そこを理解せずに「なんでもlate-interactionにすればいい」と考えると痛い目を見るやつですね。品質重視のコーパス向けの一段目、あるいは大規模パイプラインの後段として使う、というのが公式の位置づけです。
テキトー教師DotAI 認定講師単に精度が上がるという話じゃないんですよ。保存とスコア計算の構造が変わる、という話です。
pplx-embed-v2-lateでできること――OCR不要のPDF・スライド・画像検索
従来パイプライン vs pplx-embed-v2-late
従来のパイプライン
- PDF・スライド・スクリーンショット・スキャン・チャート・表を解析
- OCRやキャプションでテキスト化してから検索
- 公式ブログは「高コストで損失がある」と説明
- OCR誤りが入りうる
- レイアウト、表構造、図、空間的な関係が捨てられる
pplx-embed-v2-late
- レンダリング済みページを直接表現空間に投影
- テキストクエリでそのまま検索
- OCRやパースの工程を挟まずに視覚文書を検索
- 文書のレンダリング画像が最も一般的な視覚入力になることを想定
- 風景写真のような自然画像のセマンティック画像検索もサポート
- ViDoRe(V3)のMarkdown版で画像とテキスト両モダリティを評価
室谷代表取締役実務でいちばん効くのがここですよ。現実の文書って、PDF、スライド、スクリーンショット、スキャン、チャート、表が混在しているじゃないですか。
テキトー教師DotAI 認定講師従来のパイプラインは、これらの文書を解析してOCRやキャプションをかけて、テキスト化してから検索していました。公式ブログはこれを「高コストで損失がある」と説明しています。
OCR誤りが入りうるし、レイアウト、表構造、図、空間的な関係が捨てられてしまう。
OCR誤りが入りうるし、レイアウト、表構造、図、空間的な関係が捨てられてしまう。
室谷代表取締役で、pplx-embed-v2-lateはレンダリング済みページを直接表現空間に投影する。テキストクエリでそのまま検索できる。
MYUUUでもPDFまわりの前処理は地味に重いので、ここが省けるのは大きいんですよね。
MYUUUでもPDFまわりの前処理は地味に重いので、ここが省けるのは大きいんですよね。
テキトー教師DotAI 認定講師公式ブログでは、文書のレンダリング画像が最も一般的な視覚入力になることが想定されている一方で、風景写真のような自然画像に対するセマンティック画像検索もサポートすると書かれています。
室谷代表取締役あと、テキスト側も忘れちゃいけない。ViDoRe(V3)のMarkdown版での評価もされていて、情報リッチな文書検索を画像とテキストの両モダリティで評価しているんですよ。
テキトー教師DotAI 認定講師想定ユースケースとしては、RAG、文書検索、マルチモーダル検索が挙げられます。特にOCRやパースの工程を挟まずに視覚文書を検索できる点が、従来との大きな違いです。
0.6Bと9Bの違いと選び方――共有埋め込み空間がもたらす使い分け
室谷代表取締役ここ、運用設計の話としてかなり実用的なんですよ。検索って本質的に非対称で、索引作成はオフラインで並列化できるからコストを将来の検索に償却できる。
クエリ処理はオンラインで毎回走るから低遅延が必須。
クエリ処理はオンラインで毎回走るから低遅延が必須。
テキトー教師DotAI 認定講師公式ブログはこの非対称性を利用して、検索パイプラインの両側に合わせたサイズを用意していると説明しています。18Bの教師モデルを対照学習で訓練し、それを9Bと0.6Bの生徒に別々に蒸留する。
室谷代表取締役蒸留のやり方も特徴的で、LEAFスタイルの表現蒸留を使っている。各入力トークンについて、生徒の出力埋め込みを教師のそれに揃える。
これをlate-interactionに拡張したのがポイントなんですよね。
これをlate-interactionに拡張したのがポイントなんですよね。
テキトー教師DotAI 認定講師結果として、公開された両チェックポイントが同じマルチベクトル埋め込み空間を共有します。これによってクロスモデル検索が可能になり、公式ブログでは4つのデプロイオプションが示されています。
整理するとこうです。
整理するとこうです。
- 最大品質: 文書もクエリも9Bモデルでエンコード
- 最大効率: 文書もクエリも0.6Bモデルでエンコードし、100%ローカル推論
- 低遅延検索: コーパス索引は9Bで構築し、ライブクエリは0.6Bでエンコード
- ローカル・クラウド検索: プライベートなローカル文書やライブクエリを0.6Bでオンデバイス処理し、クラウド上の9B索引の結果と比較・マージ
室谷代表取締役3番目がまさに共有埋め込み空間の恩恵で、9Bで索引を作って0.6Bでクエリを投げる。これでViDoRe v3が62.3%から63.5%に上がって、クエリコストは増えていない、と公式スレッドは説明しています。
テキトー教師DotAI 認定講師0.6B側の設計も細かいんですよ。Qwen3.5-0.8Bを起点に、24層のテキストタワーを12層にプルーニングして、そのタワーを498Mから240Mの非埋め込みパラメータに削減しています。
結果として総パラメータは594Mですが、公称サイズは配信コストを過大に見せると公式ブログは指摘しています。
結果として総パラメータは594Mですが、公称サイズは配信コストを過大に見せると公式ブログは指摘しています。
室谷代表取締役内訳が面白くて、100Mが画像エンコードに使われ、254Mがトークン埋め込みテーブルにあって実行時への影響は小さい。テキストエンコードで実際にアクティブなのは約240M、画像エンコードで約340M。
つまり、ずっと小さいモデル並みの配信コストで、9B索引との互換性を保っているわけです。
つまり、ずっと小さいモデル並みの配信コストで、9B索引との互換性を保っているわけです。
テキトー教師DotAI 認定講師18Bの教師モデルも同じプロセスで27Bのバックボーンから作られていて、教師の蒸留コストをかなり下げつつ、与える信号は弱めていないと説明されています。
室谷代表取締役エッジデバイスで動く軽量クエリエンコーダとして設計されている、というのが0.6Bの位置づけなんですよね。
pplx-embed-v2-lateのベンチマーク性能――ViDoRe v3・Q2D-Web・BrowseComp+の結果
室谷代表取締役数字を整理しましょう。まずテキスト検索のドメイン特化ベンチマーク、72のMTEB系タスクで、9Bが81.3%、0.6Bが78.0%。
9Bは評価した全モデル中で最高スコアで、次点に1.6ポイント差をつけています。
9Bは評価した全モデル中で最高スコアで、次点に1.6ポイント差をつけています。
テキトー教師DotAI 認定講師0.6Bもgemini-embedding-2に0.3ポイント差まで迫っている、と。しかもこれらのベンチマークのデータは訓練に使っていないので、新しいドメインに汎化できることを示している、と公式ブログは述べています。
室谷代表取締役ViDoRe(V3)のMarkdown版だと、0.6Bの61.2%が9Bの64.7%に次ぐ2位。次点の外部モデルが60.6%で、1B未満の次点であるtopk-embed-v1-0.8bには4.3ポイント差をつけています。
テキトー教師DotAI 認定講師視覚文書検索のViDoRe(V3)では、0.6Bモデルがアクティブパラメータが5倍あるモデルと同等の性能を達成したと公式ブログは書いています。
室谷代表取締役で、WebスケールのQ2D-Web。約70,000件の本番由来の検索クエリを、190MのWeb文書のコーパスに対して評価する。
9Bが74.8%、0.6Bが73.6%のRecall@1000で、nemotron-embed-8bの69.3%を上回っています。
9Bが74.8%、0.6Bが73.6%のRecall@1000で、nemotron-embed-8bの69.3%を上回っています。
テキトー教師DotAI 認定講師公式ブログによると、Q2D-Webの関連性判定はCitation、Web、Combinedの3種類で、両モデルがすべての判定セットで全ベースラインを上回っています。Combinedに注目する理由も説明されていて、CitationとWebは自社システムが既に表面化したものに由来するため、同じようにランクするモデルに有利に働く。
Combinedで追加されたLLM判定は、どちらのシステムも取得しなかった文書をカバーする、と。
Combinedで追加されたLLM判定は、どちらのシステムも取得しなかった文書をカバーする、と。
室谷代表取締役エージェント検索では、9Bモデルを使ったGPT-OSS-120BエージェントがBrowseComp+の質問の64.0%に正しく回答。次のColBERTモデルに4.9ポイント差をつけて、しかも全ベースライン中で検索回数が最も少ない、と公式スレッドは説明しています。
テキトー教師DotAI 認定講師MADQAでは、800のPDFに対する500問で92.4%に到達し、検索器の中で最高の結果だと。
室谷代表取締役訓練データの話も見逃せないんですよ。186百万のクエリ・文書ペアを、46言語・594データセットから集めている。
内訳はテキスト対テキストが88.3%、テキスト対画像が8.3%、テキスト対視覚文書が3.4%。
内訳はテキスト対テキストが88.3%、テキスト対画像が8.3%、テキスト対視覚文書が3.4%。
テキトー教師DotAI 認定講師データセットのサイズに比例してサンプリングするのではなく、各データセットにサンプリング重みを割り当てて、56.5%、30.9%、12.6%というバランスの取れた混合にしている、と。
室谷代表取締役あと、評価対象のベンチマークに関連するデータセットは訓練から除外している。ベンチマークスコアを水増しせずに結果を忠実に表すためです。
除外した中に高品質なデータがあったとしても、信頼できる数字のほうが開発中もユーザーが比較するときも有用だ、という判断なんですよね。
除外した中に高品質なデータがあったとしても、信頼できる数字のほうが開発中もユーザーが比較するときも有用だ、という判断なんですよね。
テキトー教師DotAI 認定講師この姿勢は評価に値しますね。
pplx-embed-v2-lateの使い方・入手方法――Hugging Faceでの公開状況
室谷代表取締役入手方法ですが、両モデルともHugging Faceで公開されています。Perplexityの公式コレクション「pplx-embed-v2」に、pplx-embed-v2-late-9bとpplx-embed-v2-late-0.6bが並んでいます。
テキトー教師DotAI 認定講師タスクはFeature Extraction、9bは8B、0.6bは0.6Bという表示ですね。同じコレクションにはpplx-embed-v2-context-9b-previewも含まれています。
室谷代表取締役ここで注意したいのが、APIの話と混ざりやすい点です。Perplexityのドキュメントには標準埋め込みと文脈化埋め込みのページがあって、pplx-embed-v1-0.6b、pplx-embed-v1-4b、pplx-embed-context-v1-0.6b、pplx-embed-context-v1-4bの価格が載っています。
テキトー教師DotAI 認定講師標準埋め込みだとpplx-embed-v1-0.6bが100万トークンあたり0.004ドル、pplx-embed-v1-4bが0.03ドル。文脈化埋め込みだとpplx-embed-context-v1-0.6bが0.008ドル、pplx-embed-context-v1-4bが0.05ドルです。
室谷代表取締役ただし、これはあくまでv1系のAPI価格なんですよ。今回のpplx-embed-v2-lateについては、提供された公式資料の中にAPI経由の提供や価格の記載が見当たらない。
なので「Hugging Faceで公開されている」までが確実に言えることですね。
なので「Hugging Faceで公開されている」までが確実に言えることですね。
テキトー教師DotAI 認定講師そうですね。APIでの提供状況や料金は、現時点では明らかにされていません、という扱いが正確です。
室谷代表取締役あと、v1系のドキュメントにはINT8やバイナリの量子化、Matryoshka次元、32Kコンテキストといった仕様が書かれていますが、これもv1系の話。v2-lateのスペックとして混同しないほうがいいです。
テキトー教師DotAI 認定講師公式スレッドで確認できるv2-lateのスペックは、トークンごとに128次元のベクトルを保持する、という点ですね。
室谷代表取締役そう、そこは分けて考えましょう。
よくある質問
テキトー教師DotAI 認定講師ここからは、よく聞かれるポイントを整理していきます。
室谷代表取締役まず「pplx-embed-v2-lateとは何か」を一言でいうと、Perplexityが2026年10月7日に公開したlate-interaction方式のマルチモーダル埋め込みモデルで、テキスト・画像・レンダリング済みページを1つの共有埋め込み空間で検索できます。
テキトー教師DotAI 認定講師「モデルサイズと構成は?」については、0.6Bと9Bの2サイズです。両方とも18Bの教師モデルからトークン単位で蒸留され、埋め込み空間を共有します。
室谷代表取締役「どちらを選ぶべきか」は、公式ブログが4つのデプロイオプションを示しているので、それに沿うのが素直です。最大品質なら9B、最大効率やローカル推論なら0.6B、低遅延検索なら9Bで索引・0.6Bでクエリ、という使い分けですね。
テキトー教師DotAI 認定講師「必要なハードウェア要件は?」については、0.6Bがエッジデバイスでも動く軽量クエリエンコーダとして設計されている、という説明が公式ブログにあります。具体的な必要メモリやGPU要件の数値は、今回の資料では明らかにされていません。
室谷代表取締役「テキスト・画像・PDFをどう検索できるのか」は、レンダリング済みページを直接埋め込み空間に投影するので、OCRやパースなしでPDF、スライド、スキャンを検索できる。表、図、レイアウトも保持される、というのが公式の説明です。
テキトー教師DotAI 認定講師「既存モデルと比べて性能は?」については、Q2D-Webで9Bが74.8%、0.6Bが73.6%のRecall@1000で、nemotron-embed-8bの69.3%を上回る。ViDoRe(V3)では0.6Bがアクティブパラメータ5倍のモデルと同等、といった結果が示されています。
室谷代表取締役「どこで入手でき、どう使うのか」は、Hugging FaceのPerplexity公式コレクションで公開されています。推論の具体的な方法やAPI提供の有無は、今回の資料の範囲では明らかにされていません。
テキトー教師DotAI 認定講師「ライセンスは?」も、今回の公式ブログ抜粋には記載が見当たらないので、現時点では明らかにされていない、が正確な答えですね。
室谷代表取締役総じて、埋め込みモデルという地味な部品の話でありながら、OCRを挟まない視覚文書検索と、サイズをまたいだ索引共有という2点で、RAGやエージェント検索の設計に効いてくる発表なんですよね。
テキトー教師DotAI 認定講師そうなんですよ。単にベンチマークが上がったという話じゃなくて、索引とクエリの非対称性をどう設計するか、という実務の勘所に踏み込んでいるのが今回のポイントです。
