室谷代表取締役MiniMax M3(ミニマックス エムスリー)は、MiniMaxが2026年5月31日に発表したフロンティアモデルで、フロンティア水準のコーディング、1Mコンテキスト、ネイティブ・マルチモーダルを1つのモデルに統合したものです。今回はそのM3が、NVIDIAの新しい計算基盤「Vera Rubin NVL72」上で、オープンソースの推論エンジンvLLMを使って稼働するようになった、という発表なんですよね。
テキトー教師DotAI 認定講師そうなんですよ。MiniMaxの公式スレッドでは「MiniMax M3 is now running on NVIDIA Vera Rubin NVL72 with vLLM」と告知されていて、vLLM側の引用では、ベンチマーク「AgentX」でM3を動かした初期結果として、GB200と比べて7.8倍以上のスループットが確認されたとされています。
単に「新しいハードで動いた」という話じゃないんですよ。
単に「新しいハードで動いた」という話じゃないんですよ。
室谷代表取締役ここ、発表の主語はあくまでMiniMaxです。Xで告知されたからといって「Xが発表」ではないですし、vLLMやNVIDIAは協力主体として名前が挙がっている立場ですね。
テキトー教師DotAI 認定講師そこは講座でも必ず最初に確認するポイントで、受講生さんも混同しがちなんです。発表元はMiniMax、協力主体としてNVIDIA、Red Hat、inferact、vLLMコミュニティが挙げられている、という整理になります。
MiniMax M3とは?今回何が発表されたのか
MiniMax M3の発表と推論基盤の流れ
- 2026年5月31日MiniMax M3 発表Frontier Coding、1M Context、Native Multimodalityを1つのモデルに統合
- 今回推論環境の発表M3がNVIDIA Vera Rubin NVL72上でvLLMを使って稼働を開始
室谷代表取締役まずM3というモデル自体の立ち位置を押さえておきたいんですよね。MiniMaxの投資家向けページのニュース欄では、2026年5月31日の項目として「MiniMax M3: Frontier Coding, 1M Context, Native Multimodality — All in One Model」と掲載されています。
つまりフロンティア級のコーディング、100万トークンのコンテキスト、ネイティブのマルチモーダルを、別々のモデルではなく1つに統合したという打ち出し方です。
つまりフロンティア級のコーディング、100万トークンのコンテキスト、ネイティブのマルチモーダルを、別々のモデルではなく1つに統合したという打ち出し方です。
テキトー教師DotAI 認定講師で、今回の発表はそのM3の「中身」ではなく「どこで動くか」の話なんですよ。M3がNVIDIA Vera Rubin NVL72上でvLLMを使って稼働を始めた、というのが今回のニュースです。
室谷代表取締役順番としては、5月31日にモデルが出て、そのモデルが新しい推論基盤に載った、という流れですね。モデルの発表と、推論環境の発表は別物として読む必要があります。
テキトー教師DotAI 認定講師ここを混ぜてしまうと「M3が新しくなった」と誤読されるので注意です。あくまで同じM3が、より強力な計算基盤で動くようになったという話です。
MiniMax M3がNVIDIA Vera Rubin NVL72とvLLMで稼働、AgentXで7.8倍超のスループット
まとめ
MiniMax M3 × NVIDIA Vera Rubin NVL72 × vLLM の要点
- vLLMがNVIDIA Vera Rubinをサポートし、AgentX上のMiniMax M3でGB200比7.8倍以上のスループットを初期結果として確認
- 7.8倍はモデルの賢さではなく、同じ時間で処理できる量(スループット)が増えたという意味
- スループット向上は、同じハードウェアでより多くの利用者を捌ける、または同じ利用者数なら応答が速くなることにつながる
- MiniMaxはvLLM、inferact、NVIDIA、Red Hatに「M3をRubinに届けてくれた」ことへの感謝を表明
- vLLM側はinferact、NVIDIA、Red Hat、vLLMコミュニティがRubin発表時から移植作業を進めてきたと説明(一夜にして出た成果ではない)
- モデル企業・ハード企業・推論エンジンコミュニティ・ベンダーが別々の役割で並ぶ協力体制
- 7.8倍の詳細な測定条件(バッチサイズ・入力長など)は資料では未公開。AgentXベンチマーク、GB200比較、初期結果であることのみ読み取れる
- 条件不明の数字をそのまま自社環境の見積もりに当てはめるのは危険。数字は条件とセットで読む
室谷代表取締役発表の中身をもう少し丁寧に見ていくと、MiniMaxのスレッドでは、vLLMプロジェクト、inferact、NVIDIA、Red Hatに対して「M3をRubinに届けてくれた」ことへの感謝が述べられています。
テキトー教師DotAI 認定講師そして引用元のvLLM側の投稿が具体的で、「vLLM now supports NVIDIA Vera Rubin. The early results show more than 7.8x the throughput of GB200 on MiniMax M3 on AgentX.」とあります。vLLMがNVIDIA Vera Rubinをサポートし、初期結果としてAgentX上のMiniMax M3でGB200の7.8倍以上のスループットが出た、という内容です。
室谷代表取締役ここで大事なのは、7.8倍という数字が「M3をAgentXで動かしたときのスループット」だという点です。モデルの賢さが7.8倍になったわけではなく、同じ時間で処理できる量が増えたという話ですね。
テキトー教師DotAI 認定講師用語を整理しておくと、スループットは単位時間あたりに処理できるリクエストやトークンの量です。これが上がるということは、同じハードウェアでより多くの利用者を捌ける、あるいは同じ利用者数なら応答が速くなる、ということにつながります。
室谷代表取締役あと、vLLM側の投稿には「inferact、NVIDIA、Red Hat、そしてvLLMコミュニティが、Rubinが発表されたときからvLLMをRubin上に持ってくる作業を進めてきた」という趣旨の説明も添えられています。つまり今回の稼働は一夜にして出てきたものではなく、継続的な移植作業の成果だということですね。
テキトー教師DotAI 認定講師ここは協力体制の話として読むと面白いんですよ。モデルを作る企業、ハードを作る企業、推論エンジンを開発するコミュニティ、それを支えるベンダーが、それぞれ別の役割で並んでいる構図です。
室谷代表取締役MYUUUでも推論コストの見積もりは常に悩みどころなので、この「同じモデルが別の基盤でどれだけ捌けるか」という数字はかなり実務的に響きます。
テキトー教師DotAI 認定講師ただ、7.8倍という数字の詳細な測定条件は、今回の資料では明らかにされていません。AgentXというベンチマーク名と、GB200との比較であること、初期結果であること、までは読み取れますが、バッチサイズや入力長などの条件までは触れられていないんです。
室谷代表取締役そこは正直に「初期結果として7.8倍以上」までで止めておくのが正確ですよね。条件が分からない数字を、そのまま自社環境の見積もりに当てはめるのは危険です。
テキトー教師DotAI 認定講師そうなんです。ベンチマークは条件が変われば結果も変わりますから、受講生さんにも「数字は条件とセットで読む」と伝えています。
なぜ7.8倍が重要か——長時間エージェント時代の推論基盤競争
長時間エージェント時代の推論基盤競争——時系列
- 2026年5月27日MiniMax Agent Team 発表「Built for Long-Running Tasks and Continuous Evolution」—長時間稼働タスクと継続的進化を前提にしたエージェント
- 2026年9月末〜10月LLMエラー多発インシデントステータスページに「Large Language Models (LLM)」のエラー多発が繰り返し記録
- 2026年10月5日〜10日Elevated errors が1日に何度も発生InvestigatingからResolvedへ、という記録が繰り返し並ぶ
- 現在Rubin上での稼働とスループット7.8倍改善単なる技術デモではなく、供給力をどう確保するかという経営課題への答えの一部
室谷代表取締役ここからが本題なんですけど、なぜ今このタイミングでスループットの話が出るのかというと、エージェントの使い方が変わってきたからなんですよね。
テキトー教師DotAI 認定講師そうなんですよ。MiniMaxの投資家向けページには、2026年5月27日の項目として「MiniMax Agent Team: Built for Long-Running Tasks and Continuous Evolution」という発表が並んでいます。
長時間稼働するタスクと継続的な進化を前提にしたエージェント、という打ち出しです。
長時間稼働するタスクと継続的な進化を前提にしたエージェント、という打ち出しです。
室谷代表取締役長時間動くエージェントは、短いチャットとは比べ物にならない量の推論を回します。1回のやり取りで終わらず、考えて、ツールを呼んで、また考える、を何十回も繰り返すわけです。
テキトー教師DotAI 認定講師しかもM3は1Mコンテキストとネイティブ・マルチモーダルを掲げています。長い文脈を持ち、画像などのモダリティも扱うとなると、1リクエストあたりの計算量もメモリ消費も大きくなります。
室谷代表取締役そこに大量の同時リクエストが乗ってくると、ボトルネックはモデルの賢さではなく、捌く側の処理能力になるんですよね。
テキトー教師DotAI 認定講師だからスループットの改善が、そのまま応答速度、コスト、安定性に効いてくる。7.8倍という数字は、そういう負荷への対応力を示すものとして位置づけられるわけです。
室谷代表取締役あと、これは見逃せないんですけど、MiniMaxのステータスページには2026年9月末から10月にかけて「Large Language Models (LLM)」のエラー多発インシデントが繰り返し記録されているんですよ。10月5日から10日にかけては、1日に何度も「Elevated errors」が起きて、そのたびにInvestigatingからResolvedへ、という記録が並んでいます。
テキトー教師DotAI 認定講師これは需要に対して安定供給が課題になっていたことをうかがわせる記録です。ステータスページの過去90日の稼働率の表示は「All Systems Operational」ですが、履歴を見ると短時間の障害が高頻度で発生していたことが分かります。
室谷代表取締役そう考えると、今回のRubin上での稼働とスループット改善は、単なる技術デモではなく、供給力をどう確保するかという経営課題への答えの一部として読めるんですよね。
テキトー教師DotAI 認定講師モデルとAI製品が230以上の国・地域で3億人超のユーザー、100以上の国で200万社超の企業・開発者に使われている、とMiniMaxは投資家向け情報で説明しています。その規模を支える基盤強化の文脈で、今回の発表が位置づけられるわけです。
室谷代表取締役モデル競争だと思われがちなところで、実は推論基盤の競争が効いてくる。ここは実務者としてすごく共感するところです。
テキトー教師DotAI 認定講師講座でも「モデルを選ぶときに、どこで動くかまで見る」という話をしているんですよ。同じモデルでも、載る基盤が変われば体験が変わる時代になっています。
MiniMax M3でできること——1Mコンテキスト・ネイティブマルチモーダル・コーディング
室谷代表取締役ここでM3自体の能力を、公式に書かれている範囲で整理しておきたいんですよね。
テキトー教師DotAI 認定講師では整理するとこうです。
- フロンティア水準のコーディング(Frontier Coding)
- 1Mトークンのコンテキストウィンドウ
- ネイティブ・マルチモーダル
- これらを1つのモデルに統合
室谷代表取締役出典はMiniMaxの投資家向けページにある2026年5月31日の発表項目で、タイトルがそのまま「Frontier Coding, 1M Context, Native Multimodality — All in One Model」です。
テキトー教師DotAI 認定講師1Mコンテキストというのは、扱える文脈の長さが100万トークン規模ということです。長いコードベースや長いドキュメントを丸ごと渡す使い方が現実的になってきます。
室谷代表取締役ネイティブ・マルチモーダルというのは、後付けで画像対応を足したのではなく、モデルとしてマルチモーダルを前提にしているという意味ですね。
テキトー教師DotAI 認定講師そしてコーディングとエージェント能力をフロンティア水準として打ち出している。エージェント用途のベンチマークとしてAgentXの名前が出てくるのも、この文脈とつながります。
室谷代表取締役ただ、パラメータ数や個別ベンチマークのスコアについては、今回の資料では確認できません。検索でよく調べられる論点ではありますが、ソースに無い数字をこちらで補うのはやめておきます。
テキトー教師DotAI 認定講師そうですね。現時点で確認できるのは、公式が掲げている「Frontier Coding、1M Context、Native Multimodality」という3点と、AgentXでのスループット比較までです。
室谷代表取締役あと、MiniMaxの投資家向けページの研究欄には、M3に加えてM2.7、M2.5、H3、Speech 2.8、Music 3.0といったモデルが並んでいます。M3はそのラインナップの中のフロンティア枠という位置づけで読むと分かりやすいですね。
テキトー教師DotAI 認定講師モデルの系譜として見ると、M2.5、M2.7と積み上げてきた流れの先にM3がある、という並びです。
MiniMax M3の料金とAPI提供状況、日本から使えるのか
室谷代表取締役ここが読者の一番知りたいところだと思うんですけど、M3はすでにMiniMaxの開放プラットフォームでAPI提供されています。
テキトー教師DotAI 認定講師料金は公式のドキュメントにきちんと出ています。整理するとこうです。
| 条件 | 入力(元/百万トークン) | 出力(元/百万トークン) | キャッシュ読み取り(元/百万トークン) |
|---|---|---|---|
| 512k入力トークン以下(永久五折) | 4.20 → 2.10 | 16.80 → 8.40 | 0.84 → 0.42 |
| 512k入力トークン超(永久五折) | 8.40 → 4.20 | 33.60 → 16.80 | 1.68 → 0.84 |
室谷代表取締役512kトークン以下の入力なら永久五折で、入力2.10元、出力8.40元という価格ですね。512kを超えると入力4.20元、出力16.80元になります。
テキトー教師DotAI 認定講師ここで注意したいのが、1Mコンテキストを謳っているモデルでも、料金の区分は512kで切られているという点です。長い文脈を扱うほど単価が上がる設計になっています。
室谷代表取締役あと、公式ドキュメントには「标准」と「优先」というサービス区分の記載があります。優先サービスについては、この抜粋では価格の内訳までは示されていません。
テキトー教師DotAI 認定講師そこは現時点では明らかにされていない、としておくのが正確ですね。ドキュメントのFAQにも「M3 标准服务与优先服务有什么区别?」という項目が立っているので、詳細は公式の該当ページで確認するのが確実です。
室谷代表取締役日本から使えるのかという点については、MiniMaxはモデルとAI製品が230以上の国・地域で3億人超のユーザーに使われていると説明しています。日本が含まれるという明示的な記述は今回の資料にはありませんが、グローバル提供が前提のプラットフォームであることは読み取れます。
テキトー教師DotAI 認定講師開放プラットフォームにはコンソールのログイン導線も用意されています。開発者ドキュメント、Token Plan、Pricing、Console Loginという並びが投資家向けページからも確認できます。
室谷代表取締役支払いが人民元建てなので、そこは実務上の考慮点になりますね。日本円での請求になるかどうかは、資料からは分かりません。
テキトー教師DotAI 認定講師あと、MiniMaxのプラットフォームではM3以外にも言語モデル、音声、動画、画像、音楽、MCP、サーバーツールという幅広いラインナップが同じ料金ページに並んでいます。M3だけを単体で契約するというより、プラットフォーム全体の中の1モデルとして使う形ですね。
室谷代表取締役ちなみに動画の資源パッケージはHailuoシリーズ向けで、MiniMax H3には対応していないという注記もあります。同じMiniMaxの中でも、モデルごとに課金体系が分かれているので、そこは混同しないほうがいいです。
テキトー教師DotAI 認定講師受講生さんからも「同じ会社のモデルなのに買い方が違う」という質問がよく出るんですよ。M3を使うなら、言語モデルの按量计费、つまり従量課金のページを見るのが正解です。
室谷代表取締役あと、MiniMaxのステータスページでLLMの稼働状況が公開されているので、本番利用を検討するならそこをウォッチしておくのが実務的ですね。
テキトー教師DotAI 認定講師過去90日の稼働率とインシデント履歴が見られるので、SLAを気にする企業ユーザーには有用な情報です。
よくある質問——MiniMax M3の性能・使い方・Rubinの提供時期は?
室谷代表取締役最後に、読者がよく気にするポイントをまとめておきます。
テキトー教師DotAI 認定講師まず「MiniMax M3の性能はどうなのか」ですが、公式が掲げているのはフロンティア水準のコーディング、1Mコンテキスト、ネイティブ・マルチモーダルの3点です。今回の発表では、AgentXでGB200比7.8倍以上のスループットが初期結果として確認されたとされています。
室谷代表取締役ただし、この7.8倍はスループットの比較であって、モデルの知能や回答品質の比較ではありません。そこは誤解しないようにしたいですね。
テキトー教師DotAI 認定講師次に「使い方」ですが、MiniMaxの開放プラットフォームでAPIとして提供されています。開発者ドキュメントとコンソールが用意されていて、従量課金のAPIキーで利用する形です。
室谷代表取締役料金は512kトークン以下の入力で永久五折、入力2.10元、出力8.40元。512k超は入力4.20元、出力16.80元です。
テキトー教師DotAI 認定講師「日本から使えるのか」については、MiniMaxは230以上の国・地域で3億人超のユーザーに使われていると説明しています。日本からの利用可否を明示した記述は今回の資料には無いので、そこは公式のコンソールで確認するのが確実です。
室谷代表取締役そして「NVIDIA Vera Rubinの提供時期はいつなのか」ですが、これは現時点では明らかにされていません。今回の資料には、Rubinが発表されたときからvLLMコミュニティが移植を進めてきた、という経緯は書かれていますが、一般提供の時期までは触れられていません。
テキトー教師DotAI 認定講師ここは憶測で埋めずに、公式の続報を待つべきところですね。
室谷代表取締役まとめると、今回のニュースは「M3というモデルが、より強力な推論基盤で動き始めた」という話です。モデルの賢さの話と、それをどう捌くかの話は分けて読む。
これが実務では一番効いてくる視点なんですよね。
これが実務では一番効いてくる視点なんですよね。
テキトー教師DotAI 認定講師そうなんですよ。長時間エージェントを本番で回そうとすると、必ず推論基盤の話に行き着きます。
M3のRubin対応は、その流れを象徴する一歩として見ておくと、今後の続報も追いやすくなります。
M3のRubin対応は、その流れを象徴する一歩として見ておくと、今後の続報も追いやすくなります。
