2026年10月11日

MiniMax M3とは?NVIDIA Vera Rubin NVL72で稼働、AgentXで7.8倍超

室谷室谷代表取締役
MiniMax M3(ミニマックス エムスリー)は、MiniMaxが2026年5月31日に発表したフロンティアモデルで、フロンティア水準のコーディング、1Mコンテキスト、ネイティブ・マルチモーダルを1つのモデルに統合したものです。今回はそのM3が、NVIDIAの新しい計算基盤「Vera Rubin NVL72」上で、オープンソースの推論エンジンvLLMを使って稼働するようになった、という発表なんですよね。
テキトー教師テキトー教師DotAI 認定講師
そうなんですよ。MiniMaxの公式スレッドでは「MiniMax M3 is now running on NVIDIA Vera Rubin NVL72 with vLLM」と告知されていて、vLLM側の引用では、ベンチマーク「AgentX」でM3を動かした初期結果として、GB200と比べて7.8倍以上のスループットが確認されたとされています。

単に「新しいハードで動いた」という話じゃないんですよ。
室谷室谷代表取締役
ここ、発表の主語はあくまでMiniMaxです。Xで告知されたからといって「Xが発表」ではないですし、vLLMやNVIDIAは協力主体として名前が挙がっている立場ですね。
テキトー教師テキトー教師DotAI 認定講師
そこは講座でも必ず最初に確認するポイントで、受講生さんも混同しがちなんです。発表元はMiniMax、協力主体としてNVIDIA、Red Hat、inferact、vLLMコミュニティが挙げられている、という整理になります。

MiniMax M3とは?今回何が発表されたのか

MiniMax M3の発表と推論基盤の流れ
  • 2026年5月31日
    MiniMax M3 発表
    Frontier Coding、1M Context、Native Multimodalityを1つのモデルに統合
  • 今回
    推論環境の発表
    M3がNVIDIA Vera Rubin NVL72上でvLLMを使って稼働を開始
室谷室谷代表取締役
まずM3というモデル自体の立ち位置を押さえておきたいんですよね。MiniMaxの投資家向けページのニュース欄では、2026年5月31日の項目として「MiniMax M3: Frontier Coding, 1M Context, Native Multimodality — All in One Model」と掲載されています。

つまりフロンティア級のコーディング、100万トークンのコンテキスト、ネイティブのマルチモーダルを、別々のモデルではなく1つに統合したという打ち出し方です。
テキトー教師テキトー教師DotAI 認定講師
で、今回の発表はそのM3の「中身」ではなく「どこで動くか」の話なんですよ。M3がNVIDIA Vera Rubin NVL72上でvLLMを使って稼働を始めた、というのが今回のニュースです。
室谷室谷代表取締役
順番としては、5月31日にモデルが出て、そのモデルが新しい推論基盤に載った、という流れですね。モデルの発表と、推論環境の発表は別物として読む必要があります。
テキトー教師テキトー教師DotAI 認定講師
ここを混ぜてしまうと「M3が新しくなった」と誤読されるので注意です。あくまで同じM3が、より強力な計算基盤で動くようになったという話です。

MiniMax M3がNVIDIA Vera Rubin NVL72とvLLMで稼働、AgentXで7.8倍超のスループット

まとめ
MiniMax M3 × NVIDIA Vera Rubin NVL72 × vLLM の要点
  • vLLMがNVIDIA Vera Rubinをサポートし、AgentX上のMiniMax M3でGB200比7.8倍以上のスループットを初期結果として確認
  • 7.8倍はモデルの賢さではなく、同じ時間で処理できる量(スループット)が増えたという意味
  • スループット向上は、同じハードウェアでより多くの利用者を捌ける、または同じ利用者数なら応答が速くなることにつながる
  • MiniMaxはvLLM、inferact、NVIDIA、Red Hatに「M3をRubinに届けてくれた」ことへの感謝を表明
  • vLLM側はinferact、NVIDIA、Red Hat、vLLMコミュニティがRubin発表時から移植作業を進めてきたと説明(一夜にして出た成果ではない)
  • モデル企業・ハード企業・推論エンジンコミュニティ・ベンダーが別々の役割で並ぶ協力体制
  • 7.8倍の詳細な測定条件(バッチサイズ・入力長など)は資料では未公開。AgentXベンチマーク、GB200比較、初期結果であることのみ読み取れる
  • 条件不明の数字をそのまま自社環境の見積もりに当てはめるのは危険。数字は条件とセットで読む
室谷室谷代表取締役
発表の中身をもう少し丁寧に見ていくと、MiniMaxのスレッドでは、vLLMプロジェクト、inferact、NVIDIA、Red Hatに対して「M3をRubinに届けてくれた」ことへの感謝が述べられています。
テキトー教師テキトー教師DotAI 認定講師
そして引用元のvLLM側の投稿が具体的で、「vLLM now supports NVIDIA Vera Rubin. The early results show more than 7.8x the throughput of GB200 on MiniMax M3 on AgentX.」とあります。vLLMがNVIDIA Vera Rubinをサポートし、初期結果としてAgentX上のMiniMax M3でGB200の7.8倍以上のスループットが出た、という内容です。
室谷室谷代表取締役
ここで大事なのは、7.8倍という数字が「M3をAgentXで動かしたときのスループット」だという点です。モデルの賢さが7.8倍になったわけではなく、同じ時間で処理できる量が増えたという話ですね。
テキトー教師テキトー教師DotAI 認定講師
用語を整理しておくと、スループットは単位時間あたりに処理できるリクエストやトークンの量です。これが上がるということは、同じハードウェアでより多くの利用者を捌ける、あるいは同じ利用者数なら応答が速くなる、ということにつながります。
室谷室谷代表取締役
あと、vLLM側の投稿には「inferact、NVIDIA、Red Hat、そしてvLLMコミュニティが、Rubinが発表されたときからvLLMをRubin上に持ってくる作業を進めてきた」という趣旨の説明も添えられています。つまり今回の稼働は一夜にして出てきたものではなく、継続的な移植作業の成果だということですね。
テキトー教師テキトー教師DotAI 認定講師
ここは協力体制の話として読むと面白いんですよ。モデルを作る企業、ハードを作る企業、推論エンジンを開発するコミュニティ、それを支えるベンダーが、それぞれ別の役割で並んでいる構図です。
室谷室谷代表取締役
MYUUUでも推論コストの見積もりは常に悩みどころなので、この「同じモデルが別の基盤でどれだけ捌けるか」という数字はかなり実務的に響きます。
テキトー教師テキトー教師DotAI 認定講師
ただ、7.8倍という数字の詳細な測定条件は、今回の資料では明らかにされていません。AgentXというベンチマーク名と、GB200との比較であること、初期結果であること、までは読み取れますが、バッチサイズや入力長などの条件までは触れられていないんです。
室谷室谷代表取締役
そこは正直に「初期結果として7.8倍以上」までで止めておくのが正確ですよね。条件が分からない数字を、そのまま自社環境の見積もりに当てはめるのは危険です。
テキトー教師テキトー教師DotAI 認定講師
そうなんです。ベンチマークは条件が変われば結果も変わりますから、受講生さんにも「数字は条件とセットで読む」と伝えています。

なぜ7.8倍が重要か——長時間エージェント時代の推論基盤競争

長時間エージェント時代の推論基盤競争——時系列
  • 2026年5月27日
    MiniMax Agent Team 発表
    「Built for Long-Running Tasks and Continuous Evolution」—長時間稼働タスクと継続的進化を前提にしたエージェント
  • 2026年9月末〜10月
    LLMエラー多発インシデント
    ステータスページに「Large Language Models (LLM)」のエラー多発が繰り返し記録
  • 2026年10月5日〜10日
    Elevated errors が1日に何度も発生
    InvestigatingからResolvedへ、という記録が繰り返し並ぶ
  • 現在
    Rubin上での稼働とスループット7.8倍改善
    単なる技術デモではなく、供給力をどう確保するかという経営課題への答えの一部
室谷室谷代表取締役
ここからが本題なんですけど、なぜ今このタイミングでスループットの話が出るのかというと、エージェントの使い方が変わってきたからなんですよね。
テキトー教師テキトー教師DotAI 認定講師
そうなんですよ。MiniMaxの投資家向けページには、2026年5月27日の項目として「MiniMax Agent Team: Built for Long-Running Tasks and Continuous Evolution」という発表が並んでいます。

長時間稼働するタスクと継続的な進化を前提にしたエージェント、という打ち出しです。
室谷室谷代表取締役
長時間動くエージェントは、短いチャットとは比べ物にならない量の推論を回します。1回のやり取りで終わらず、考えて、ツールを呼んで、また考える、を何十回も繰り返すわけです。
テキトー教師テキトー教師DotAI 認定講師
しかもM3は1Mコンテキストとネイティブ・マルチモーダルを掲げています。長い文脈を持ち、画像などのモダリティも扱うとなると、1リクエストあたりの計算量もメモリ消費も大きくなります。
室谷室谷代表取締役
そこに大量の同時リクエストが乗ってくると、ボトルネックはモデルの賢さではなく、捌く側の処理能力になるんですよね。
テキトー教師テキトー教師DotAI 認定講師
だからスループットの改善が、そのまま応答速度、コスト、安定性に効いてくる。7.8倍という数字は、そういう負荷への対応力を示すものとして位置づけられるわけです。
室谷室谷代表取締役
あと、これは見逃せないんですけど、MiniMaxのステータスページには2026年9月末から10月にかけて「Large Language Models (LLM)」のエラー多発インシデントが繰り返し記録されているんですよ。10月5日から10日にかけては、1日に何度も「Elevated errors」が起きて、そのたびにInvestigatingからResolvedへ、という記録が並んでいます。
テキトー教師テキトー教師DotAI 認定講師
これは需要に対して安定供給が課題になっていたことをうかがわせる記録です。ステータスページの過去90日の稼働率の表示は「All Systems Operational」ですが、履歴を見ると短時間の障害が高頻度で発生していたことが分かります。
室谷室谷代表取締役
そう考えると、今回のRubin上での稼働とスループット改善は、単なる技術デモではなく、供給力をどう確保するかという経営課題への答えの一部として読めるんですよね。
テキトー教師テキトー教師DotAI 認定講師
モデルとAI製品が230以上の国・地域で3億人超のユーザー、100以上の国で200万社超の企業・開発者に使われている、とMiniMaxは投資家向け情報で説明しています。その規模を支える基盤強化の文脈で、今回の発表が位置づけられるわけです。
室谷室谷代表取締役
モデル競争だと思われがちなところで、実は推論基盤の競争が効いてくる。ここは実務者としてすごく共感するところです。
テキトー教師テキトー教師DotAI 認定講師
講座でも「モデルを選ぶときに、どこで動くかまで見る」という話をしているんですよ。同じモデルでも、載る基盤が変われば体験が変わる時代になっています。

MiniMax M3でできること——1Mコンテキスト・ネイティブマルチモーダル・コーディング

室谷室谷代表取締役
ここでM3自体の能力を、公式に書かれている範囲で整理しておきたいんですよね。
テキトー教師テキトー教師DotAI 認定講師
では整理するとこうです。
  • フロンティア水準のコーディング(Frontier Coding)
  • 1Mトークンのコンテキストウィンドウ
  • ネイティブ・マルチモーダル
  • これらを1つのモデルに統合
室谷室谷代表取締役
出典はMiniMaxの投資家向けページにある2026年5月31日の発表項目で、タイトルがそのまま「Frontier Coding, 1M Context, Native Multimodality — All in One Model」です。
テキトー教師テキトー教師DotAI 認定講師
1Mコンテキストというのは、扱える文脈の長さが100万トークン規模ということです。長いコードベースや長いドキュメントを丸ごと渡す使い方が現実的になってきます。
室谷室谷代表取締役
ネイティブ・マルチモーダルというのは、後付けで画像対応を足したのではなく、モデルとしてマルチモーダルを前提にしているという意味ですね。
テキトー教師テキトー教師DotAI 認定講師
そしてコーディングとエージェント能力をフロンティア水準として打ち出している。エージェント用途のベンチマークとしてAgentXの名前が出てくるのも、この文脈とつながります。
室谷室谷代表取締役
ただ、パラメータ数や個別ベンチマークのスコアについては、今回の資料では確認できません。検索でよく調べられる論点ではありますが、ソースに無い数字をこちらで補うのはやめておきます。
テキトー教師テキトー教師DotAI 認定講師
そうですね。現時点で確認できるのは、公式が掲げている「Frontier Coding、1M Context、Native Multimodality」という3点と、AgentXでのスループット比較までです。
室谷室谷代表取締役
あと、MiniMaxの投資家向けページの研究欄には、M3に加えてM2.7、M2.5、H3、Speech 2.8、Music 3.0といったモデルが並んでいます。M3はそのラインナップの中のフロンティア枠という位置づけで読むと分かりやすいですね。
テキトー教師テキトー教師DotAI 認定講師
モデルの系譜として見ると、M2.5、M2.7と積み上げてきた流れの先にM3がある、という並びです。

MiniMax M3の料金とAPI提供状況、日本から使えるのか

室谷室谷代表取締役
ここが読者の一番知りたいところだと思うんですけど、M3はすでにMiniMaxの開放プラットフォームでAPI提供されています。
テキトー教師テキトー教師DotAI 認定講師
料金は公式のドキュメントにきちんと出ています。整理するとこうです。
条件入力(元/百万トークン)出力(元/百万トークン)キャッシュ読み取り(元/百万トークン)
512k入力トークン以下(永久五折)4.20 → 2.1016.80 → 8.400.84 → 0.42
512k入力トークン超(永久五折)8.40 → 4.2033.60 → 16.801.68 → 0.84
室谷室谷代表取締役
512kトークン以下の入力なら永久五折で、入力2.10元、出力8.40元という価格ですね。512kを超えると入力4.20元、出力16.80元になります。
テキトー教師テキトー教師DotAI 認定講師
ここで注意したいのが、1Mコンテキストを謳っているモデルでも、料金の区分は512kで切られているという点です。長い文脈を扱うほど単価が上がる設計になっています。
室谷室谷代表取締役
あと、公式ドキュメントには「标准」と「优先」というサービス区分の記載があります。優先サービスについては、この抜粋では価格の内訳までは示されていません。
テキトー教師テキトー教師DotAI 認定講師
そこは現時点では明らかにされていない、としておくのが正確ですね。ドキュメントのFAQにも「M3 标准服务与优先服务有什么区别?」という項目が立っているので、詳細は公式の該当ページで確認するのが確実です。
室谷室谷代表取締役
日本から使えるのかという点については、MiniMaxはモデルとAI製品が230以上の国・地域で3億人超のユーザーに使われていると説明しています。日本が含まれるという明示的な記述は今回の資料にはありませんが、グローバル提供が前提のプラットフォームであることは読み取れます。
テキトー教師テキトー教師DotAI 認定講師
開放プラットフォームにはコンソールのログイン導線も用意されています。開発者ドキュメント、Token Plan、Pricing、Console Loginという並びが投資家向けページからも確認できます。
室谷室谷代表取締役
支払いが人民元建てなので、そこは実務上の考慮点になりますね。日本円での請求になるかどうかは、資料からは分かりません。
テキトー教師テキトー教師DotAI 認定講師
あと、MiniMaxのプラットフォームではM3以外にも言語モデル、音声、動画、画像、音楽、MCP、サーバーツールという幅広いラインナップが同じ料金ページに並んでいます。M3だけを単体で契約するというより、プラットフォーム全体の中の1モデルとして使う形ですね。
室谷室谷代表取締役
ちなみに動画の資源パッケージはHailuoシリーズ向けで、MiniMax H3には対応していないという注記もあります。同じMiniMaxの中でも、モデルごとに課金体系が分かれているので、そこは混同しないほうがいいです。
テキトー教師テキトー教師DotAI 認定講師
受講生さんからも「同じ会社のモデルなのに買い方が違う」という質問がよく出るんですよ。M3を使うなら、言語モデルの按量计费、つまり従量課金のページを見るのが正解です。
室谷室谷代表取締役
あと、MiniMaxのステータスページでLLMの稼働状況が公開されているので、本番利用を検討するならそこをウォッチしておくのが実務的ですね。
テキトー教師テキトー教師DotAI 認定講師
過去90日の稼働率とインシデント履歴が見られるので、SLAを気にする企業ユーザーには有用な情報です。

よくある質問——MiniMax M3の性能・使い方・Rubinの提供時期は?

室谷室谷代表取締役
最後に、読者がよく気にするポイントをまとめておきます。
テキトー教師テキトー教師DotAI 認定講師
まず「MiniMax M3の性能はどうなのか」ですが、公式が掲げているのはフロンティア水準のコーディング、1Mコンテキスト、ネイティブ・マルチモーダルの3点です。今回の発表では、AgentXでGB200比7.8倍以上のスループットが初期結果として確認されたとされています。
室谷室谷代表取締役
ただし、この7.8倍はスループットの比較であって、モデルの知能や回答品質の比較ではありません。そこは誤解しないようにしたいですね。
テキトー教師テキトー教師DotAI 認定講師
次に「使い方」ですが、MiniMaxの開放プラットフォームでAPIとして提供されています。開発者ドキュメントとコンソールが用意されていて、従量課金のAPIキーで利用する形です。
室谷室谷代表取締役
料金は512kトークン以下の入力で永久五折、入力2.10元、出力8.40元。512k超は入力4.20元、出力16.80元です。
テキトー教師テキトー教師DotAI 認定講師
「日本から使えるのか」については、MiniMaxは230以上の国・地域で3億人超のユーザーに使われていると説明しています。日本からの利用可否を明示した記述は今回の資料には無いので、そこは公式のコンソールで確認するのが確実です。
室谷室谷代表取締役
そして「NVIDIA Vera Rubinの提供時期はいつなのか」ですが、これは現時点では明らかにされていません。今回の資料には、Rubinが発表されたときからvLLMコミュニティが移植を進めてきた、という経緯は書かれていますが、一般提供の時期までは触れられていません。
テキトー教師テキトー教師DotAI 認定講師
ここは憶測で埋めずに、公式の続報を待つべきところですね。
室谷室谷代表取締役
まとめると、今回のニュースは「M3というモデルが、より強力な推論基盤で動き始めた」という話です。モデルの賢さの話と、それをどう捌くかの話は分けて読む。

これが実務では一番効いてくる視点なんですよね。
テキトー教師テキトー教師DotAI 認定講師
そうなんですよ。長時間エージェントを本番で回そうとすると、必ず推論基盤の話に行き着きます。

M3のRubin対応は、その流れを象徴する一歩として見ておくと、今後の続報も追いやすくなります。

Related

関連記事

New Articles

新着記事

ガイド

GeminiのMacアプリはIntel Macでも使える?対応条件とインストール手順

2026年10月11日
室谷テキトー教師
ニュース

Devinのクラウド環境とは?macOS・Windows・Android対応でiOS開発も

2026年10月11日
室谷テキトー教師
ニュース

Microsoft Copilotの「Home」とは?ChatとCoworkを統合した新起点

2026年10月11日
室谷テキトー教師
ニュース

Devin ChatGPT連携とは?Go/Plus/Proの枠でGPTモデルを使う仕組み

2026年10月11日
室谷テキトー教師
ニュース

Devinの「Managed Devins」とは?子Devinを多段階に起動する新機能

2026年10月11日
室谷テキトー教師
ニュース

NotionのiPadアプリがネイティブ再構築へ、Siri連携も

2026年10月11日
室谷テキトー教師
ニュース

OpenAIの「dots」とは?スマホ作成とCodex委任に対応した最新アップデート

2026年10月11日
室谷テキトー教師
ニュース

Anthropicの「モデル行動レポート」とは?Claudeの意図しない行動4類型を解説

2026年10月11日
室谷テキトー教師
ガイド

Grokの画像生成は無料でどこまで?アプリの使い方と料金・商用利用の注意点

2026年10月11日
室谷テキトー教師
ニュース

HeyGenとは?Avatar Vと音声を強化する最新アップデートを解説

2026年10月11日
室谷テキトー教師

Join

AIプレナーになる。

入会は審査制です。いまの事業と、AIで何を動かしたいのかを聞かせてください。

参加を申請する