2026年10月9日

MiniMaxとは?会社概要から料金、H3の使い方とローカル実行まで解説

MiniMaxとはどんな会社?提供しているモデルとブランドを整理

MiniMaxはどんな会社?設立と「co-create intelligence with everyone」という考え方

室谷室谷代表取締役
まず押さえておきたいのが、MiniMaxが2022年設立の中国のAI企業だってことなんですよね。テキストも画像も音声も動画も音楽も、まとめて自前でモデルを作っている。
テキトー教師テキトー教師DotAI 認定講師
名前だけ聞くと「また動画生成の会社?」って思われがちなんですけど、実際は基盤モデルを自分たちで持っている会社なんですよ。そこが最初の戸惑いどころですね。
室谷室谷代表取締役
掲げているのが「co-create intelligence with everyone」で、要は一部の研究者だけのものにしないという思想です。こういう言い切り方をする会社は、事業設計にも一貫性が出るんですよね。
テキトー教師テキトー教師DotAI 認定講師
あえて横文字のまま出してくるあたり、思想をブランドの一部にしている感じがします。

MiniMax Code、Design、Audio、Talkieなどプロダクトの広がり

室谷室谷代表取締役
プロダクトの広がり方も特徴で。MiniMax Code、MiniMax Design、MiniMax Audio、Talkie、それに法人や開発者向けのオープンプラットフォームまで展開しています。
テキトー教師テキトー教師DotAI 認定講師
コンシューマー向けと開発者向けがきれいに分かれているのが面白いですね。初めて触る人は、どの入口から入ればいいのか迷うんですよ。
室谷室谷代表取締役
ここは業界構造として見ていて、モデルを自前で持ったうえでAPIとコンシューマーアプリの両方をやる形は、収益の柱を分散できる。ただ日本の事業会社からすると、どの窓口に相談すればいいのかが分かりにくいんですよね。
テキトー教師テキトー教師DotAI 認定講師
実際、使いたい機能から逆算して入るのが早いと思います。コーディングなら Code、音声なら Audio、という具合に。

動画はHailuo AIブランドで提供、Hailuo 2.3の位置づけ

室谷室谷代表取締役
で、動画生成のコンシューマー向けはHailuo AIというブランド名で出ています。hailuoai.videoですね。
テキトー教師テキトー教師DotAI 認定講師
モデル名とサービス名が別なんですね。ここ、初めての人が一番混乱するところです。
室谷室谷代表取締役
Hailuo 2.3は前のHailuo 02の後継で、物理的な動きの表現や、アニメ・イラスト・水墨画・ゲームCGといったスタイル対応、キャラクターの微表情が強化されている。価格は据え置きのまま性能を上げてきたという話なので、そこは素直に評価したいところです。
テキトー教師テキトー教師DotAI 認定講師
Fastがつく方はバッチ生成のコストが最大で半分減るらしくて、まとめて作る用途だと効いてきますよね。

テキストのM3、動画のH3、音声のSpeech 2.8、音楽のMusic 3.0という主要モデル

室谷室谷代表取締役
主要モデルは4本立てで覚えると整理しやすいです。テキストとコーディングのM3、動画のH3、音声のSpeech 2.8、音楽のMusic 3.0。
テキトー教師テキトー教師DotAI 認定講師
M3は100万トークンのコンテキストに、新しく設計したスパースアテンションを組み合わせているんですよ。長い資料を丸ごと渡す使い方が現実的になってきました。
室谷室谷代表取締役
H3とMusic 3.0はオープンウェイトで公開されている。重みを配る戦略は開発者を取り込む意味で効きますし、実際うちの界隈でも話題になっているんですよね。
テキトー教師テキトー教師DotAI 認定講師
音声のSpeech 2.8はAPI経由で使う前提で考えると分かりやすいです。まずはどのモーダルが必要かで見ていくと迷いません。

MiniMax H3とは?オムニモーダル動画生成でできること

オムニモーダルって結局なにができるのか

室谷室谷代表取締役
MiniMax H3、一言でいうと入り口が全部つながった動画生成なんですよね。テキストだけじゃなく画像・動画・音声をまとめて文脈として読んで、音声付きの動画を出す。
テキトー教師テキトー教師DotAI 認定講師
現場でよく聞くのが「動画生成と音声生成って別のツールじゃないんですか」という疑問なんですよ。それが一体になってるのがH3の面白さで。
室谷室谷代表取締役
別々のツールをつなぐと、尺と音のタイミングを合わせるだけで工数が溶けるんですよ。それがひとつのモデルで完結するなら、制作の原価構造が変わってきます。
テキトー教師テキトー教師DotAI 認定講師
しかも公開されている部分がある。ただし全部がオープンというわけではないんですよね。

そこが次の話につながります。

最大2K・最長15秒・32kHzステレオ音声という仕様の中身

室谷室谷代表取締役
仕様を並べると、最大2K解像度・最長15秒・32kHzステレオ音声。出力は4〜15秒で、フレームレートは24fpsなんですよね。
テキトー教師テキトー教師DotAI 認定講師
15秒と聞くと短いと思う人もいるかもしれないですけど、音声付きでこの長さを安定して出すのがどれだけ大変か。初めて触る人はここを軽く見がちなんですよ。
室谷室谷代表取締役
15秒を何本かつなぐ前提で考えると、1本あたりの試行回数がそのままコストになる。やり直しをどれだけ減らせるかが、制作側の損益に直で効いてきますからね。
テキトー教師テキトー教師DotAI 認定講師
たしかに。短尺で切って数を出す使い方のほうが、今は相性が良さそうです。

H3は3つのモジュールでできている(Context-IR/Base/Regenerate-2K)

室谷室谷代表取締役
中身は3つのモジュールに分かれてるんですよ。まず H3-Context-IR がマルチモーダルの入力を理解して構造化する前処理です。
テキトー教師テキトー教師DotAI 認定講師
ここは複雑なのでオープンソース化されてなくて、APIで提供されるんですね。
室谷室谷代表取締役
次が H3-Base。33Bパラメータの単一Transformerで、768pの出力を作って重みが公開されてる。

最後の H3-Regenerate-2K が768pを2Kに引き上げる役割で、こちらは未公開のままAPI提供です。
テキトー教師テキトー教師DotAI 認定講師
つまり全部がオープンウェイトなわけではない、というのが正確な理解なんですよ。重みが公開されてるのはBaseの部分で、前処理と2K化はホスト側に残ってる。

対応アスペクト比と11言語の対話サポート

室谷室谷代表取締役
アスペクト比は21:9、16:9、4:3、1:1、3:4、9:16あたりに対応してる。横も縦もシネマ比率もいけるので、媒体を選ばないんですよね。
テキトー教師テキトー教師DotAI 認定講師
対話言語は11言語を安定サポートしていて、日本語も入ってます。日本語プロンプトの追従性が話題になってるのも、現場の体感と合いますね。
室谷室谷代表取締役
日本の制作現場だと、日本語で指示が通るかどうかで導入の判断が変わるじゃないですか。そこがクリアなのは大きいです。

MiniMaxの料金は4つの体系に分かれている

MiniMaxの4つの料金体系
APIの従量課金
テキスト・音声・動画・画像を単位ごとに課金。テキストM3は入力$0.60/出力$2.40 per Mトークン、音声は$100/$60 per M文字、動画H3は768P $0.08/秒・2K $0.13/秒、画像image-01は$0.0035/枚
個人向けM Plan
Go・Explore・Buildの3段階。年払いで$220/$550/$1,320。H3動画モデルはGoに含まれずExplore以上が必要。月払いも選択可
Audio専用サブスク
Starter $5/月〜Business $999/月の5段階。年払いは2割引
コーディング向けToken Plan
Plus $22・Max $55・Ultra $132の3段階。H3など特別なモデルは対象外でCreditsを使用。クレジットは$5で5,000、購入日から365日有効

APIの従量課金はいくら?テキスト・動画・音声・画像の単価

室谷室谷代表取締役
MiniMaxの料金、最初に整理しておきたいんですけど、これが4系統に分かれてるんですよ。APIの従量課金、個人向けのM Plan、音声専用のサブスク、それとコーディング向けのToken Plan。

同じ会社の中に全然別の料金体系が並んでるんですよね。
テキトー教師テキトー教師DotAI 認定講師
そこが最初に混乱するところなんですよ。「どこに登録すればいいのか」で手が止まる。

まず従量課金の中身から見ておきましょうか。
対象料率
テキスト MiniMax-M3(入力512kトークン以下)入力 $0.60 / Mトークン、出力 $2.40 / Mトークン
音声合成 speech-2.8-hd / speech-2.8-turbo$100 / M文字、$60 / M文字
動画 MiniMax-H3768P $0.08/秒、2K $0.13/秒
動画 MiniMax-H3-Max480P $0.05/秒、768P $0.08/秒
画像 image-01$0.0035 / 枚
室谷室谷代表取締役
動画が秒単位、音声が文字単位、画像が枚単位。単位がバラバラなのが地味に厄介で、社内でコスト試算するときは秒と文字と枚を全部揃えないといけないんですよね。
テキトー教師テキトー教師DotAI 認定講師
現場でよく聞くのは「音声だけで月いくらかかるの」という話です。文字単価なので読み上げる原稿の量で変わってくる。

動画は秒数で読めるので、まだイメージしやすいんですけど。

個人向けのM Planは3段階、H3が使えるのはどのプランから?

MiniMax M PlanのGo・Explore・Build機能比較表(動画モデルH3はExplore以上で利用可)。MiniMax公式サイトより

室谷室谷代表取締役
個人向けのM PlanはGo、Explore、Buildの3段階なんですよね。年払いでGoが$220、Exploreが$550、Buildが$1,320。

で、ここが大事なところで、GoにはH3の動画モデルが含まれてないんですよ。
テキトー教師テキトー教師DotAI 認定講師
そこは見落としやすいですね。動画を試したいと思って一番安いプランに入ったら、肝心の動画モデルが対象外だった、というのは十分あり得る話です。
室谷室谷代表取締役
だから動画を触る前提ならExplore以上。月払いも選べるので、まず1ヶ月だけ回して判断するのが一番無駄がない判断なんですよね。
テキトー教師テキトー教師DotAI 認定講師
その考え方は分かります。年間契約は安いんですけど、使わなかったときの損失も一緒に大きくなるので。

Audio専用サブスクとコーディング向けのToken Plan

室谷室谷代表取締役
音声に特化したサブスクも別にあって、Starter $5/月からBusiness $999/月まで5段階。年払いなら2割引になります。

で、コーディング向けのToken PlanはPlus $22、Max $55、Ultra $132の3段階なんですよ。
テキトー教師テキトー教師DotAI 認定講師
用途が分かれているので、両方契約する必要は基本的にないんですよね。音声を作る人とコードを書く人が、それぞれ自分の側だけ選べばいい。
室谷室谷代表取締役
ただしToken PlanはH3のような特別なモデルが対象外で、そこはCreditsで回す形になる。契約したのに動かない、というズレが起きやすいところです。
テキトー教師テキトー教師DotAI 認定講師
クレジットのパックは$5で5,000クレジット、購入日から365日間有効なので、足りない分だけ後から足すという使い方ができますね。

2026年8月20日のMusic生成・作詞生成APIの新規受付終了で何が変わる?

室谷室谷代表取締役
ここは最新の変更点で、2026年8月20日以降、Music生成と作詞生成の有料APIは新規ユーザー向けの提供が終了してるんですよ。既存の有料ユーザーは継続して使えるんですけど。
テキトー教師テキトー教師DotAI 認定講師
これ、初めて触る人が一番ハマるところですね。これから音楽生成を試そうと思って登録しても、API経由では受け付けてもらえない。
室谷室谷代表取締役
無料のMusic-3.0-freeといったAPIも終了予定なので、音楽を作りたい場合はMiniMax Audioのサイト経由か、Hugging Faceで公開されているオープンウェイトのMusic 3を使う形になる。API前提で組み込んでいた設計は見直しが要るんですよね。
テキトー教師テキトー教師DotAI 認定講師
料金表だけ見て「音楽もこの単価で叩ける」と思い込むと危ないので、そこは先に確認しておきたいところです。

MiniMax H3をローカルで動かすにはどのくらいのGPUとメモリが必要?

公式要件と有志の実測値の比較
公式のデプロイ手順
  • SGLangやvLLMを使用
  • 実行例は「--num-gpus 4」の4GPU構成
  • 1枚刺しのPCは想定外
  • VRAMの最低要件は明記されていない
有志の実測値(量子化利用)
  • ComfyUIのレイヤー単位オフロード+GGUF量子化
  • VRAM 8〜12GB、メインメモリ32GB以上で生成可
  • Q2〜Q4あたりの量子化を使用
  • 12GB GPU+メモリ32GBで480p・5秒を9分弱
  • 新規購入なら16GB・メモリ64GB目安の声も

公式のデプロイ手順は4GPU構成が前提

室谷室谷代表取締役
H3のローカル実行、まず前提を揃えておきたいんですよね。公式が案内しているデプロイ方法はSGLangやvLLMで、実行例が「--num-gpus 4」の4GPU構成なんです。

つまり公式は1枚刺しのPCで動かす想定をしていない。
テキトー教師テキトー教師DotAI 認定講師
そこ、最初に戸惑うポイントです。公式の手順を見て「GPU4枚なんて無理です」と止まってしまう人が多いんですが、公式が明記していないのはVRAMの最低要件なんですよ。

手順の前提と、実際に必要なスペックは別の話なんです。
室谷室谷代表取締役
経営目線で言うと、4GPU前提の構成をそのまま組むとサーバー費用が一桁変わってくる。だからどこまでを公式準拠でやって、どこからを工夫でカバーするかの判断が要るんですよね。

量子化を使えば8〜12GBで動くという報告がある

テキトー教師テキトー教師DotAI 認定講師
実際に動かしている人の報告だと、ComfyUIのレイヤー単位オフロードとGGUFの量子化を組み合わせて、VRAM 8〜12GB、メインメモリ32GB以上で生成できたというケースが出ています。Q2〜Q4あたりの量子化を使う形ですね。
室谷室谷代表取締役
それは現実的ですね。ただこれはMiniMax公式が定めた最低スペックではなくて、コミュニティの実測値です。

公式のドキュメントに「8GBで動く」とは書かれていない。
テキトー教師テキトー教師DotAI 認定講師
そうなんです。12GBのGPUとメモリ32GBで480p・5秒を9分弱で作れたという報告もあって、新しく買うなら16GB・メモリ64GBあたりを目安に挙げる人もいます。

ただ数字は環境でかなり振れるので、そのまま鵜呑みにはしないほうがいいです。

未量子化は約40GB、まず何から試すか

室谷室谷代表取締役
量子化なしだと約40GBと言われていて、これは個人のPCだと相当きつい。手元で試すなら、いきなりフル精度を狙わずに量子化から入るのが現実的な順番ですよね。
テキトー教師テキトー教師DotAI 認定講師
現場感覚で言うと、最初から全部詰め込もうとして挫折するパターンが一番多いんですよ。まずは低めの量子化で「動いた」という感触を取ってから、余裕が出たら精度を上げていく。

順番を逆にすると、原因がスペックなのか設定なのか分からなくなります。
室谷室谷代表取締役
それ、投資判断と同じですね。最初から最大構成を買うより、小さく始めて効果を見てから足す。

GPUは高い買い物なので、そこは慎重でいいと思います。

「公式の要件」と「有志の実測」を分けて読む

テキトー教師テキトー教師DotAI 認定講師
ここは整理しておきたいんですけど、公式が出しているのはデプロイ方法であって、最低スペックの保証ではないんです。有志の実測は「この環境で動いた」という一例で、動作を約束するものではない。
室谷室谷代表取締役
この2つを混ぜると判断を誤るんですよ。公式準拠で組むならマルチGPU前提、個人で試すなら量子化込みの実測値を参考にする。

どっちの土俵で話しているかを意識するだけで、必要なスペックの見え方が変わります。
テキトー教師テキトー教師DotAI 認定講師
対応状況はこれからも変わっていくので、実際に組む前に公式リポジトリの手順と、自分のGPUに合った量子化の情報を確認しておくのが確実ですね。

ComfyUIでMiniMax H3の動画を作るまでの流れ

動かす前に決めておくこと(量子化の形式と解像度)

ComfyUIでMiniMax H3の動画を作るまでの流れ
  1. 01
    ComfyUIをセットアップする
  2. 02
    MiniMax H3の量子化済み重みを配置
    公式リポジトリの案内に沿って配置する
  3. 03
    ワークフローのテンプレートを読み込む
  4. 04
    解像度は768p、長さは短め(5秒前後)に設定する
  5. 05
    実行して最初の1本を書き出す
    UIの表記や位置は環境で異なるため公式ヘルプで確認を
室谷室谷代表取締役
ComfyUI で回す前提だと、最初に決めるのは重みの量子化と解像度なんですよね。公開されてる H3-Base は 33B パラメータの単一 Transformer で、素のままだと手元の GPU には重すぎる。

GGUF の Q2〜Q4 あたりまで落とすのが現実的なスタート地点です。
テキトー教師テキトー教師DotAI 認定講師
初めて触る人は「量子化したら画質が落ちるんじゃ」と身構えるんですけど、まず動かせる状態を作る方が先ですよね。VRAM 8〜12GB でも、メインメモリを 32GB 以上確保すれば動くという報告が共有されています。
室谷室谷代表取締役
もう一個、解像度の線引きも先に決めておきたい。ローカルの公開重みで出せるのは 768p までで、2K に上げるための再生成モジュールは未公開、API 提供なんですよ。

ここを知らずに 2K を狙ってワークフローを組むと、そもそも詰みます。
テキトー教師テキトー教師DotAI 認定講師
たしかに。長さも 4〜15 秒、フレームレートは 24fps、アスペクト比は 16:9 や 9:16 などから選ぶ形なので、最初は短い秒数で試すのが堅いですね。

ワークフローを組んで最初の1本を出すまでの流れ

  1. ComfyUI をセットアップする
  2. MiniMax H3 の量子化済み重みを、公式リポジトリの案内に沿って配置する
  3. ワークフローのテンプレートを読み込む
  4. 解像度は 768p、長さは短め(5 秒前後)に設定する
  5. 実行して最初の 1 本を書き出す(UI の表記や位置は環境で異なるため公式ヘルプで確認を)
室谷室谷代表取締役
流れ自体はシンプルで、詰まる場所はほぼ重みの置き場所と量子化の選び方なんですよね。公式のデプロイ推奨に ComfyUI が入っているので、公式リポジトリの案内どおりに進めるのが一番事故が少ない。
テキトー教師テキトー教師DotAI 認定講師
現場でよく聞くのは「ワークフローは読めたけど、どこを触れば画が変わるのか分からない」なんですよ。最初は解像度と秒数だけ動かして、出力の変化を確認するのが理解の早道ですね。
室谷室谷代表取締役
最初の 1 本は 480p・5 秒くらいで出し切るのがいい。RTX 3060 12GB・メモリ 32GB で 480p の 5 秒を 9 分弱で生成できたというコミュニティの実測が共有されてます。

所要時間を把握してから解像度を上げた方が、待ち時間で心が折れないです。

生成が重い・落ちるときに見直すポイント

テキトー教師テキトー教師DotAI 認定講師
落ちるときは大体 VRAM の取り合いですね。レイヤー単位のオフロードを有効にして、量子化のビットをもう一段下げると通ることが多いです。
室谷室谷代表取締役
戻し方の順番としては、解像度を下げる、秒数を短くする、量子化を落とす、の順が効きやすい。いきなり全部いじると、何が効いたのか分からなくなるんですよね。
テキトー教師テキトー教師DotAI 認定講師
あと未量子化のモデルは 40GB 前後になるので、そこを掴んでしまうとどうやっても載りません。最初から量子化前提で組む方が、結局は速いんですよ。
室谷室谷代表取締役
構造の話をすると、入力を理解して構造化する前処理と 2K への再生成は API 側にある。だからローカルは 768p までと割り切って、重い工程は API に投げる前提で組む方が、ワークフロー全体の設計は素直になります。

MiniMax H3は商用利用できる?ライセンスの条件

適用地域と除外地域、日本はどちらに入る?

MiniMax H3 商用利用の可否フロー

あなたは適用地域(日本など)に住んでいますか?

YES / はい(適用地域内)
  • 年間売上2,000万米ドル以下 → 追加許諾なしで商用利用可
  • 年間売上2,000万米ドル超 → api@minimax.io に事前連絡し別途許諾を取得
  • 商用利用時はUIに「MiniMax H3」を表示
  • 利用・複製・配布・改変・派生モデル作成まで許諾(非独占・譲渡不可・ロイヤリティフリー)
NO / いいえ(EU・英国・韓国・米国)
  • このライセンス自体を使用できない
室谷室谷代表取締役
H3のライセンス、適用地域の書き方が独特なんですよ。「世界中」と書いてあるんですが、そこから除外される地域が別で定義されていて・・・
テキトー教師テキトー教師DotAI 認定講師
たしかに、そこが一番つまずくところですね。除外されているのは欧州連合・英国・韓国・米国です。

ここに住んでいる人は、このライセンス自体を使えないんですよ。
室谷室谷代表取締役
なので日本のユーザーは適用地域に入る、と。ただ「世界中の人が使える」と理解してしまうと、米国やEUのチームと一緒に何かを作るときに前提が崩れるんですよね。

契約まわりはこういう例外の方が効いてきます。
テキトー教師テキトー教師DotAI 認定講師
最初に戸惑うのがまさにそこです。「オープンだからどこでも大丈夫」ではなく、住んでいる地域で可否が分かれる、という前提を持っておくのが大事なんですよ。

年間売上2,000万ドルという条件とapi@minimax.ioへの事前連絡

室谷室谷代表取締役
商用利用の線引きも明快で、商用製品やサービスの年間売上が2,000万米ドル、または他通貨で同額を超える場合は、api@minimax.io に連絡して事前に別途の許諾を取る必要があるんですよ。
テキトー教師テキトー教師DotAI 認定講師
逆に言うと、それ未満なら追加の許諾は要らないと。個人や小さめの制作チームだと、ここは実質そのまま使えるラインですね。
室谷室谷代表取締役
経営目線で言うと、この金額は「超えたら連絡する」という運用フラグとして読むのが現実的で。売上が伸びた年に慌てないよう、社内の誰がこの条件を把握しておくか、最初に決めておくのが大事なんですよね。
テキトー教師テキトー教師DotAI 認定講師
現場でよく聞くのは「超えてから考えます」なんですけど、事業計画に動画生成を組み込む段階で一度確認しておくと安心です。

商用利用時に必要な「MiniMax H3」の表示義務

室谷室谷代表取締役
もう一つ見落としやすいのが表示義務で、商用利用するときはUIに「MiniMax H3」と出す必要があるんですよね。
テキトー教師テキトー教師DotAI 認定講師
クレジット表記、制作の現場だとつい後回しになりがちです。ただ動画のUIや概要欄に出しておくだけなので、手間としてはかなり小さいんですよ。
室谷室谷代表取締役
逆に、そこを落とすと条件違反になりうる。自社プロダクトに組み込む前提なら、表記を出す場所をリリース前のチェックリストに入れておくくらいがちょうどいいと思います。

ライセンスで許諾される範囲(複製・配布・改変・派生モデル)

室谷室谷代表取締役
適用地域内であれば、非独占・譲渡不可・ロイヤリティフリーで、利用・複製・配布・改変が許諾される。派生モデルを作るところまで入っているんですよ。
テキトー教師テキトー教師DotAI 認定講師
ここは大きいですね。モデルを自社向けに調整して、その成果まで展開できるというのは、現場の選択肢がかなり変わります。
室谷室谷代表取締役
モデルのライセンスは「無料で使えるか」より「作った後にどこまで動かせるか」で価値が決まるので。ただ、この条件は適用地域と売上の前提の上に乗っているので、まず自分の位置を確認してから読むのが順番なんですよね。
テキトー教師テキトー教師DotAI 認定講師
原文のライセンスが一次情報なので、実際に組み込む前にそちらも一度確認しておくと確実です。

MiniMax Audioは何ができる?音声生成と音声クローンの機能

50以上の言語・300以上の声をそろえたテキスト読み上げ

MiniMax Audioの音声生成ツール入力画面。サインイン前は無料トライアル5回まで試用可能。MiniMax公式サイトより

室谷室谷代表取締役
MiniMax Audio、要はテキストを入れたら人が喋ってるような音声が出てくるサービスなんですよ。50以上の言語、300以上の声が用意されていて、日本語もネイティブのアクセントで出せるんですよね。
テキトー教師テキトー教師DotAI 認定講師
初めて触る人が一番驚くのがそこなんですよ。「多言語の読み上げって機械っぽい発音になるでしょ」と思って聴いたら、普通に耳が受け入れる声で返ってくる。

声の数が多いのも、案件ごとにトーンを変えたい人には効きますね。
室谷室谷代表取締役
制作の現場だと、同じ原稿を何言語ぶんも作り直すコストが地味に重いんですよ。ナレーターを言語ごとに手配すると単価が普通に跳ねる。

そこを1本のテキストから分岐できるのは、経営目線だとかなり効きます。
テキトー教師テキトー教師DotAI 認定講師
しかも後から「やっぱり女性の声で」みたいな差し替えがすぐ効くので、収録のやり直しが発生しないのが現場としてはありがたいんですよね。

約10秒のサンプルから作る音声クローン

室谷室谷代表取締役
音声クローンは、10秒くらいの音声サンプルがあれば作れると。これ、自分の声を録り直さなくていいってことなんですよね。
テキトー教師テキトー教師DotAI 認定講師
ハマる人多いんですよ、ここ。10秒って聞くと「そんな短くて大丈夫?」となるんですけど、試すと拍子抜けするくらい似た声が返ってくる。

逆に長い素材を用意しなきゃと思い込んで、手が止まってる人が多いです。
室谷室谷代表取締役
事業で使うなら、まず自分で試して「これは使える・使えない」を判断した方が早いんですよ。発注の前に見極められるのは大きい。
テキトー教師テキトー教師DotAI 認定講師
そうですね。ただ、自分の声を複製するときは、その声をどう使うかの線引きだけ先に決めておいた方がいいです。

後から「これは外に出せないな」となるケースがあるので。

無料トライアルで何が試せるのか

室谷室谷代表取締役
サインインする前でも無料トライアルが5回ぶん用意されているので、課金の前に音の質を確かめられるんですよ。
テキトー教師テキトー教師DotAI 認定講師
現場感覚で言うと、この5回を「なんとなく触る」で使っちゃうともったいないんですよ。自分の原稿を1本決めて、それを複数言語で出してみる。

それだけで向き不向きがかなり見えます。
室谷室谷代表取締役
まさに。導入を検討するときって、デモの質じゃなくて自社の原稿でどう出るかで判断するじゃないですか。

判断材料を増やさずに契約するのが一番もったいない。
テキトー教師テキトー教師DotAI 認定講師
あと、最初に戸惑うのが声の選び方なんですよ。数が多いと逆に決められないので、言語と用途を先に決めてから絞る方が早いです。

どんな用途に向いているか(ナレーション・多言語展開など)

室谷室谷代表取締役
向いてるのは、ナレーションと多言語展開なんですよね。動画の解説、製品の紹介、教材の読み上げあたりは素直にハマる。
テキトー教師テキトー教師DotAI 認定講師
逆に、感情の振り幅が大きい演技をガッツリ作り込みたい用途は、まだ人がやった方が早い場面があります。そこは期待値を分けておいた方がいいですね。
室谷室谷代表取締役
MYUUU の現場でも、説明パートだけ音声を差し替えるみたいな使い方が一番コスパがいいんですよ。全部を置き換えるというより、人がやらなくていい部分を外していくイメージ。
テキトー教師テキトー教師DotAI 認定講師
その使い方なら手戻りも減りますしね。まずは「人が読まなくていい原稿」を1本選ぶところから始めるのが現実的だと思います。

MiniMaxはどんな人に向いている?用途別の選び方

動画を作りたい人・音声を作りたい人・コーディングで使いたい人

室谷室谷代表取締役
MiniMaxという名前は一つでも、入口は用途ごとに分かれてるんですよね。動画を作りたいだけなら、Hailuo AI のブランドで出ているコンシューマー向けのサービスが最短です。

APIから呼ぶ、あるいは手元のマシンで回したいなら MiniMax H3 を触ることになる。この2つ、同じ会社の中の別の層なんで、最初に切り分けておくと迷わないです。
テキトー教師テキトー教師DotAI 認定講師
そこが最初のつまずきなんですよ。Hailuo AIはサービスの名前で、H3はモデルの名前。

指しているものが違うので、「どっちを調べればいいんだ」となりがちです。作りたい動画の解像度や長さに希望があるなら、先にモデル側の仕様を見たほうが判断が早いと思います。
室谷室谷代表取締役
音声も構造は同じです。MiniMax Audio は50以上の言語と300以上の声を持っていて、10秒ほどの音声サンプルからクローンが作れる。

しかもサインイン前でも5回は試せるので、まず自分の声で一度鳴らしてから判断すればいいんですよ。
テキトー教師テキトー教師DotAI 認定講師
コーディングなら MiniMax Code と M3 の組み合わせが本線ですね。M3はコンテキストが1Mトークンあるので、リポジトリをまとめて読ませるような使い方と相性がいい。

音楽を作りたい場合は、有料APIの新規提供が終わっているので、MiniMax Audio のサイトか、公開されているオープンウェイトの Music 3 を使う案内になっています。

最新の料金と提供状況はどこで確認するか

室谷室谷代表取締役
料金は公式で確認するのが鉄則です。プラットフォームのドキュメントに従量課金の料金ページがあって、モデルごとに料率が載っている。

個人向けのM Plan、コーディング向けのToken Planと、契約の入口も分かれているんですよね。
テキトー教師テキトー教師DotAI 認定講師
料金も提供状況も動くものだと思っておいたほうがいいですね。実際、音楽生成の有料APIは新規ユーザー向けの提供が終了していて、既存の有料ユーザーは続けられるという扱いでした。

使いたい機能が今から新規で契約できるのか、先に確認する癖をつけたいところです。
室谷室谷代表取締役
クレジットは購入から365日で切れるんですよ。検証用にまとめて買うなら、その期限から逆算してスケジュールを組む。

MYUUUでも新しいモデルを試すときは、誰がいつまでに何を確かめるかまで決めてから予算を切るようにしてます。
テキトー教師テキトー教師DotAI 認定講師
用途がまだ固まっていない人は、無料で触れる範囲を先に確認するのが一番無駄がないですね。音声ならサインイン前のトライアル、動画ならコンシューマー側のサービスから入って、物足りなくなったらAPIやプランを検討する順番が自然だと思います。

数字は必ず公式の最新ページで押さえてください。

よくある質問

Q1. MiniMaxのモデルは日本語でも自然に使える?

テキトー教師テキトー教師DotAI 認定講師
現場でよく聞くのが「日本語だと指示がうまく通るのか」という不安なんですよ。多言語を前提にしているので日本語でも動きますが、英語の方がニュアンスが乗る場面はあって、長い指示ほど言葉の選び方にコツがいります。
室谷室谷代表取締役
そこは用途次第なんですよね。日本語で書いた原稿をそのまま渡すより、動画なら情景を短く区切って投げた方が安定する。

MYUUU でも指示文は日本語のまま、分解して渡す運用にしてます。

Q2. ChatGPTやMidjourneyとどう使い分ける?

室谷室谷代表取締役
棲み分けで言うと、ChatGPTは対話とテキスト、Midjourneyは静止画、MiniMaxは動画と音声のオムニモーダル。同じ「AIで作る」でも出力の形が違うんですよね。
テキトー教師テキトー教師DotAI 認定講師
たしかに。最初に戸惑うのが「これ一本で全部済むのか」という期待なんですよ。

実際は役割が違っていて、絵コンテをChatGPT、キービジュアルをMidjourney、動かすところをMiniMax、みたいに繋ぐ人が多いです。

Q3. 手元のPCが弱くてもMiniMaxは使える?

テキトー教師テキトー教師DotAI 認定講師
ここ、ハマる人多いんですよ。ローカル実行の話を聞くと「自分のPCじゃ無理だ」と身構えるんですが、公式サービスやAPI経由なら手元のスペックは関係ありません。

重い処理は生成する側で動きますから。
室谷室谷代表取締役
そう、ローカルはあくまで選択肢のひとつなんですよ。コストと自由度のトレードオフで選ぶ話で、手元で動かしたい人だけGPUを気にすればいい。

まず触ってみるならクラウドで十分です。

Q4. APIで組み込む場合、最初に何を決める?

室谷室谷代表取締役
先に決めるのは「何を自動化するか」なんですよね。動画か音声か、それともテキストか。

出力の形が決まらないと、費用も構成も決まらないまま走り出しちゃう。
テキトー教師テキトー教師DotAI 認定講師
現場感覚で言うと、いきなり本番に繋がず、短い動画を1本作って品質と待ち時間の感覚を掴んでからです。やってみて気づくのが、思ったより1本あたりの待ち時間を意識していなかった、というパターンなんですよ。

Q5. MiniMaxの進化が速いけど、情報はどう追えばいい?

テキトー教師テキトー教師DotAI 認定講師
これは難しいところで、SNSのまとめは古い情報が混ざりやすいんですよ。モデルも料金も更新されるので、公式のドキュメントやお知らせを一次情報として見るのが結局いちばん早いです。
室谷室谷代表取締役
そう、二次情報は鮮度が落ちるんですよね。判断の前に必ず公式で確認する。

これ、AI関連は全部そうなんですけど、特に動きの速いところでは効きます。

まとめ

室谷室谷代表取締役
結局、MiniMaxって「動画と音声をまとめて扱える」ところが軸なんですよね。会社としての懐の広さと、オムニモーダルに振り切っている方向性、そこを押さえておけば迷いにくい。
テキトー教師テキトー教師DotAI 認定講師
そうですね。迷いやすいのが「どこから手を出すか」なんですが、用途をひとつ決めれば道は見えます。

動画ならH3、音声ならAudio、と選んでから料金やライセンスを確認する順番がおすすめです。
室谷室谷代表取締役
あと、ローカルかクラウドかは好みで選べばいいんですよ。手元で回したい人はGPUを、すぐ試したい人は公式やAPIを。

ROIで見るなら、まずクラウドで1本作って判断するのが早い。
テキトー教師テキトー教師DotAI 認定講師
最終的には公式の最新情報を見て、自分の用途に合うかで決めるのが確実ですね。この記事を入口に、気になった機能から触ってみてください。

Related

関連記事

New Articles

新着記事

ガイド

FLUXとは?最新のFLUX3を含む種類・料金・商用利用・使い方を解説

2026年10月9日
室谷テキトー教師
ニュース

GPT-6.1 Sol Ultrafastとは?OpenAIが最大8倍速で提供開始

2026年10月9日
室谷テキトー教師
ニュース

Nano Banana 2.1とは?Googleの新画像モデルが半額で品質向上

2026年10月9日
室谷テキトー教師
ニュース

Cline Cloud Agentsとは?ブラウザで使えるクラウド型コーディングエージェント

2026年10月9日
室谷テキトー教師
ニュース

GitHub Copilotの「ローカルサンドボックス」とは?GAで追加費用なし

2026年10月9日
室谷テキトー教師
ニュース

Perplexity Decider v1.1とは?OpenRouterで提供開始、半額・マルチモーダル化

2026年10月9日
室谷テキトー教師
ニュース

GitHub Copilotのローカルモデル自動ルーティングとは?月末提供の仕組み

2026年10月9日
室谷テキトー教師
ニュース

ElevenLabsの「Brand Kit」とは?ElevenCreativeに追加されたブランド一貫性の仕組み

2026年10月9日
室谷テキトー教師
ニュース

Perplexityの「pplx-embed-v2-late」とは?OCR不要のマルチモーダル埋め込みモデル

2026年10月9日
室谷テキトー教師
ニュース

OpenAIのChatGPTプラグイン拡張とは?サイドバー起動と@メンション追加

2026年10月9日
室谷テキトー教師

Join

AIプレナーになる。

入会は審査制です。いまの事業と、AIで何を動かしたいのかを聞かせてください。

参加を申請する