Kimi K3とはどんなモデル?まず結論から
結論:Moonshot AIが2026年7月16日に出した2.8兆パラメータの旗艦モデル
室谷代表取締役Kimi K3、Moonshot AIが2026年7月16日に発表したフラッグシップなんですよ。2.8兆パラメータのMoEで、コンテキストは約100万トークン。
オープン側から出てきた中では最大級のモデルです。
オープン側から出てきた中では最大級のモデルです。
テキトー教師DotAI 認定講師たしかに。最初に戸惑うのが「これ、どこの会社のモデルなのか」というところで。
中国のMoonshot AIですよ、という説明から入ることが多いんですよ。
中国のMoonshot AIですよ、という説明から入ることが多いんですよ。
室谷代表取締役そうなんですよね。GPTやClaudeと同じ土俵に、オープンな立場で入ってきた構図。
業界的にはここが一番おもしろくて、これまで閉じた側が握っていた前提に風穴を開けにきてるわけです。
業界的にはここが一番おもしろくて、これまで閉じた側が握っていた前提に風穴を開けにきてるわけです。
テキトー教師DotAI 認定講師しかも「世界初のオープンな3Tクラスモデル」という立ち位置で名乗ってきてますからね。攻めてるなと。
背景の競争環境はMoonshot AI、Kimi K3無料公開:WPが分析する競争の必然で解説されています。
背景の競争環境はMoonshot AI、Kimi K3無料公開:WPが分析する競争の必然で解説されています。
中身は何でできているのか
室谷代表取締役構造も独特で、896個のエキスパートのうち1トークンあたり16個だけを活性化するStable LatentMoE。独自のKimi Delta AttentionとAttention Residualsを土台に、前世代のK2比でスケーリング効率が約2.5倍になったと説明してます。
テキトー教師DotAI 認定講師数字だけ聞くともう「すごい」で終わりがちなんですけど、現場感覚で言うと、要は大きさの割に軽く動く設計にしたという話で。全部のエキスパートを使わないから、推論コストがそのまま膨らまない。
室谷代表取締役そこが経営目線で効くところなんですよ。同じ性能を出すのに必要な計算資源が減るなら、それは単価の話に直結する。
しかもオープンなので、自前でホストする選択肢まで出てくるわけです。
しかもオープンなので、自前でホストする選択肢まで出てくるわけです。
テキトー教師DotAI 認定講師画像や動画も後付けじゃなくモデルに統合されてる、というのも大きいですね。別のモデルを挟まなくていいのは、実際に触ると差が出ます。
ChatGPTやClaudeと並べたときの位置
テキトー教師DotAI 認定講師公式の言い方だと、全体性能はClaude Fable 5とGPT-5.6 Solに次ぐ水準で、他の試験モデルは一貫して上回った、という整理なんですよね。
室谷代表取締役ただ、ここは冷静に見たほうがよくて。各社のベンチは評価に使うハーネスも条件も揃ってないので単純比較はできない、と公式自身も注記してます。
意思決定の場で「ベンチ1位だからこれ」は危ないんですよ。
意思決定の場で「ベンチ1位だからこれ」は危ないんですよ。
テキトー教師DotAI 認定講師たしかに、順位表だけ持ち帰っても判断はできないですね。だから最初に押さえるべきは、誰がいつ出して、どういう立ち位置のモデルなのかという3点。
そこさえ分かれば、あとは自分の用途で考えられますから。
そこさえ分かれば、あとは自分の用途で考えられますから。
Kimi K3の性能とスペックはどこが新しい?
2.8兆パラメータのMoEと、1トークンあたり16エキスパートの選び方
室谷代表取締役まず数字の見た目に引っ張られないほうがいいんですよね。総パラメータ2.8兆で、896個のエキスパートのうち1トークンあたり16個だけを活性化するStable LatentMoE構成。
要は毎回全部を動かしてるわけじゃない、と。
要は毎回全部を動かしてるわけじゃない、と。
テキトー教師DotAI 認定講師そこ、初めて触る人がいちばん誤解するポイントです。「2.8兆」と聞いた瞬間に、自分の環境では絶対に無理だと身構える。
でも計算に実際に使われるのは一部だけ、という仕組みの違いなんですよね。
でも計算に実際に使われるのは一部だけ、という仕組みの違いなんですよね。
室谷代表取締役前世代のKimi K2と比べて約2.5倍のスケーリング効率を実現した、という説明がついてます。同じ計算資源から引き出せる性能が増えるという話なので、ここは経営目線で見ても無視できない部分です。
テキトー教師DotAI 認定講師巨大さの自慢に見えて、中身は「太らせ方の設計」の話なんですよ。そこを押さえると、後ろのコンテキストや料金の話もすっと入ってきます。
約100万トークンのコンテキストで変わること
室谷代表取締役コンテキストは最大1,048,576トークン、約100万トークンです。大規模なリポジトリを丸ごと読ませるような使い方が現実味を帯びてくる。
MYUUUの現場でも、仕様とコードを小分けにして渡す手間が減るなら、そこは工程の短縮になりますからね。
MYUUUの現場でも、仕様とコードを小分けにして渡す手間が減るなら、そこは工程の短縮になりますからね。
テキトー教師DotAI 認定講師現場でよく聞くのは「長く入れると途中の指示を忘れる」という不満なんですけど、その辺りがどこまで改善されているかは、実際に自分の題材で試して確かめるしかないです。数字だけでは体感は分からないですから。
室谷代表取締役ただ、長い文脈はAPIの料金と直結します。キャッシュが効くかどうかで原価が変わるので、導入するなら費用対効果の前提に置いておきたい。
Mooncakeという分散推論基盤でコーディング用途のキャッシュヒット率90%超を狙う設計、という説明もそこに効いてきます。
Mooncakeという分散推論基盤でコーディング用途のキャッシュヒット率90%超を狙う設計、という説明もそこに効いてきます。
ネイティブビジョンとKDA・AttnResが効いてくる場面
室谷代表取締役画像や動画を後付けでなくモデルに統合したネイティブビジョンも今回の特徴です。公式では動画編集まわりの用途が挙がっていて、別モデルに説明させてから渡す二段構えが要らなくなる。
テキトー教師DotAI 認定講師そこが実は大きいんですよ。最初に戸惑うのが「どこまでを一つのモデルに任せていいのか」という線引きで、間に別のモデルを挟まなくていいなら、設計そのものがシンプルになります。
室谷代表取締役土台にはKimi Delta AttentionとAttention Residualsという独自の仕組みがあって、長い文脈を扱うときの効率に関わってくる。中身を追うより、どの場面で差が出るかを見るほうが実務的です。
テキトー教師DotAI 認定講師そうですね。公式もベンチマークは評価条件が揃っておらず単純比較はできないと注記していて、実際の順位付けより自分の用途で試すのが早いと思います。
3Tクラスのオープンモデルが出てきた、という競争環境の変化も含めて、まず触ってみるのが分かりやすいですね。
3Tクラスのオープンモデルが出てきた、という競争環境の変化も含めて、まず触ってみるのが分かりやすいですね。
Kimi K3で実際に何ができる?
長時間コーディングと大規模リポジトリの横断理解
室谷代表取締役一番インパクトが大きいのは長時間コーディングなんですよね。大規模なリポジトリを横断して理解したまま、GPUカーネルの最適化まで踏み込む。
ゼロからGPUコンパイラ「MiniTriton」を書き上げた例まで発表で出てきてます。
ゼロからGPUコンパイラ「MiniTriton」を書き上げた例まで発表で出てきてます。
テキトー教師DotAI 認定講師現場でよく聞くのは「何時間も走らせ続けるって、どういう状態なんですか?」という戸惑いです。48時間の自律実行でチップ設計まで進めた例は、もう人間が横でずっと見ている前提じゃないんですよ。
室谷代表取締役ただ、思考履歴の引き継ぎに敏感らしくて。対応した環境以外でセッションの途中から乗り換えると、生成品質が不安定になる。
長く走らせるなら最初から同じ環境で通すのが前提なんですよね。
長く走らせるなら最初から同じ環境で通すのが前提なんですよね。
テキトー教師DotAI 認定講師そうですね。長く任せるほど途中の設計判断が効いてくるので、どこまで任せるかを最初に決めておくのが大事になります。
調査レポート・プレゼン資料・ダッシュボードの作成
室谷代表取締役コーディングだけじゃなくて、調査レポートやプレゼン資料、インタラクティブなダッシュボードまで作れるんですよ。Kimi WorkのWidgetsとDashboard機能で、数字が動く資料がそのまま出てくる。
テキトー教師DotAI 認定講師初めて触る人が驚くのがそこなんですよ。文章を書く延長で表やグラフまで一気に組み上がるので、資料づくりの工程そのものが短くなる感覚があります。
室谷代表取締役動画編集も、56素材からティザーを組む例が紹介されてました。ゲームや3Dワールド、アニメーションの生成も含めると、出力の幅がかなり広いんですよね。
テキトー教師DotAI 認定講師一方で、指示が曖昧だと意図を超えて先回りして動くこともあるらしく。何を作るかを先に固めてから渡す方が安定します。
Agent Swarmでエージェントを並列に走らせる
室谷代表取締役3つ目がAgent Swarmで、複数のエージェントを並列に走らせる使い方です。公式ドキュメントの範囲では最大300体、1タスクあたり4,000回を超えるツール呼び出しまで対応すると紹介されています。
テキトー教師DotAI 認定講師たしかに、並列に走らせる前提になると「1つのチャットと会話する」感覚とは別物になりますね。役割を分けて投げる設計が要ります。
室谷代表取締役MYUUUの現場でも、まずタスクを分解する人がいないと並列化は回らないんですよ。エージェントの数を増やす前に、分解の粒度を揃えるほうが効いてくる。
テキトー教師DotAI 認定講師段取りの質がそのまま出る、ということですね。ここは料金の話とも直結するので、そちらはまた別の章で見ていきましょう。
Kimi K3はどこから使える?日本語対応は?
Webとモバイルアプリ、入口はどこにある
室谷代表取締役まず入口の整理から。Kimi K3はKimi.comのWeb、それからiOS・Android・HarmonyOSのモバイルアプリ、同じアカウントで触れるんですよね。
ここは素直に使いやすい。
ここは素直に使いやすい。
テキトー教師DotAI 認定講師初めて触る人はだいたいブラウザからです。インストールも要らず、開いて聞けば返ってくる。
つまずく場所がほぼないんですよ。
つまずく場所がほぼないんですよ。
室谷代表取締役入口を複数用意してるのは意図があって。スマホで思いつきを投げて、PCで続きをやる、という動線を最初から想定してるんですよね。
アプリ前提の設計が徹底されてる。
アプリ前提の設計が徹底されてる。
テキトー教師DotAI 認定講師ただ、逆に「どこが本体なの」と迷う人もいます。普段スマホならアプリ、長文を書くならWeb、くらいの分け方で十分だと思います。
デスクトップアプリKimi Workでできること
室谷代表取締役デスクトップ側はKimi Workという専用アプリがあって、WindowsとAppleシリコンのMac、v3.1.0以降で使えるんですよ。
テキトー教師DotAI 認定講師現場でよく聞くのは「チャットと何が違うんですか」なんですよね。Kimi Workだと調査レポートやプレゼン資料、インタラクティブなダッシュボードまで作れます。
WidgetsとDashboardの機能が付いてます。
WidgetsとDashboardの機能が付いてます。
室谷代表取締役ここは経営目線で見ると分かりやすくて、資料作成の一次工程をまるごと任せられるか、という話なんですよ。下書きが数十秒で出るなら、人は判断だけに時間を使える。
テキトー教師DotAI 認定講師ただ、最初から全部任せるのはハードルが高いです。まず1枚もののレポートを1本作らせてみる、くらいが入りやすいと思います。
Kimi Codeをターミナル・VS Code・Cursorから使う
- Kimi Codeをターミナル、またはVS Code・Cursorに導入する
- 起動して「/model」コマンドを実行する
- 一覧からK3を選ぶ
室谷代表取締役コーディング派はKimi Codeが本命なんですよね。ターミナルでもVS CodeでもCursorでも動く。
切り替えは「/model」でK3を選ぶだけです。
切り替えは「/model」でK3を選ぶだけです。
テキトー教師DotAI 認定講師最初に戸惑うのが、モデル選択を忘れて別のものが動いてるパターンです。「なんか弱いな」と思ったら「/model」を見る、と覚えておくと安心ですよ。
室谷代表取締役既存のエディタに乗る形なので、開発フローを組み替えずに試せるのが効くんですよね。ツールを移すコストって、地味に一番重いので。
テキトー教師DotAI 認定講師そうですね。まず1つのリポジトリで、レビューだけK3にやらせてみる、みたいな入り方が安全だと思います。
日本語で使うときの感覚と日本からの利用
テキトー教師DotAI 認定講師「日本語で大丈夫なのか」は最初に気になるところです。公式サイトに日本語のページが用意されているので、日本語話者向けの案内はされている、と見ていいと思います。
ただ出力の自然さは用途で差が出るので、自分の業務文書を1本通してみるのが一番早いです。
ただ出力の自然さは用途で差が出るので、自分の業務文書を1本通してみるのが一番早いです。
室谷代表取締役日本から使えるかについても、公式の案内に特別な制限の話は出てこないですね。契約主体がシンガポール法人になっている点は、業務で使うなら把握しておいたほうがいい。
データの扱いは別の章で触れますけど、規約は自分で読むのが前提です。
データの扱いは別の章で触れますけど、規約は自分で読むのが前提です。
テキトー教師DotAI 認定講師個人で試すなら、まず無料の範囲で日本語を投げてみる、で十分だと思います。重い判断はそこからで遅くないです。
Kimi K3の料金はいくら?プラン名が変わっている点に注意
無料のAdagioでどこまで使えるのか
室谷代表取締役まず一番下、無料プランのAdagioですね。$0で、料金体系のいちばん下に置かれてる枠です。
どの機能がどこまで開いてるかは、公式の料金ページにある機能比較表を見るのが確実で・・・
どの機能がどこまで開いてるかは、公式の料金ページにある機能比較表を見るのが確実で・・・
テキトー教師DotAI 認定講師たしかに。初めて触る人は「無料だと何ができないのか」から知りたがるんですよ。
ただ、いちばん大きい線引きは超長文チャットで、それは無料の範囲には入っていないんです。
ただ、いちばん大きい線引きは超長文チャットで、それは無料の範囲には入っていないんです。
室谷代表取締役そうなんですよね。1Mトークンの超長文チャット、いわゆるK3 Extra Long chat capacityは無料プランの対象外。
この境界は後半でもう一度触れますけど、無料のままだと長いコードベースを丸ごと読ませる使い方には届かない、という理解でいいと思います。
この境界は後半でもう一度触れますけど、無料のままだと長いコードベースを丸ごと読ませる使い方には届かない、という理解でいいと思います。
テキトー教師DotAI 認定講師最初に戸惑うのがまさにそこなんですよ。「とりあえず無料で様子を見よう」は正解なんですけど、そのまま業務の長文処理まで行けるかというと、別の話になります。
現行4プランの月額と年払い
Kimi K3 プラン別 料金と1Mトークン超長文チャット対応
| プラン | 月払い | 年払い(月額換算) | 年額 | 1Mトークン超長文チャット |
|---|---|---|---|---|
| Adagio(無料) | $0 | - | - | × |
| Plus(旧Moderato) | $19 | $15 | $180 | × |
| Pro(旧Allegretto) | $39 | $31 | $372 | × |
| Max(旧Allegro) | $99 | $79 | $948 | ○ |
| Ultra(旧Vivace) | $199 | $159 | $1,908 | ○ |
テキトー教師DotAI 認定講師現行の有料プランは4つで、並びはこうなっています。
| プラン | 月払い | 年払い(月額換算) | 年額 |
|---|---|---|---|
| Plus | $19 | $15 | $180 |
| Pro | $39 | $31 | $372 |
| Max | $99 | $79 | $948 |
| Ultra | $199 | $159 | $1,908 |
室谷代表取締役年払いにするとどのプランも2割前後安くなる計算で、ヘビーに使う人ほど年払いのリターンが効いてくるんですよね。ただ、いきなり年額を払う判断は経営側でも慎重になります。
テキトー教師DotAI 認定講師現場感覚でも、最初から年払いを選ぶ人は少ないんですよ。まず月払いで自分の使用量を測ってから、足りているのを確認して切り替える。
その順番のほうが失敗が少ないです。
その順番のほうが失敗が少ないです。
旧名称との対応:Moderato→Plus、Allegretto→Pro、Allegro→Max、Vivace→Ultra
室谷代表取締役ここが今日いちばん伝えたいところで。2026年の7月から9月にかけて出た記事だと、Moderato、Allegretto、Allegro、Vivaceという名前で紹介されてるんですよ。
テキトー教師DotAI 認定講師ああ、それで混乱する人が多いんです。価格は1ドルも変わってなくて、名前だけ付け替わっているんですよね。
室谷代表取締役そうなんです。ModeratoがPlus、AllegrettoがPro、AllegroがMax、VivaceがUltra。
$19、$39、$99、$199という金額の並びはそのままです。古い記事の価格表を信じても金額は合ってるのに、今の公式サイトで同じ名前を探すと見つからない、という状態なんですよね。
$19、$39、$99、$199という金額の並びはそのままです。古い記事の価格表を信じても金額は合ってるのに、今の公式サイトで同じ名前を探すと見つからない、という状態なんですよね。
テキトー教師DotAI 認定講師なので「Allegrettoって今どこにあるの?」と名前を追いかけるより、金額の数字で対応を取るのが早いです。$39の枠は今はPro、と覚え方も変えたほうがいいですね。
1Mトークンの超長文チャットが付くのはどのプランからか
室谷代表取締役で、さっき触れた超長文チャットの線引きです。1Mトークンの超長文チャットが付いてくるのはMaxとUltraだけ。
PlusとProには含まれていないんですよね。
PlusとProには含まれていないんですよね。
テキトー教師DotAI 認定講師ここ、料金表を横目で見てると見落としやすいんですよ。金額だけ追うと「Proで足りそう」に見えるのに、長文を扱う前提にすると一段上が必要になる。
室谷代表取締役経営目線で言うと、Maxの月$99を「高い」と見るか「長文コンテキスト込みの値段」と見るかで判断が変わるんですよ。大規模なリポジトリを丸ごと読ませる運用なら、下のプランを複数契約するよりMax一本のほうが収まる、という見方もできます。
テキトー教師DotAI 認定講師逆に長文を扱わないなら、無理に上げなくていいと思います。機能比較表を開いて、自分の使い方に関係する行だけ追いかけるのが確実です。
Kimi K3のAPI料金と、呼び出し方の実際
キャッシュヒット・キャッシュミス・出力の単価をどう読むか
まとめ
Kimi K3 APIの料金と呼び出しの要点
- APIは1Mトークンあたりの従量課金。キャッシュヒット入力0.30ドル、キャッシュミス入力3.00ドル、出力15.00ドルで、入力の当たり外れで10倍の差
- キャッシュ書き込み料金は保持5分で3.00ドル、1時間で6.00ドル。ヒットした分には書き込み料金はかからない
- Web検索は1回の呼び出しごとに0.004ドル。単価は安いがエージェントが何十回も調べると積み上がる
- Mooncakeの分散推論基盤でキャッシュを効かせ、コーディング用途ではヒット率が9割超と説明されている
- 呼び出し手順は、APIキー発行→OpenAI SDK(1.0.0以降)用意→base_urlをapi.moonshot.ai/v1に差し替え→modelにkimi-k3を指定
- Chat Completions APIとResponses APIがOpenAI互換で、キーと接続先を変えるだけで動く
- reasoning_effortはlow/high/maxに対応し既定はmax。画像は4K以下、動画は1080p以下が推奨で、繰り返し参照する素材はファイルアップロードにする
- Messages APIがAnthropic互換でClaude Code系からも接続可能だが、思考履歴の引き継ぎに敏感で途中切り替えは出力が不安定になりやすい。最初からK3で通すのが安全
室谷代表取締役APIは1Mトークンあたりの従量課金で、キャッシュにヒットした入力が0.30ドル、ヒットしなかった入力が3.00ドル、出力が15.00ドル。入力の当たり外れで10倍違うんですよ。
テキトー教師DotAI 認定講師初めて触る人が一番戸惑うのがそこですね。「キャッシュって何をしてるんですか」と必ず聞かれます。
同じ長いコンテキストを何度も投げるときに効く仕組みだと捉えると分かりやすいです。
同じ長いコンテキストを何度も投げるときに効く仕組みだと捉えると分かりやすいです。
室谷代表取締役書き込み側の料金もあって、保持5分なら3.00ドル、1時間なら6.00ドル。ヒットした分には書き込み料金はかからない、という建付けなんですよね。
テキトー教師DotAI 認定講師現場感覚で言うと、長いコードを毎回丸ごと読ませる使い方だと、この差がそのまま請求額に出ます。逆に一言だけ聞く使い方だと、あまり気にしなくていい。
Web検索の追加料金とMooncakeのキャッシュ設計
室谷代表取締役Web検索を使うと1回の呼び出しごとに0.004ドル。単価だけ見ると安いんですけど、エージェントに何十回も調べさせると積み上がるんですよ。
時給換算の話と同じで、回数で効いてくるタイプのコストです。
時給換算の話と同じで、回数で効いてくるタイプのコストです。
テキトー教師DotAI 認定講師一方で、Moonshot側がMooncakeという分散推論基盤でキャッシュを効かせていて、コーディング用途ではヒット率が9割を超えると説明されています。
室谷代表取締役そこが設計のうまいところで、コーディングみたいに同じ前提を共有し続ける作業ほど単価が下がる。業界構造としても、重みを小さくする競争より「どう安く回すか」に投資が移ってる印象です。
モデル名kimi-k3とベースURL、OpenAI SDKからの呼び出し
室谷代表取締役呼び出しは既存のコードからの乗り換えがかなり素直です。手順を並べるとこうなります。
- Kimi OpenPlatform でAPIキーを発行する
- OpenAI SDK(1.0.0以降)を用意する
- base_url を
api.moonshot.ai/v1に差し替える(httpsのAPIエンドポイントで、ブラウザで開くページではありません) - model に
kimi-k3を指定して呼ぶ
テキトー教師DotAI 認定講師Chat Completions APIとResponses APIがOpenAI互換なので、キーと接続先を変えるだけで動くのは大きいですね。既存のコードをほぼ触らないで試せます。
室谷代表取締役細かいところだと reasoning_effort が low / high / max に対応していて、既定は max。中身の作り込み度を変えられるパラメータです。
テキトー教師DotAI 認定講師画像は4K以下、動画は1080p以下が推奨で、繰り返し参照する素材はファイルアップロードにする。最初に戸惑うのがこの辺の使い分けなんですよ。
Anthropic互換でClaude Code系からつなぐときの注意
室谷代表取締役Messages APIがAnthropic互換なので、Claude Code系の環境からも接続できます。ただ、ここは素直に置き換えれば済む話ではないんですよね。
テキトー教師DotAI 認定講師たしかに。思考履歴の引き継ぎに敏感で、対応している環境以外でセッションの途中から切り替えると出力が不安定になりやすいと公式も認めています。
室谷代表取締役だから運用でカバーするなら、途中で差し替えるのではなく最初からK3で通す。乗り換えコストを見るなら、そこを前提に組んだほうが結果的に安く済みます。
Kimi K3はオープンソース?ローカルで動かすのは現実的か
Hugging Faceでのウェイト公開とKimi K3 License
室谷代表取締役Kimi K3、発表されたときは「完全なモデルウェイトは7月27日までに公開予定」という話だったんですよね。で、今はそこが動いていて、公式のモデルページには完全なモデルウェイトがHugging Faceで公開され、ウェイトとコードはいずれもKimi K3 Licenseのもとで提供されている、と明記されています。
テキトー教師DotAI 認定講師そこ、古い記事のまま止まってる人が多いんですよ。「オープンになる予定らしいけど、まだでしょ」という認識で。
実際はライセンス条項に従えば、実行もデプロイもファインチューニングも改変もできる形になっています。
実際はライセンス条項に従えば、実行もデプロイもファインチューニングも改変もできる形になっています。
室谷代表取締役公開の裏でどんな競争が起きていたかは、Moonshot AI、Kimi K3無料公開:WPが分析する競争の必然で解説しています。で、経営の目線で言うと、この「オープン」という言葉の意味が昔と全然違うんですよ。
ウェイトが手元にあるということは、調達先を自分で選べるということで、特定ベンダーの値上げに全部乗る必要がなくなる。
ウェイトが手元にあるということは、調達先を自分で選べるということで、特定ベンダーの値上げに全部乗る必要がなくなる。
テキトー教師DotAI 認定講師ただ、手元に置けることと動かせることは別で。そこが今回いちばん大きな落とし穴なんですよね。
MXFP4量子化でも重みは約1.4TBという壁
Kimi K3の実行環境:公式想定 vs 個人環境の事例
公式が推奨する構成
- 64基以上のアクセラレータを使うスーパーノード構成
- 想定はデータセンター側
- MXFP4量子化でも重みは約1.4TB(FP16換算で約5.6TB)
- 2.8兆パラメータ
個人環境で試す事例
- GitHubのC言語製推論エンジン kimi-k3-in-c
- GPUなしでディスクから重みを読み込む方式
- Starは約8,500
- ピークRAMは約8.24GB
- 重みは約1.56TB
- 124コア環境でメモリを絞ると1トークンあたり約26.5秒
- X上の紹介投稿ベースのコミュニティ事例(公式発表ではない)
テキトー教師DotAI 認定講師実際どれくらい重いかというと。K3は2.8兆パラメータで、MXFP4という4bitの量子化を掛けても重みだけで約1.4TB。
量子化前のFP16換算だと約5.6TB相当になります。
量子化前のFP16換算だと約5.6TB相当になります。
室谷代表取締役しかもその量子化、あとから誤差を削ってるんじゃなくて、学習の段階から量子化を含めて最適化しているんですよね。それでも1.4TB。
手元のSSDに置く時点で、もう一般的なノートPCの話じゃない。
手元のSSDに置く時点で、もう一般的なノートPCの話じゃない。
テキトー教師DotAI 認定講師初めて触る人ほど「量子化=軽い」で止まりがちなんですけど、4bitにしてもこの規模だと単位がTBなんですよ。桁がひとつ違う。
室谷代表取締役だから「オープンだからローカルで無料」という期待は、ここで一回折れるんですよね。無料で配られているのは重みであって、動かす側の計算資源はこっち持ちですから。
公式が推奨する64基以上のアクセラレータ構成
室谷代表取締役さらにMoonshot自身が推奨しているのが、64基以上のアクセラレータをつないだスーパーノード構成なんですよ。要はデータセンター前提の想定です。
テキトー教師DotAI 認定講師1台のマシンに載せる話じゃないんですね。ここで「自分でホストする」のハードルが一気に上がります。
室谷代表取締役企業でセルフホストを検討するなら、これは調達の意思決定の話になります。機材を積むのか、APIに払うのか。
API側は従量課金なので、社内の利用量が読めるなら比較はできるんですけど、64基規模を自前で持つ判断はよほどの理由がないと出てこないですよね。
API側は従量課金なので、社内の利用量が読めるなら比較はできるんですけど、64基規模を自前で持つ判断はよほどの理由がないと出てこないですよね。
テキトー教師DotAI 認定講師はい、そこは「安いから自前」で済む規模じゃないですね。
個人環境で試すときの現実的な線引き
テキトー教師DotAI 認定講師個人で試す話に降りると、まずフルモデルは無理という前提です。その上で面白い例があって。
GitHubで公開されているkimi-k3-in-cというC言語製の推論エンジン(Star約8,500)が、GPUなしでディスクから重みを読み込む方式でKimi K3を動かしています。作者の計測ではピークRAMが約8.24GB。
一方で重みは約1.56TBあって、124コア環境でメモリを絞ったときは1トークンあたり約26.5秒かかったと報告されています。ただこれはX上の紹介投稿で広まったコミュニティ事例で、公式発表ではないんですよ。
GitHubで公開されているkimi-k3-in-cというC言語製の推論エンジン(Star約8,500)が、GPUなしでディスクから重みを読み込む方式でKimi K3を動かしています。作者の計測ではピークRAMが約8.24GB。
一方で重みは約1.56TBあって、124コア環境でメモリを絞ったときは1トークンあたり約26.5秒かかったと報告されています。ただこれはX上の紹介投稿で広まったコミュニティ事例で、公式発表ではないんですよ。
室谷代表取締役動いてはいるけど、会話にはならない数字ですね。線引きとしては、フルモデルを自前で動かすのは諦めて、API経由で触るのが現実的。
手元で試したいなら、そういう実験として眺める、くらいの距離感が正確なんですよ。
手元で試したいなら、そういう実験として眺める、くらいの距離感が正確なんですよ。
テキトー教師DotAI 認定講師「8GBで動く」という部分だけが独り歩きしやすいので、そこは分けて受け取ってほしいんですよね。
室谷代表取締役デモが動くことと実務で使えることの間には谷がある、というのは投資判断でも同じで。今回のは完全に前者です。
他モデルとの比較・制限・企業利用で気をつけること
ベンチマークの数字をそのまま比較できない理由
室谷代表取締役ベンチマークの順位、あれをそのまま信じるのは危ないんですよね。公式も脚注で認めてますけど、各社の評価条件が揃ってないんですよ。
使ってる harness が Kimi Code だったり Claude Code だったり Codex だったりでバラバラで。
使ってる harness が Kimi Code だったり Claude Code だったり Codex だったりでバラバラで。
テキトー教師DotAI 認定講師そこ、初めて触る人が一番つまずくところです。数字だけ見て「こっちが上だ」って結論を出しちゃうんですよね。
室谷代表取締役公式の言い方も「全体は Claude Fable 5 や GPT-5.6 Sol に次ぐが、他の試験モデルは一貫して上回った」という整理なんです。ただ LMArena のフロントエンドコードの順位では1位、みたいに指標によって見え方が変わるんですよね。
テキトー教師DotAI 認定講師人間の好みで選ぶランキングと、標準化された総合指標だと顔が違う。自分の業務に近いタスクで試すのが結局は一番早いんですよ。
公式が認めている3つの弱点(思考履歴・自発性・会話UX)
テキトー教師DotAI 認定講師公式が Limitations として挙げてる内容が正直で。1つ目は思考履歴の引き継ぎに敏感なこと。
対応している harness 以外でセッション途中に切り替えると、出力が不安定になりうるんですよ。
対応している harness 以外でセッション途中に切り替えると、出力が不安定になりうるんですよ。
室谷代表取締役2つ目が過度な自発性。曖昧な指示や小さな問題に対して、こちらの意図を超えて先回りした動きを取ることがあるから、システムプロンプトや AGENTS.md に制約を明記しろと。
これ、放置すると事故るやつです。
これ、放置すると事故るやつです。
テキトー教師DotAI 認定講師3つ目が会話の使い勝手。ベンチマーク上の実力に対して、Claude Fable 5 や GPT-5.6 Sol に見劣りする場面があると、公式自身が認めてます。
室谷代表取締役数字が強いイコール使いやすい、じゃないんですよね。使う側の整備がセットで要る。
コンシューマ向けとAPIで違うデータの扱い
室谷代表取締役企業で一番効くのがここで。Kimi.com やアプリに入れた内容は、Moonshot AI のプライバシーポリシー上、モデルの学習・最適化に利用すると明記されてるんです。
テキトー教師DotAI 認定講師しかも、学習利用だけを止めるオプトアウトがポリシー上は確認できない、と。ここは規約の読み込みが必須なんですよ。
室谷代表取締役API 側も、デフォルトだとサービスの開発・改善にコンテンツを使える建付けで、制限するには個別のエンタープライズ契約や書面合意が要る。契約主体はシンガポール法人で、保存先もシンガポールと規約に書かれてます。
テキトー教師DotAI 認定講師OpenAI や Anthropic の API がデフォルトで学習に使わない設計なのと、そこが明確に違うんですよね。機密情報やソースコードを軽い気持ちで入れるのは危ないです。
業務で使う前に決めておきたい運用ルール
室谷代表取締役なので導入前に決めるべきは、まず入力してはいけない情報の線引き。機密情報、個人情報、自社のソースコードは投げない、を基本にする。
テキトー教師DotAI 認定講師あとは推論の強度ですね。reasoning_effort は low・high・max に対応していて、既定が max なので、現時点だと max 中心の運用になりがちなんですよ。
室谷代表取締役コスト目線で言うと、全部を max で回す前提の見積もりは置いておいて、まずは限定的なチームで試す。規約は変更されうるので、契約前に原文を読むのが前提です。
テキトー教師DotAI 認定講師学習利用や保存先の扱いは、利用規約とプライバシーポリシーの原文で確認する。ここを飛ばさないのが一番大事です。
よくある質問
Q1. Kimi K3とKimi K2はどこが変わったの?
室谷代表取締役ここ、よく聞かれるんですよね。K2とK3は同じ系列の別世代という位置づけで、規模の話として2.8兆パラメータという数字がまず話題になっています。
ただ細かい比較は発表条件が世代ごとに違うので、公式の一次情報を見たほうが確実です。
ただ細かい比較は発表条件が世代ごとに違うので、公式の一次情報を見たほうが確実です。
テキトー教師DotAI 認定講師現場でよく聞くのは「K2で覚えた使い方は通用するの?」という点なんですよ。同じ系列の新しい世代という捉え方でいいと思うので、細かい挙動は実際に触って確かめるのが早いと思います。
Q2. 料金や仕様の変更はどこで追えばいい?
室谷代表取締役料金プランの名前が変わったタイミングで、古いまとめ記事が一気に陳腐化したんですよね。数字を見るときは公式ページを一次情報にする、これが一番安上がりなんですよ。
テキトー教師DotAI 認定講師たしかに。検索で上に出てくる比較記事は更新が止まっているものが多いので、そこは注意が必要です。
最初に公式を見るクセをつけておくと、後で混乱しにくくなります。
最初に公式を見るクセをつけておくと、後で混乱しにくくなります。
Q3. 出力をそのまま仕事で使うとき、どこまで人がチェックすべき?
テキトー教師DotAI 認定講師最初に戸惑うのが、出てきた文章が自然すぎてそのまま出したくなる点なんですよ。固有名詞や数字は人が確認する前提で使うと、安心して使えます。
室谷代表取締役MYUUU の現場でも、AIの出力は下書きで最終チェックは人がやる、という前提にしてます。ここを曖昧にすると、後から戻ってくる手戻りのコストのほうが大きいんですよね。
Q4. Kimi K3は商用利用できる?
室谷代表取締役これは2つに分けて考えるといいんですよ。Kimi.com や Kimi Work、API 経由で作った成果物をサービスに使う話と、公開されているモデルの重みを自社で展開する話は、見るべきルールが別なんですよね。
テキトー教師DotAI 認定講師たしかに。前者は各サービスの利用規約の範囲内で、という整理になります。
後者は Kimi K3 License の条件に従う形になるので、改変や再配布まで考えているならライセンス原文を確認する必要があります。
後者は Kimi K3 License の条件に従う形になるので、改変や再配布まで考えているならライセンス原文を確認する必要があります。
室谷代表取締役そう、ここは曖昧なまま進めるのが一番危ない。判断に迷うなら、原文をそのまま法務に持っていくのが最短なんですよ。
Q5. パラメータ数が多いほど賢いの?
テキトー教師DotAI 認定講師ここ、誤解されやすいところなんですよね。パラメータの数はモデルの規模を示す数字であって、大きければ必ず良いという単純な話ではないんですよ。
学習のさせ方や設計の違いも効いてきます。
学習のさせ方や設計の違いも効いてきます。
室谷代表取締役そうなんですよね。2.8兆という数字はインパクトが強いんですけど、実際に効くのは自分の用途で出力が使えるかどうか。
規模は話題として大きい、くらいの捉え方がちょうどいいと思います。
規模は話題として大きい、くらいの捉え方がちょうどいいと思います。
まとめ
テキトー教師DotAI 認定講師ここまでで、Kimi K3の立ち位置と、料金まわりが動いていること、商用利用の考え方が見えてきた感じです。
室谷代表取締役MYUUU 的に言うと、まず公式の一次情報を押さえて、小さく試してから判断する、この順番が一番コストが低いんですよね。数字だけを追いかけると迷子になります。
テキトー教師DotAI 認定講師たしかに。最初に戸惑うのが「今見ている情報は最新なのか」という点なので、公式を見るクセさえつけば、あとは自分の用途で触ってみるのが早いです。
室谷代表取締役そうそう。ツールは使ってナンボなので、迷ったら触ってみるのがいいと思います。
商用利用の細かい条件だけは、原文を確認するのを忘れずに。
商用利用の細かい条件だけは、原文を確認するのを忘れずに。
