2026年10月9日

Unslothの「決定モデル」訓練機能とは?4GB VRAMでLLMを判断モデルに

室谷室谷代表取締役
Unsloth(アンスロス)が、任意のLLMを確率付きの「決定モデル」に変換できるオープンソースの訓練スタックを公開したんですよね。これ、地味にすごい話で。
テキトー教師テキトー教師DotAI 認定講師
そうなんですよ。決定モデルは、Unslothが公開した、テキストを生成するのではなく与えられた選択肢から「どれを選ぶか」を確率付きで返すモデルで、Qwen3.8やGemma 4といったLLMを訓練で決定モデルに変換できます。
室谷室谷代表取締役
まず何が発表されたかを整理したいんですけど、Unslothは自社のオープンソースリポジトリで、LLMを決定モデルにファインチューニングする機能を追加した、と。
テキトー教師テキトー教師DotAI 認定講師
はい。Unsloth Desktopアプリとオープンソースのトレーニングスタックの両方に、決定モデルのファインチューニングが追加された、というのが今回の発表の核です。
室谷室谷代表取締役
数字がまた強いんですよね。Qwen3.5 0.8Bの総合精度を、3つの決定ベンチマークで20.7%から74.3%に引き上げた、と。

しかも4GB VRAMで。
テキトー教師テキトー教師DotAI 認定講師
そこが今回いちばん刺さるところだと思います。Clef headを使ってLoRA(r=64)で1エポック訓練しただけで、下流精度が30〜37%から最大78%まで上がった、と公式が説明しています。
室谷室谷代表取締役
30〜37%って、ほぼチャンスレベルですからね。それが78%まで上がるのは、実務で使う側からするとインパクトがあります。
テキトー教師テキトー教師DotAI 認定講師
しかも2.5GB VRAMでLayaのような小さいモデルも訓練できる、と。訓練はUI経由でできる、というのが公式の説明です。

Unslothの決定モデル訓練機能とは?何が発表されたのか

まとめ
Unslothの決定モデル訓練機能:発表内容の整理
  • Qwen3.5 0.8Bの総合精度を3つの決定ベンチマークで20.7%→74.3%に向上、わずか4GB VRAM
  • Clef head + LoRA(r=64)で1エポック訓練、下流精度30〜37%→最大78%
  • Qwen3.8、Gemma 4などのLLMを決定モデルに変換可能
  • 2.5GB VRAMでLayaのような小モデルも訓練可能。UI経由で訓練できる
  • 訓練後はDecision APIで利用でき、`laya`、`default`、`jev-latest`へのリクエストが自分のモデルに向く
  • 「既製品を使う」から「自分で作る」に一歩踏み込んだ点がポイント
  • サポートチケットの振り分け、メールのフィルタリング、自動タグ付け・分類など、テキストを構造化された決定に変換してアプリで実行したいニーズに応える
  • データを全部端末内に留めたいプライバシー用途やオンプレ回しにも対応
  • 既存の決定モデルのファインチューニングや自前データでの訓練にも応える
室谷室谷代表取締役
ここで一度、発表内容を整理しておきたいです。
テキトー教師テキトー教師DotAI 認定講師
整理するとこうです。
  • Qwen3.5 0.8Bの総合精度を3つの決定ベンチマークで20.7%→74.3%に向上、わずか4GB VRAM
  • Clef head + LoRA(r=64)で1エポック訓練、下流精度30〜37%→最大78%
  • Qwen3.8、Gemma 4などのLLMを決定モデルに変換可能
  • 2.5GB VRAMでLayaのような小モデルも訓練可能。UI経由で訓練できる
  • 訓練後はDecision APIで利用でき、laya、default、jev-latestへのリクエストが自分のモデルに向く
室谷室谷代表取締役
ポイントは「既製品を使う」から「自分で作る」に一歩踏み込んだことですよね。MYUUUでも、分類やルーティングのロジックをルールベースで書いて、だんだん保守できなくなっていく、みたいな場面を見てきたので、これは刺さります。
テキトー教師テキトー教師DotAI 認定講師
まさにそこなんですよ。サポートチケットの振り分け、メールのフィルタリング、自動タグ付け・分類といった、テキストを構造化された決定に変換してアプリで実行したいニーズに応える形です。
室谷室谷代表取締役
あと、データを全部端末内に留めたい、というプライバシー用途も想定されていますよね。これはオンプレで回したい企業には大きい。
テキトー教師テキトー教師DotAI 認定講師
そうですね。既存の決定モデルをさらにファインチューニングしたい、あるいは自前のデータで訓練したい、という声に応える発表だと公式は説明しています。

決定モデルは従来のLLMと何が違う?仕組みとClef head

決定モデルと従来のLLMの違い
従来のLLM
  • テキストを生成する
  • 単語予測のためのメモリを使う
  • 出力は文章
決定モデル(Unsloth)
  • 入力・質問・選択肢を1つのプロンプトにまとめる
  • LLMが一度読むだけで判断する
  • テキストを生成しない
  • 出力層にClefと同じ設計の小さなヘッドを載せる
  • 各質問・選択肢を採点する
  • 単語予測のメモリが不要で軽い
室谷室谷代表取締役
ここが一番理解が要るところなんですけど、決定モデルって普通のLLMと何が違うんですか。
テキトー教師テキトー教師DotAI 認定講師
仕組みから説明すると、Unslothは入力・質問・選択肢を1つのプロンプトにまとめて、LLMが一度読むだけで判断する方式なんですよ。
室谷室谷代表取締役
テキストを生成しない、というのがミソですよね。
テキトー教師テキトー教師DotAI 認定講師
はい。LLMの出力の上に、CloudflareのClefと同じ設計の小さなヘッド(出力層)を載せて、各質問・選択肢を採点します。

テキストを書かないので、単語予測のためのメモリを使わずに済むんです。
室谷室谷代表取締役
そこが軽さにつながっている、と。質問のタイプも決まっているんですよね。
テキトー教師テキトー教師DotAI 認定講師
整理するとこうです。
  • noul: はい/いいえ。yesの確率を0〜1で返す
  • choice: 選択肢から1つ選ぶ。各選択肢の確率付き
  • score: 尺度上の評価。0から数える
室谷室谷代表取締役
noulって聞き慣れないですけど、yes/noの確率を返すやつですね。0.98ならかなりyes寄り、0.5なら五分五分、と。
テキトー教師テキトー教師DotAI 認定講師
そういうことです。choiceとscoreはconfidenceも返します。

1に近いほど1つの答えが突出していて、0に近いほど確率が均等に散っている、という読み方をします。
室谷室谷代表取締役
ここで実務的な注意点があるんですよね。choiceで何かアクションを起こすときは、confidenceじゃなくてprobabilitiesの値を使う、と。
テキトー教師テキトー教師DotAI 認定講師
はい。たとえばtechnicalが0.8を超えたときだけバグ報告を起票する、といった閾値の置き方ですね。

LayaとJevはconfidenceの計算式が違うので、Jevで調整した閾値はそのまま使えない、というのが公式の説明です。
室谷室谷代表取締役
これは移行するときにハマるポイントなので、記事として残しておきたいところです。

Qwen3.5 0.8Bで精度20.7%→74.3%、4GB VRAMで動く理由

モデル別ベンチマーク精度(訓練前→訓練後)
モデルtyped-decisionsBANKING77CLINC150Holdout acc
Qwen3.5-0.8B36%→73%7%→74%19%→76%78%
Qwen3.5-2B33%→78%1%→58%1%→62%81%
室谷室谷代表取締役
で、この精度の数字なんですけど、ベンチマークの内訳も出ていますよね。
テキトー教師テキトー教師DotAI 認定講師
出ています。整理するとこうです。
モデルtyped-decisionsBANKING77CLINC150Holdout acc
Qwen3.5-0.8B36%→73%7%→74%19%→76%78%
Qwen3.5-2B33%→78%1%→58%1%→62%81%
室谷室谷代表取締役
0.8Bみたいな小さいモデルでも、訓練後は78%まで来る、と。ここが「小規模モデルでも高速な決定エンジンとして使えるのか」という疑問への答えになっていますよね。
テキトー教師テキトー教師DotAI 認定講師
そうなんですよ。訓練時間とVRAMの一覧も出ていて、こちらも整理するとこうです。
モデルTest accuracyVRAMTraining time
Qwen3.5-0.8B78%4GB42分
Qwen3.5-2B81%8GB40分
Llama 3.2 3B79%4.1GB30分
Gemma 4 E4B77%14.4GB49分
Laya(ファインチューニング後)77%2.5GB10分
室谷室谷代表取締役
4GB VRAMで42分というのは、手元のGPUでも現実的なラインですよね。
テキトー教師テキトー教師DotAI 認定講師
そこが「4GB VRAMで動く理由」につながります。元のモデル全体を再訓練せず、小さな追加パラメータだけを訓練するLoRAやQLoRAを使うので、VRAMを大幅に節約できるんです。
室谷室谷代表取締役
訓練データの構成も公開されていますよね。
テキトー教師テキトー教師DotAI 認定講師
はい。12ソースとtyped-decisionsのミックスで、ag_news、arc、banking77、boolq、clinc150、commonsense_qa、mmlu、mnli、prompt_injections、snli、sst5、wanliです。

テストセットは3,000行で、うち2,000行がtyped-decisions、500行がBANKING77、500行がCLINC150。テストセットは訓練データに対してdecontaminate済み、と公式が明記しています。
室谷室谷代表取締役
ここは評価の公平性に関わるので、ちゃんと書いておきたいですね。

Unslothで決定モデルを訓練する方法・始め方

室谷室谷代表取締役
で、実際どう始めるのか。ここが読者の知りたいところだと思うんですけど。
テキトー教師テキトー教師DotAI 認定講師
一番簡単なのはUnsloth Desktopアプリをダウンロードする方法で、macOS、Windows、Linuxで動きます。手動で入れるなら、macOS・Linux・WSLはcurl -fsSL https://unsloth.ai/install.sh | sh、Windows PowerShellはirm https://unsloth.ai/install.ps1 | iexです。
室谷室谷代表取締役
手順はUIで完結するんですよね。
テキトー教師テキトー教師DotAI 認定講師
はい。Trainタブを開いて、unsloth/Qwen3.5-4BのようなLLMを選び、Train asをDecision modelに設定します。

Unslothが良い感じの設定を埋めてくれるので、公式の結果に合わせたい場合はepochsを2、LoRA rankを16、learning rateを2e-4にします。あとはデータセットをアップロードするかHugging Faceから選んで、typed-decisionsならSubsetをallにする、という流れです。
室谷室谷代表取締役
Start Trainingを押すと、訓練前後の精度をレポートして、confidenceもキャリブレーションしてくれる、と。
テキトー教師テキトー教師DotAI 認定講師
そうなんですよ。コードで回したい人向けには、FastDecisionModelとDecisionTrainerを使う例も公式に出ています。

pip install --upgrade unslothで入れて、FastDecisionModel.from_pretrainedでモデルを読み、get_peft_modelでLoRAを付けて、build_datasetでデータを組み立てる、という流れです。
室谷室谷代表取締役
モデル名を変えればLlamaやGemma 4にも使える、と。
テキトー教師テキトー教師DotAI 認定講師
はい。unsloth/Llama-3.2-3B-Instructやunsloth/gemma-4-E4B-itに変えればよくて、Unslothがファインチューニングできる他のLLMも同じように動くはずだ、と公式は説明しています。
室谷室谷代表取締役
推奨設定も細かく出ていますよね。
テキトー教師テキトー教師DotAI 認定講師
整理するとこうです。
  • まずは4-bit LoRAのrank 16、learning rate 2e-4から。新しいヘッドはデフォルトで1e-4で訓練され、head_learning_rateで変更できる
  • typed-decisionsでは2エポック。データが少ない場合は3か4を試す
  • すぐ試すならmax_steps = 60。Qwen3.5-4BはL4で10分で76%に到達した
  • メモリが足りなければバッチサイズを半分にして勾配蓄積を倍にする
  • max_seq_lengthは訓練時の最長入力を決める。長い入力は質問と選択肢を残して末尾を切る。予測は最大16,384トークンまで読む
室谷室谷代表取締役
キャリブレーションと保存の流れも押さえておきたいです。
テキトー教師テキトー教師DotAI 認定講師
split_holdoutが残した行でキャリブレーションして、確率が実際の正解率と合うようにします。保存はsave_pretrainedでLoRAアダプタとヘッドを、save_pretrained_mergedで16-bitのフルモデルを保存できます。
室谷室谷代表取締役
自分のデータを使う場合は、各行にstate、判断したい質問、正解が入ったデータセット形式にすればいい、と。

訓練した決定モデルはどう使う?Decision APIとローカル実行

室谷室谷代表取締役
訓練したあと、どう使うかも大事ですよね。
テキトー教師テキトー教師DotAI 認定講師
UIで訓練した場合は「Use in Decision API」をクリックすると、laya、default、jev-latestを使うリクエストが自分のモデルに向くようになります。コードで訓練した場合は、保存したマージ済みフォルダを指定してUnslothを起動します。
室谷室谷代表取締役
具体的にはUNSLOTH_SYSTEMONE_MODEL=/path/to/qwen-decisions-merged unsloth studio -H 0.0.0.0 -p 8888、という形ですよね。
テキトー教師テキトー教師DotAI 認定講師
はい。Settings → APIでDecision APIをオンにすると、laya、default、jev-latestへのリクエストが自分のモデルに向き、答えの形式はLayaと同じになります。

モデルにはGPUが必要で、最初のリクエスト時に読み込むため数分かかることがあります。訓練がGPUを使っている間はDecision APIが待機して、訓練が終わるとまた答え始める、という挙動も公式に書かれています。
室谷室谷代表取締役
ローカルで動かす場合は、Mac、Windows、Linuxに対応している、と。
テキトー教師テキトー教師DotAI 認定講師
そうですね。データはすべて端末内に留まり、CPU、ユニファイドメモリ、GPUの構成をサポートします。

Layaのモデルは多言語(678MB、4GB RAM)、英語(846MB、5GB RAM)、typed decisions(846MB、5GB RAM)の3種類です。CPUがデフォルトで、GPUに切り替えると速くなります。

GPUのメモリが足りなくなるとLayaはCPUにフォールバックして答え続ける、という説明もあります。
室谷室谷代表取締役
最初のリクエストはモデル読み込みで10〜20秒、その後はほとんどのCPUで1秒未満、というのも実運用の感覚として大事です。
テキトー教師テキトー教師DotAI 認定講師
リクエストは最大64問、choiceは最大255選択肢、scoreは最大10段階まで、という制限も公式に明記されています。
室谷室谷代表取締役
Jevからの移行も用意されているんですよね。
テキトー教師テキトー教師DotAI 認定講師
pip install typesafe-sdkでSDKを入れて、TYPESAFE_BASE_URLとTYPESAFE_API_KEYの2つの環境変数を設定すれば、既存コードがUnslothと話せるようになります。SDKのデフォルトモデルjev-latestは、Settingsで選んだモデルにマップされます。
室谷室谷代表取締役
ただし注意点が2つあって、confidenceは計算式が違うのでJevで調整した閾値は移行できない、閾値はprobabilitiesで設定する、と。もう1つはchoiceの選択肢が固定トークン予算を共有するので、約20個を超える記述的な選択肢だとラベルが切り詰められる、と。
テキトー教師テキトー教師DotAI 認定講師
そこは移行時に必ず確認すべきポイントですね。

Qwen3.8やGemma 4、Layaとの関係とベンチマーク比較

室谷室谷代表取締役
最後に、既存の決定モデルとの関係を整理しておきたいです。
テキトー教師テキトー教師DotAI 認定講師
まず、今回の発表は「既製品を置き換える」というより「既製品もさらに訓練できる」という位置づけなんですよ。公式は、LayaやClefのような決定モデルもさらにファインチューニングできる、と説明しています。
室谷室谷代表取締役
訓練対象になるLLMはQwen3.8やGemma 4、Qwen3.5などですよね。
テキトー教師テキトー教師DotAI 認定講師
はい。資料で言及されるのはCloudflareのClef(ヘッド設計の参照元)、TypeSafe(API互換)、Jev(移行元API)です。

それ以外の他社動向については、今回の資料には記述がありません。
室谷室谷代表取締役
ベンチマークで見ると、Layaをファインチューニングした場合は77%で2.5GB、10分ですから、軽さと速さのバランスがいい、と。
テキトー教師テキトー教師DotAI 認定講師
そうですね。Qwen3.5-2Bが81%で8GB、40分、Llama 3.2 3Bが79%で4.1GB、30分、Gemma 4 E4Bが77%で14.4GB、49分、という並びで見ると、精度だけじゃなくVRAMと時間のトレードオフで選べるのが分かります。
室谷室谷代表取締役
リアルタイムパッキングのデモも紹介されていて、ローカルのLayaをDecision API経由で使って、旅行計画を変えるとスーツケースの中身が更新される、という実用例が示されています。
テキトー教師テキトー教師DotAI 認定講師
ああいうのは、決定モデルが「アプリの中で動く部品」として使える、という分かりやすい例ですよね。
室谷室谷代表取締役
あと、ビジョンLLMを決定モデル化できるか、という点については、今回の資料には言及がないので、現時点では明らかにされていません。
テキトー教師テキトー教師DotAI 認定講師
そうですね。今回の発表はテキストLLMの決定モデル化に関するものです。

よくある質問

室谷室谷代表取締役
ここからは、読者が気になりそうな点をFAQ形式で整理していきます。
テキトー教師テキトー教師DotAI 認定講師
まず、Unslothの決定モデルとは何か、という点です。これは、テキストを生成するのではなく、与えられた選択肢からどれを選ぶかを確率付きで返すモデルで、Qwen3.8やGemma 4などのLLMを訓練で変換して作れます。
室谷室谷代表取締役
従来のLLMと何が違うんですか。
テキトー教師テキトー教師DotAI 認定講師
入力・質問・選択肢を1つのプロンプトにまとめて一度読ませ、CloudflareのClefと同じ設計の小さなヘッドで各選択肢を採点します。テキストを書かないので、単語予測のためのメモリを使わずに済むのが違いです。
室谷室谷代表取締役
実際の訓練手順は。
テキトー教師テキトー教師DotAI 認定講師
Unsloth DesktopアプリならTrainタブでLLMを選び、Train asをDecision modelに設定して、データセットを選んでStart Trainingです。コードならFastDecisionModelとDecisionTrainerを使います。
室谷室谷代表取締役
ローカルで実行・提供するには。
テキトー教師テキトー教師DotAI 認定講師
Settings → APIでDecision APIをオンにすると、laya、default、jev-latestへのリクエストが自分のモデルに向きます。モデルにはGPUが必要で、最初のリクエスト時の読み込みに数分かかることがあります。
室谷室谷代表取締役
Decision APIの使い方やインターフェースは。
テキトー教師テキトー教師DotAI 認定講師
訓練したモデルはSettings → APIに表示され、requestsはLayaと同じ形式で返ります。既存のJev連携はtypesafe-sdkと2つの環境変数でUnslothに向けられます。
室谷室谷代表取締役
JevやLaya、Clefとの関係は。
テキトー教師テキトー教師DotAI 認定講師
LayaやClefのような決定モデルもさらにファインチューニングできます。Jevから移行する場合は、confidenceの計算式が違うため閾値はprobabilitiesで設定し直す必要があります。
室谷室谷代表取締役
0.8Bのような小さいモデルでも使えるのか、という点は。
テキトー教師テキトー教師DotAI 認定講師
Qwen3.5-0.8Bは4GB VRAM、42分の訓練で78%に到達しています。小規模モデルを高速な決定エンジンとして使う事例として公式が示しています。
室谷室谷代表取締役
Unsloth Desktopアプリで決定モデルを扱えるのか、という点も気になりますよね。
テキトー教師テキトー教師DotAI 認定講師
扱えます。Trainタブから訓練し、Use in Decision APIでそのまま提供できます。
室谷室谷代表取締役
視覚LLMも決定モデル化できるのか、という点は。
テキトー教師テキトー教師DotAI 認定講師
今回の資料には言及がなく、現時点では明らかにされていません。
室谷室谷代表取締役
性能指標や評価方法は。
テキトー教師テキトー教師DotAI 認定講師
訓練前にheld-outの決定で精度をレポートし、confidenceをキャリブレーションします。FastDecisionModel.evaluateでラベル付きテストセットの精度も確認できます。
室谷室谷代表取締役
オープンソースのトレーニングスタックとしての対応状況は。
テキトー教師テキトー教師DotAI 認定講師
Unslothのオープンソースリポジトリに決定モデルのファインチューニングが追加され、GitHubと公式ガイド、ノートブックが公開されています。
室谷室谷代表取締役
というわけで、決定モデルを自前で作ってアプリに組み込む、という選択肢が一気に現実的になった発表でした。
テキトー教師テキトー教師DotAI 認定講師
分類やルーティングをルールで頑張っているチームほど、一度試す価値があると思います。

Related

関連記事

New Articles

新着記事

ニュース

OpenAIのChatGPTプラグイン拡張とは?サイドバー起動と@メンション追加

2026年10月9日
室谷テキトー教師
ガイド

PixVerseとは?無料でどこまで使えるか、料金とV6の新機能まで解説

2026年10月9日
室谷テキトー教師
ニュース

ChatGPT for Teensとは?OpenAIがCollege Planner予告、学習ツールも拡充

2026年10月9日
室谷テキトー教師
ニュース

Claude Computer useとは?SDK組み込みで変わるAIエージェント操作

2026年10月9日
室谷テキトー教師
ニュース

OpenRouterの「Step 5 Preview」とは?StepFunの新フラッグシップを解説

2026年10月8日
室谷テキトー教師
ガイド

HeyGenとは?無料の範囲と料金、商用利用の条件を2026年の公式情報で確認

2026年10月8日
室谷テキトー教師
ガイド

D-IDとは?AIアバターの料金・商用利用条件と2026年の最新機能

2026年10月8日
室谷テキトー教師
ガイド

Fish Audioの料金と無料で使える範囲、商用利用の条件をまとめて解説

2026年10月8日
室谷テキトー教師
ガイド

Geminiのログイン方法と料金プラン、Bardからの変更点をやさしく整理

2026年10月8日
室谷テキトー教師
ガイド

Hailuo AIとは?無料でできることと料金・使い方を解説

2026年10月8日
室谷テキトー教師

Join

AIプレナーになる。

入会は審査制です。いまの事業と、AIで何を動かしたいのかを聞かせてください。

参加を申請する