室谷代表取締役Unsloth(アンスロス)が、任意のLLMを確率付きの「決定モデル」に変換できるオープンソースの訓練スタックを公開したんですよね。これ、地味にすごい話で。
テキトー教師DotAI 認定講師そうなんですよ。決定モデルは、Unslothが公開した、テキストを生成するのではなく与えられた選択肢から「どれを選ぶか」を確率付きで返すモデルで、Qwen3.8やGemma 4といったLLMを訓練で決定モデルに変換できます。
室谷代表取締役まず何が発表されたかを整理したいんですけど、Unslothは自社のオープンソースリポジトリで、LLMを決定モデルにファインチューニングする機能を追加した、と。
テキトー教師DotAI 認定講師はい。Unsloth Desktopアプリとオープンソースのトレーニングスタックの両方に、決定モデルのファインチューニングが追加された、というのが今回の発表の核です。
室谷代表取締役数字がまた強いんですよね。Qwen3.5 0.8Bの総合精度を、3つの決定ベンチマークで20.7%から74.3%に引き上げた、と。
しかも4GB VRAMで。
しかも4GB VRAMで。
テキトー教師DotAI 認定講師そこが今回いちばん刺さるところだと思います。Clef headを使ってLoRA(r=64)で1エポック訓練しただけで、下流精度が30〜37%から最大78%まで上がった、と公式が説明しています。
室谷代表取締役30〜37%って、ほぼチャンスレベルですからね。それが78%まで上がるのは、実務で使う側からするとインパクトがあります。
テキトー教師DotAI 認定講師しかも2.5GB VRAMでLayaのような小さいモデルも訓練できる、と。訓練はUI経由でできる、というのが公式の説明です。
Unslothの決定モデル訓練機能とは?何が発表されたのか
まとめ
Unslothの決定モデル訓練機能:発表内容の整理
- Qwen3.5 0.8Bの総合精度を3つの決定ベンチマークで20.7%→74.3%に向上、わずか4GB VRAM
- Clef head + LoRA(r=64)で1エポック訓練、下流精度30〜37%→最大78%
- Qwen3.8、Gemma 4などのLLMを決定モデルに変換可能
- 2.5GB VRAMでLayaのような小モデルも訓練可能。UI経由で訓練できる
- 訓練後はDecision APIで利用でき、`laya`、`default`、`jev-latest`へのリクエストが自分のモデルに向く
- 「既製品を使う」から「自分で作る」に一歩踏み込んだ点がポイント
- サポートチケットの振り分け、メールのフィルタリング、自動タグ付け・分類など、テキストを構造化された決定に変換してアプリで実行したいニーズに応える
- データを全部端末内に留めたいプライバシー用途やオンプレ回しにも対応
- 既存の決定モデルのファインチューニングや自前データでの訓練にも応える
室谷代表取締役ここで一度、発表内容を整理しておきたいです。
テキトー教師DotAI 認定講師整理するとこうです。
- Qwen3.5 0.8Bの総合精度を3つの決定ベンチマークで20.7%→74.3%に向上、わずか4GB VRAM
- Clef head + LoRA(r=64)で1エポック訓練、下流精度30〜37%→最大78%
- Qwen3.8、Gemma 4などのLLMを決定モデルに変換可能
- 2.5GB VRAMでLayaのような小モデルも訓練可能。UI経由で訓練できる
- 訓練後はDecision APIで利用でき、
laya、default、jev-latestへのリクエストが自分のモデルに向く
室谷代表取締役ポイントは「既製品を使う」から「自分で作る」に一歩踏み込んだことですよね。MYUUUでも、分類やルーティングのロジックをルールベースで書いて、だんだん保守できなくなっていく、みたいな場面を見てきたので、これは刺さります。
テキトー教師DotAI 認定講師まさにそこなんですよ。サポートチケットの振り分け、メールのフィルタリング、自動タグ付け・分類といった、テキストを構造化された決定に変換してアプリで実行したいニーズに応える形です。
室谷代表取締役あと、データを全部端末内に留めたい、というプライバシー用途も想定されていますよね。これはオンプレで回したい企業には大きい。
テキトー教師DotAI 認定講師そうですね。既存の決定モデルをさらにファインチューニングしたい、あるいは自前のデータで訓練したい、という声に応える発表だと公式は説明しています。
決定モデルは従来のLLMと何が違う?仕組みとClef head
決定モデルと従来のLLMの違い
従来のLLM
- テキストを生成する
- 単語予測のためのメモリを使う
- 出力は文章
決定モデル(Unsloth)
- 入力・質問・選択肢を1つのプロンプトにまとめる
- LLMが一度読むだけで判断する
- テキストを生成しない
- 出力層にClefと同じ設計の小さなヘッドを載せる
- 各質問・選択肢を採点する
- 単語予測のメモリが不要で軽い
室谷代表取締役ここが一番理解が要るところなんですけど、決定モデルって普通のLLMと何が違うんですか。
テキトー教師DotAI 認定講師仕組みから説明すると、Unslothは入力・質問・選択肢を1つのプロンプトにまとめて、LLMが一度読むだけで判断する方式なんですよ。
室谷代表取締役テキストを生成しない、というのがミソですよね。
テキトー教師DotAI 認定講師はい。LLMの出力の上に、CloudflareのClefと同じ設計の小さなヘッド(出力層)を載せて、各質問・選択肢を採点します。
テキストを書かないので、単語予測のためのメモリを使わずに済むんです。
テキストを書かないので、単語予測のためのメモリを使わずに済むんです。
室谷代表取締役そこが軽さにつながっている、と。質問のタイプも決まっているんですよね。
テキトー教師DotAI 認定講師整理するとこうです。
noul: はい/いいえ。yesの確率を0〜1で返すchoice: 選択肢から1つ選ぶ。各選択肢の確率付きscore: 尺度上の評価。0から数える
室谷代表取締役noulって聞き慣れないですけど、yes/noの確率を返すやつですね。0.98ならかなりyes寄り、0.5なら五分五分、と。
テキトー教師DotAI 認定講師そういうことです。choiceとscoreはconfidenceも返します。
1に近いほど1つの答えが突出していて、0に近いほど確率が均等に散っている、という読み方をします。
1に近いほど1つの答えが突出していて、0に近いほど確率が均等に散っている、という読み方をします。
室谷代表取締役ここで実務的な注意点があるんですよね。choiceで何かアクションを起こすときは、confidenceじゃなくてprobabilitiesの値を使う、と。
テキトー教師DotAI 認定講師はい。たとえばtechnicalが0.8を超えたときだけバグ報告を起票する、といった閾値の置き方ですね。
LayaとJevはconfidenceの計算式が違うので、Jevで調整した閾値はそのまま使えない、というのが公式の説明です。
LayaとJevはconfidenceの計算式が違うので、Jevで調整した閾値はそのまま使えない、というのが公式の説明です。
室谷代表取締役これは移行するときにハマるポイントなので、記事として残しておきたいところです。
Qwen3.5 0.8Bで精度20.7%→74.3%、4GB VRAMで動く理由
モデル別ベンチマーク精度(訓練前→訓練後)
| モデル | typed-decisions | BANKING77 | CLINC150 | Holdout acc |
|---|---|---|---|---|
| Qwen3.5-0.8B | 36%→73% | 7%→74% | 19%→76% | 78% |
| Qwen3.5-2B | 33%→78% | 1%→58% | 1%→62% | 81% |
室谷代表取締役で、この精度の数字なんですけど、ベンチマークの内訳も出ていますよね。
テキトー教師DotAI 認定講師出ています。整理するとこうです。
| モデル | typed-decisions | BANKING77 | CLINC150 | Holdout acc |
|---|---|---|---|---|
| Qwen3.5-0.8B | 36%→73% | 7%→74% | 19%→76% | 78% |
| Qwen3.5-2B | 33%→78% | 1%→58% | 1%→62% | 81% |
室谷代表取締役0.8Bみたいな小さいモデルでも、訓練後は78%まで来る、と。ここが「小規模モデルでも高速な決定エンジンとして使えるのか」という疑問への答えになっていますよね。
テキトー教師DotAI 認定講師そうなんですよ。訓練時間とVRAMの一覧も出ていて、こちらも整理するとこうです。
| モデル | Test accuracy | VRAM | Training time |
|---|---|---|---|
| Qwen3.5-0.8B | 78% | 4GB | 42分 |
| Qwen3.5-2B | 81% | 8GB | 40分 |
| Llama 3.2 3B | 79% | 4.1GB | 30分 |
| Gemma 4 E4B | 77% | 14.4GB | 49分 |
| Laya(ファインチューニング後) | 77% | 2.5GB | 10分 |
室谷代表取締役4GB VRAMで42分というのは、手元のGPUでも現実的なラインですよね。
テキトー教師DotAI 認定講師そこが「4GB VRAMで動く理由」につながります。元のモデル全体を再訓練せず、小さな追加パラメータだけを訓練するLoRAやQLoRAを使うので、VRAMを大幅に節約できるんです。
室谷代表取締役訓練データの構成も公開されていますよね。
テキトー教師DotAI 認定講師はい。12ソースとtyped-decisionsのミックスで、ag_news、arc、banking77、boolq、clinc150、commonsense_qa、mmlu、mnli、prompt_injections、snli、sst5、wanliです。
テストセットは3,000行で、うち2,000行がtyped-decisions、500行がBANKING77、500行がCLINC150。テストセットは訓練データに対してdecontaminate済み、と公式が明記しています。
テストセットは3,000行で、うち2,000行がtyped-decisions、500行がBANKING77、500行がCLINC150。テストセットは訓練データに対してdecontaminate済み、と公式が明記しています。
室谷代表取締役ここは評価の公平性に関わるので、ちゃんと書いておきたいですね。
Unslothで決定モデルを訓練する方法・始め方
室谷代表取締役で、実際どう始めるのか。ここが読者の知りたいところだと思うんですけど。
テキトー教師DotAI 認定講師一番簡単なのはUnsloth Desktopアプリをダウンロードする方法で、macOS、Windows、Linuxで動きます。手動で入れるなら、macOS・Linux・WSLは
curl -fsSL https://unsloth.ai/install.sh | sh、Windows PowerShellはirm https://unsloth.ai/install.ps1 | iexです。
室谷代表取締役手順はUIで完結するんですよね。
テキトー教師DotAI 認定講師はい。Trainタブを開いて、
Unslothが良い感じの設定を埋めてくれるので、公式の結果に合わせたい場合はepochsを2、LoRA rankを16、learning rateを2e-4にします。あとはデータセットをアップロードするかHugging Faceから選んで、typed-decisionsならSubsetをallにする、という流れです。
unsloth/Qwen3.5-4BのようなLLMを選び、Train asをDecision modelに設定します。Unslothが良い感じの設定を埋めてくれるので、公式の結果に合わせたい場合はepochsを2、LoRA rankを16、learning rateを2e-4にします。あとはデータセットをアップロードするかHugging Faceから選んで、typed-decisionsならSubsetをallにする、という流れです。
室谷代表取締役Start Trainingを押すと、訓練前後の精度をレポートして、confidenceもキャリブレーションしてくれる、と。
テキトー教師DotAI 認定講師そうなんですよ。コードで回したい人向けには、
FastDecisionModelとDecisionTrainerを使う例も公式に出ています。pip install --upgrade unslothで入れて、FastDecisionModel.from_pretrainedでモデルを読み、get_peft_modelでLoRAを付けて、build_datasetでデータを組み立てる、という流れです。
室谷代表取締役モデル名を変えればLlamaやGemma 4にも使える、と。
テキトー教師DotAI 認定講師はい。
unsloth/Llama-3.2-3B-Instructやunsloth/gemma-4-E4B-itに変えればよくて、Unslothがファインチューニングできる他のLLMも同じように動くはずだ、と公式は説明しています。
室谷代表取締役推奨設定も細かく出ていますよね。
テキトー教師DotAI 認定講師整理するとこうです。
- まずは4-bit LoRAのrank 16、learning rate 2e-4から。新しいヘッドはデフォルトで1e-4で訓練され、
head_learning_rateで変更できる - typed-decisionsでは2エポック。データが少ない場合は3か4を試す
- すぐ試すなら
max_steps = 60。Qwen3.5-4BはL4で10分で76%に到達した - メモリが足りなければバッチサイズを半分にして勾配蓄積を倍にする
max_seq_lengthは訓練時の最長入力を決める。長い入力は質問と選択肢を残して末尾を切る。予測は最大16,384トークンまで読む
室谷代表取締役キャリブレーションと保存の流れも押さえておきたいです。
テキトー教師DotAI 認定講師split_holdoutが残した行でキャリブレーションして、確率が実際の正解率と合うようにします。保存はsave_pretrainedでLoRAアダプタとヘッドを、save_pretrained_mergedで16-bitのフルモデルを保存できます。
室谷代表取締役自分のデータを使う場合は、各行にstate、判断したい質問、正解が入ったデータセット形式にすればいい、と。
訓練した決定モデルはどう使う?Decision APIとローカル実行
室谷代表取締役訓練したあと、どう使うかも大事ですよね。
テキトー教師DotAI 認定講師UIで訓練した場合は「Use in Decision API」をクリックすると、
laya、default、jev-latestを使うリクエストが自分のモデルに向くようになります。コードで訓練した場合は、保存したマージ済みフォルダを指定してUnslothを起動します。
室谷代表取締役具体的には
UNSLOTH_SYSTEMONE_MODEL=/path/to/qwen-decisions-merged unsloth studio -H 0.0.0.0 -p 8888、という形ですよね。
テキトー教師DotAI 認定講師はい。Settings → APIでDecision APIをオンにすると、
モデルにはGPUが必要で、最初のリクエスト時に読み込むため数分かかることがあります。訓練がGPUを使っている間はDecision APIが待機して、訓練が終わるとまた答え始める、という挙動も公式に書かれています。
laya、default、jev-latestへのリクエストが自分のモデルに向き、答えの形式はLayaと同じになります。モデルにはGPUが必要で、最初のリクエスト時に読み込むため数分かかることがあります。訓練がGPUを使っている間はDecision APIが待機して、訓練が終わるとまた答え始める、という挙動も公式に書かれています。
室谷代表取締役ローカルで動かす場合は、Mac、Windows、Linuxに対応している、と。
テキトー教師DotAI 認定講師そうですね。データはすべて端末内に留まり、CPU、ユニファイドメモリ、GPUの構成をサポートします。
Layaのモデルは多言語(678MB、4GB RAM)、英語(846MB、5GB RAM)、typed decisions(846MB、5GB RAM)の3種類です。CPUがデフォルトで、GPUに切り替えると速くなります。
GPUのメモリが足りなくなるとLayaはCPUにフォールバックして答え続ける、という説明もあります。
Layaのモデルは多言語(678MB、4GB RAM)、英語(846MB、5GB RAM)、typed decisions(846MB、5GB RAM)の3種類です。CPUがデフォルトで、GPUに切り替えると速くなります。
GPUのメモリが足りなくなるとLayaはCPUにフォールバックして答え続ける、という説明もあります。
室谷代表取締役最初のリクエストはモデル読み込みで10〜20秒、その後はほとんどのCPUで1秒未満、というのも実運用の感覚として大事です。
テキトー教師DotAI 認定講師リクエストは最大64問、choiceは最大255選択肢、scoreは最大10段階まで、という制限も公式に明記されています。
室谷代表取締役Jevからの移行も用意されているんですよね。
テキトー教師DotAI 認定講師pip install typesafe-sdkでSDKを入れて、TYPESAFE_BASE_URLとTYPESAFE_API_KEYの2つの環境変数を設定すれば、既存コードがUnslothと話せるようになります。SDKのデフォルトモデルjev-latestは、Settingsで選んだモデルにマップされます。
室谷代表取締役ただし注意点が2つあって、confidenceは計算式が違うのでJevで調整した閾値は移行できない、閾値はprobabilitiesで設定する、と。もう1つはchoiceの選択肢が固定トークン予算を共有するので、約20個を超える記述的な選択肢だとラベルが切り詰められる、と。
テキトー教師DotAI 認定講師そこは移行時に必ず確認すべきポイントですね。
Qwen3.8やGemma 4、Layaとの関係とベンチマーク比較
室谷代表取締役最後に、既存の決定モデルとの関係を整理しておきたいです。
テキトー教師DotAI 認定講師まず、今回の発表は「既製品を置き換える」というより「既製品もさらに訓練できる」という位置づけなんですよ。公式は、LayaやClefのような決定モデルもさらにファインチューニングできる、と説明しています。
室谷代表取締役訓練対象になるLLMはQwen3.8やGemma 4、Qwen3.5などですよね。
テキトー教師DotAI 認定講師はい。資料で言及されるのはCloudflareのClef(ヘッド設計の参照元)、TypeSafe(API互換)、Jev(移行元API)です。
それ以外の他社動向については、今回の資料には記述がありません。
それ以外の他社動向については、今回の資料には記述がありません。
室谷代表取締役ベンチマークで見ると、Layaをファインチューニングした場合は77%で2.5GB、10分ですから、軽さと速さのバランスがいい、と。
テキトー教師DotAI 認定講師そうですね。Qwen3.5-2Bが81%で8GB、40分、Llama 3.2 3Bが79%で4.1GB、30分、Gemma 4 E4Bが77%で14.4GB、49分、という並びで見ると、精度だけじゃなくVRAMと時間のトレードオフで選べるのが分かります。
室谷代表取締役リアルタイムパッキングのデモも紹介されていて、ローカルのLayaをDecision API経由で使って、旅行計画を変えるとスーツケースの中身が更新される、という実用例が示されています。
テキトー教師DotAI 認定講師ああいうのは、決定モデルが「アプリの中で動く部品」として使える、という分かりやすい例ですよね。
室谷代表取締役あと、ビジョンLLMを決定モデル化できるか、という点については、今回の資料には言及がないので、現時点では明らかにされていません。
テキトー教師DotAI 認定講師そうですね。今回の発表はテキストLLMの決定モデル化に関するものです。
よくある質問
室谷代表取締役ここからは、読者が気になりそうな点をFAQ形式で整理していきます。
テキトー教師DotAI 認定講師まず、Unslothの決定モデルとは何か、という点です。これは、テキストを生成するのではなく、与えられた選択肢からどれを選ぶかを確率付きで返すモデルで、Qwen3.8やGemma 4などのLLMを訓練で変換して作れます。
室谷代表取締役従来のLLMと何が違うんですか。
テキトー教師DotAI 認定講師入力・質問・選択肢を1つのプロンプトにまとめて一度読ませ、CloudflareのClefと同じ設計の小さなヘッドで各選択肢を採点します。テキストを書かないので、単語予測のためのメモリを使わずに済むのが違いです。
室谷代表取締役実際の訓練手順は。
テキトー教師DotAI 認定講師Unsloth DesktopアプリならTrainタブでLLMを選び、Train asをDecision modelに設定して、データセットを選んでStart Trainingです。コードなら
FastDecisionModelとDecisionTrainerを使います。
室谷代表取締役ローカルで実行・提供するには。
テキトー教師DotAI 認定講師Settings → APIでDecision APIをオンにすると、
laya、default、jev-latestへのリクエストが自分のモデルに向きます。モデルにはGPUが必要で、最初のリクエスト時の読み込みに数分かかることがあります。
室谷代表取締役Decision APIの使い方やインターフェースは。
テキトー教師DotAI 認定講師訓練したモデルはSettings → APIに表示され、requestsはLayaと同じ形式で返ります。既存のJev連携は
typesafe-sdkと2つの環境変数でUnslothに向けられます。
室谷代表取締役JevやLaya、Clefとの関係は。
テキトー教師DotAI 認定講師LayaやClefのような決定モデルもさらにファインチューニングできます。Jevから移行する場合は、confidenceの計算式が違うため閾値はprobabilitiesで設定し直す必要があります。
室谷代表取締役0.8Bのような小さいモデルでも使えるのか、という点は。
テキトー教師DotAI 認定講師Qwen3.5-0.8Bは4GB VRAM、42分の訓練で78%に到達しています。小規模モデルを高速な決定エンジンとして使う事例として公式が示しています。
室谷代表取締役Unsloth Desktopアプリで決定モデルを扱えるのか、という点も気になりますよね。
テキトー教師DotAI 認定講師扱えます。Trainタブから訓練し、Use in Decision APIでそのまま提供できます。
室谷代表取締役視覚LLMも決定モデル化できるのか、という点は。
テキトー教師DotAI 認定講師今回の資料には言及がなく、現時点では明らかにされていません。
室谷代表取締役性能指標や評価方法は。
テキトー教師DotAI 認定講師訓練前にheld-outの決定で精度をレポートし、confidenceをキャリブレーションします。
FastDecisionModel.evaluateでラベル付きテストセットの精度も確認できます。
室谷代表取締役オープンソースのトレーニングスタックとしての対応状況は。
テキトー教師DotAI 認定講師Unslothのオープンソースリポジトリに決定モデルのファインチューニングが追加され、GitHubと公式ガイド、ノートブックが公開されています。
室谷代表取締役というわけで、決定モデルを自前で作ってアプリに組み込む、という選択肢が一気に現実的になった発表でした。
テキトー教師DotAI 認定講師分類やルーティングをルールで頑張っているチームほど、一度試す価値があると思います。
