Qwen 3.8 27Bをローカルで動かす:GGUFの入手先と必要メモリ

Qwen3.8-27B の最新 GGUF 配布先と量子化サイズを確認。RAM と VRAM の見積もり、llama.cpp の起動、画像用 projector を解説します。

フラットなアイソメトリック図。デスクトップワークステーションの横に段状に積まれたメモリブロックが並び、明るいオレンジの線が積み上げの途中で上限を示し、その上のブロックはグレーアウトされている。

Qwen3.8-27B の元の重みは Qwen が Apache 2.0 で公開しています。GGUF は別途変換されたファイルです。公開者と正確なファイル名を確認してから、実行時のメモリを見積もってください。ダウンロード容量は必要 VRAM と同じではありません。

GGUF の入手先とメモリの見積もり

構成やライセンス、対応ランタイムは Qwen 公式モデルカード を参照してください。下表は 2026 年 9 月 9 日の Unsloth GGUF 一覧です。Qwen が公開した GGUF ではなく、コミュニティによる変換版です。GB は十進表記(1 GB = 1,000,000,000 バイト)です。

ファイル容量 GB
Qwen3.8-27B-UD-IQ2_XXS.gguf7.27
Qwen3.8-27B-UD-Q3_K_XL.gguf13.15
Qwen3.8-27B-UD-Q4_K_M.gguf16.46
Qwen3.8-27B-UD-Q4_K_XL.gguf17.56
Qwen3.8-27B-UD-Q6_K.gguf21.98
mmproj-F16.gguf0.93

実行用メモリを確保する

重み以外にも KV キャッシュ、計算バッファ、ランタイム、OS のメモリが必要です。専用 VRAM、システム RAM、Apple のユニファイドメモリは区別してください。RAM と VRAM の合計が、そのまま GPU の割り当て可能容量になるわけではありません。

24〜32 GB の GPU では、まず 4-bit と短いコンテキストで評価します。16 GB の GPU では低ビット量子化や CPU オフロードが必要になる場合があります。16 GB の Mac では macOS や他のアプリの使用分も確保してください。低ビット量子化は品質に影響するため、実際のタスクで確認します。

llama.cpp でダウンロードして起動する

モデルに対応した新しい llama.cpp を導入し、llama-server --version と手元の --help を確認してください。古いビルドの日付だけで互換性を判断しないでください。以下は 13.15 GB の UD-Q3_K_XL を選び、4K コンテキストから始める設定例です。今回のハードウェア実測ではありません。

curl --fail --location -o qwen38-27b.gguf \
  "https://huggingface.co/unsloth/Qwen3.8-27B-GGUF/resolve/main/Qwen3.8-27B-UD-Q3_K_XL.gguf"
llama-server -m qwen38-27b.gguf -c 4096 --port 8080

画像入力には projector も必要

同じ変換リポジトリから対応する projector を取得し、起動コマンドに --mmproj mmproj.gguf を加えます。現在の Unsloth F16 projector は約 0.93 GB で、主な重みとは別に必要です。言語モデルの読み込み成功だけでは画像入力の動作は確認できません。

curl --fail --location -o mmproj.gguf \
  "https://huggingface.co/unsloth/Qwen3.8-27B-GGUF/resolve/main/mmproj-F16.gguf"
llama-server -m qwen38-27b.gguf --mmproj mmproj.gguf -c 4096 --port 8080

実際の処理速度を測る

リポジトリの revision、ファイル名、llama.cpp のビルド、ハードウェア、GPU オフロード、コンテキスト長を記録します。入力処理と生成を分け、実際に使う長さのプロンプトで測定してください。短いベンチマークだけでは長いエージェント処理の速度は分かりません。

旧版には 8 月 16 日時点のファイル容量と M2 Pro の測定値を掲載していました。現在のファイルは変わっており、UD-IQ2_XXS は旧記載の 9.01 GB ではなく 7.27 GB です。再測定せずに古い速度を現行ファイルへ当てはめることはできません。今回の更新では新たな推論ベンチマークを実行していません。

読み込みや出力が失敗するとき

空きメモリ、ランタイムの対応、コンテキスト長、オフロード設定を確認します。画像入力では projector の組み合わせを確認してください。最終回答が空や途中終了の場合は、終了理由と思考・出力トークンの予算を確認します。decode エラーだけで特定のメモリ問題と断定はできません。

ローカルと API の選び方

オフライン利用やデータ管理を重視するならローカルが候補です。利用頻度が低い場合や大きな処理では、現在のモデル ID、コンテキスト、料金を確認して API と比較してください。27B の公開重みと Qwen3.8-Max は別の製品です。Qwen シリーズの解説も参照してください。