Qwen2.5-3B-Instruct は GeForce RTX 4090 24GB (desktop) で動くか
1つの設定に対する条件付きの判断です。コンテキスト・量子化・エンジンを変えると結論も変わります。
3B Q4_K_M on RTX 4090 with a matching llama.cpp runtime-resident trace at 8192 tokens.
このページの設定: gguf-q4_k_m、キャッシュ 8,192 トークン、シーケンス 1、エンジン llama.cpp。
判定: 載る見込み。ソフトウェア: 文書で対応が確認できる。
ウェイト 1.96 GiB · 生 KV 0.28 GiB · 合計 2.37 GiB–2.80 GiB。
既定の予約を除いた利用可能予算 22.00 GiB。
実行時常駐の実測 rt-qwen2.5-3b-instruct-q4km-4090-ctx8192: プロセス GPU 2.59 GiB、取得 2026-09-19T15:43:43Z(llama.cpp version: 0.4.1-dev (build 1, commit 1af554f))。式による見積もりは別に表示します。
- 常駐ウェイトの見積もりは総パラメータを使い、非アクティブな MoE エキスパートも含めます。
- ウェイトのバイト数は選んだファイルだけです。リポジトリ内の全量子化を合計しません。
- ダウンロードサイズはピーク GPU メモリではありません。実行時レイアウトと KV は別です。
- 計上したファイル: qwen2.5-3b-instruct-q4_k_m.gguf。
- コンテキストはシーケンスあたりのキャッシュトークン数(入力+生成の予約)です。
- 同時シーケンスは同一のモデル複製を共有し、ウェイトはシーケンス数では増えません。
- KV の型は、変更しない限りウェイト量子化とは独立です。
- 16 個の query heads ではなく 2 個の KV heads を使います。
見積もり
載る見込み
現在の前提では、見積もりの上限が利用可能予算の 90% 以下です。
推定メモリ範囲: 2.37 GiB – 2.80 GiB
一致する環境での実行時常駐データがあります。
利用可能予算: 22.00 GiB · 見積もり後の残り: 19.20 GiB – 19.63 GiB
ソフトウェアの対応
文書で対応が確認できる. メモリが足りても、指定のエンジン・量子化・OS で動くとは限りません。動いても速いとは限りません。
一致する環境での実行時常駐データがあります。 実測したプロセス GPU メモリ: 2.59 GiB · llama.cpp version: 0.4.1-dev (build 1, commit 1af554f) · 2026-09-19T15:43:43Z
結果を左右する前提
- 常駐ウェイトの見積もりは総パラメータを使い、非アクティブな MoE エキスパートも含めます。
- ウェイトのバイト数は選んだファイルだけです。リポジトリ内の全量子化を合計しません。
- ダウンロードサイズはピーク GPU メモリではありません。実行時レイアウトと KV は別です。
- 計上したファイル: qwen2.5-3b-instruct-q4_k_m.gguf。
- コンテキストはシーケンスあたりのキャッシュトークン数(入力+生成の予約)です。
- 同時シーケンスは同一のモデル複製を共有し、ウェイトはシーケンス数では増えません。
- KV の型は、変更しない限りウェイト量子化とは独立です。
- 16 個の query heads ではなく 2 個の KV heads を使います。
- プリフィルのピークと定常デコードは同じではありません。高シナリオはプリフィル寄りです。
- エンジン予約はウェイトと KV の実使用量ではありません。
- llama.cpp の計算バッファはコンテキストとバッチで増えます。ここは調整可能なシナリオで、一致する校正がある場合だけ実測として示します。
- ホスト RAM は独立 GPU の VRAM に自動では入りません。