GeForce RTX 4060 8GB (desktop)

GeForce RTX 4060 8GB desktop · discrete-vram

見積もりに使う容量: 8.00 GiB

Vendor-marketed GB for discrete GPU VRAM is treated as GiB (2^30 bytes), matching physical GDDR/HBM module organization. This is an explicit unit assumption.

機材と負荷条件を選び、カタログ上で載りそうなモデルを絞ります。

詳細設定

GiB(2^30 バイト)

モデル構造を手入力

ブラウザ内だけで解析します。ファイルは送信しません。

huggingface.co の config.json のみ。トークンなし。非公開リポジトリは拒否します。

見積もり

載る見込み

現在の前提では、見積もりの上限が利用可能予算の 90% 以下です。

推定メモリ範囲: 4.92 GiB5.42 GiB

重みは選択したファイルのメタデータを使います。実行時の追加分は見積もりです。

重み4.36 GiB
KV Cache(生データ)0.44 GiB
KV の追加分(量子化メタデータなど)0.00 GiB
アクティベーション / 作業領域0.06 GiB
エンジン予約0.06 GiB
安全マージン0.00 GiB

利用可能予算: 7.00 GiB · 見積もり後の残り: 1.58 GiB2.08 GiB

ソフトウェアの対応

文書で対応が確認できる. メモリが足りても、指定のエンジン・量子化・OS で動くとは限りません。動いても速いとは限りません。

結果を左右する前提

  • 常駐ウェイトの見積もりは総パラメータを使い、非アクティブな MoE エキスパートも含めます。
  • ウェイトのバイト数は選んだファイルだけです。リポジトリ内の全量子化を合計しません。
  • ダウンロードサイズはピーク GPU メモリではありません。実行時レイアウトと KV は別です。
  • 計上したファイル: qwen2.5-7b-instruct-q4_k_m-00001-of-00002.gguf, qwen2.5-7b-instruct-q4_k_m-00002-of-00002.gguf。
  • コンテキストはシーケンスあたりのキャッシュトークン数(入力+生成の予約)です。
  • 同時シーケンスは同一のモデル複製を共有し、ウェイトはシーケンス数では増えません。
  • KV の型は、変更しない限りウェイト量子化とは独立です。
  • 28 個の query heads ではなく 4 個の KV heads を使います。
  • プリフィルのピークと定常デコードは同じではありません。高シナリオはプリフィル寄りです。
  • エンジン予約はウェイトと KV の実使用量ではありません。
  • llama.cpp の計算バッファはコンテキストとバッチで増えます。ここは調整可能なシナリオで、一致する校正がある場合だけ実測として示します。
  • ホスト RAM は独立 GPU の VRAM に自動では入りません。

計算方法

この負荷でカタログ上のモデル

モデル見積もり推定メモリ範囲
載る見込み4.92 GiB5.42 GiB
載る見込み1.14 GiB1.54 GiB
載る見込み3.22 GiB3.67 GiB
載る見込み2.37 GiB2.80 GiB
載る見込み4.78 GiB5.30 GiB
載る見込み3.58 GiB4.08 GiB
余裕が少ない5.93 GiB6.48 GiB