GeForce RTX 4060 Ti 16GB (desktop)

GeForce RTX 4060 Ti 16GB desktop · discrete-vram

見積もりに使う容量: 16.00 GiB

Vendor-marketed GB for discrete GPU VRAM is treated as GiB (2^30 bytes), matching physical GDDR/HBM module organization. This is an explicit unit assumption.

機材と負荷条件を選び、カタログ上で載りそうなモデルを絞ります。

詳細設定

GiB(2^30 バイト)

モデル構造を手入力

ブラウザ内だけで解析します。ファイルは送信しません。

huggingface.co の config.json のみ。トークンなし。非公開リポジトリは拒否します。

見積もり

載る見込み

現在の前提では、見積もりの上限が利用可能予算の 90% 以下です。

推定メモリ範囲: 4.92 GiB5.42 GiB

重みは選択したファイルのメタデータを使います。実行時の追加分は見積もりです。

重み4.36 GiB
KV Cache(生データ)0.44 GiB
KV の追加分(量子化メタデータなど)0.00 GiB
アクティベーション / 作業領域0.06 GiB
エンジン予約0.06 GiB
安全マージン0.00 GiB

利用可能予算: 15.00 GiB · 見積もり後の残り: 9.58 GiB10.08 GiB

ソフトウェアの対応

文書で対応が確認できる. メモリが足りても、指定のエンジン・量子化・OS で動くとは限りません。動いても速いとは限りません。

結果を左右する前提

  • 常駐ウェイトの見積もりは総パラメータを使い、非アクティブな MoE エキスパートも含めます。
  • ウェイトのバイト数は選んだファイルだけです。リポジトリ内の全量子化を合計しません。
  • ダウンロードサイズはピーク GPU メモリではありません。実行時レイアウトと KV は別です。
  • 計上したファイル: qwen2.5-7b-instruct-q4_k_m-00001-of-00002.gguf, qwen2.5-7b-instruct-q4_k_m-00002-of-00002.gguf。
  • コンテキストはシーケンスあたりのキャッシュトークン数(入力+生成の予約)です。
  • 同時シーケンスは同一のモデル複製を共有し、ウェイトはシーケンス数では増えません。
  • KV の型は、変更しない限りウェイト量子化とは独立です。
  • 28 個の query heads ではなく 4 個の KV heads を使います。
  • プリフィルのピークと定常デコードは同じではありません。高シナリオはプリフィル寄りです。
  • エンジン予約はウェイトと KV の実使用量ではありません。
  • llama.cpp の計算バッファはコンテキストとバッチで増えます。ここは調整可能なシナリオで、一致する校正がある場合だけ実測として示します。
  • ホスト RAM は独立 GPU の VRAM に自動では入りません。

計算方法

この負荷でカタログ上のモデル

モデル見積もり推定メモリ範囲
載る見込み4.92 GiB5.42 GiB
載る見込み1.14 GiB1.54 GiB
載る見込み3.22 GiB3.67 GiB
載る見込み2.37 GiB2.80 GiB
載る見込み10.00 GiB10.64 GiB
載る見込み4.78 GiB5.30 GiB
載る見込み3.58 GiB4.08 GiB
載る見込み5.93 GiB6.48 GiB
載る見込み9.76 GiB10.39 GiB
載る見込み10.24 GiB10.97 GiB
余裕が少ない14.63 GiB15.34 GiB