NVIDIA A100 80GB SXM
A100 80GB SXM HBM2e · discrete-vram
見積もりに使う容量: 80.00 GiB
Vendor-marketed GB for discrete GPU VRAM is treated as GiB (2^30 bytes), matching physical GDDR/HBM module organization. This is an explicit unit assumption.
見積もり
載る見込み
現在の前提では、見積もりの上限が利用可能予算の 90% 以下です。
推定メモリ範囲: 4.92 GiB – 5.42 GiB
重みは選択したファイルのメタデータを使います。実行時の追加分は見積もりです。
利用可能予算: 78.00 GiB · 見積もり後の残り: 72.58 GiB – 73.08 GiB
ソフトウェアの対応
文書で対応が確認できる. メモリが足りても、指定のエンジン・量子化・OS で動くとは限りません。動いても速いとは限りません。
結果を左右する前提
- 常駐ウェイトの見積もりは総パラメータを使い、非アクティブな MoE エキスパートも含めます。
- ウェイトのバイト数は選んだファイルだけです。リポジトリ内の全量子化を合計しません。
- ダウンロードサイズはピーク GPU メモリではありません。実行時レイアウトと KV は別です。
- 計上したファイル: qwen2.5-7b-instruct-q4_k_m-00001-of-00002.gguf, qwen2.5-7b-instruct-q4_k_m-00002-of-00002.gguf。
- コンテキストはシーケンスあたりのキャッシュトークン数(入力+生成の予約)です。
- 同時シーケンスは同一のモデル複製を共有し、ウェイトはシーケンス数では増えません。
- KV の型は、変更しない限りウェイト量子化とは独立です。
- 28 個の query heads ではなく 4 個の KV heads を使います。
- プリフィルのピークと定常デコードは同じではありません。高シナリオはプリフィル寄りです。
- エンジン予約はウェイトと KV の実使用量ではありません。
- llama.cpp の計算バッファはコンテキストとバッチで増えます。ここは調整可能なシナリオで、一致する校正がある場合だけ実測として示します。
- ホスト RAM は独立 GPU の VRAM に自動では入りません。
この負荷でカタログ上のモデル
| モデル | 見積もり | 推定メモリ範囲 |
|---|---|---|
| 載る見込み | 4.92 GiB – 5.42 GiB | |
| 載る見込み | 1.14 GiB – 1.54 GiB | |
| 載る見込み | 3.22 GiB – 3.67 GiB | |
| 載る見込み | 2.37 GiB – 2.80 GiB | |
| 載る見込み | 10.00 GiB – 10.64 GiB | |
| 載る見込み | 20.61 GiB – 21.50 GiB | |
| 載る見込み | 43.61 GiB – 44.98 GiB | |
| 載る見込み | 4.78 GiB – 5.30 GiB | |
| 載る見込み | 3.58 GiB – 4.08 GiB | |
| 載る見込み | 5.93 GiB – 6.48 GiB | |
| 載る見込み | 9.76 GiB – 10.39 GiB | |
| 載る見込み | 20.53 GiB – 21.41 GiB | |
| 載る見込み | 18.16 GiB – 18.93 GiB | |
| 載る見込み | 10.24 GiB – 10.97 GiB | |
| 載る見込み | 14.63 GiB – 15.34 GiB | |
| 載る見込み | 16.08 GiB – 16.83 GiB | |
| 載る見込み | 63.15 GiB – 64.89 GiB |