Qwen2.5-32B-Instruct は NVIDIA DGX Spark (GB10, 128 GB unified) で動くか

1つの設定に対する条件付きの判断です。コンテキスト・量子化・エンジンを変えると結論も変わります。

Unified memory budget after OS reserve, not 128GB dedicated VRAM.

このページの設定: bf16、キャッシュ 8,192 トークン、シーケンス 1、エンジン vllm。

判定: 載る見込み。ソフトウェア: 文書で対応が確認できる。

ウェイト 61.03 GiB · 生 KV 2.00 GiB · 合計 63.65 GiB–65.59 GiB。

既定の予約を除いた利用可能予算 112.00 GiB。

一致する実行時常駐の実測が付いていない限り、このページは見積もりです。

特定のモデルと機材の組み合わせを、条件付きで判定します。

詳細設定

GiB(2^30 バイト)

モデル構造を手入力

ブラウザ内だけで解析します。ファイルは送信しません。

huggingface.co の config.json のみ。トークンなし。非公開リポジトリは拒否します。

見積もり

載る見込み

現在の前提では、見積もりの上限が利用可能予算の 90% 以下です。

推定メモリ範囲: 63.65 GiB65.59 GiB

重みは選択したファイルのメタデータを使います。実行時の追加分は見積もりです。

重み61.03 GiB
KV Cache(生データ)2.00 GiB
KV の追加分(量子化メタデータなど)0.00 GiB
アクティベーション / 作業領域0.13 GiB
エンジン予約0.50 GiB
安全マージン0.00 GiB

利用可能予算: 112.00 GiB · 見積もり後の残り: 46.41 GiB48.35 GiB

ソフトウェアの対応

文書で対応が確認できる. メモリが足りても、指定のエンジン・量子化・OS で動くとは限りません。動いても速いとは限りません。

結果を左右する前提

  • 常駐ウェイトの見積もりは総パラメータを使い、非アクティブな MoE エキスパートも含めます。
  • ウェイトのバイト数は選んだファイルだけです。リポジトリ内の全量子化を合計しません。
  • ダウンロードサイズはピーク GPU メモリではありません。実行時レイアウトと KV は別です。
  • 計上したファイル: model.safetensors.index.json metadata.total_size。
  • コンテキストはシーケンスあたりのキャッシュトークン数(入力+生成の予約)です。
  • 同時シーケンスは同一のモデル複製を共有し、ウェイトはシーケンス数では増えません。
  • KV の型は、変更しない限りウェイト量子化とは独立です。
  • 40 個の query heads ではなく 8 個の KV heads を使います。
  • プリフィルのピークと定常デコードは同じではありません。高シナリオはプリフィル寄りです。
  • エンジン予約はウェイトと KV の実使用量ではありません。
  • vLLM は残り GPU メモリから KV を先に確保しがちです。ここでは必要 KV と CUDA/グラフ分を出し、残り全部を掴んだ量は出しません。
  • PagedAttention のブロック整列で、生の KV より少し増えることがあります。
  • ユニファイドメモリは CPU/GPU の共有プールです。ホスト RAM をその上に足しません。

計算方法