Qwen2.5-72B-Instruct

Qwen · Qwen/Qwen2.5-72B-Instruct · gqa · full

量子化2,0488,19232,768
BF16 safetensors136.11 GiB–136.68 GiB137.99 GiB–138.55 GiB145.49 GiB–146.05 GiB
GGUF Q4_K_M41.68 GiB–42.24 GiB43.55 GiB–44.11 GiB51.05 GiB–51.61 GiB
INT4 theoretical34.54 GiB–38.49 GiB36.42 GiB–40.36 GiB43.92 GiB–47.86 GiB

モデルと設定を選んで、必要なメモリを確認します。

詳細設定

GiB(2^30 バイト)

モデル構造を手入力

ブラウザ内だけで解析します。ファイルは送信しません。

huggingface.co の config.json のみ。トークンなし。非公開リポジトリは拒否します。

見積もり

判断できない

予算や必須データが足りないか、この版では扱えない配置です。

推定メモリ範囲: 43.61 GiB44.98 GiB

重みは選択したファイルのメタデータを使います。実行時の追加分は見積もりです。

重み40.99 GiB
KV Cache(生データ)2.50 GiB
KV の追加分(量子化メタデータなど)0.00 GiB
アクティベーション / 作業領域0.06 GiB
エンジン予約0.06 GiB
安全マージン0.00 GiB

ソフトウェアの対応

文書で対応が確認できる. メモリが足りても、指定のエンジン・量子化・OS で動くとは限りません。動いても速いとは限りません。

結果を左右する前提

  • 常駐ウェイトの見積もりは総パラメータを使い、非アクティブな MoE エキスパートも含めます。
  • ウェイトのバイト数は選んだファイルだけです。リポジトリ内の全量子化を合計しません。
  • ダウンロードサイズはピーク GPU メモリではありません。実行時レイアウトと KV は別です。
  • 計上したファイル: qwen2.5-72b-instruct-q4_k_m-00001-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00002-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00003-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00004-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00005-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00006-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00007-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00008-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00009-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00010-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00011-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00012-of-00012.gguf。
  • コンテキストはシーケンスあたりのキャッシュトークン数(入力+生成の予約)です。
  • 同時シーケンスは同一のモデル複製を共有し、ウェイトはシーケンス数では増えません。
  • KV の型は、変更しない限りウェイト量子化とは独立です。
  • 64 個の query heads ではなく 8 個の KV heads を使います。
  • プリフィルのピークと定常デコードは同じではありません。高シナリオはプリフィル寄りです。
  • エンジン予約はウェイトと KV の実使用量ではありません。
  • llama.cpp の計算バッファはコンテキストとバッチで増えます。ここは調整可能なシナリオで、一致する校正がある場合だけ実測として示します。

計算方法

設定を変えて再計算