Mixtral-8x7B-Instruct-v0.1 は GeForce RTX 4090 24GB (desktop) で動くか
1つの設定に対する条件付きの判断です。コンテキスト・量子化・エンジンを変えると結論も変わります。
Mixtral BF16 needs far more than 24GB despite 12.9B active params.
このページの設定: bf16、キャッシュ 4,096 トークン、シーケンス 1、エンジン vllm。
判定: メモリ不足の見込み。ソフトウェア: 文書で対応が確認できる。
ウェイト 86.99 GiB · 生 KV 0.50 GiB · 合計 88.12 GiB–90.01 GiB。
既定の予約を除いた利用可能予算 22.00 GiB。
一致する実行時常駐の実測が付いていない限り、このページは見積もりです。
- 常駐ウェイトの見積もりは総パラメータを使い、非アクティブな MoE エキスパートも含めます。
- この MoE は総パラメータ 46700000000、アクティブ 12900000000 です。アクティブ側の計算量はウェイト常駐メモリに使いません。
- ウェイトのバイト数は選んだファイルだけです。リポジトリ内の全量子化を合計しません。
- ダウンロードサイズはピーク GPU メモリではありません。実行時レイアウトと KV は別です。
- 計上したファイル: model.safetensors.index.json metadata.total_size。
- コンテキストはシーケンスあたりのキャッシュトークン数(入力+生成の予約)です。
- 同時シーケンスは同一のモデル複製を共有し、ウェイトはシーケンス数では増えません。
- KV の型は、変更しない限りウェイト量子化とは独立です。
見積もり
メモリ不足の見込み
下限見積もりでも、現在の予算を超えます。
推定メモリ範囲: 88.12 GiB – 90.01 GiB
重みは選択したファイルのメタデータを使います。実行時の追加分は見積もりです。
利用可能予算: 22.00 GiB · 見積もり後の残り: -68.01 GiB – -66.12 GiB
ソフトウェアの対応
文書で対応が確認できる. メモリが足りても、指定のエンジン・量子化・OS で動くとは限りません。動いても速いとは限りません。
結果を左右する前提
- 常駐ウェイトの見積もりは総パラメータを使い、非アクティブな MoE エキスパートも含めます。
- この MoE は総パラメータ 46700000000、アクティブ 12900000000 です。アクティブ側の計算量はウェイト常駐メモリに使いません。
- ウェイトのバイト数は選んだファイルだけです。リポジトリ内の全量子化を合計しません。
- ダウンロードサイズはピーク GPU メモリではありません。実行時レイアウトと KV は別です。
- 計上したファイル: model.safetensors.index.json metadata.total_size。
- コンテキストはシーケンスあたりのキャッシュトークン数(入力+生成の予約)です。
- 同時シーケンスは同一のモデル複製を共有し、ウェイトはシーケンス数では増えません。
- KV の型は、変更しない限りウェイト量子化とは独立です。
- 32 個の query heads ではなく 8 個の KV heads を使います。
- プリフィルのピークと定常デコードは同じではありません。高シナリオはプリフィル寄りです。
- エンジン予約はウェイトと KV の実使用量ではありません。
- vLLM は残り GPU メモリから KV を先に確保しがちです。ここでは必要 KV と CUDA/グラフ分を出し、残り全部を掴んだ量は出しません。
- PagedAttention のブロック整列で、生の KV より少し増えることがあります。
- ホスト RAM は独立 GPU の VRAM に自動では入りません。