Qwen2.5-7B-Instruct
Qwen · Qwen/Qwen2.5-7B-Instruct · gqa · full
| 量子化 | 2,048 | 8,192 | 32,768 |
|---|---|---|---|
| BF16 safetensors | 14.36 GiB–14.92 GiB | 14.69 GiB–15.25 GiB | 16.00 GiB–16.56 GiB |
| GGUF Q8_0 | 7.71 GiB–8.28 GiB | 8.04 GiB–8.60 GiB | 9.35 GiB–9.92 GiB |
| GGUF Q5_K_M | 5.24 GiB–5.81 GiB | 5.57 GiB–6.13 GiB | 6.88 GiB–7.45 GiB |
| GGUF Q4_K_M | 4.53 GiB–5.10 GiB | 4.86 GiB–5.42 GiB | 6.17 GiB–6.74 GiB |
| INT4 theoretical | 3.72 GiB–4.63 GiB | 4.04 GiB–4.96 GiB | 5.36 GiB–6.27 GiB |
見積もり
判断できない
予算や必須データが足りないか、この版では扱えない配置です。
推定メモリ範囲: 4.92 GiB – 5.42 GiB
重みは選択したファイルのメタデータを使います。実行時の追加分は見積もりです。
ソフトウェアの対応
文書で対応が確認できる. メモリが足りても、指定のエンジン・量子化・OS で動くとは限りません。動いても速いとは限りません。
結果を左右する前提
- 常駐ウェイトの見積もりは総パラメータを使い、非アクティブな MoE エキスパートも含めます。
- ウェイトのバイト数は選んだファイルだけです。リポジトリ内の全量子化を合計しません。
- ダウンロードサイズはピーク GPU メモリではありません。実行時レイアウトと KV は別です。
- 計上したファイル: qwen2.5-7b-instruct-q4_k_m-00001-of-00002.gguf, qwen2.5-7b-instruct-q4_k_m-00002-of-00002.gguf。
- コンテキストはシーケンスあたりのキャッシュトークン数(入力+生成の予約)です。
- 同時シーケンスは同一のモデル複製を共有し、ウェイトはシーケンス数では増えません。
- KV の型は、変更しない限りウェイト量子化とは独立です。
- 28 個の query heads ではなく 4 個の KV heads を使います。
- プリフィルのピークと定常デコードは同じではありません。高シナリオはプリフィル寄りです。
- エンジン予約はウェイトと KV の実使用量ではありません。
- llama.cpp の計算バッファはコンテキストとバッチで増えます。ここは調整可能なシナリオで、一致する校正がある場合だけ実測として示します。