DeepSeek-V2-Lite-Chat
DeepSeek · deepseek-ai/DeepSeek-V2-Lite-Chat · mla · unsupported
| 量子化 | 2,048 | 8,192 | 32,768 |
|---|---|---|---|
| BF16 safetensors | 未対応 / データ不足 | 未対応 / データ不足 | 未対応 / データ不足 |
見積もり
未対応 / データ不足
アーキテクチャや分割方法が対象外です。重みの内訳は表示できる場合があります。
推定メモリ範囲: 29.26 GiB – 29.26 GiB
重みは選択したファイルのメタデータを使います。実行時の追加分は見積もりです。
ソフトウェアの対応
未確認. メモリが足りても、指定のエンジン・量子化・OS で動くとは限りません。動いても速いとは限りません。
- アーキテクチャ mla の KV は完全には扱えません。
- MLA の KV は GQA の式では見積もりません。
- メモリに余裕があっても、そのエンジン・量子化・OS の組み合わせが動くとは限りません。
結果を左右する前提
- 常駐ウェイトの見積もりは総パラメータを使い、非アクティブな MoE エキスパートも含めます。
- この MoE は総パラメータ 15700000000、アクティブ 2400000000 です。アクティブ側の計算量はウェイト常駐メモリに使いません。
- ウェイトのバイト数は選んだファイルだけです。リポジトリ内の全量子化を合計しません。
- ダウンロードサイズはピーク GPU メモリではありません。実行時レイアウトと KV は別です。
- 計上したファイル: model.safetensors.index.json metadata.total_size。
- コンテキストはシーケンスあたりのキャッシュトークン数(入力+生成の予約)です。
- 同時シーケンスは同一のモデル複製を共有し、ウェイトはシーケンス数では増えません。
- KV の型は、変更しない限りウェイト量子化とは独立です。