DeepSeek-V2-Lite-Chat

DeepSeek · deepseek-ai/DeepSeek-V2-Lite-Chat · mla · unsupported

量子化2,0488,19232,768
BF16 safetensors未対応 / データ不足未対応 / データ不足未対応 / データ不足

モデルと設定を選んで、必要なメモリを確認します。

詳細設定

GiB(2^30 バイト)

モデル構造を手入力

ブラウザ内だけで解析します。ファイルは送信しません。

huggingface.co の config.json のみ。トークンなし。非公開リポジトリは拒否します。

見積もり

未対応 / データ不足

アーキテクチャや分割方法が対象外です。重みの内訳は表示できる場合があります。

推定メモリ範囲: 29.26 GiB29.26 GiB

重みは選択したファイルのメタデータを使います。実行時の追加分は見積もりです。

重み29.26 GiB
KV Cache(生データ)0.00 GiB
KV の追加分(量子化メタデータなど)0.00 GiB
アクティベーション / 作業領域0.00 GiB
エンジン予約0.00 GiB
安全マージン0.00 GiB

ソフトウェアの対応

未確認. メモリが足りても、指定のエンジン・量子化・OS で動くとは限りません。動いても速いとは限りません。

  • アーキテクチャ mla の KV は完全には扱えません。
  • MLA の KV は GQA の式では見積もりません。
  • メモリに余裕があっても、そのエンジン・量子化・OS の組み合わせが動くとは限りません。

結果を左右する前提

  • 常駐ウェイトの見積もりは総パラメータを使い、非アクティブな MoE エキスパートも含めます。
  • この MoE は総パラメータ 15700000000、アクティブ 2400000000 です。アクティブ側の計算量はウェイト常駐メモリに使いません。
  • ウェイトのバイト数は選んだファイルだけです。リポジトリ内の全量子化を合計しません。
  • ダウンロードサイズはピーク GPU メモリではありません。実行時レイアウトと KV は別です。
  • 計上したファイル: model.safetensors.index.json metadata.total_size。
  • コンテキストはシーケンスあたりのキャッシュトークン数(入力+生成の予約)です。
  • 同時シーケンスは同一のモデル複製を共有し、ウェイトはシーケンス数では増えません。
  • KV の型は、変更しない限りウェイト量子化とは独立です。

計算方法

設定を変えて再計算