DeepSeek-V2-Lite-Chat

DeepSeek · deepseek-ai/DeepSeek-V2-Lite-Chat · mla · unsupported

Quantisierung2.0488.19232.768
BF16 safetensorsNicht unterstützt / unvollständigNicht unterstützt / unvollständigNicht unterstützt / unvollständig

Modell und Einstellungen wählen, um den Bedarf zu sehen.

Erweiterte Einstellungen

GiB (2^30 Byte)

Modellstruktur selbst eintragen

Die Datei wird nur im Browser gelesen und nicht hochgeladen.

Nur huggingface.co, nur config.json, kein Token. Private Repos werden abgelehnt.

Schätzung

Nicht unterstützt / unvollständig

Architektur oder Aufteilung liegen außerhalb des Umfangs. Gewichtsanteile können trotzdem erscheinen.

Geschätzter Speicherbereich: 29,26 GiB29,26 GiB

Die Gewichte stammen aus den gewählten Dateimetadaten. Laufzeitanteile bleiben geschätzt.

Gewichte29,26 GiB
KV-Cache (Rohdaten)0,00 GiB
KV-Zusatz (Quantisierungsmetadaten u. a.)0,00 GiB
Aktivierungen / Arbeitsbereich0,00 GiB
Reserve der Laufzeit0,00 GiB
Sicherheitsmarge0,00 GiB

Softwareunterstützung

Nicht geprüft. Genug Speicher bedeutet nicht, dass Engine, Quantisierung und Betriebssystem zusammenlaufen. Unterstützung bedeutet nicht, dass es schnell ist.

  • Architektur mla ist für KV-Schätzungen nicht vollständig unterstützt.
  • MLA-KV wird nicht mit der GQA-Formel geschätzt.
  • Genug Speicher beweist nicht, dass Engine, Quantisierung und OS zusammenlaufen.

Annahmen, die das Ergebnis beeinflussen

  • Die vollständige Residenzschätzung nutzt die Gesamtparameter, inklusive inaktiver MoE-Experten.
  • Dieses MoE nennt 15700000000 Gesamt- und 2400000000 aktive Parameter. Die aktive Rechenmenge ist nicht die Gewichtresidenz.
  • Gewichtbytes kommen nur von den gewählten Dateien, nicht von allen Quantisierungen im Repository.
  • Die Downloadgröße ist nicht der GPU-Spitzenspeicher. Layout, Allocator und KV kommen extra.
  • Berücksichtigte Dateien: model.safetensors.index.json metadata.total_size.
  • Das Kontextbudget ist die Zahl gecachter Tokens je Sequenz (Prompt plus reservierte Generierung).
  • Gleichzeitige Sequenzen teilen eine Modellkopie; Gewichte werden nicht mit der Sequenzzahl multipliziert.
  • Der KV-Datentyp ist unabhängig von der Gewichtquantisierung, außer Sie ändern ihn.

Rechenweg

Diese Änderungen neu berechnen