DeepSeek-V2-Lite-Chat
DeepSeek · deepseek-ai/DeepSeek-V2-Lite-Chat · mla · unsupported
| Quantisierung | 2.048 | 8.192 | 32.768 |
|---|---|---|---|
| BF16 safetensors | Nicht unterstützt / unvollständig | Nicht unterstützt / unvollständig | Nicht unterstützt / unvollständig |
Schätzung
Nicht unterstützt / unvollständig
Architektur oder Aufteilung liegen außerhalb des Umfangs. Gewichtsanteile können trotzdem erscheinen.
Geschätzter Speicherbereich: 29,26 GiB – 29,26 GiB
Die Gewichte stammen aus den gewählten Dateimetadaten. Laufzeitanteile bleiben geschätzt.
Softwareunterstützung
Nicht geprüft. Genug Speicher bedeutet nicht, dass Engine, Quantisierung und Betriebssystem zusammenlaufen. Unterstützung bedeutet nicht, dass es schnell ist.
- Architektur mla ist für KV-Schätzungen nicht vollständig unterstützt.
- MLA-KV wird nicht mit der GQA-Formel geschätzt.
- Genug Speicher beweist nicht, dass Engine, Quantisierung und OS zusammenlaufen.
Annahmen, die das Ergebnis beeinflussen
- Die vollständige Residenzschätzung nutzt die Gesamtparameter, inklusive inaktiver MoE-Experten.
- Dieses MoE nennt 15700000000 Gesamt- und 2400000000 aktive Parameter. Die aktive Rechenmenge ist nicht die Gewichtresidenz.
- Gewichtbytes kommen nur von den gewählten Dateien, nicht von allen Quantisierungen im Repository.
- Die Downloadgröße ist nicht der GPU-Spitzenspeicher. Layout, Allocator und KV kommen extra.
- Berücksichtigte Dateien: model.safetensors.index.json metadata.total_size.
- Das Kontextbudget ist die Zahl gecachter Tokens je Sequenz (Prompt plus reservierte Generierung).
- Gleichzeitige Sequenzen teilen eine Modellkopie; Gewichte werden nicht mit der Sequenzzahl multipliziert.
- Der KV-Datentyp ist unabhängig von der Gewichtquantisierung, außer Sie ändern ihn.