Läuft DeepSeek-V2-Lite-Chat auf GeForce RTX 4090 24GB (desktop)?
Bedingte Speicherbeurteilung für eine Konfiguration. Kontext, Quantisierung oder Engine können die Aussage ändern.
MLA is unsupported for full KV; page explains the gap instead of faking GQA.
Konfiguration auf dieser Seite: bf16, 4.096 gecachte Tokens, 1 Sequenz, Engine vllm.
Status: Nicht unterstützt / unvollständig. Software: Dokumentiert unterstützt.
Gewichte 29,26 GiB · rohes KV 0,00 GiB · gesamt 29,26 GiB–29,26 GiB.
Verfügbares Budget 22,00 GiB nach der Standardreserve.
Diese Seite ist eine Schätzung, solange keine passende Laufzeitmessung vorliegt.
- Die vollständige Residenzschätzung nutzt die Gesamtparameter, inklusive inaktiver MoE-Experten.
- Dieses MoE nennt 15700000000 Gesamt- und 2400000000 aktive Parameter. Die aktive Rechenmenge ist nicht die Gewichtresidenz.
- Gewichtbytes kommen nur von den gewählten Dateien, nicht von allen Quantisierungen im Repository.
- Die Downloadgröße ist nicht der GPU-Spitzenspeicher. Layout, Allocator und KV kommen extra.
- Berücksichtigte Dateien: model.safetensors.index.json metadata.total_size.
- Das Kontextbudget ist die Zahl gecachter Tokens je Sequenz (Prompt plus reservierte Generierung).
- Gleichzeitige Sequenzen teilen eine Modellkopie; Gewichte werden nicht mit der Sequenzzahl multipliziert.
- Der KV-Datentyp ist unabhängig von der Gewichtquantisierung, außer Sie ändern ihn.
Schätzung
Nicht unterstützt / unvollständig
Architektur oder Aufteilung liegen außerhalb des Umfangs. Gewichtsanteile können trotzdem erscheinen.
Geschätzter Speicherbereich: 29,26 GiB – 29,26 GiB
Die Gewichte stammen aus den gewählten Dateimetadaten. Laufzeitanteile bleiben geschätzt.
Verfügbares Budget: 22,00 GiB · Rest nach der Schätzung: -7,26 GiB – -7,26 GiB
Softwareunterstützung
Dokumentiert unterstützt. Genug Speicher bedeutet nicht, dass Engine, Quantisierung und Betriebssystem zusammenlaufen. Unterstützung bedeutet nicht, dass es schnell ist.
- Architektur mla ist für KV-Schätzungen nicht vollständig unterstützt.
- MLA-KV wird nicht mit der GQA-Formel geschätzt.
Annahmen, die das Ergebnis beeinflussen
- Die vollständige Residenzschätzung nutzt die Gesamtparameter, inklusive inaktiver MoE-Experten.
- Dieses MoE nennt 15700000000 Gesamt- und 2400000000 aktive Parameter. Die aktive Rechenmenge ist nicht die Gewichtresidenz.
- Gewichtbytes kommen nur von den gewählten Dateien, nicht von allen Quantisierungen im Repository.
- Die Downloadgröße ist nicht der GPU-Spitzenspeicher. Layout, Allocator und KV kommen extra.
- Berücksichtigte Dateien: model.safetensors.index.json metadata.total_size.
- Das Kontextbudget ist die Zahl gecachter Tokens je Sequenz (Prompt plus reservierte Generierung).
- Gleichzeitige Sequenzen teilen eine Modellkopie; Gewichte werden nicht mit der Sequenzzahl multipliziert.
- Der KV-Datentyp ist unabhängig von der Gewichtquantisierung, außer Sie ändern ihn.
- Host-RAM fließt nicht automatisch in dedizierten GPU-Speicher.