Läuft DeepSeek-V2-Lite-Chat auf GeForce RTX 4090 24GB (desktop)?

Bedingte Speicherbeurteilung für eine Konfiguration. Kontext, Quantisierung oder Engine können die Aussage ändern.

MLA is unsupported for full KV; page explains the gap instead of faking GQA.

Konfiguration auf dieser Seite: bf16, 4.096 gecachte Tokens, 1 Sequenz, Engine vllm.

Status: Nicht unterstützt / unvollständig. Software: Dokumentiert unterstützt.

Gewichte 29,26 GiB · rohes KV 0,00 GiB · gesamt 29,26 GiB–29,26 GiB.

Verfügbares Budget 22,00 GiB nach der Standardreserve.

Diese Seite ist eine Schätzung, solange keine passende Laufzeitmessung vorliegt.

Ein konkretes Modell und ein Gerät bedingt beurteilen.

Erweiterte Einstellungen

GiB (2^30 Byte)

Modellstruktur selbst eintragen

Die Datei wird nur im Browser gelesen und nicht hochgeladen.

Nur huggingface.co, nur config.json, kein Token. Private Repos werden abgelehnt.

Schätzung

Nicht unterstützt / unvollständig

Architektur oder Aufteilung liegen außerhalb des Umfangs. Gewichtsanteile können trotzdem erscheinen.

Geschätzter Speicherbereich: 29,26 GiB29,26 GiB

Die Gewichte stammen aus den gewählten Dateimetadaten. Laufzeitanteile bleiben geschätzt.

Gewichte29,26 GiB
KV-Cache (Rohdaten)0,00 GiB
KV-Zusatz (Quantisierungsmetadaten u. a.)0,00 GiB
Aktivierungen / Arbeitsbereich0,00 GiB
Reserve der Laufzeit0,00 GiB
Sicherheitsmarge0,00 GiB

Verfügbares Budget: 22,00 GiB · Rest nach der Schätzung: -7,26 GiB-7,26 GiB

Softwareunterstützung

Dokumentiert unterstützt. Genug Speicher bedeutet nicht, dass Engine, Quantisierung und Betriebssystem zusammenlaufen. Unterstützung bedeutet nicht, dass es schnell ist.

  • Architektur mla ist für KV-Schätzungen nicht vollständig unterstützt.
  • MLA-KV wird nicht mit der GQA-Formel geschätzt.

Annahmen, die das Ergebnis beeinflussen

  • Die vollständige Residenzschätzung nutzt die Gesamtparameter, inklusive inaktiver MoE-Experten.
  • Dieses MoE nennt 15700000000 Gesamt- und 2400000000 aktive Parameter. Die aktive Rechenmenge ist nicht die Gewichtresidenz.
  • Gewichtbytes kommen nur von den gewählten Dateien, nicht von allen Quantisierungen im Repository.
  • Die Downloadgröße ist nicht der GPU-Spitzenspeicher. Layout, Allocator und KV kommen extra.
  • Berücksichtigte Dateien: model.safetensors.index.json metadata.total_size.
  • Das Kontextbudget ist die Zahl gecachter Tokens je Sequenz (Prompt plus reservierte Generierung).
  • Gleichzeitige Sequenzen teilen eine Modellkopie; Gewichte werden nicht mit der Sequenzzahl multipliziert.
  • Der KV-Datentyp ist unabhängig von der Gewichtquantisierung, außer Sie ändern ihn.
  • Host-RAM fließt nicht automatisch in dedizierten GPU-Speicher.

Rechenweg

Diese Änderungen neu berechnen