Läuft Mixtral-8x7B-Instruct-v0.1 auf GeForce RTX 4090 24GB (desktop)?
Bedingte Speicherbeurteilung für eine Konfiguration. Kontext, Quantisierung oder Engine können die Aussage ändern.
Mixtral BF16 needs far more than 24GB despite 12.9B active params.
Konfiguration auf dieser Seite: bf16, 4.096 gecachte Tokens, 1 Sequenz, Engine vllm.
Status: Voraussichtlich zu wenig Speicher. Software: Dokumentiert unterstützt.
Gewichte 86,99 GiB · rohes KV 0,50 GiB · gesamt 88,12 GiB–90,01 GiB.
Verfügbares Budget 22,00 GiB nach der Standardreserve.
Diese Seite ist eine Schätzung, solange keine passende Laufzeitmessung vorliegt.
- Die vollständige Residenzschätzung nutzt die Gesamtparameter, inklusive inaktiver MoE-Experten.
- Dieses MoE nennt 46700000000 Gesamt- und 12900000000 aktive Parameter. Die aktive Rechenmenge ist nicht die Gewichtresidenz.
- Gewichtbytes kommen nur von den gewählten Dateien, nicht von allen Quantisierungen im Repository.
- Die Downloadgröße ist nicht der GPU-Spitzenspeicher. Layout, Allocator und KV kommen extra.
- Berücksichtigte Dateien: model.safetensors.index.json metadata.total_size.
- Das Kontextbudget ist die Zahl gecachter Tokens je Sequenz (Prompt plus reservierte Generierung).
- Gleichzeitige Sequenzen teilen eine Modellkopie; Gewichte werden nicht mit der Sequenzzahl multipliziert.
- Der KV-Datentyp ist unabhängig von der Gewichtquantisierung, außer Sie ändern ihn.
Schätzung
Voraussichtlich zu wenig Speicher
Selbst die untere Schätzung übersteigt das verfügbare Budget.
Geschätzter Speicherbereich: 88,12 GiB – 90,01 GiB
Die Gewichte stammen aus den gewählten Dateimetadaten. Laufzeitanteile bleiben geschätzt.
Verfügbares Budget: 22,00 GiB · Rest nach der Schätzung: -68,01 GiB – -66,12 GiB
Softwareunterstützung
Dokumentiert unterstützt. Genug Speicher bedeutet nicht, dass Engine, Quantisierung und Betriebssystem zusammenlaufen. Unterstützung bedeutet nicht, dass es schnell ist.
Annahmen, die das Ergebnis beeinflussen
- Die vollständige Residenzschätzung nutzt die Gesamtparameter, inklusive inaktiver MoE-Experten.
- Dieses MoE nennt 46700000000 Gesamt- und 12900000000 aktive Parameter. Die aktive Rechenmenge ist nicht die Gewichtresidenz.
- Gewichtbytes kommen nur von den gewählten Dateien, nicht von allen Quantisierungen im Repository.
- Die Downloadgröße ist nicht der GPU-Spitzenspeicher. Layout, Allocator und KV kommen extra.
- Berücksichtigte Dateien: model.safetensors.index.json metadata.total_size.
- Das Kontextbudget ist die Zahl gecachter Tokens je Sequenz (Prompt plus reservierte Generierung).
- Gleichzeitige Sequenzen teilen eine Modellkopie; Gewichte werden nicht mit der Sequenzzahl multipliziert.
- Der KV-Datentyp ist unabhängig von der Gewichtquantisierung, außer Sie ändern ihn.
- Es werden 8 KV-Köpfe verwendet, nicht 32 Query-Köpfe.
- Prefill-Spitze und stabiles Decoding sind nicht gleich. Das hohe Szenario liegt näher am Prefill.
- Die Engine-Reserve ist nicht der tatsächliche Verbrauch von Gewichten und KV.
- vLLM reserviert KV oft aus dem restlichen GPU-Speicher. Hier stehen benötigtes KV plus CUDA/Graph, nicht der Restgriff des Allocators.
- PagedAttention-Blockausrichtung kann etwas über dem rohen KV liegen.
- Host-RAM fließt nicht automatisch in dedizierten GPU-Speicher.