Läuft Phi-3.5-mini-instruct auf GeForce RTX 4060 8GB (desktop)?
Bedingte Speicherbeurteilung für eine Konfiguration. Kontext, Quantisierung oder Engine können die Aussage ändern.
Small dense model on 8GB, including long-context KV pressure.
Konfiguration auf dieser Seite: bf16, 8.192 gecachte Tokens, 1 Sequenz, Engine vllm.
Status: Voraussichtlich zu wenig Speicher. Software: Dokumentiert unterstützt.
Gewichte 7,12 GiB · rohes KV 3,00 GiB · gesamt 10,74 GiB–12,71 GiB.
Verfügbares Budget 7,00 GiB nach der Standardreserve.
Diese Seite ist eine Schätzung, solange keine passende Laufzeitmessung vorliegt.
- Die vollständige Residenzschätzung nutzt die Gesamtparameter, inklusive inaktiver MoE-Experten.
- Gewichtbytes kommen nur von den gewählten Dateien, nicht von allen Quantisierungen im Repository.
- Die Downloadgröße ist nicht der GPU-Spitzenspeicher. Layout, Allocator und KV kommen extra.
- Berücksichtigte Dateien: model.safetensors.index.json metadata.total_size.
- Das Kontextbudget ist die Zahl gecachter Tokens je Sequenz (Prompt plus reservierte Generierung).
- Gleichzeitige Sequenzen teilen eine Modellkopie; Gewichte werden nicht mit der Sequenzzahl multipliziert.
- Der KV-Datentyp ist unabhängig von der Gewichtquantisierung, außer Sie ändern ihn.
- Prefill-Spitze und stabiles Decoding sind nicht gleich. Das hohe Szenario liegt näher am Prefill.
Schätzung
Voraussichtlich zu wenig Speicher
Selbst die untere Schätzung übersteigt das verfügbare Budget.
Geschätzter Speicherbereich: 10,74 GiB – 12,71 GiB
Die Gewichte stammen aus den gewählten Dateimetadaten. Laufzeitanteile bleiben geschätzt.
Verfügbares Budget: 7,00 GiB · Rest nach der Schätzung: -5,71 GiB – -3,74 GiB
Softwareunterstützung
Dokumentiert unterstützt. Genug Speicher bedeutet nicht, dass Engine, Quantisierung und Betriebssystem zusammenlaufen. Unterstützung bedeutet nicht, dass es schnell ist.
Annahmen, die das Ergebnis beeinflussen
- Die vollständige Residenzschätzung nutzt die Gesamtparameter, inklusive inaktiver MoE-Experten.
- Gewichtbytes kommen nur von den gewählten Dateien, nicht von allen Quantisierungen im Repository.
- Die Downloadgröße ist nicht der GPU-Spitzenspeicher. Layout, Allocator und KV kommen extra.
- Berücksichtigte Dateien: model.safetensors.index.json metadata.total_size.
- Das Kontextbudget ist die Zahl gecachter Tokens je Sequenz (Prompt plus reservierte Generierung).
- Gleichzeitige Sequenzen teilen eine Modellkopie; Gewichte werden nicht mit der Sequenzzahl multipliziert.
- Der KV-Datentyp ist unabhängig von der Gewichtquantisierung, außer Sie ändern ihn.
- Prefill-Spitze und stabiles Decoding sind nicht gleich. Das hohe Szenario liegt näher am Prefill.
- Die Engine-Reserve ist nicht der tatsächliche Verbrauch von Gewichten und KV.
- vLLM reserviert KV oft aus dem restlichen GPU-Speicher. Hier stehen benötigtes KV plus CUDA/Graph, nicht der Restgriff des Allocators.
- PagedAttention-Blockausrichtung kann etwas über dem rohen KV liegen.
- Host-RAM fließt nicht automatisch in dedizierten GPU-Speicher.