Läuft Qwen2.5-72B-Instruct auf NVIDIA DGX Spark (GB10, 128 GB unified)?
Bedingte Speicherbeurteilung für eine Konfiguration. Kontext, Quantisierung oder Engine können die Aussage ändern.
72B Q4 on unified memory after a realistic system reserve.
Konfiguration auf dieser Seite: gguf-q4_k_m, 8.192 gecachte Tokens, 1 Sequenz, Engine llama.cpp.
Status: Passt voraussichtlich. Software: Dokumentiert unterstützt.
Gewichte 40,99 GiB · rohes KV 2,50 GiB · gesamt 43,61 GiB–44,98 GiB.
Verfügbares Budget 112,00 GiB nach der Standardreserve.
Diese Seite ist eine Schätzung, solange keine passende Laufzeitmessung vorliegt.
- Die vollständige Residenzschätzung nutzt die Gesamtparameter, inklusive inaktiver MoE-Experten.
- Gewichtbytes kommen nur von den gewählten Dateien, nicht von allen Quantisierungen im Repository.
- Die Downloadgröße ist nicht der GPU-Spitzenspeicher. Layout, Allocator und KV kommen extra.
- Berücksichtigte Dateien: qwen2.5-72b-instruct-q4_k_m-00001-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00002-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00003-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00004-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00005-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00006-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00007-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00008-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00009-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00010-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00011-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00012-of-00012.gguf.
- Das Kontextbudget ist die Zahl gecachter Tokens je Sequenz (Prompt plus reservierte Generierung).
- Gleichzeitige Sequenzen teilen eine Modellkopie; Gewichte werden nicht mit der Sequenzzahl multipliziert.
- Der KV-Datentyp ist unabhängig von der Gewichtquantisierung, außer Sie ändern ihn.
- Es werden 8 KV-Köpfe verwendet, nicht 64 Query-Köpfe.
Schätzung
Passt voraussichtlich
Unter den aktuellen Annahmen liegt die obere Schätzung unter 90 % des Budgets.
Geschätzter Speicherbereich: 43,61 GiB – 44,98 GiB
Die Gewichte stammen aus den gewählten Dateimetadaten. Laufzeitanteile bleiben geschätzt.
Verfügbares Budget: 112,00 GiB · Rest nach der Schätzung: 67,02 GiB – 68,39 GiB
Softwareunterstützung
Dokumentiert unterstützt. Genug Speicher bedeutet nicht, dass Engine, Quantisierung und Betriebssystem zusammenlaufen. Unterstützung bedeutet nicht, dass es schnell ist.
Annahmen, die das Ergebnis beeinflussen
- Die vollständige Residenzschätzung nutzt die Gesamtparameter, inklusive inaktiver MoE-Experten.
- Gewichtbytes kommen nur von den gewählten Dateien, nicht von allen Quantisierungen im Repository.
- Die Downloadgröße ist nicht der GPU-Spitzenspeicher. Layout, Allocator und KV kommen extra.
- Berücksichtigte Dateien: qwen2.5-72b-instruct-q4_k_m-00001-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00002-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00003-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00004-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00005-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00006-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00007-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00008-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00009-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00010-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00011-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00012-of-00012.gguf.
- Das Kontextbudget ist die Zahl gecachter Tokens je Sequenz (Prompt plus reservierte Generierung).
- Gleichzeitige Sequenzen teilen eine Modellkopie; Gewichte werden nicht mit der Sequenzzahl multipliziert.
- Der KV-Datentyp ist unabhängig von der Gewichtquantisierung, außer Sie ändern ihn.
- Es werden 8 KV-Köpfe verwendet, nicht 64 Query-Köpfe.
- Prefill-Spitze und stabiles Decoding sind nicht gleich. Das hohe Szenario liegt näher am Prefill.
- Die Engine-Reserve ist nicht der tatsächliche Verbrauch von Gewichten und KV.
- llama.cpp-Puffer wachsen mit Kontext und Batch. Das sind anpassbare Szenarien, keine Messungen — außer eine passende Kalibrierung liegt vor.
- Unified Memory ist ein gemeinsamer CPU/GPU-Pool. Host-RAM wird nicht obendrauf addiert.