Qwen3-30B-A3B

Qwen · Qwen/Qwen3-30B-A3B · gqa · full

Quantisierung2.0488.19232.768
BF16 safetensors57,12 GiB–57,68 GiB57,68 GiB–58,25 GiB59,93 GiB–60,50 GiB
GGUF Q4_K_M17,53 GiB–18,09 GiB18,09 GiB–18,66 GiB20,34 GiB–20,91 GiB
GGUF Q8_030,50 GiB–31,07 GiB31,07 GiB–31,63 GiB33,32 GiB–33,88 GiB
INT4 theoretical14,45 GiB–16,44 GiB15,02 GiB–17,00 GiB17,27 GiB–19,25 GiB

Modell und Einstellungen wählen, um den Bedarf zu sehen.

Erweiterte Einstellungen

GiB (2^30 Byte)

Modellstruktur selbst eintragen

Die Datei wird nur im Browser gelesen und nicht hochgeladen.

Nur huggingface.co, nur config.json, kein Token. Private Repos werden abgelehnt.

Schätzung

Unklar

Budget oder Pflichtangaben fehlen, oder die Verteilung kann diese Version nicht beurteilen.

Geschätzter Speicherbereich: 18,16 GiB18,93 GiB

Die Gewichte stammen aus den gewählten Dateimetadaten. Laufzeitanteile bleiben geschätzt.

Gewichte17,28 GiB
KV-Cache (Rohdaten)0,75 GiB
KV-Zusatz (Quantisierungsmetadaten u. a.)0,00 GiB
Aktivierungen / Arbeitsbereich0,06 GiB
Reserve der Laufzeit0,06 GiB
Sicherheitsmarge0,00 GiB

Softwareunterstützung

Dokumentiert unterstützt. Genug Speicher bedeutet nicht, dass Engine, Quantisierung und Betriebssystem zusammenlaufen. Unterstützung bedeutet nicht, dass es schnell ist.

Annahmen, die das Ergebnis beeinflussen

  • Die vollständige Residenzschätzung nutzt die Gesamtparameter, inklusive inaktiver MoE-Experten.
  • Dieses MoE nennt 30500000000 Gesamt- und 3300000000 aktive Parameter. Die aktive Rechenmenge ist nicht die Gewichtresidenz.
  • Gewichtbytes kommen nur von den gewählten Dateien, nicht von allen Quantisierungen im Repository.
  • Die Downloadgröße ist nicht der GPU-Spitzenspeicher. Layout, Allocator und KV kommen extra.
  • Berücksichtigte Dateien: Qwen3-30B-A3B-Q4_K_M.gguf.
  • Das Kontextbudget ist die Zahl gecachter Tokens je Sequenz (Prompt plus reservierte Generierung).
  • Gleichzeitige Sequenzen teilen eine Modellkopie; Gewichte werden nicht mit der Sequenzzahl multipliziert.
  • Der KV-Datentyp ist unabhängig von der Gewichtquantisierung, außer Sie ändern ihn.
  • Es werden 4 KV-Köpfe verwendet, nicht 32 Query-Köpfe.
  • Prefill-Spitze und stabiles Decoding sind nicht gleich. Das hohe Szenario liegt näher am Prefill.
  • Die Engine-Reserve ist nicht der tatsächliche Verbrauch von Gewichten und KV.
  • llama.cpp-Puffer wachsen mit Kontext und Batch. Das sind anpassbare Szenarien, keine Messungen — außer eine passende Kalibrierung liegt vor.

Rechenweg

Diese Änderungen neu berechnen