Läuft Qwen2.5-3B-Instruct auf GeForce RTX 4090 24GB (desktop)?

Bedingte Speicherbeurteilung für eine Konfiguration. Kontext, Quantisierung oder Engine können die Aussage ändern.

3B Q4_K_M on RTX 4090 with a matching llama.cpp runtime-resident trace at 8192 tokens.

Konfiguration auf dieser Seite: gguf-q4_k_m, 8.192 gecachte Tokens, 1 Sequenz, Engine llama.cpp.

Status: Passt voraussichtlich. Software: Dokumentiert unterstützt.

Gewichte 1,96 GiB · rohes KV 0,28 GiB · gesamt 2,37 GiB–2,80 GiB.

Verfügbares Budget 22,00 GiB nach der Standardreserve.

Laufzeitmessung rt-qwen2.5-3b-instruct-q4km-4090-ctx8192: Prozess-GPU 2,59 GiB am 2026-09-19T15:43:43Z (llama.cpp version: 0.4.1-dev (build 1, commit 1af554f)). Die Formelabschätzung bleibt getrennt sichtbar.

Ein konkretes Modell und ein Gerät bedingt beurteilen.

Erweiterte Einstellungen

GiB (2^30 Byte)

Modellstruktur selbst eintragen

Die Datei wird nur im Browser gelesen und nicht hochgeladen.

Nur huggingface.co, nur config.json, kein Token. Private Repos werden abgelehnt.

Schätzung

Passt voraussichtlich

Unter den aktuellen Annahmen liegt die obere Schätzung unter 90 % des Budgets.

Geschätzter Speicherbereich: 2,37 GiB2,80 GiB

Es gibt eine gemessene Residenz für eine passende Umgebung.

Gewichte1,96 GiB
KV-Cache (Rohdaten)0,28 GiB
KV-Zusatz (Quantisierungsmetadaten u. a.)0,00 GiB
Aktivierungen / Arbeitsbereich0,06 GiB
Reserve der Laufzeit0,06 GiB
Sicherheitsmarge0,00 GiB

Verfügbares Budget: 22,00 GiB · Rest nach der Schätzung: 19,20 GiB19,63 GiB

Softwareunterstützung

Dokumentiert unterstützt. Genug Speicher bedeutet nicht, dass Engine, Quantisierung und Betriebssystem zusammenlaufen. Unterstützung bedeutet nicht, dass es schnell ist.

Es gibt eine gemessene Residenz für eine passende Umgebung. Gemessener GPU-Speicher des Prozesses: 2,59 GiB · llama.cpp version: 0.4.1-dev (build 1, commit 1af554f) · 2026-09-19T15:43:43Z

Annahmen, die das Ergebnis beeinflussen

  • Die vollständige Residenzschätzung nutzt die Gesamtparameter, inklusive inaktiver MoE-Experten.
  • Gewichtbytes kommen nur von den gewählten Dateien, nicht von allen Quantisierungen im Repository.
  • Die Downloadgröße ist nicht der GPU-Spitzenspeicher. Layout, Allocator und KV kommen extra.
  • Berücksichtigte Dateien: qwen2.5-3b-instruct-q4_k_m.gguf.
  • Das Kontextbudget ist die Zahl gecachter Tokens je Sequenz (Prompt plus reservierte Generierung).
  • Gleichzeitige Sequenzen teilen eine Modellkopie; Gewichte werden nicht mit der Sequenzzahl multipliziert.
  • Der KV-Datentyp ist unabhängig von der Gewichtquantisierung, außer Sie ändern ihn.
  • Es werden 2 KV-Köpfe verwendet, nicht 16 Query-Köpfe.
  • Prefill-Spitze und stabiles Decoding sind nicht gleich. Das hohe Szenario liegt näher am Prefill.
  • Die Engine-Reserve ist nicht der tatsächliche Verbrauch von Gewichten und KV.
  • llama.cpp-Puffer wachsen mit Kontext und Batch. Das sind anpassbare Szenarien, keine Messungen — außer eine passende Kalibrierung liegt vor.
  • Host-RAM fließt nicht automatisch in dedizierten GPU-Speicher.

Rechenweg