Qwen2.5-3B-Instruct roda em GeForce RTX 4090 24GB (desktop)?
Julgamento condicional de memória para uma configuração. Contexto, quantização ou motor podem mudar a conclusão.
3B Q4_K_M on RTX 4090 with a matching llama.cpp runtime-resident trace at 8192 tokens.
Configuração desta página: gguf-q4_k_m, 8.192 tokens em cache, 1 sequência, motor llama.cpp.
Status: Provavelmente cabe. Software: Suporte documentado.
Pesos 1,96 GiB · KV bruta 0,28 GiB · total 2,37 GiB–2,80 GiB.
Orçamento disponível 22,00 GiB após a reserva padrão.
Medição residente rt-qwen2.5-3b-instruct-q4km-4090-ctx8192: GPU do processo 2,59 GiB em 2026-09-19T15:43:43Z (llama.cpp version: 0.4.1-dev (build 1, commit 1af554f)). A estimativa da fórmula continua à parte.
- A estimativa residente usa o total de parâmetros, inclusive especialistas MoE inativos.
- Os bytes dos pesos vêm só dos arquivos escolhidos, não de todas as quantizações do repositório.
- O tamanho do download não é o pico de GPU. Layout em execução e KV vêm a mais.
- Arquivos contados: qwen2.5-3b-instruct-q4_k_m.gguf.
- O contexto é o número de tokens em cache por sequência (entrada mais geração reservada).
- Sequências simultâneas compartilham uma cópia do modelo; os pesos não multiplicam pela quantidade de sequências.
- O tipo da KV é independente da quantização dos pesos, a menos que você mude.
- Usando 2 heads KV, não 16 de consulta.
Estimativa
Provavelmente cabe
Nas premissas atuais, o máximo estimado fica abaixo de 90% do orçamento disponível.
Faixa estimada de memória: 2,37 GiB – 2,80 GiB
Há medição residente para um ambiente correspondente.
Orçamento disponível: 22,00 GiB · Restante após a estimativa: 19,20 GiB – 19,63 GiB
Compatibilidade de software
Suporte documentado. Caber na memória não prova que o motor, a quantização e o sistema operacional funcionam juntos. Ter suporte também não significa ser rápido.
Há medição residente para um ambiente correspondente. Memória GPU medida do processo: 2,59 GiB · llama.cpp version: 0.4.1-dev (build 1, commit 1af554f) · 2026-09-19T15:43:43Z
Premissas que afetam o resultado
- A estimativa residente usa o total de parâmetros, inclusive especialistas MoE inativos.
- Os bytes dos pesos vêm só dos arquivos escolhidos, não de todas as quantizações do repositório.
- O tamanho do download não é o pico de GPU. Layout em execução e KV vêm a mais.
- Arquivos contados: qwen2.5-3b-instruct-q4_k_m.gguf.
- O contexto é o número de tokens em cache por sequência (entrada mais geração reservada).
- Sequências simultâneas compartilham uma cópia do modelo; os pesos não multiplicam pela quantidade de sequências.
- O tipo da KV é independente da quantização dos pesos, a menos que você mude.
- Usando 2 heads KV, não 16 de consulta.
- O pico de prefill e a decodificação estável não são iguais. O cenário alto fica mais perto do prefill.
- A reserva do motor não é o uso real de pesos e KV.
- Os buffers do llama.cpp crescem com contexto e batch. São cenários ajustáveis, não medições — salvo uma calibração correspondente.
- A RAM do host não entra sozinha na VRAM discreta.