Qwen2.5-72B-Instruct roda em GeForce RTX 4090 24GB (desktop)?

Julgamento condicional de memória para uma configuração. Contexto, quantização ou motor podem mudar a conclusão.

72B does not fit a 24GB card even in Q4 without offload.

Configuração desta página: gguf-q4_k_m, 4.096 tokens em cache, 1 sequência, motor llama.cpp.

Status: Memória insuficiente. Software: Suporte documentado.

Pesos 40,99 GiB · KV bruta 1,25 GiB · total 42,36 GiB–43,58 GiB.

Orçamento disponível 22,00 GiB após a reserva padrão.

Esta página é uma estimativa, salvo uma medição residente correspondente.

Avalie um modelo e um dispositivo específicos, com condições.

Configurações avançadas

GiB (2^30 bytes)

Estrutura de modelo personalizada

O arquivo é lido só no navegador e não é enviado.

Só huggingface.co, só config.json, sem token. Repositório privado é recusado.

Estimativa

Memória insuficiente

Mesmo o mínimo estimado passa do orçamento disponível.

Faixa estimada de memória: 42,36 GiB43,58 GiB

Os pesos usam metadados dos arquivos escolhidos. O extra de execução continua estimado.

Pesos40,99 GiB
Cache KV (dados brutos)1,25 GiB
Extras de KV (metadados de quantização etc.)0,00 GiB
Ativações / área de trabalho0,06 GiB
Reserva do motor0,06 GiB
Margem de segurança0,00 GiB

Orçamento disponível: 22,00 GiB · Restante após a estimativa: -21,58 GiB-20,36 GiB

Compatibilidade de software

Suporte documentado. Caber na memória não prova que o motor, a quantização e o sistema operacional funcionam juntos. Ter suporte também não significa ser rápido.

Premissas que afetam o resultado

  • A estimativa residente usa o total de parâmetros, inclusive especialistas MoE inativos.
  • Os bytes dos pesos vêm só dos arquivos escolhidos, não de todas as quantizações do repositório.
  • O tamanho do download não é o pico de GPU. Layout em execução e KV vêm a mais.
  • Arquivos contados: qwen2.5-72b-instruct-q4_k_m-00001-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00002-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00003-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00004-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00005-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00006-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00007-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00008-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00009-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00010-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00011-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00012-of-00012.gguf.
  • O contexto é o número de tokens em cache por sequência (entrada mais geração reservada).
  • Sequências simultâneas compartilham uma cópia do modelo; os pesos não multiplicam pela quantidade de sequências.
  • O tipo da KV é independente da quantização dos pesos, a menos que você mude.
  • Usando 8 heads KV, não 64 de consulta.
  • O pico de prefill e a decodificação estável não são iguais. O cenário alto fica mais perto do prefill.
  • A reserva do motor não é o uso real de pesos e KV.
  • Os buffers do llama.cpp crescem com contexto e batch. São cenários ajustáveis, não medições — salvo uma calibração correspondente.
  • A RAM do host não entra sozinha na VRAM discreta.

Método de cálculo

Recalcular com estas mudanças