Qwen2.5-32B-Instruct roda em NVIDIA DGX Spark (GB10, 128 GB unified)?
Julgamento condicional de memória para uma configuração. Contexto, quantização ou motor podem mudar a conclusão.
Unified memory budget after OS reserve, not 128GB dedicated VRAM.
Configuração desta página: bf16, 8.192 tokens em cache, 1 sequência, motor vllm.
Status: Provavelmente cabe. Software: Suporte documentado.
Pesos 61,03 GiB · KV bruta 2,00 GiB · total 63,65 GiB–65,59 GiB.
Orçamento disponível 112,00 GiB após a reserva padrão.
Esta página é uma estimativa, salvo uma medição residente correspondente.
- A estimativa residente usa o total de parâmetros, inclusive especialistas MoE inativos.
- Os bytes dos pesos vêm só dos arquivos escolhidos, não de todas as quantizações do repositório.
- O tamanho do download não é o pico de GPU. Layout em execução e KV vêm a mais.
- Arquivos contados: model.safetensors.index.json metadata.total_size.
- O contexto é o número de tokens em cache por sequência (entrada mais geração reservada).
- Sequências simultâneas compartilham uma cópia do modelo; os pesos não multiplicam pela quantidade de sequências.
- O tipo da KV é independente da quantização dos pesos, a menos que você mude.
- Usando 8 heads KV, não 40 de consulta.
Estimativa
Provavelmente cabe
Nas premissas atuais, o máximo estimado fica abaixo de 90% do orçamento disponível.
Faixa estimada de memória: 63,65 GiB – 65,59 GiB
Os pesos usam metadados dos arquivos escolhidos. O extra de execução continua estimado.
Orçamento disponível: 112,00 GiB · Restante após a estimativa: 46,41 GiB – 48,35 GiB
Compatibilidade de software
Suporte documentado. Caber na memória não prova que o motor, a quantização e o sistema operacional funcionam juntos. Ter suporte também não significa ser rápido.
Premissas que afetam o resultado
- A estimativa residente usa o total de parâmetros, inclusive especialistas MoE inativos.
- Os bytes dos pesos vêm só dos arquivos escolhidos, não de todas as quantizações do repositório.
- O tamanho do download não é o pico de GPU. Layout em execução e KV vêm a mais.
- Arquivos contados: model.safetensors.index.json metadata.total_size.
- O contexto é o número de tokens em cache por sequência (entrada mais geração reservada).
- Sequências simultâneas compartilham uma cópia do modelo; os pesos não multiplicam pela quantidade de sequências.
- O tipo da KV é independente da quantização dos pesos, a menos que você mude.
- Usando 8 heads KV, não 40 de consulta.
- O pico de prefill e a decodificação estável não são iguais. O cenário alto fica mais perto do prefill.
- A reserva do motor não é o uso real de pesos e KV.
- vLLM costuma pré-alocar KV da GPU restante. Aqui entra a KV necessária mais extras de CUDA/grafo, não o resto que o alocador pega.
- O alinhamento de blocos do PagedAttention pode somar um pouco acima da KV crua.
- Memória unificada é um pool CPU/GPU. RAM do host não é somada por cima.