¿Puede ejecutarse Qwen2.5-72B-Instruct en NVIDIA DGX Spark (GB10, 128 GB unified)?
Juicio condicional de memoria para una configuración. El contexto, la cuantización o el motor pueden cambiar la conclusión.
72B Q4 on unified memory after a realistic system reserve.
Configuración de esta página: gguf-q4_k_m, 8192 tokens en caché, 1 secuencia, motor llama.cpp.
Estado: Es probable que quepa. Software: Soporte documentado.
Pesos 40,99 GiB · KV cruda 2,50 GiB · total 43,61 GiB–44,98 GiB.
Presupuesto disponible 112,00 GiB tras la reserva por defecto.
Esta página es una estimación salvo que haya una medición residente coincidente.
- La estimación residente usa el total de parámetros, incluidos expertos MoE inactivos.
- Los bytes de pesos salen solo de los archivos elegidos, no de todas las cuantizaciones del repositorio.
- El tamaño de descarga no es la memoria GPU de pico. El diseño en ejecución y la KV van aparte.
- Archivos contados: qwen2.5-72b-instruct-q4_k_m-00001-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00002-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00003-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00004-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00005-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00006-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00007-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00008-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00009-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00010-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00011-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00012-of-00012.gguf.
- El contexto es el número de tokens en caché por secuencia (entrada más generación reservada).
- Las secuencias concurrentes comparten una copia del modelo; los pesos no se multiplican por el número de secuencias.
- El tipo de KV es independiente de la cuantización de pesos salvo que lo cambie.
- Se usan 8 cabezas KV, no 64 de consulta.
Estimación
Es probable que quepa
Con las hipótesis actuales, el máximo estimado queda por debajo del 90 % del presupuesto.
Rango estimado de memoria: 43,61 GiB – 44,98 GiB
Los pesos usan metadatos de los archivos elegidos. El extra de ejecución sigue siendo estimado.
Presupuesto disponible: 112,00 GiB · Restante tras la estimación: 67,02 GiB – 68,39 GiB
Compatibilidad de software
Soporte documentado. Que quepa en memoria no prueba que el motor, la cuantización y el sistema funcionen juntos. Compatibilidad no implica buen rendimiento.
Hipótesis que afectan al resultado
- La estimación residente usa el total de parámetros, incluidos expertos MoE inactivos.
- Los bytes de pesos salen solo de los archivos elegidos, no de todas las cuantizaciones del repositorio.
- El tamaño de descarga no es la memoria GPU de pico. El diseño en ejecución y la KV van aparte.
- Archivos contados: qwen2.5-72b-instruct-q4_k_m-00001-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00002-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00003-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00004-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00005-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00006-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00007-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00008-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00009-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00010-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00011-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00012-of-00012.gguf.
- El contexto es el número de tokens en caché por secuencia (entrada más generación reservada).
- Las secuencias concurrentes comparten una copia del modelo; los pesos no se multiplican por el número de secuencias.
- El tipo de KV es independiente de la cuantización de pesos salvo que lo cambie.
- Se usan 8 cabezas KV, no 64 de consulta.
- El pico de prefill y la decodificación estable no coinciden. El escenario alto se acerca al prefill.
- La reserva del motor no es el uso real de pesos y KV.
- Los búferes de llama.cpp crecen con el contexto y el batch. Son escenarios ajustables, no mediciones, salvo que haya una calibración coincidente.
- La memoria unificada es un pool CPU/GPU. No se suma RAM de host encima.