NVIDIA DGX Spark (GB10, 128 GB unified)

NVIDIA DGX Spark 940-54242-0000 · unified-memory

Capacidad usada en las estimaciones: 128,00 GiB

Marketed 128 GB unified system memory is treated as 128 GiB (2^30 bytes) for calculation. Users can override the budget. Unified memory is a shared CPU/GPU pool; host RAM is not added again.

Elija dispositivo y carga, y filtre modelos del catálogo que podrían caber.

Ajustes avanzados

GiB (2^30 bytes)

Estructura de modelo personalizada

Se analiza en el navegador. El archivo no se sube.

Solo huggingface.co, solo config.json, sin token. Se rechazan repos privados.

Estimación

Es probable que quepa

Con las hipótesis actuales, el máximo estimado queda por debajo del 90 % del presupuesto.

Rango estimado de memoria: 4,92 GiB5,42 GiB

Los pesos usan metadatos de los archivos elegidos. El extra de ejecución sigue siendo estimado.

Pesos4,36 GiB
Caché KV (datos brutos)0,44 GiB
Extras de KV (metadatos de cuantización, etc.)0,00 GiB
Activaciones / espacio de trabajo0,06 GiB
Reserva del motor0,06 GiB
Margen de seguridad0,00 GiB

Presupuesto disponible: 112,00 GiB · Restante tras la estimación: 106,58 GiB107,08 GiB

Compatibilidad de software

Soporte documentado. Que quepa en memoria no prueba que el motor, la cuantización y el sistema funcionen juntos. Compatibilidad no implica buen rendimiento.

Hipótesis que afectan al resultado

  • La estimación residente usa el total de parámetros, incluidos expertos MoE inactivos.
  • Los bytes de pesos salen solo de los archivos elegidos, no de todas las cuantizaciones del repositorio.
  • El tamaño de descarga no es la memoria GPU de pico. El diseño en ejecución y la KV van aparte.
  • Archivos contados: qwen2.5-7b-instruct-q4_k_m-00001-of-00002.gguf, qwen2.5-7b-instruct-q4_k_m-00002-of-00002.gguf.
  • El contexto es el número de tokens en caché por secuencia (entrada más generación reservada).
  • Las secuencias concurrentes comparten una copia del modelo; los pesos no se multiplican por el número de secuencias.
  • El tipo de KV es independiente de la cuantización de pesos salvo que lo cambie.
  • Se usan 4 cabezas KV, no 28 de consulta.
  • El pico de prefill y la decodificación estable no coinciden. El escenario alto se acerca al prefill.
  • La reserva del motor no es el uso real de pesos y KV.
  • Los búferes de llama.cpp crecen con el contexto y el batch. Son escenarios ajustables, no mediciones, salvo que haya una calibración coincidente.
  • La memoria unificada es un pool CPU/GPU. No se suma RAM de host encima.

Método de cálculo

Modelos del catálogo con esta carga

ModeloEstimaciónRango estimado de memoria
Es probable que quepa4,92 GiB5,42 GiB
Es probable que quepa1,14 GiB1,54 GiB
Es probable que quepa3,22 GiB3,67 GiB
Es probable que quepa2,37 GiB2,80 GiB
Es probable que quepa10,00 GiB10,64 GiB
Es probable que quepa20,61 GiB21,50 GiB
Es probable que quepa43,61 GiB44,98 GiB
Es probable que quepa4,78 GiB5,30 GiB
Es probable que quepa3,58 GiB4,08 GiB
Es probable que quepa5,93 GiB6,48 GiB
Es probable que quepa9,76 GiB10,39 GiB
Es probable que quepa20,53 GiB21,41 GiB
Es probable que quepa18,16 GiB18,93 GiB
Es probable que quepa10,24 GiB10,97 GiB
Es probable que quepa14,63 GiB15,34 GiB
Es probable que quepa88,12 GiB90,30 GiB
Es probable que quepa16,08 GiB16,83 GiB
Es probable que quepa63,15 GiB64,89 GiB