¿Puede ejecutarse Qwen2.5-72B-Instruct en NVIDIA A100 80GB SXM?

Juicio condicional de memoria para una configuración. El contexto, la cuantización o el motor pueden cambiar la conclusión.

72B BF16 against 80GB datacenter memory.

Configuración de esta página: bf16, 8192 tokens en caché, 1 secuencia, motor vllm.

Estado: Memoria insuficiente. Software: Soporte documentado.

Pesos 135,43 GiB · KV cruda 2,50 GiB · total 138,55 GiB–140,50 GiB.

Presupuesto disponible 78,00 GiB tras la reserva por defecto.

Esta página es una estimación salvo que haya una medición residente coincidente.

Evalúe un modelo y un dispositivo concretos, con condiciones.

Ajustes avanzados

GiB (2^30 bytes)

Estructura de modelo personalizada

Se analiza en el navegador. El archivo no se sube.

Solo huggingface.co, solo config.json, sin token. Se rechazan repos privados.

Estimación

Memoria insuficiente

Incluso el mínimo estimado supera el presupuesto disponible.

Rango estimado de memoria: 138,55 GiB140,50 GiB

Los pesos usan metadatos de los archivos elegidos. El extra de ejecución sigue siendo estimado.

Pesos135,43 GiB
Caché KV (datos brutos)2,50 GiB
Extras de KV (metadatos de cuantización, etc.)0,00 GiB
Activaciones / espacio de trabajo0,13 GiB
Reserva del motor0,50 GiB
Margen de seguridad0,00 GiB

Presupuesto disponible: 78,00 GiB · Restante tras la estimación: -62,50 GiB-60,55 GiB

Compatibilidad de software

Soporte documentado. Que quepa en memoria no prueba que el motor, la cuantización y el sistema funcionen juntos. Compatibilidad no implica buen rendimiento.

Hipótesis que afectan al resultado

  • La estimación residente usa el total de parámetros, incluidos expertos MoE inactivos.
  • Los bytes de pesos salen solo de los archivos elegidos, no de todas las cuantizaciones del repositorio.
  • El tamaño de descarga no es la memoria GPU de pico. El diseño en ejecución y la KV van aparte.
  • Archivos contados: model.safetensors.index.json metadata.total_size.
  • El contexto es el número de tokens en caché por secuencia (entrada más generación reservada).
  • Las secuencias concurrentes comparten una copia del modelo; los pesos no se multiplican por el número de secuencias.
  • El tipo de KV es independiente de la cuantización de pesos salvo que lo cambie.
  • Se usan 8 cabezas KV, no 64 de consulta.
  • El pico de prefill y la decodificación estable no coinciden. El escenario alto se acerca al prefill.
  • La reserva del motor no es el uso real de pesos y KV.
  • vLLM suele preasignar KV de la GPU restante. Aquí se informa la KV necesaria más extras de CUDA/grafos, no el resto que se queda el asignador.
  • La alineación de bloques de PagedAttention puede sumar un poco sobre la KV cruda.
  • La RAM del host no se añade sola a la VRAM discreta.

Método de cálculo

Recalcular con estos cambios