¿Puede ejecutarse Qwen3-30B-A3B en GeForce RTX 4090 24GB (desktop)?
Juicio condicional de memoria para una configuración. El contexto, la cuantización o el motor pueden cambiar la conclusión.
MoE full-resident weights vs 24GB, not active-parameter compute.
Configuración de esta página: gguf-q4_k_m, 8192 tokens en caché, 1 secuencia, motor llama.cpp.
Estado: Es probable que quepa. Software: Soporte documentado.
Pesos 17,28 GiB · KV cruda 0,75 GiB · total 18,16 GiB–18,93 GiB.
Presupuesto disponible 22,00 GiB tras la reserva por defecto.
Esta página es una estimación salvo que haya una medición residente coincidente.
- La estimación residente usa el total de parámetros, incluidos expertos MoE inactivos.
- Este MoE declara 30500000000 parámetros totales y 3300000000 activos. El cómputo activo no es la residencia de pesos.
- Los bytes de pesos salen solo de los archivos elegidos, no de todas las cuantizaciones del repositorio.
- El tamaño de descarga no es la memoria GPU de pico. El diseño en ejecución y la KV van aparte.
- Archivos contados: Qwen3-30B-A3B-Q4_K_M.gguf.
- El contexto es el número de tokens en caché por secuencia (entrada más generación reservada).
- Las secuencias concurrentes comparten una copia del modelo; los pesos no se multiplican por el número de secuencias.
- El tipo de KV es independiente de la cuantización de pesos salvo que lo cambie.
Estimación
Es probable que quepa
Con las hipótesis actuales, el máximo estimado queda por debajo del 90 % del presupuesto.
Rango estimado de memoria: 18,16 GiB – 18,93 GiB
Los pesos usan metadatos de los archivos elegidos. El extra de ejecución sigue siendo estimado.
Presupuesto disponible: 22,00 GiB · Restante tras la estimación: 3,07 GiB – 3,84 GiB
Compatibilidad de software
Soporte documentado. Que quepa en memoria no prueba que el motor, la cuantización y el sistema funcionen juntos. Compatibilidad no implica buen rendimiento.
Hipótesis que afectan al resultado
- La estimación residente usa el total de parámetros, incluidos expertos MoE inactivos.
- Este MoE declara 30500000000 parámetros totales y 3300000000 activos. El cómputo activo no es la residencia de pesos.
- Los bytes de pesos salen solo de los archivos elegidos, no de todas las cuantizaciones del repositorio.
- El tamaño de descarga no es la memoria GPU de pico. El diseño en ejecución y la KV van aparte.
- Archivos contados: Qwen3-30B-A3B-Q4_K_M.gguf.
- El contexto es el número de tokens en caché por secuencia (entrada más generación reservada).
- Las secuencias concurrentes comparten una copia del modelo; los pesos no se multiplican por el número de secuencias.
- El tipo de KV es independiente de la cuantización de pesos salvo que lo cambie.
- Se usan 4 cabezas KV, no 32 de consulta.
- El pico de prefill y la decodificación estable no coinciden. El escenario alto se acerca al prefill.
- La reserva del motor no es el uso real de pesos y KV.
- Los búferes de llama.cpp crecen con el contexto y el batch. Son escenarios ajustables, no mediciones, salvo que haya una calibración coincidente.
- La RAM del host no se añade sola a la VRAM discreta.