¿Puede ejecutarse DeepSeek-V2-Lite-Chat en GeForce RTX 4090 24GB (desktop)?
Juicio condicional de memoria para una configuración. El contexto, la cuantización o el motor pueden cambiar la conclusión.
MLA is unsupported for full KV; page explains the gap instead of faking GQA.
Configuración de esta página: bf16, 4096 tokens en caché, 1 secuencia, motor vllm.
Estado: No compatible / incompleto. Software: Soporte documentado.
Pesos 29,26 GiB · KV cruda 0,00 GiB · total 29,26 GiB–29,26 GiB.
Presupuesto disponible 22,00 GiB tras la reserva por defecto.
Esta página es una estimación salvo que haya una medición residente coincidente.
- La estimación residente usa el total de parámetros, incluidos expertos MoE inactivos.
- Este MoE declara 15700000000 parámetros totales y 2400000000 activos. El cómputo activo no es la residencia de pesos.
- Los bytes de pesos salen solo de los archivos elegidos, no de todas las cuantizaciones del repositorio.
- El tamaño de descarga no es la memoria GPU de pico. El diseño en ejecución y la KV van aparte.
- Archivos contados: model.safetensors.index.json metadata.total_size.
- El contexto es el número de tokens en caché por secuencia (entrada más generación reservada).
- Las secuencias concurrentes comparten una copia del modelo; los pesos no se multiplican por el número de secuencias.
- El tipo de KV es independiente de la cuantización de pesos salvo que lo cambie.
Estimación
No compatible / incompleto
La arquitectura o la partición están fuera de alcance. Aun así pueden mostrarse los pesos.
Rango estimado de memoria: 29,26 GiB – 29,26 GiB
Los pesos usan metadatos de los archivos elegidos. El extra de ejecución sigue siendo estimado.
Presupuesto disponible: 22,00 GiB · Restante tras la estimación: -7,26 GiB – -7,26 GiB
Compatibilidad de software
Soporte documentado. Que quepa en memoria no prueba que el motor, la cuantización y el sistema funcionen juntos. Compatibilidad no implica buen rendimiento.
- La arquitectura mla no tiene estimación completa de KV.
- La KV de MLA no se estima con la fórmula GQA.
Hipótesis que afectan al resultado
- La estimación residente usa el total de parámetros, incluidos expertos MoE inactivos.
- Este MoE declara 15700000000 parámetros totales y 2400000000 activos. El cómputo activo no es la residencia de pesos.
- Los bytes de pesos salen solo de los archivos elegidos, no de todas las cuantizaciones del repositorio.
- El tamaño de descarga no es la memoria GPU de pico. El diseño en ejecución y la KV van aparte.
- Archivos contados: model.safetensors.index.json metadata.total_size.
- El contexto es el número de tokens en caché por secuencia (entrada más generación reservada).
- Las secuencias concurrentes comparten una copia del modelo; los pesos no se multiplican por el número de secuencias.
- El tipo de KV es independiente de la cuantización de pesos salvo que lo cambie.
- La RAM del host no se añade sola a la VRAM discreta.