DeepSeek-V2-Lite-Chat

DeepSeek · deepseek-ai/DeepSeek-V2-Lite-Chat · mla · unsupported

Cuantización2048819232.768
BF16 safetensorsNo compatible / incompletoNo compatible / incompletoNo compatible / incompleto

Elija modelo y ajustes para ver la demanda de memoria.

Ajustes avanzados

GiB (2^30 bytes)

Estructura de modelo personalizada

Se analiza en el navegador. El archivo no se sube.

Solo huggingface.co, solo config.json, sin token. Se rechazan repos privados.

Estimación

No compatible / incompleto

La arquitectura o la partición están fuera de alcance. Aun así pueden mostrarse los pesos.

Rango estimado de memoria: 29,26 GiB29,26 GiB

Los pesos usan metadatos de los archivos elegidos. El extra de ejecución sigue siendo estimado.

Pesos29,26 GiB
Caché KV (datos brutos)0,00 GiB
Extras de KV (metadatos de cuantización, etc.)0,00 GiB
Activaciones / espacio de trabajo0,00 GiB
Reserva del motor0,00 GiB
Margen de seguridad0,00 GiB

Compatibilidad de software

No verificado. Que quepa en memoria no prueba que el motor, la cuantización y el sistema funcionen juntos. Compatibilidad no implica buen rendimiento.

  • La arquitectura mla no tiene estimación completa de KV.
  • La KV de MLA no se estima con la fórmula GQA.
  • Que quepa en memoria no prueba que el motor, la cuantización y el sistema funcionen juntos.

Hipótesis que afectan al resultado

  • La estimación residente usa el total de parámetros, incluidos expertos MoE inactivos.
  • Este MoE declara 15700000000 parámetros totales y 2400000000 activos. El cómputo activo no es la residencia de pesos.
  • Los bytes de pesos salen solo de los archivos elegidos, no de todas las cuantizaciones del repositorio.
  • El tamaño de descarga no es la memoria GPU de pico. El diseño en ejecución y la KV van aparte.
  • Archivos contados: model.safetensors.index.json metadata.total_size.
  • El contexto es el número de tokens en caché por secuencia (entrada más generación reservada).
  • Las secuencias concurrentes comparten una copia del modelo; los pesos no se multiplican por el número de secuencias.
  • El tipo de KV es independiente de la cuantización de pesos salvo que lo cambie.

Método de cálculo

Recalcular con estos cambios