DeepSeek-V2-Lite-Chat
DeepSeek · deepseek-ai/DeepSeek-V2-Lite-Chat · mla · unsupported
| Cuantización | 2048 | 8192 | 32.768 |
|---|---|---|---|
| BF16 safetensors | No compatible / incompleto | No compatible / incompleto | No compatible / incompleto |
Estimación
No compatible / incompleto
La arquitectura o la partición están fuera de alcance. Aun así pueden mostrarse los pesos.
Rango estimado de memoria: 29,26 GiB – 29,26 GiB
Los pesos usan metadatos de los archivos elegidos. El extra de ejecución sigue siendo estimado.
Compatibilidad de software
No verificado. Que quepa en memoria no prueba que el motor, la cuantización y el sistema funcionen juntos. Compatibilidad no implica buen rendimiento.
- La arquitectura mla no tiene estimación completa de KV.
- La KV de MLA no se estima con la fórmula GQA.
- Que quepa en memoria no prueba que el motor, la cuantización y el sistema funcionen juntos.
Hipótesis que afectan al resultado
- La estimación residente usa el total de parámetros, incluidos expertos MoE inactivos.
- Este MoE declara 15700000000 parámetros totales y 2400000000 activos. El cómputo activo no es la residencia de pesos.
- Los bytes de pesos salen solo de los archivos elegidos, no de todas las cuantizaciones del repositorio.
- El tamaño de descarga no es la memoria GPU de pico. El diseño en ejecución y la KV van aparte.
- Archivos contados: model.safetensors.index.json metadata.total_size.
- El contexto es el número de tokens en caché por secuencia (entrada más generación reservada).
- Las secuencias concurrentes comparten una copia del modelo; los pesos no se multiplican por el número de secuencias.
- El tipo de KV es independiente de la cuantización de pesos salvo que lo cambie.