DeepSeek-V2-Lite-Chat
DeepSeek · deepseek-ai/DeepSeek-V2-Lite-Chat · mla · unsupported
| Quantização | 2.048 | 8.192 | 32.768 |
|---|---|---|---|
| BF16 safetensors | Sem suporte / incompleto | Sem suporte / incompleto | Sem suporte / incompleto |
Estimativa
Sem suporte / incompleto
A arquitetura ou a partição está fora do escopo. Os pesos ainda podem aparecer.
Faixa estimada de memória: 29,26 GiB – 29,26 GiB
Os pesos usam metadados dos arquivos escolhidos. O extra de execução continua estimado.
Compatibilidade de software
Não verificado. Caber na memória não prova que o motor, a quantização e o sistema operacional funcionam juntos. Ter suporte também não significa ser rápido.
- A arquitetura mla não tem estimativa completa de KV.
- A KV de MLA não é estimada com a fórmula GQA.
- Caber na memória não prova que motor, quantização e sistema operacional funcionam juntos.
Premissas que afetam o resultado
- A estimativa residente usa o total de parâmetros, inclusive especialistas MoE inativos.
- Este MoE tem 15700000000 parâmetros totais e 2400000000 ativos. O compute ativo não é a residência dos pesos.
- Os bytes dos pesos vêm só dos arquivos escolhidos, não de todas as quantizações do repositório.
- O tamanho do download não é o pico de GPU. Layout em execução e KV vêm a mais.
- Arquivos contados: model.safetensors.index.json metadata.total_size.
- O contexto é o número de tokens em cache por sequência (entrada mais geração reservada).
- Sequências simultâneas compartilham uma cópia do modelo; os pesos não multiplicam pela quantidade de sequências.
- O tipo da KV é independente da quantização dos pesos, a menos que você mude.