DeepSeek-V2-Lite-Chat

DeepSeek · deepseek-ai/DeepSeek-V2-Lite-Chat · mla · unsupported

Quantização2.0488.19232.768
BF16 safetensorsSem suporte / incompletoSem suporte / incompletoSem suporte / incompleto

Escolha o modelo e as opções para ver a demanda de memória.

Configurações avançadas

GiB (2^30 bytes)

Estrutura de modelo personalizada

O arquivo é lido só no navegador e não é enviado.

Só huggingface.co, só config.json, sem token. Repositório privado é recusado.

Estimativa

Sem suporte / incompleto

A arquitetura ou a partição está fora do escopo. Os pesos ainda podem aparecer.

Faixa estimada de memória: 29,26 GiB29,26 GiB

Os pesos usam metadados dos arquivos escolhidos. O extra de execução continua estimado.

Pesos29,26 GiB
Cache KV (dados brutos)0,00 GiB
Extras de KV (metadados de quantização etc.)0,00 GiB
Ativações / área de trabalho0,00 GiB
Reserva do motor0,00 GiB
Margem de segurança0,00 GiB

Compatibilidade de software

Não verificado. Caber na memória não prova que o motor, a quantização e o sistema operacional funcionam juntos. Ter suporte também não significa ser rápido.

  • A arquitetura mla não tem estimativa completa de KV.
  • A KV de MLA não é estimada com a fórmula GQA.
  • Caber na memória não prova que motor, quantização e sistema operacional funcionam juntos.

Premissas que afetam o resultado

  • A estimativa residente usa o total de parâmetros, inclusive especialistas MoE inativos.
  • Este MoE tem 15700000000 parâmetros totais e 2400000000 ativos. O compute ativo não é a residência dos pesos.
  • Os bytes dos pesos vêm só dos arquivos escolhidos, não de todas as quantizações do repositório.
  • O tamanho do download não é o pico de GPU. Layout em execução e KV vêm a mais.
  • Arquivos contados: model.safetensors.index.json metadata.total_size.
  • O contexto é o número de tokens em cache por sequência (entrada mais geração reservada).
  • Sequências simultâneas compartilham uma cópia do modelo; os pesos não multiplicam pela quantidade de sequências.
  • O tipo da KV é independente da quantização dos pesos, a menos que você mude.

Método de cálculo

Recalcular com estas mudanças