DeepSeek-V2-Lite-Chat roda em GeForce RTX 4090 24GB (desktop)?
Julgamento condicional de memória para uma configuração. Contexto, quantização ou motor podem mudar a conclusão.
MLA is unsupported for full KV; page explains the gap instead of faking GQA.
Configuração desta página: bf16, 4.096 tokens em cache, 1 sequência, motor vllm.
Status: Sem suporte / incompleto. Software: Suporte documentado.
Pesos 29,26 GiB · KV bruta 0,00 GiB · total 29,26 GiB–29,26 GiB.
Orçamento disponível 22,00 GiB após a reserva padrão.
Esta página é uma estimativa, salvo uma medição residente correspondente.
- A estimativa residente usa o total de parâmetros, inclusive especialistas MoE inativos.
- Este MoE tem 15700000000 parâmetros totais e 2400000000 ativos. O compute ativo não é a residência dos pesos.
- Os bytes dos pesos vêm só dos arquivos escolhidos, não de todas as quantizações do repositório.
- O tamanho do download não é o pico de GPU. Layout em execução e KV vêm a mais.
- Arquivos contados: model.safetensors.index.json metadata.total_size.
- O contexto é o número de tokens em cache por sequência (entrada mais geração reservada).
- Sequências simultâneas compartilham uma cópia do modelo; os pesos não multiplicam pela quantidade de sequências.
- O tipo da KV é independente da quantização dos pesos, a menos que você mude.
Estimativa
Sem suporte / incompleto
A arquitetura ou a partição está fora do escopo. Os pesos ainda podem aparecer.
Faixa estimada de memória: 29,26 GiB – 29,26 GiB
Os pesos usam metadados dos arquivos escolhidos. O extra de execução continua estimado.
Orçamento disponível: 22,00 GiB · Restante após a estimativa: -7,26 GiB – -7,26 GiB
Compatibilidade de software
Suporte documentado. Caber na memória não prova que o motor, a quantização e o sistema operacional funcionam juntos. Ter suporte também não significa ser rápido.
- A arquitetura mla não tem estimativa completa de KV.
- A KV de MLA não é estimada com a fórmula GQA.
Premissas que afetam o resultado
- A estimativa residente usa o total de parâmetros, inclusive especialistas MoE inativos.
- Este MoE tem 15700000000 parâmetros totais e 2400000000 ativos. O compute ativo não é a residência dos pesos.
- Os bytes dos pesos vêm só dos arquivos escolhidos, não de todas as quantizações do repositório.
- O tamanho do download não é o pico de GPU. Layout em execução e KV vêm a mais.
- Arquivos contados: model.safetensors.index.json metadata.total_size.
- O contexto é o número de tokens em cache por sequência (entrada mais geração reservada).
- Sequências simultâneas compartilham uma cópia do modelo; os pesos não multiplicam pela quantidade de sequências.
- O tipo da KV é independente da quantização dos pesos, a menos que você mude.
- A RAM do host não entra sozinha na VRAM discreta.