Qwen2.5-3B-Instruct

Qwen · Qwen/Qwen2.5-3B-Instruct · gqa · full

Quantização2.0488.19232.768
BF16 safetensors5,88 GiB–6,44 GiB6,09 GiB–6,65 GiB6,94 GiB–7,50 GiB
GGUF Q8_03,50 GiB–4,06 GiB3,71 GiB–4,27 GiB4,56 GiB–5,12 GiB
GGUF Q5_K_M2,40 GiB–2,97 GiB2,62 GiB–3,18 GiB3,46 GiB–4,02 GiB
GGUF Q4_K_M2,09 GiB–2,66 GiB2,30 GiB–2,87 GiB3,15 GiB–3,71 GiB
INT4 theoretical1,57 GiB–2,28 GiB1,78 GiB–2,49 GiB2,63 GiB–3,33 GiB

Escolha o modelo e as opções para ver a demanda de memória.

Configurações avançadas

GiB (2^30 bytes)

Estrutura de modelo personalizada

O arquivo é lido só no navegador e não é enviado.

Só huggingface.co, só config.json, sem token. Repositório privado é recusado.

Estimativa

Indeterminado

Falta orçamento ou dado essencial, ou este modo de implantação não pode ser julgado nesta versão.

Faixa estimada de memória: 2,37 GiB2,80 GiB

Os pesos usam metadados dos arquivos escolhidos. O extra de execução continua estimado.

Pesos1,96 GiB
Cache KV (dados brutos)0,28 GiB
Extras de KV (metadados de quantização etc.)0,00 GiB
Ativações / área de trabalho0,06 GiB
Reserva do motor0,06 GiB
Margem de segurança0,00 GiB

Compatibilidade de software

Suporte documentado. Caber na memória não prova que o motor, a quantização e o sistema operacional funcionam juntos. Ter suporte também não significa ser rápido.

Premissas que afetam o resultado

  • A estimativa residente usa o total de parâmetros, inclusive especialistas MoE inativos.
  • Os bytes dos pesos vêm só dos arquivos escolhidos, não de todas as quantizações do repositório.
  • O tamanho do download não é o pico de GPU. Layout em execução e KV vêm a mais.
  • Arquivos contados: qwen2.5-3b-instruct-q4_k_m.gguf.
  • O contexto é o número de tokens em cache por sequência (entrada mais geração reservada).
  • Sequências simultâneas compartilham uma cópia do modelo; os pesos não multiplicam pela quantidade de sequências.
  • O tipo da KV é independente da quantização dos pesos, a menos que você mude.
  • Usando 2 heads KV, não 16 de consulta.
  • O pico de prefill e a decodificação estável não são iguais. O cenário alto fica mais perto do prefill.
  • A reserva do motor não é o uso real de pesos e KV.
  • Os buffers do llama.cpp crescem com contexto e batch. São cenários ajustáveis, não medições — salvo uma calibração correspondente.

Método de cálculo

Recalcular com estas mudanças