Qwen2.5-7B-Instruct
Qwen · Qwen/Qwen2.5-7B-Instruct · gqa · full
| Quantização | 2.048 | 8.192 | 32.768 |
|---|---|---|---|
| BF16 safetensors | 14,36 GiB–14,92 GiB | 14,69 GiB–15,25 GiB | 16,00 GiB–16,56 GiB |
| GGUF Q8_0 | 7,71 GiB–8,28 GiB | 8,04 GiB–8,60 GiB | 9,35 GiB–9,92 GiB |
| GGUF Q5_K_M | 5,24 GiB–5,81 GiB | 5,57 GiB–6,13 GiB | 6,88 GiB–7,45 GiB |
| GGUF Q4_K_M | 4,53 GiB–5,10 GiB | 4,86 GiB–5,42 GiB | 6,17 GiB–6,74 GiB |
| INT4 theoretical | 3,72 GiB–4,63 GiB | 4,04 GiB–4,96 GiB | 5,36 GiB–6,27 GiB |
Estimativa
Indeterminado
Falta orçamento ou dado essencial, ou este modo de implantação não pode ser julgado nesta versão.
Faixa estimada de memória: 4,92 GiB – 5,42 GiB
Os pesos usam metadados dos arquivos escolhidos. O extra de execução continua estimado.
Compatibilidade de software
Suporte documentado. Caber na memória não prova que o motor, a quantização e o sistema operacional funcionam juntos. Ter suporte também não significa ser rápido.
Premissas que afetam o resultado
- A estimativa residente usa o total de parâmetros, inclusive especialistas MoE inativos.
- Os bytes dos pesos vêm só dos arquivos escolhidos, não de todas as quantizações do repositório.
- O tamanho do download não é o pico de GPU. Layout em execução e KV vêm a mais.
- Arquivos contados: qwen2.5-7b-instruct-q4_k_m-00001-of-00002.gguf, qwen2.5-7b-instruct-q4_k_m-00002-of-00002.gguf.
- O contexto é o número de tokens em cache por sequência (entrada mais geração reservada).
- Sequências simultâneas compartilham uma cópia do modelo; os pesos não multiplicam pela quantidade de sequências.
- O tipo da KV é independente da quantização dos pesos, a menos que você mude.
- Usando 4 heads KV, não 28 de consulta.
- O pico de prefill e a decodificação estável não são iguais. O cenário alto fica mais perto do prefill.
- A reserva do motor não é o uso real de pesos e KV.
- Os buffers do llama.cpp crescem com contexto e batch. São cenários ajustáveis, não medições — salvo uma calibração correspondente.