GeForce RTX 4060 Ti 16GB (desktop)

GeForce RTX 4060 Ti 16GB desktop · discrete-vram

Capacidade usada nos cálculos: 16,00 GiB

Vendor-marketed GB for discrete GPU VRAM is treated as GiB (2^30 bytes), matching physical GDDR/HBM module organization. This is an explicit unit assumption.

Escolha o dispositivo e a carga, e filtre modelos do catálogo que talvez caibam.

Configurações avançadas

GiB (2^30 bytes)

Estrutura de modelo personalizada

O arquivo é lido só no navegador e não é enviado.

Só huggingface.co, só config.json, sem token. Repositório privado é recusado.

Estimativa

Provavelmente cabe

Nas premissas atuais, o máximo estimado fica abaixo de 90% do orçamento disponível.

Faixa estimada de memória: 4,92 GiB5,42 GiB

Os pesos usam metadados dos arquivos escolhidos. O extra de execução continua estimado.

Pesos4,36 GiB
Cache KV (dados brutos)0,44 GiB
Extras de KV (metadados de quantização etc.)0,00 GiB
Ativações / área de trabalho0,06 GiB
Reserva do motor0,06 GiB
Margem de segurança0,00 GiB

Orçamento disponível: 15,00 GiB · Restante após a estimativa: 9,58 GiB10,08 GiB

Compatibilidade de software

Suporte documentado. Caber na memória não prova que o motor, a quantização e o sistema operacional funcionam juntos. Ter suporte também não significa ser rápido.

Premissas que afetam o resultado

  • A estimativa residente usa o total de parâmetros, inclusive especialistas MoE inativos.
  • Os bytes dos pesos vêm só dos arquivos escolhidos, não de todas as quantizações do repositório.
  • O tamanho do download não é o pico de GPU. Layout em execução e KV vêm a mais.
  • Arquivos contados: qwen2.5-7b-instruct-q4_k_m-00001-of-00002.gguf, qwen2.5-7b-instruct-q4_k_m-00002-of-00002.gguf.
  • O contexto é o número de tokens em cache por sequência (entrada mais geração reservada).
  • Sequências simultâneas compartilham uma cópia do modelo; os pesos não multiplicam pela quantidade de sequências.
  • O tipo da KV é independente da quantização dos pesos, a menos que você mude.
  • Usando 4 heads KV, não 28 de consulta.
  • O pico de prefill e a decodificação estável não são iguais. O cenário alto fica mais perto do prefill.
  • A reserva do motor não é o uso real de pesos e KV.
  • Os buffers do llama.cpp crescem com contexto e batch. São cenários ajustáveis, não medições — salvo uma calibração correspondente.
  • A RAM do host não entra sozinha na VRAM discreta.

Método de cálculo

Modelos do catálogo nesta carga

ModeloEstimativaFaixa estimada de memória
Provavelmente cabe4,92 GiB5,42 GiB
Provavelmente cabe1,14 GiB1,54 GiB
Provavelmente cabe3,22 GiB3,67 GiB
Provavelmente cabe2,37 GiB2,80 GiB
Provavelmente cabe10,00 GiB10,64 GiB
Provavelmente cabe4,78 GiB5,30 GiB
Provavelmente cabe3,58 GiB4,08 GiB
Provavelmente cabe5,93 GiB6,48 GiB
Provavelmente cabe9,76 GiB10,39 GiB
Provavelmente cabe10,24 GiB10,97 GiB
Apertado14,63 GiB15,34 GiB