Radeon RX 7900 XTX 24GB (desktop)

AMD Radeon RX 7900 XTX 24GB · discrete-vram

用于估算的容量: 24.00 GiB

Vendor-marketed GB for discrete GPU VRAM is treated as GiB (2^30 bytes), matching physical GDDR/HBM module organization. This is an explicit unit assumption.

选择设备和负载条件,筛选目录中可能放得下的模型。

高级设置

GiB(2^30 字节)

自定义模型结构

仅在浏览器中解析,不会上传文件。

只允许 huggingface.co 上的 config.json,不使用 token,不读取私有仓库。

估算结果

预计放得下

在当前假设下,估算上限低于可用预算的 90%。

估算内存区间: 4.92 GiB5.42 GiB

权重使用了选定文件的元数据。运行时额外占用仍是估算。

权重4.36 GiB
KV Cache(原始数据)0.44 GiB
KV 额外占用(量化元数据等)0.00 GiB
激活 / 工作区0.06 GiB
引擎预留0.06 GiB
安全余量0.00 GiB

可用预算: 22.00 GiB · 估算后剩余: 16.58 GiB17.08 GiB

软件兼容性

已有文档支持. 内存够用,不代表指定引擎、量化格式和操作系统一定能跑。软件兼容也不代表性能足够好。

影响结论的假设

  • 完整驻留权重估算使用总参数量,包括未激活的 MoE 专家。
  • 权重字节只计入选定的权重文件,不会把仓库里所有量化版本加在一起。
  • 下载文件大小不是峰值 GPU 内存。运行时布局、分配器填充和 KV 是额外占用。
  • 计入的文件:qwen2.5-7b-instruct-q4_k_m-00001-of-00002.gguf, qwen2.5-7b-instruct-q4_k_m-00002-of-00002.gguf。
  • 上下文预算是每个序列缓存的 token 数(输入加上预留的生成长度)。
  • 并发序列共用一份模型副本;权重不会按序列数再乘一遍。
  • 除非你改 KV 精度,否则 KV 的数据类型与权重量化无关。
  • 使用 4 个 KV heads,而不是 28 个 query heads。
  • 预填充峰值和稳定解码占用不一定相同。高情景更接近预填充/工作区压力。
  • 引擎预留不等于模型权重和 KV 的实际占用。
  • llama.cpp 的计算缓冲会随上下文和 batch 增长。这里是可调情景,不是实测;若有匹配校准会单独标明。
  • 主机 RAM 不会自动并入独立显卡显存。

计算方法

当前负载下目录中的模型

模型估算结果估算内存区间
预计放得下4.92 GiB5.42 GiB
预计放得下1.14 GiB1.54 GiB
预计放得下3.22 GiB3.67 GiB
预计放得下2.37 GiB2.80 GiB
预计放得下10.00 GiB10.64 GiB
接近上限20.61 GiB21.50 GiB
预计放得下4.78 GiB5.30 GiB
预计放得下3.58 GiB4.08 GiB
预计放得下5.93 GiB6.48 GiB
预计放得下9.76 GiB10.39 GiB
接近上限20.53 GiB21.41 GiB
预计放得下18.16 GiB18.93 GiB
预计放得下10.24 GiB10.97 GiB
预计放得下14.63 GiB15.34 GiB
预计放得下16.08 GiB16.83 GiB