Qwen2.5-72B-Instruct
Qwen · Qwen/Qwen2.5-72B-Instruct · gqa · full
| 量化 | 2,048 | 8,192 | 32,768 |
|---|---|---|---|
| BF16 safetensors | 136.11 GiB–136.68 GiB | 137.99 GiB–138.55 GiB | 145.49 GiB–146.05 GiB |
| GGUF Q4_K_M | 41.68 GiB–42.24 GiB | 43.55 GiB–44.11 GiB | 51.05 GiB–51.61 GiB |
| INT4 theoretical | 34.54 GiB–38.49 GiB | 36.42 GiB–40.36 GiB | 43.92 GiB–47.86 GiB |
估算结果
无法判断
缺少预算、关键数据,或部署方式超出本版本能力。
估算内存区间: 43.61 GiB – 44.98 GiB
权重使用了选定文件的元数据。运行时额外占用仍是估算。
软件兼容性
已有文档支持. 内存够用,不代表指定引擎、量化格式和操作系统一定能跑。软件兼容也不代表性能足够好。
影响结论的假设
- 完整驻留权重估算使用总参数量,包括未激活的 MoE 专家。
- 权重字节只计入选定的权重文件,不会把仓库里所有量化版本加在一起。
- 下载文件大小不是峰值 GPU 内存。运行时布局、分配器填充和 KV 是额外占用。
- 计入的文件:qwen2.5-72b-instruct-q4_k_m-00001-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00002-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00003-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00004-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00005-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00006-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00007-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00008-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00009-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00010-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00011-of-00012.gguf, qwen2.5-72b-instruct-q4_k_m-00012-of-00012.gguf。
- 上下文预算是每个序列缓存的 token 数(输入加上预留的生成长度)。
- 并发序列共用一份模型副本;权重不会按序列数再乘一遍。
- 除非你改 KV 精度,否则 KV 的数据类型与权重量化无关。
- 使用 8 个 KV heads,而不是 64 个 query heads。
- 预填充峰值和稳定解码占用不一定相同。高情景更接近预填充/工作区压力。
- 引擎预留不等于模型权重和 KV 的实际占用。
- llama.cpp 的计算缓冲会随上下文和 batch 增长。这里是可调情景,不是实测;若有匹配校准会单独标明。