Qwen2.5-14B-Instruct

Qwen · Qwen/Qwen2.5-14B-Instruct · gqa · full

量化2,0488,19232,768
BF16 safetensors27.95 GiB–28.51 GiB29.07 GiB–29.64 GiB33.57 GiB–34.14 GiB
GGUF Q8_015.06 GiB–15.62 GiB16.19 GiB–16.75 GiB20.69 GiB–21.25 GiB
GGUF Q4_K_M8.81 GiB–9.37 GiB9.93 GiB–10.50 GiB14.43 GiB–15.00 GiB
INT4 theoretical7.28 GiB–8.53 GiB8.41 GiB–9.65 GiB12.91 GiB–14.15 GiB

选择模型和配置,查看内存需求。

高级设置

GiB(2^30 字节)

自定义模型结构

仅在浏览器中解析,不会上传文件。

只允许 huggingface.co 上的 config.json,不使用 token,不读取私有仓库。

估算结果

无法判断

缺少预算、关键数据,或部署方式超出本版本能力。

估算内存区间: 10.00 GiB10.64 GiB

权重使用了选定文件的元数据。运行时额外占用仍是估算。

权重8.37 GiB
KV Cache(原始数据)1.50 GiB
KV 额外占用(量化元数据等)0.00 GiB
激活 / 工作区0.06 GiB
引擎预留0.06 GiB
安全余量0.00 GiB

软件兼容性

已有文档支持. 内存够用,不代表指定引擎、量化格式和操作系统一定能跑。软件兼容也不代表性能足够好。

影响结论的假设

  • 完整驻留权重估算使用总参数量,包括未激活的 MoE 专家。
  • 权重字节只计入选定的权重文件,不会把仓库里所有量化版本加在一起。
  • 下载文件大小不是峰值 GPU 内存。运行时布局、分配器填充和 KV 是额外占用。
  • 计入的文件:qwen2.5-14b-instruct-q4_k_m-00001-of-00003.gguf, qwen2.5-14b-instruct-q4_k_m-00002-of-00003.gguf, qwen2.5-14b-instruct-q4_k_m-00003-of-00003.gguf。
  • 上下文预算是每个序列缓存的 token 数(输入加上预留的生成长度)。
  • 并发序列共用一份模型副本;权重不会按序列数再乘一遍。
  • 除非你改 KV 精度,否则 KV 的数据类型与权重量化无关。
  • 使用 8 个 KV heads,而不是 40 个 query heads。
  • 预填充峰值和稳定解码占用不一定相同。高情景更接近预填充/工作区压力。
  • 引擎预留不等于模型权重和 KV 的实际占用。
  • llama.cpp 的计算缓冲会随上下文和 batch 增长。这里是可调情景,不是实测;若有匹配校准会单独标明。

计算方法

可以改这些配置再算