Qwen2.5-3B-Instruct 能在 GeForce RTX 4090 24GB (desktop) 上运行吗?
针对一种配置的有条件判断。上下文、量化和引擎一变,结论也可能变。
3B Q4_K_M on RTX 4090 with a matching llama.cpp runtime-resident trace at 8192 tokens.
本页使用的配置:gguf-q4_k_m,8,192 个缓存 token,1 个序列,引擎 llama.cpp。
状态:预计放得下。软件:已有文档支持。
权重 1.96 GiB · 原始 KV 0.28 GiB · 合计 2.37 GiB–2.80 GiB。
扣除默认预留后的可用预算 22.00 GiB。
运行时驻留实测 rt-qwen2.5-3b-instruct-q4km-4090-ctx8192:进程 GPU 2.59 GiB,采集于 2026-09-19T15:43:43Z(llama.cpp version: 0.4.1-dev (build 1, commit 1af554f))。公式估算仍单独显示。
- 完整驻留权重估算使用总参数量,包括未激活的 MoE 专家。
- 权重字节只计入选定的权重文件,不会把仓库里所有量化版本加在一起。
- 下载文件大小不是峰值 GPU 内存。运行时布局、分配器填充和 KV 是额外占用。
- 计入的文件:qwen2.5-3b-instruct-q4_k_m.gguf。
- 上下文预算是每个序列缓存的 token 数(输入加上预留的生成长度)。
- 并发序列共用一份模型副本;权重不会按序列数再乘一遍。
- 除非你改 KV 精度,否则 KV 的数据类型与权重量化无关。
- 使用 2 个 KV heads,而不是 16 个 query heads。
估算结果
预计放得下
在当前假设下,估算上限低于可用预算的 90%。
估算内存区间: 2.37 GiB – 2.80 GiB
有匹配环境的运行时驻留数据。
可用预算: 22.00 GiB · 估算后剩余: 19.20 GiB – 19.63 GiB
软件兼容性
已有文档支持. 内存够用,不代表指定引擎、量化格式和操作系统一定能跑。软件兼容也不代表性能足够好。
有匹配环境的运行时驻留数据。 实测进程 GPU 占用: 2.59 GiB · llama.cpp version: 0.4.1-dev (build 1, commit 1af554f) · 2026-09-19T15:43:43Z
影响结论的假设
- 完整驻留权重估算使用总参数量,包括未激活的 MoE 专家。
- 权重字节只计入选定的权重文件,不会把仓库里所有量化版本加在一起。
- 下载文件大小不是峰值 GPU 内存。运行时布局、分配器填充和 KV 是额外占用。
- 计入的文件:qwen2.5-3b-instruct-q4_k_m.gguf。
- 上下文预算是每个序列缓存的 token 数(输入加上预留的生成长度)。
- 并发序列共用一份模型副本;权重不会按序列数再乘一遍。
- 除非你改 KV 精度,否则 KV 的数据类型与权重量化无关。
- 使用 2 个 KV heads,而不是 16 个 query heads。
- 预填充峰值和稳定解码占用不一定相同。高情景更接近预填充/工作区压力。
- 引擎预留不等于模型权重和 KV 的实际占用。
- llama.cpp 的计算缓冲会随上下文和 batch 增长。这里是可调情景,不是实测;若有匹配校准会单独标明。
- 主机 RAM 不会自动并入独立显卡显存。