DeepSeek-V2-Lite-Chat 能在 GeForce RTX 4090 24GB (desktop) 上运行吗?

针对一种配置的有条件判断。上下文、量化和引擎一变,结论也可能变。

MLA is unsupported for full KV; page explains the gap instead of faking GQA.

本页使用的配置:bf16,4,096 个缓存 token,1 个序列,引擎 vllm。

状态:暂不支持 / 数据不完整。软件:已有文档支持。

权重 29.26 GiB · 原始 KV 0.00 GiB · 合计 29.26 GiB–29.26 GiB。

扣除默认预留后的可用预算 22.00 GiB。

除非附上匹配的运行时驻留实测,本页只是估算。

指定模型和设备,给出有条件的判断。

高级设置

GiB(2^30 字节)

自定义模型结构

仅在浏览器中解析,不会上传文件。

只允许 huggingface.co 上的 config.json,不使用 token,不读取私有仓库。

估算结果

暂不支持 / 数据不完整

架构或切分方式不在支持范围。权重分项仍可能显示。

估算内存区间: 29.26 GiB29.26 GiB

权重使用了选定文件的元数据。运行时额外占用仍是估算。

权重29.26 GiB
KV Cache(原始数据)0.00 GiB
KV 额外占用(量化元数据等)0.00 GiB
激活 / 工作区0.00 GiB
引擎预留0.00 GiB
安全余量0.00 GiB

可用预算: 22.00 GiB · 估算后剩余: -7.26 GiB-7.26 GiB

软件兼容性

已有文档支持. 内存够用,不代表指定引擎、量化格式和操作系统一定能跑。软件兼容也不代表性能足够好。

  • 架构 mla 暂不能完整估算 KV。
  • MLA 的 KV 不会套用 GQA 公式。

影响结论的假设

  • 完整驻留权重估算使用总参数量,包括未激活的 MoE 专家。
  • 该 MoE 记录总参数 15700000000、激活参数 2400000000。激活参数的计算量不会当成权重驻留内存。
  • 权重字节只计入选定的权重文件,不会把仓库里所有量化版本加在一起。
  • 下载文件大小不是峰值 GPU 内存。运行时布局、分配器填充和 KV 是额外占用。
  • 计入的文件:model.safetensors.index.json metadata.total_size。
  • 上下文预算是每个序列缓存的 token 数(输入加上预留的生成长度)。
  • 并发序列共用一份模型副本;权重不会按序列数再乘一遍。
  • 除非你改 KV 精度,否则 KV 的数据类型与权重量化无关。
  • 主机 RAM 不会自动并入独立显卡显存。

计算方法

可以改这些配置再算