DeepSeek-V2-Lite-Chat
DeepSeek · deepseek-ai/DeepSeek-V2-Lite-Chat · mla · unsupported
| 量化 | 2,048 | 8,192 | 32,768 |
|---|---|---|---|
| BF16 safetensors | 暂不支持 / 数据不完整 | 暂不支持 / 数据不完整 | 暂不支持 / 数据不完整 |
估算结果
暂不支持 / 数据不完整
架构或切分方式不在支持范围。权重分项仍可能显示。
估算内存区间: 29.26 GiB – 29.26 GiB
权重使用了选定文件的元数据。运行时额外占用仍是估算。
软件兼容性
未核实. 内存够用,不代表指定引擎、量化格式和操作系统一定能跑。软件兼容也不代表性能足够好。
- 架构 mla 暂不能完整估算 KV。
- MLA 的 KV 不会套用 GQA 公式。
- 内存够用,不代表该引擎、量化格式和操作系统一定兼容。
影响结论的假设
- 完整驻留权重估算使用总参数量,包括未激活的 MoE 专家。
- 该 MoE 记录总参数 15700000000、激活参数 2400000000。激活参数的计算量不会当成权重驻留内存。
- 权重字节只计入选定的权重文件,不会把仓库里所有量化版本加在一起。
- 下载文件大小不是峰值 GPU 内存。运行时布局、分配器填充和 KV 是额外占用。
- 计入的文件:model.safetensors.index.json metadata.total_size。
- 上下文预算是每个序列缓存的 token 数(输入加上预留的生成长度)。
- 并发序列共用一份模型副本;权重不会按序列数再乘一遍。
- 除非你改 KV 精度,否则 KV 的数据类型与权重量化无关。