NVIDIA DGX Spark (GB10, 128 GB unified)
NVIDIA DGX Spark 940-54242-0000 · unified-memory
用于估算的容量: 128.00 GiB
Marketed 128 GB unified system memory is treated as 128 GiB (2^30 bytes) for calculation. Users can override the budget. Unified memory is a shared CPU/GPU pool; host RAM is not added again.
估算结果
预计放得下
在当前假设下,估算上限低于可用预算的 90%。
估算内存区间: 4.92 GiB – 5.42 GiB
权重使用了选定文件的元数据。运行时额外占用仍是估算。
可用预算: 112.00 GiB · 估算后剩余: 106.58 GiB – 107.08 GiB
软件兼容性
已有文档支持. 内存够用,不代表指定引擎、量化格式和操作系统一定能跑。软件兼容也不代表性能足够好。
影响结论的假设
- 完整驻留权重估算使用总参数量,包括未激活的 MoE 专家。
- 权重字节只计入选定的权重文件,不会把仓库里所有量化版本加在一起。
- 下载文件大小不是峰值 GPU 内存。运行时布局、分配器填充和 KV 是额外占用。
- 计入的文件:qwen2.5-7b-instruct-q4_k_m-00001-of-00002.gguf, qwen2.5-7b-instruct-q4_k_m-00002-of-00002.gguf。
- 上下文预算是每个序列缓存的 token 数(输入加上预留的生成长度)。
- 并发序列共用一份模型副本;权重不会按序列数再乘一遍。
- 除非你改 KV 精度,否则 KV 的数据类型与权重量化无关。
- 使用 4 个 KV heads,而不是 28 个 query heads。
- 预填充峰值和稳定解码占用不一定相同。高情景更接近预填充/工作区压力。
- 引擎预留不等于模型权重和 KV 的实际占用。
- llama.cpp 的计算缓冲会随上下文和 batch 增长。这里是可调情景,不是实测;若有匹配校准会单独标明。
- 统一内存是 CPU/GPU 共享池。不会再把主机 RAM 加在这个容量上面。
当前负载下目录中的模型
| 模型 | 估算结果 | 估算内存区间 |
|---|---|---|
| 预计放得下 | 4.92 GiB – 5.42 GiB | |
| 预计放得下 | 1.14 GiB – 1.54 GiB | |
| 预计放得下 | 3.22 GiB – 3.67 GiB | |
| 预计放得下 | 2.37 GiB – 2.80 GiB | |
| 预计放得下 | 10.00 GiB – 10.64 GiB | |
| 预计放得下 | 20.61 GiB – 21.50 GiB | |
| 预计放得下 | 43.61 GiB – 44.98 GiB | |
| 预计放得下 | 4.78 GiB – 5.30 GiB | |
| 预计放得下 | 3.58 GiB – 4.08 GiB | |
| 预计放得下 | 5.93 GiB – 6.48 GiB | |
| 预计放得下 | 9.76 GiB – 10.39 GiB | |
| 预计放得下 | 20.53 GiB – 21.41 GiB | |
| 预计放得下 | 18.16 GiB – 18.93 GiB | |
| 预计放得下 | 10.24 GiB – 10.97 GiB | |
| 预计放得下 | 14.63 GiB – 15.34 GiB | |
| 预计放得下 | 88.12 GiB – 90.30 GiB | |
| 预计放得下 | 16.08 GiB – 16.83 GiB | |
| 预计放得下 | 63.15 GiB – 64.89 GiB |