← 返回方舟智算博客

大模型需要多少显存:7B、14B、32B 模型推理速查

方舟智算团队
大模型需要多少显存:7B、14B、32B 模型推理速查

大模型显存不只由参数量决定。权重精度、上下文长度、并发数和推理引擎的 KV Cache 都会改变实际需求。

权重只是起点

更低比特量化能减少权重占用,但仍需要运行时缓冲和额外空间。选择 GPU 时不要以“刚好能加载”为目标,应预留余量给请求波动和框架开销。

KV Cache 随上下文和并发增长

长上下文或多并发会显著扩大 KV Cache。线上服务应该根据最大上下文、最大并发和可接受延迟做容量压测,而不是只测单请求。

先从真实请求压测

用接近生产的输入长度、输出长度和并发运行基准,观察峰值显存、首 Token 延迟和吞吐。结果将直接决定该选 24GB、48GB 还是 80GB 显存实例。

---

方舟智算算力市场按显存筛选 GPU,并免费注册创建推理测试实例。