大模型需要多少显存:7B、14B、32B 模型推理速查
大模型显存不只由参数量决定。权重精度、上下文长度、并发数和推理引擎的 KV Cache 都会改变实际需求。
权重只是起点
更低比特量化能减少权重占用,但仍需要运行时缓冲和额外空间。选择 GPU 时不要以“刚好能加载”为目标,应预留余量给请求波动和框架开销。
KV Cache 随上下文和并发增长
长上下文或多并发会显著扩大 KV Cache。线上服务应该根据最大上下文、最大并发和可接受延迟做容量压测,而不是只测单请求。
先从真实请求压测
用接近生产的输入长度、输出长度和并发运行基准,观察峰值显存、首 Token 延迟和吞吐。结果将直接决定该选 24GB、48GB 还是 80GB 显存实例。
---
在方舟智算算力市场按显存筛选 GPU,并免费注册创建推理测试实例。