← 返回方舟智算博客

GPU Serverless 如何实现弹性伸缩

方舟智算团队
GPU Serverless 如何实现弹性伸缩

传统在线推理通常长期运行固定数量的 GPU 实例。流量波动较大时,高峰容量不足,低峰又产生大量空闲成本。Serverless 模式通过自动增加或减少 Worker 来改善这一问题。

扩缩容依据

常见指标包括请求队列长度、排队时间、GPU 利用率、并发数和每秒 Token 数。单一指标容易误判,实际系统通常组合多个信号并设置持续时间窗口。

冷启动是核心挑战

GPU Worker 启动需要分配机器、拉取镜像、下载模型并加载权重。模型越大,冷启动越久。可通过预热镜像、就近缓存权重和保留少量冷池或热实例降低延迟。

缩容要避免抖动

流量短暂下降时立即释放实例,可能导致下一波请求再次冷启动。合理的空闲超时、最小实例数和缩容冷却时间可以减少频繁伸缩。

无状态与有状态分离

推理 Worker 应尽量保持无状态,把模型版本、配置和结果写入外部存储。这样实例才能被安全替换,扩容也更简单。

GPU Serverless 并不是让冷启动消失,而是通过调度、缓存和容量策略,把用户可接受的延迟转换为更低的空闲成本。

---

关于方舟智算:方舟智算提供按需 GPU 算力,支持训练、推理与图像生成等工作负载。可在算力市场比较可用节点与报价,或免费注册后创建第一个实例。

<!-- arkcore-article-cta -->