推理 API 可观测性:应该监控哪些指标
只监控 GPU 利用率无法解释用户体验。推理服务至少需要四类指标:请求、队列、模型和基础设施。
请求侧关注 QPS、并发、状态码和 P50/P95/P99 延迟;队列侧关注长度和等待时间;模型侧关注输入输出 Token、首 Token 延迟、生成速度和拒绝请求数;基础设施侧关注 GPU 利用率、显存、温度、CPU、磁盘和网络。
日志应包含请求 ID、模型版本、实例 ID 和各阶段耗时,但避免记录密钥或敏感正文。分布式追踪可以进一步定位网关、检索、排队和生成各自的耗时。
告警应围绕用户影响设置,例如错误率持续升高、P95 超过目标或队列不断增长。单次 GPU 峰值通常不值得告警,持续趋势才更有意义。
---
关于方舟智算:方舟智算提供按需 GPU 算力,支持训练、推理与图像生成等工作负载。可在算力市场比较可用节点与报价,或免费注册后创建第一个实例。
<!-- arkcore-article-cta -->