自动层(每小时):可用性探测、首页响应时间、证书有效期、磁盘用量。用平台自带监控或免费的拨测服务都行,四项指标全配,异常推送到手机。
人工层(每周 30 分钟):看一遍自动巡检的趋势图、抽查 3 个页面内容显示、过一遍后台操作日志。自动巡检告诉你「挂没挂」,人工复核告诉你「好不好」——两者不可互相替代。
四件事做完刚好半小时,多一分钟都是浪费。
| 级别 | 典型情形 | 处置要求 |
|---|---|---|
| P0 站点不可用 | 探测连续失败 3 次 | 立即处理,联系平台支持 |
| P1 核心受损 | 响应超 5 秒、证书 7 天内到期 | 当天处理 |
| P2 隐患 | 磁盘过 80%、慢查询增多 | 本周处理 |
分级的目的省人力:P2 类告警攒到每周复核一起看,不为每个小波动打断一次。自助运维的精髓就是「低频高质」。
每月看一次趋势:响应时间是否持续变慢(该优化图片或升套餐了,升档判断见套餐与升级)、访问量与资源用量是否匹配。巡检数据同时是和服务商沟通的凭据——拿着曲线图去提工单,比口头描述快一倍。数据至少留存 90 天,才有「趋势」可言。
平台侧的故障(机房、底层服务)自助做不了,只能等平台修——这时候比的是工单响应速度,选平台时就要问清 SLA。自己能控的:内容质量、配置正确性、密钥安全。分清这两类,出问题才不会病急乱投医。上线初 48 小时的强化巡查见上线检查清单,接入期的配置基础见API 与接入配置。