首页 › 技术专题 › 运维巡检

自助运维:让脚本值班,让人做判断

自助平台的运维不是「没事可做」,而是「不用事事自己做」。设计好自动巡检,人工只处理真问题。

巡检分两层:自动打底,人工复核

自动层(每小时):可用性探测、首页响应时间、证书有效期、磁盘用量。用平台自带监控或免费的拨测服务都行,四项指标全配,异常推送到手机。

人工层(每周 30 分钟):看一遍自动巡检的趋势图、抽查 3 个页面内容显示、过一遍后台操作日志。自动巡检告诉你「挂没挂」,人工复核告诉你「好不好」——两者不可互相替代。

自动巡检的四个阈值

  • 可用性:每 5 分钟探测一次,连续 3 次失败触发 P0。
  • 响应时间:首页超 3 秒预警,连续 3 次超 5 秒升级 P1。
  • 证书:到期前 14 天预警,前 7 天升级 P1。
  • 磁盘:80% 预警,90% 升级——自助平台超容量的处理手段有限,提前量要留够。

每周 30 分钟复核什么

  1. 看趋势图:响应时间和流量是否同步——流量涨响应也涨,说明快到档位上限了。
  2. 抽查页面:随机点 3 个页面,在手机上完整看一遍。
  3. 过操作日志:确认没有异常时段的陌生登录。
  4. 清积压:垃圾评论、过期内容、闲置成员,一次清完。

四件事做完刚好半小时,多一分钟都是浪费。

告警分级:不是所有异常都值得爬起来

级别典型情形处置要求
P0 站点不可用探测连续失败 3 次立即处理,联系平台支持
P1 核心受损响应超 5 秒、证书 7 天内到期当天处理
P2 隐患磁盘过 80%、慢查询增多本周处理

分级的目的省人力:P2 类告警攒到每周复核一起看,不为每个小波动打断一次。自助运维的精髓就是「低频高质」。

巡检数据怎么用

每月看一次趋势:响应时间是否持续变慢(该优化图片或升套餐了,升档判断见套餐与升级)、访问量与资源用量是否匹配。巡检数据同时是和服务商沟通的凭据——拿着曲线图去提工单,比口头描述快一倍。数据至少留存 90 天,才有「趋势」可言。

自助运维的边界

平台侧的故障(机房、底层服务)自助做不了,只能等平台修——这时候比的是工单响应速度,选平台时就要问清 SLA。自己能控的:内容质量、配置正确性、密钥安全。分清这两类,出问题才不会病急乱投医。上线初 48 小时的强化巡查见上线检查清单,接入期的配置基础见API 与接入配置

巡检体系不知道从哪搭起?

从四项自动指标聊起,半小时能配完。

立即联系我们