有几个采样超阈值
按模型,采样 [2,5,6,7] 里 count_over(samples, 4) 交回几? 贯穿本节的运维模型(判题机纯 Python、无网,这是它的确定模型,见 spine.py):服务上线后靠日志/指标/健康/告警盯住它。 告警阈值:
最近三个都超了吗
按模型,sustained([2,5,6,7], 4, 3) 交回什么? 贯穿本节的运维模型(判题机纯 Python、无网,这是它的确定模型,见 spine.py):服务上线后靠日志/指标/健康/告警盯住它。 告警阈值:over(值,阈值)
补全:是否超阈值
补全 over:这个值有没有超过阈值。 贯穿本节的运维模型(判题机纯 Python、无网,这是它的确定模型,见 spine.py):服务上线后靠日志/指标/健康/告警盯住它。 告警阈值:over(值,阈值)、count_over 超阈值几个
补全:数超阈值的
补全 count_over:一串采样里有几个超过阈值。 贯穿本节的运维模型(判题机纯 Python、无网,这是它的确定模型,见 spine.py):服务上线后靠日志/指标/健康/告警盯住它。 告警阈值:over(值,阈值)、count_ov
补全:持续超才报
补全 sustained:最近 n 个采样是不是全超阈值。 贯穿本节的运维模型(判题机纯 Python、无网,这是它的确定模型,见 spine.py):服务上线后靠日志/指标/健康/告警盯住它。 告警阈值:over(值,阈值)、count_
补全:能否消警
补全 should_clear:最新采样回落到阈值内就可消警。 贯穿本节的运维模型(判题机纯 Python、无网,这是它的确定模型,见 spine.py):服务上线后靠日志/指标/健康/告警盯住它。 告警阈值:over(值,阈值)、coun
服务崩了怎么先恢复
服务进程崩了,最快的止损办法通常是【0】。 贯穿本节的运维模型(判题机纯 Python、无网,这是它的确定模型,见 spine.py):服务上线后靠日志/指标/健康/告警盯住它。 恢复与重启:should_restart(策略,退出码)(a
为什么重启要指数退避
反复重启失败时改成指数退避(等得越来越久),是为了【0】。 贯穿本节的运维模型(判题机纯 Python、无网,这是它的确定模型,见 spine.py):服务上线后靠日志/指标/健康/告警盯住它。 恢复与重启:should_restart(策
非 0 退出要不要重启
按模型,should_restart("on-failure", 1) 交回什么? 贯穿本节的运维模型(判题机纯 Python、无网,这是它的确定模型,见 spine.py):服务上线后靠日志/指标/健康/告警盯住它。
第三次退避等多久
按模型,backoff(2, 3) 交回几?(base=2,第 3 次) 贯穿本节的运维模型(判题机纯 Python、无网,这是它的确定模型,见 spine.py):服务上线后靠日志/指标/健康/告警盯住它。 恢复与重启:should_re