有几个采样超阈值

按模型,采样 [2,5,6,7] 里 count_over(samples, 4) 交回几? 贯穿本节的运维模型(判题机纯 Python、无网,这是它的确定模型,见 spine.py):服务上线后靠日志/指标/健康/告警盯住它。 告警阈值:

开始练习 →

最近三个都超了吗

按模型,sustained([2,5,6,7], 4, 3) 交回什么? 贯穿本节的运维模型(判题机纯 Python、无网,这是它的确定模型,见 spine.py):服务上线后靠日志/指标/健康/告警盯住它。 告警阈值:over(值,阈值)

开始练习 →

补全:是否超阈值

补全 over:这个值有没有超过阈值。 贯穿本节的运维模型(判题机纯 Python、无网,这是它的确定模型,见 spine.py):服务上线后靠日志/指标/健康/告警盯住它。 告警阈值:over(值,阈值)、count_over 超阈值几个

开始练习 →

补全:数超阈值的

补全 count_over:一串采样里有几个超过阈值。 贯穿本节的运维模型(判题机纯 Python、无网,这是它的确定模型,见 spine.py):服务上线后靠日志/指标/健康/告警盯住它。 告警阈值:over(值,阈值)、count_ov

开始练习 →

补全:持续超才报

补全 sustained:最近 n 个采样是不是全超阈值。 贯穿本节的运维模型(判题机纯 Python、无网,这是它的确定模型,见 spine.py):服务上线后靠日志/指标/健康/告警盯住它。 告警阈值:over(值,阈值)、count_

开始练习 →

补全:能否消警

补全 should_clear:最新采样回落到阈值内就可消警。 贯穿本节的运维模型(判题机纯 Python、无网,这是它的确定模型,见 spine.py):服务上线后靠日志/指标/健康/告警盯住它。 告警阈值:over(值,阈值)、coun

开始练习 →

服务崩了怎么先恢复

服务进程崩了,最快的止损办法通常是【0】。 贯穿本节的运维模型(判题机纯 Python、无网,这是它的确定模型,见 spine.py):服务上线后靠日志/指标/健康/告警盯住它。 恢复与重启:should_restart(策略,退出码)(a

开始练习 →

为什么重启要指数退避

反复重启失败时改成指数退避(等得越来越久),是为了【0】。 贯穿本节的运维模型(判题机纯 Python、无网,这是它的确定模型,见 spine.py):服务上线后靠日志/指标/健康/告警盯住它。 恢复与重启:should_restart(策

开始练习 →

非 0 退出要不要重启

按模型,should_restart("on-failure", 1) 交回什么? 贯穿本节的运维模型(判题机纯 Python、无网,这是它的确定模型,见 spine.py):服务上线后靠日志/指标/健康/告警盯住它。

开始练习 →

第三次退避等多久

按模型,backoff(2, 3) 交回几?(base=2,第 3 次) 贯穿本节的运维模型(判题机纯 Python、无网,这是它的确定模型,见 spine.py):服务上线后靠日志/指标/健康/告警盯住它。 恢复与重启:should_re

开始练习 →