反复重启失败时改成指数退避(等得越来越久),是为了【0】。
贯穿本节的运维模型(判题机纯 Python、无网,这是它的确定模型,见 spine.py):服务上线后靠日志/指标/健康/告警盯住它。
恢复与重启:should_restart(策略,退出码)(always/on-failure/no)、retries_left、backoff(base,attempt)=base*2**attempt 指数退避、give_up=次数用完。
should_restart(策略,退出码)
retries_left
backoff(base,attempt)
give_up
全部评论