查:健康端点回几

场景:~/svc/health.json 记着各依赖的探测结果,mon.py --health 汇总。 任务:跑 python3 ~/svc/mon.py --health,读它报的 码 = N(健康端点该回的状态码),到 ~/对照表.tx

开始练习 →

查:哪个请求先出错

场景:访问日志里带请求 id 和级别,要定位首个出错的请求。 任务:跑 python3 ~/svc/mon.py --errors,读它报的 首错请求 = R,到 ~/对照表.txt 查 R 填进来。 (判分只看你在受控容器里的真机产物,纯

开始练习 →

修:健康检查放水了

场景:~/svc/app.py 的健康判断把 all(...) 写成了 any(...),只要有一项依赖没挂就报健康,坏了也报 200。 任务:把它改回 all,让 python3 ~/svc/app.py --health 在有依赖挂时如

开始练习 →

交付:健康与错误率都修好

场景:~/svc/app.py 两处 bug——健康判断 all 写成 any、错误统计把 status >= 500 写成 >= 400(把 4xx 也算错误)。 任务:两处都修好(any→all、400→500),让 --h

开始练习 →

维护服务的正确姿势

独立维护一个运行中的服务,稳妥的做法是【0】。 (判分只看你在受控容器里的真机产物,纯本机、纯 Python,没有公网。)

开始练习 →

改错误阈值后的错误数

真机:app.py 原把 status >= 400 当错误,日志里有 3 条 4xx、2 条 5xx。修成 >= 500 后,--metrics 报的 错误 = N 是几? (判分只看你在受控容器里的真机产物,纯本机、纯 Py

开始练习 →

查:告警超了几次

场景:~/svc/samples.txt 是每分钟的错误数采样,阈值写在 ~/说明.txt 里。 任务:跑 python3 ~/svc/mon.py --alert,读它报的 超阈 = N(超过阈值的采样数),到 ~/对照表.txt 查 N

开始练习 →

查:故障从第几个采样起

场景:同一批采样,要找出从哪个采样开始持续超阈(连续超线的起点)。 任务:跑 python3 ~/svc/mon.py --onset,读它报的 起点 = K(第几个采样,从 1 数),到 ~/对照表.txt 查 K 填进来。 (判分只看你

开始练习 →

查:这批的 p95

场景:另一批访问日志,要看这段时间延迟的长尾。 任务:跑 python3 ~/svc/mon.py --metrics,读它报的 p95 = M ms,到 ~/对照表.txt 查 M 填进来。 (判分只看你在受控容器里的真机产物,纯本机、纯

开始练习 →

修:错误统计把 4xx 也算了

场景:~/svc/app.py 的错误统计把 status >= 500 写成了 >= 400,把 4xx(客户端错)也当成服务错误,错误率虚高。 任务:把阈值改回 500,让 --metrics 的 错误 = N 只数 5xx

开始练习 →