高可用、变更与综合交付
SLO、监控基线和故障演练
本课问题:“高可用”怎样转成可测量的恢复标准? 学完你能:为链路、网关、路由和业务定义正常值、恢复时间和演练步骤。
前置知识
- 接口跟踪和 BFD 怎样避免出口黑洞
课堂开场
本课问题:“高可用”怎样转成可测量的恢复标准?
学完结果:为链路、网关、路由和业务定义正常值、恢复时间和演练步骤。
预计时间:20 分钟。前置课:接口跟踪和 BFD 怎样避免出口黑洞。
范围控制:本课不把单次 Ping 成功当作 SLO 达标。
02基础知识讲解
方案写着“故障快速恢复”,但没人定义允许丢几个包、多久恢复以及从哪里测量。
本课最小拓扑或状态图:Probe VLAN10—VIP—Core1/Core2—Edge—Test Server;监控同时采集 VRRP、OSPF、接口和业务探针。
直觉解释:高可用要变成秒表和计数器:何时注入、协议何时变化、业务何时恢复、是否超过承诺。
正式定义:SLO 是在统计窗口内对可用性、最大中断、丢包和恢复时间的可测量目标;演练用受控故障验证目标。
判断依据:演练要记录触发、协议变化、业务影响和稳态恢复。
| 重点 | 你要理解 | 判断依据 |
|---|---|---|
| 重点 1 | SLO 写明允许中断、丢包和恢复时间。 | 要求单上联故障业务恢复不超过 3 秒、连续丢包不超过 3 个,并保存探针和协议时间线。 |
| 重点 2 | 监控基线提供故障前的正常对照。 | 10:00:00.120 发生主备切换,是计算恢复时间的起点之一。 |
| 重点 3 | 演练要记录触发、协议变化、业务影响和稳态恢复。 | 确认设备与探针 NTP 时间一致。 |
03正确理解与常见误解
正确示例:要求单上联故障业务恢复不超过 3 秒、连续丢包不超过 3 个,并保存探针和协议时间线。
错误示例:故障后手工 Ping 一次成功便认定高可用达标,没有记录中断区间。
- 术语与判断:SLO 写明允许中断、丢包和恢复时间。
- 术语与判断:监控基线提供故障前的正常对照。
- 术语与判断:演练要记录触发、协议变化、业务影响和稳态恢复。
04老师演示
演示环境:设备 SW1,华为 S5735-L24T4X-A,VRP V200R022C00SPC500,当前提示符 <SW1>,隔离课程网络。教师准备执行只读命令:
- 前检
核对 SW1、目标对象、当前状态、带外路径和变更前业务基线。 - 只读核验(采集网关主备切换证据)
display vrrp verbose第 1 步:在目标设备上执行并核对命令作用范围。 - 只读核验(采集网关主备切换证据)
display track all第 2 步:在目标设备上执行并核对命令作用范围。 - 只读核验(采集网关主备切换证据)
display logbuffer | include VRRP第 3 步:在目标设备上执行并核对命令作用范围。 - 只读核验(采集网关主备切换证据)
display ip routing-table读取实际状态或计数器,确认“关联 VRRP、跟踪对象、路由和日志形成切换时间线”已经满足。 - 只读核验(查看接口实时流量速率)
display interface GigabitEthernet 0/0/48第 1 步:在目标设备上执行并核对命令作用范围。 - 只读核验(查看接口实时流量速率)
display counters rate interface GigabitEthernet 0/0/48读取实际状态或计数器,确认“判断接口利用率、广播占比和突发流量是否异常”已经满足。 - 只读核验(按模块与级别筛选日志)
display logbuffer | include GigabitEthernet0/0/48读取实际状态或计数器,确认“缩小日志时间窗并提取与故障对象相关的事件”已经满足。
安全说明:命令来自“采集网关主备切换证据”华为实现,用于华为VRP 中用于采集网关主备切换证据的最小操作与核验方法。 执行前已确认当前设备、版本、视图、影响对象、停止条件和输出脱敏范围。
脱敏真实输出:
<SW1>display ip routing-table <Core1> display logbuffer | include VRRP 10:00:00.120 VRRP10 Master -> Backup Probe recovered 10:00:01.340; outage 1.22s; lost 1 packet
异常输出:
Probe outage 8.70s exceeds SLO 3.00s Monitoring gap: no timestamp for OSPF convergence 差异说明:8.70 秒超出 3 秒 SLO,且缺少 OSPF 收敛时间戳不能归因;下一步补齐统一时间的协议与探针采集后重做受控演练。 此时不能套用正常结论;先保存采集时间,再执行“查看接口实时流量速率”对应的最小只读检查。
05逐行读懂输出
结论:当前输出可以支持“为链路、网关、路由和业务定义正常值、恢复时间和演练步骤。”中的基础判断,但仍要完成跟做任务和业务验收,不能把单份输出当作全部证明。
- 第 1 行“<Core1> display logbuffer | include VRRP”:该查询过滤 VRRP 事件,提供协议状态变化的设备时间戳。
- 第 2 行“10:00:00.120 VRRP10 Master -> Backup”:10:00:00.120 发生主备切换,是计算恢复时间的起点之一。
- 第 3 行“Probe recovered 10:00:01.340; outage 1.22s; lost 1 packet”:探针在 1.22 秒后恢复且仅丢 1 包,证明此次业务中断落在 3 秒目标以内。
06学员跟做
起始状态:使用隔离课程环境,SW1 当前配置保持阶段基线,学员已登录但尚未执行本课检查。目标状态:为链路、网关、路由和业务定义正常值、恢复时间和演练步骤。
操作步骤:①为链路、网关、路由和业务分别定义正常值与 SLO;②同步探针和设备时间并记录故障前基线;③注入单链路故障,连续采集协议与业务结果;④计算中断、丢包和恢复时间并给出达标结论;⑤进入“引导:把高可用目标写成可测量 SLO”独立完成相同目标。
成功标准:输出与规划一致,立即闯关全部目标通过,并能用自己的话说明三个重点。失败检查顺序:①确认设备与探针 NTP 时间一致;②检查采样间隔是否足以测量目标;③核对测试源目是否真正经过被注入的路径。
- 保存教师演示命令和本次学员输出,文件名含设备、日期和课次。
- 步骤标题只提示检查对象,不复制最终答案。
- 失败时一次只验证一个假设,不连续粘贴未知命令。
07安全、验证与回滚
本课以只读观察为主。只读命令仍可能暴露资产信息,保存输出前要替换序列号、真实公网地址、账号和其他敏感字段;任何清表、重启、删除或配置动作都不属于本课。
验证必须同时回答:配置或输入是否正确、设备状态是否符合预期、真实任务“为链路、网关、路由和业务定义正常值、恢复时间和演练步骤。”是否完成。
08本课关联资源
按顺序完成:先看命令 → 立即闯关 → 可选加练 → 案例步骤 → 返回本页复盘。
- 必学命令:采集网关主备切换证据打开资源 →目标:核对本课涉及的华为主线命令及四厂商差异|完成标准:能解释用途、视图、版本范围、验证和回滚。
- 必学命令:查看接口实时流量速率打开资源 →目标:核对本课涉及的华为主线命令及四厂商差异|完成标准:能解释用途、视图、版本范围、验证和回滚。
- 必学命令:按模块与级别筛选日志打开资源 →目标:核对本课涉及的华为主线命令及四厂商差异|完成标准:能解释用途、视图、版本范围、验证和回滚。
- 立即闯关:引导:把高可用目标写成可测量 SLO打开资源 →目标:独立完成“为链路、网关、路由和业务定义正常值、恢复时间和演练步骤。”对应的最小任务|完成标准:规则引擎全部目标通过并保存关键输出。
09自测一:概念判断
先判断对错,再写出为什么。
- 判断 1:以下做法是正确的——故障后手工 Ping 一次成功便认定高可用达标,没有记录中断区间。
- 判断 2:以下做法是正确的——要求单上联故障业务恢复不超过 3 秒、连续丢包不超过 3 个,并保存探针和协议时间线。
10自测二:输出解读
重新阅读老师演示的第 2 行输出:它能直接证明什么?还不能证明“为链路、网关、路由和业务定义正常值、恢复时间和演练步骤。”中的哪一部分?请写出下一条最小验证证据。
11自测三:小型操作
在隔离环境或纸面拓扑中完成:为链路、网关、路由和业务定义正常值、恢复时间和演练步骤。 保存关键输出,按“现象—证据—结论—下一步”写四行记录;不得复制本页最终结论。
答案与复盘
13下一课
下一课:维护窗口、前检、停止条件、回滚和后检。你已经能“为链路、网关、路由和业务定义正常值、恢复时间和演练步骤。”,下一课将用这项能力继续回答“怎样把一项网络变更写成可以逐步执行和停止的计划?”。