1.
故障影响范围初步判定
a) 收集报警与时间线:记录监控告警、用户反馈时间点与地域分布;
b) 快速判断域/服务受影响范围:访问关键服务(网站、API、邮件)并在不同位置(本地、云、香港/大陆节点)执行 ping/traceroute;
c) 输出结果要求:将 traceroute 的最后跃点、丢包点、延迟峰值以表格形式记录,标注是否落在台湾 CN2 骨干链路或对端 ISP。
2.
使用工具进行精确定位
a) 命令推荐(Linux/路由器):traceroute -I <目标IP>、mtr -r -c 100 <目标IP>、ping -c 10 <目标IP>;
b) BGP 层面检查:在边界路由器上执行 show ip bgp summary / show bgp neighbor / vtysh -c "show bgp summary";记录对端 ASN、状态 (Idle/Established)、路由数量;
c) 结合外部监控:使用 RIPE Atlas、BGPlay 或第三方监控平台验证是否为区域性/ISP 层面故障。
3.
优先沟通与资源准备
a) 联系上游(CN2 对端)和本地 ISP:提供 traceroute、BGP 状态与时间线;
b) 准备备用出口:确认备用链路(大陆直连/香港中转/其他国际专线/云端跨区域互联)的可用性和带宽;
c) 准备变更单与回滚计划:列出变更步骤、影响评估、负责人与回滚触发条件,获得运维/客户批准。
4.
BGP 应急切换 — 原则与先决条件
a) 原则:优先实现最小业务中断、可验证切换、快速回滚;
b) 先决条件:备用链路已物理连通、BGP 会话已建立或可快速建立、DNS 与防火墙策略已准备调整;
c) 预演:若条件允许,在低峰时段先在灰度环境或单IP上演练切换命令与回退命令。
5.
具体操作步骤 — 切换到备用上游(以 BGP 为主)
a) 在边界路由器上确认当前路径:show ip route <目标IP> / show bgp <前缀> detail;
b) 通过路由偏好改变吸引流量:方法一,调整 local-preference(在出口对等体上设置 route-map,set local-preference 200);
c) 方法二,AS-PATH 预置(在备用出口广播时对原出口做 prepend,或在本侧对备用出口减少 prepend),示例(Cisco IOS):route-map TO-ISP permit 10 set as-path prepend 65000 65000;然后 neighbor X.X.X.X route-map TO-ISP out;
d) 立刻软重启/软重载 BGP(如需要):clear ip bgp X.X.X.X soft in/out 或 vtysh -c "clear bgp X.X.X.X soft out";
6.
具体操作步骤 — DNS 与应用层应急措施
a) 如果使用自有域名,降低关键记录 TTL 到 60s(提前在正常时间设置,切换时可即刻生效);
b) 修改 DNS A 记录指向备用机房/云端弹性 IP,或使用负载均衡器做流量分流;
c) 对于 API/长连接服务,建议同时调整客户端重试策略与超时值,避免因切换导致短时间内大量重试加剧问题。
7.
验证切换效果与流量监控
a) 验证方法:从多地域节点重复 traceroute、mtr;核对公网路由表(通过公共路由查看器如 bgp.he.net);
b) 监控指标:丢包率、RTT、应用响应时间、连接失败率、BGP 收到/宣告前缀数;
c) 持续观察 30-60 分钟确认稳定再扩大切换范围,记录变更时间点供事后分析。
8.
回滚与补救
a) 回滚触发条件:备用链路不稳定、丢包/延迟高于阈值、应用错误率升高;
b) 回滚步骤:恢复原 BGP 配置(撤销 route-map、恢复 local-preference、撤销 AS-PATH 修改),并执行 soft clear;
c) 回滚验证:重复第7步的验证方法,确认返回至原状态且业务恢复正常。
9.
故障后复盘与长期方案
a) 复盘要点:故障根因、切换时延、未预见问题与改进措施;写入故障单并归档 traceroute/BGP 日志;
b) 长期建议:建立至少两条不同运营商/不同物理路径的备份链路,使用自动化流量切换(BGP Flowspec 或 SD-WAN 策略)和定期演练;
c) 优化建议:为关键前缀配置多出口、多区域 CDN 加速、并在 DNS 上配置健康检查自动切换。
10.
问:如何判定故障确实在台湾 CN2 上而不是本地设备?
答:先从多点验证(外部监控、RIPE/Atlas、不同 ISP)得到一致的丢包/跳点;再在边界路由器查看对端 BGP 状态与路由变动日志,若对端路由器返回 ICMP 超时或 BGP 会话异常且外部探测在同一跃点停止,基本可以判定为对端(CN2)或其骨干链路问题。
11.
问:切换时对客户体验影响如何最小化?
答:预先降低 DNS TTL、分批灰度切换、使用备用链路做流量镜像或按权重切换、在应用层增加重试与降级逻辑,且在切换窗口通过告警/公告提醒客户,能把感知影响降到最低。
12.
问:常用路由器/软件具体命令有哪些关键点?
答:Cisco 常用:show ip bgp summary、clear ip bgp soft in/out、route-map 配置 set local-preference/as-path;Juniper:show bgp neighbor、clear bgp neighbor ;FRR/vtysh:show bgp summary、clear bgp soft out。执行前务必有变更/回滚单并通知相关值班人员。
来源:台湾cn2线路故障影响范围及应急切换方案建议