1.1 目标:提供面向台湾本地与国际访问的VPS可用性与性能可测、可追溯服务。
1.2 范围:包含主机(VPS)、公网IP、带宽链路、域名解析、CDN回源、DDoS防护与BGP出口。
1.3 指标:关注可用率(Uptime)、平均响应时延(ms)、丢包率(%)、恢复时间(RTO/RPO)。
1.4 监测粒度:默认1分钟主动探测,支持高级15秒粒度与网络层心跳。
1.5 报告周期:小时/日/月汇总并存档 13 个月,供审计与SLA核算。
2.1 探测点:在台北、台中、高雄各部署独立探针,使用三点对目标VPS并行检测。
2.2 探测方式:HTTP(S)健康检查、TCP端口、ICMP Ping与应用层事务(如登录、数据库查询)验证。
2.3 聚合平台:采集到 Prometheus/InfluxDB,Grafana 做可视化,保留原始采样用于回溯。
2.4 门槛设定:连续3次失败(1分钟间隔)判定“可用性事件”,自动升级通知并触发冗余切换。
2.5 告警渠道:短信、邮件、Slack/Teams、Webhook 与电话回拨,含事件ID与初步诊断信息。
3.1 SLA目标:月度可用率≥99.95%(即月允许不可用时间约21.6分钟)。
3.2 例外情况:计划性维护、客户配置错误、不可抗力、第三方链路故障不计入SLA扣款。
3.3 可用性计量:以平台监测数据为准,采用探针平均可用率进行核算。
3.4 赔偿规则:月可用率 99.9%-99.95% 赔付5%服务费;99.5%-99.9% 赔付10%;低于99.5% 赔付20%,按当月费用计算。
3.5 申诉与核验:客户需在事件发生后30天内提交申诉,平台提供原始探测日志与PCAP供第三方复核。
4.1 边缘防护:与台湾三大运营商互联,并在PoP层部署流量清洗与速率限制。
4.2 CDN回源保护:设置回源白名单、TLS强制、WAF规则与回源带宽峰值限速。
4.3 清洗能力:示例清洗带宽 >= 10 Gbps(可按需扩展至100 Gbps),自动分流恶意流量至清洗池。
4.4 IP黑白名单:支持自动封禁高频请求IP与手动豁免合法爬虫。
4.5 日志与取证:保存流量镜像、攻击快照与触发规则,支持司法取证导出。
5.1 案例背景:某台湾电商双11活动,流量突增并遭遇L4 UDP放大攻击,平台触发自动清洗并切换CDN回源。
5.2 处理过程:自动扩容 4 台临时回源节点,启用WAF严格模式,完成清洗后流量回复正常,业务中断时间 < 12 分钟。
5.3 配置示例A(标准VPS):4 vCPU / 8 GB RAM / 160 GB NVMe / 1 Gbps 带宽 / 公网IP x1。
5.4 配置示例B(高可用型):8 vCPU / 32 GB RAM / 512 GB NVMe / 双网卡 BGP 出口 / 2 公网 IP / 备机热切。
5.5 性能数据:活动峰值吞吐 3.2 Gbps,平均响应 120 ms(台湾本地),丢包率 <0.1%。
| 项目 | 指标 | 示例数值 |
|---|---|---|
| 月可用率目标 | Uptime | 99.95% |
| 允许停机 | 分钟/月 | ≤21.6 |
| 探测间隔 | 秒 | 60(可选15) |
| DDoS 清洗能力 | Gbps | 10(可扩展至100) |
| 标准VPS规格 | vCPU / RAM / 磁盘 | 4 / 8GB / 160GB NVMe |
6.1 报表项:每小时可用率、平均RTT、丢包率、错误码分布、带宽峰值与清洗次数。
6.2 告警级别:信息、警告、严重、紧急;严重以上自动抄送值班与客户紧急联系人。
6.3 赔偿计算示例:当月实际可用率 99.70%,低于目标 99.95%,按条款赔付 10% 当月服务费。
6.4 核验数据:提供探针原始日志、BGP会话状态、链路流量曲线与清洗记录供客户稽核。
6.5 建议:关键业务建议多可用区部署、启用自动扩容与预置清洗策略以降低SLA风险。