1. 巡检前的准备与访问方式确认
- 登录方式:确认管理IP、堡垒机账号或直连SSH账号,优先通过堡垒机审计登录。
- 工具准备:在本地或运维机上准备ssh、scp、rsync、iftop、nethogs、tcpdump、vnstat、sar、iostat、prometheus node_exporter 等工具,并确保有权限执行。
- 文档:准备当日运维清单、变更单、联系方式(ISP/高防厂商应急电话)和恢复脚本路径。
2. 网络与高防链路巡检(逐项操作)
- 验证公网连通性:ssh 登录后执行 ping -c 4 <公网IP> 和 curl -I http://127.0.0.1 来确认服务本机响应。
- 带宽/流量快照:运行 vnstat --oneline 或 ifconfig/ss -s、iftop -P 查看实时流量;保存快照 vnstat -s > /root/vnstat_$(date +%F).log。
- 检查防护状态:登录高防面板(或通过API)查看当前清洗阈值、已激活策略、黑名单/白名单和攻击记录;记录最近24小时的攻击峰值。
3. 主机资源与服务进程巡检(含命令)
- CPU/内存/Disk:使用 top -b -n1 | head -20,free -m,df -hT 查看资源占用与磁盘挂载状态;如发现OOM或磁盘满,定位大文件:du -sh /* | sort -rh | head。
- 磁盘IO:iostat -xm 1 3,查看%util和await,若IO高于70%考虑扩容或优化。
- 服务进程:systemctl status nginx|apache|mysql,ps aux | grep <进程>,若进程异常,查看对应日志 /var/log/。
4. 日志与安全审计巡检
- 日志检查:tail -n 200 /var/log/nginx/access.log 和 /var/log/nginx/error.log,grep 搜索异常路径或大量 4xx/5xx。
- IDS/IPS:查看WAF或IPS日志,确认是否触发大量规则;导出异常IP列表:awk '{print $1}' access.log | sort | uniq -c | sort -nr | head。
- 登录审计:检查 /var/log/auth.log 或堡垒机审计记录,确认是否存在异常登录或权限提升。
5. 网络包与攻击流量分析(实操)
- 抓包命令:tcpdump -i eth0 -s 0 -c 1000 -w /tmp/cap.pcap 'dst host <公网IP>',然后用 tshark 或 wireshark 分析。
- SYN/UDP洪泛排查:ss -s 和 netstat -anp | grep SYN_RECV,若 SYN_RECV 高且来源分散,判定为SYN洪;联系高防或启用SYN cookies。
- 快速阻断:临时在 iptables 添加 DROP 规则:iptables -I INPUT -s <恶意IP> -j DROP(记录规则并写入脚本备份)。
6. 监控与报警配置要点(Prometheus/Grafana 示例)
- 指标项:必须采集 CPU、load、内存、磁盘IO、网络出入带宽、连接数(netstat 或 exporter metrics)、HTTP 5xx 率和异常流量(L7)。
- 报警阈值示例:CPU > 80% 持续 5min;带宽使用 > 70% 持续 1min;连接数 > 基线 * 2。将报警送到钉钉/企业微信并附自动化工单。
- 仪表板:按应用建立面板并加上历史曲线,方便对比峰值与基线。
7. 容量基线测量与数据整理(实操步骤)
- 收集周期:至少采样 14 天含周末和峰值时段,导出 5 分钟粒度流量与请求数。
- 计算基线:计算每天 95 百分位带宽(P95),取峰值日的 P95 作为容量参考。记录平均并计算峰值系数 PeakFactor = 峰值日P95 / 平均日P95。
- 安全冗余:建议带宽冗余系数 1.3~1.5(正常流量),对抗DDoS时至少准备清洗带宽 ≥ 历史最大攻击 * 1.2。
8. 容量规划公式与实例计算
- 公式举例:需求带宽 = 峰值正常业务流量 * 冗余系数 + 清洗后保留量。
- 实例:若平均业务带宽 200Mbps,P95 峰值 600Mbps,PeakFactor=3,取冗余1.4 => 600*1.4=840Mbps;若历史最大攻击 5Gbps,需清洗带宽至少 5Gbps 并配合CDN/Anycast降载。
- CPU/内存按并发连接计算:并发连接数 / 单进程最大连接数,得出需要的进程或实例数,乘以冗余1.2做伸缩预留。
9. 高可用与弹性策略(操作步骤)
- 负载均衡:部署至少两台后端并放入LVS或L4 LB,配置健康检查(HTTP 200)。
- CDN与缓存:把静态资源上 CDN,减少源站带宽;设置缓存规则与缓存穿透保护。
- 自动扩缩容:设置监控阈值触发脚本或云API扩容(增加实例或带宽),并测试伸缩脚本(scale-out/scale-in)。
10. 应急演练与恢复流程(实操清单)
- 演练步骤:定期(至少季度)做一次DDoS演练,步骤包含触发攻击模拟(流量工具如 hping3/boom)→ 启用高防策略 → 验证业务是否降级/恢复。
- 恢复脚本:准备一键回滚脚本(iptables flush/恢复Nginx配置/重启服务)并放入版本库;演练时计时并记录RTO/RPO。
- 通知流程:列出应急联系人、厂商联系人和恢复负责人,明确谁负责切换清洗中心、谁负责流量分流。
11. 日常巡检报告模板与记录要求
- 报告内容:日期、巡检人、带宽快照(平均/P95)、异常事件、处理动作、未解决项与下一步计划。
- 存档:将每日巡检报告放入运维系统并设置权限,保留至少 6 个月以便回溯分析。
12. 问:日本高防服务器如何判断是否需要提升清洗带宽?
- 答:观察历史攻击峰值与当前带宽占用,当业务峰值接近现有带宽的70%-80%且历史攻击峰值≥当前带宽的50%时,应评估提升清洗带宽并预留冗余;同时参考P95和PeakFactor计算结果。
13. 问:发生大流量攻击时我应先做哪些紧急操作?
- 答:先开启高防厂商的清洗策略或切换到清洗IP,临时在服务器上用 iptables 降低流量处理(rate-limit、DROP 恶意IP),并通过CDN/Anycast减载,同时通知厂商启动深度分析与黑洞/白名单策略。
14. 问:如何把容量规划落地到采购或云带宽扩容上?
- 答:基于监控和计算出的需求带宽、清洗带宽与冗余系数,形成容量需求单(含峰值、P95、历史攻击峰值及预期增长率),与供应商确认SLA与带宽弹性选项,优先选择可快速按需扩展的方案并签署应急响应时延。
来源:日常运维 日本高防服务器怎么用 的巡检与容量规划要点