🔍 网络故障综合分析报告

分析时间: 2026-06-24 | 数据来源: flow2/ (3个pcap文件 + 拓扑描述) | 分析引擎: 澜砥 N2.5

🏗 网络拓扑全景(云平台对外服务场景)
┌─────────────────────────────────────────────────────────────────────┐ │ 【互联网用户】 │ │ (微信/支付宝/浏览器客户端) │ └──────────────────────────┬──────────────────────────────────────────┘ │ ┌──────────────────────────▼──────────────────────────────────────────┐ │ SSL 卸载(双机) │ │ ↓ │ │ 防火墙(双机) │ │ ↓ │ │ IPS(双机) │ └──────────────────────────┬──────────────────────────────────────────┘ │ ┌──────────────────────────▼──────────────────────────────────────────┐ │ 外网交换机(双机) ←── 5-19-4s01G.pcap 捕获点 │ │ ┌──────────┼──────────┐ │ │ ↓ ↓ ↓ │ │ 反向代理(双机) 内网防火墙(双机) 【公共服务区】 │ │ (公服区) │inbound: 192.x.x.x │ │ │ │ └──────────────────┼──────────────────────────────────────────────────┘ │ ┌──────────────────▼──────────────────────────────────────────────────┐ │ 内网防火墙 inbound: 10.x.x.x ←── 客户端IP │ │ ↓ │ │ 安全汇聚交换机 ←── 4s0-全流量.pcap / 5-19-4s0.pcap 捕获点 │ │ ↓ │ │ 【云平台】防火墙 → 交换机 → 服务器 │ │ 10.x.x.x:80/81 (Web应用服务器) │ │ 10.x.x.x:80 (门户服务器) │ │ 10.x.x.x:8080 (业务API服务器) │ │ 10.x.x.x:1521 (Oracle数据库) │ └──────────────────────────────────────────────────────────────────────┘
⚠️ 关键拓扑关系:
10.x.x.x = 内网防火墙的 inbound 接口地址(非普通客户端)
192.x.x.x = 内网防火墙上联到外网汇聚交换机的 inbound 接口
4s0-全流量.pcap / 5-19-4s0.pcap 在 安全汇聚交换机 上捕获(内网侧)
5-19-4s01G.pcap 在 外网交换机 上捕获(外网侧)
🎯 拓扑上下文下的关键修正
修正1: 10.x.x.x 不是普通客户端,而是内网防火墙 inbound 接口
之前分析将 10.x.x.x 误判为"用户终端"。实际上它是内网防火墙的上联接口,所有从云平台出去到互联网的流量都会经过它。

这意味着:4s0-全流量.pcap 中 10.x.x.x 发起的海量 TCP 连接(0.16秒内26,581 pps),实际上是内网防火墙作为 NAT 网关,转发云平台内部服务器对外的连接。连接风暴的源头是云平台内部的业务服务器,而非单个用户终端。
修正2: 10.x.x.x:81 是反向代理/外网接入服务器
该IP位于 10.x.x.x/16 网段,从外网交换机(5-19-4s01G.pcap)视角可见其与 10.x.x.x 之间有大量流量。它很可能是公共服务区的反向代理服务器,负责将互联网请求转发到内网云平台。
修正3: 5-19-4s01G.pcap 的 iSCSI 流量不在外网链路上
外网交换机上捕获到 iSCSI (3260) 流量,说明存储同步流量错误地经过了外网链路,本应走独立存储网络或内网 VLAN,这是明显的网络规划问题。
📊 三份流量包总览
3
PCAP 文件数
~2.2 GB
总流量大小
3,225,734
总数据包数
259,519
总网络流数
~161 秒
总捕获时长
~20,000 pps
平均包速率
文件大小时间范围时长包数流数捕获位置
4s0-全流量.pcap524 MB5/18 15:20:47~15:22:1991秒645,460121,496安全汇聚交换机(内网侧)
5-19-4s0.pcap629 MB5/19 09:50:03~09:50:3331秒858,86752,378安全汇聚交换机(内网侧)
5-19-4s01G.pcap1,074 MB5/19 10:47:32~10:48:1139秒1,721,40785,645外网交换机(外网侧)
⏱ 故障时间线
5月18日 15:20:47 ~ 15:22:19 (91秒)
4s0-全流量.pcap — 安全汇聚交换机(内网侧)
645,460 包 / 121,496 流。DNS 全量无响应 + 内网防火墙(10.x.x.x) 转发的 TCP 连接风暴 + 云平台内部业务流量
5月19日 09:50:03 ~ 09:50:33 (31秒)
5-19-4s0.pcap — 安全汇聚交换机(内网侧,次日)
858,867 包 / 52,378 流。30秒内包数比前一天91秒还多33%!TCP 连接风暴加剧,内网防火墙 NAT 转发压力暴增
5月19日 10:47:32 ~ 10:48:11 (39秒)
5-19-4s01G.pcap — 外网交换机(外网侧,同日稍后)
1,721,407 包 / 85,645 流。外网视角: iSCSI 误入外网链路 (186,785包/229MB) + ICMP 双向轰炸 + DNS Query Refused + 内网防火墙 NAT 出口流量
P0 故障一: DNS 递归解析链路完全断裂(根因)

三份流量包交叉验证结果:

现象4s0-全流量(内网)5-19-4s0(内网)5-19-4s01G(外网)
DNS 响应状态❌ 全无响应❌ 全无响应❌ Query Refused
espp.api.nsfocus.com 重复查询>50次/91秒>50次/31秒N/A
NS根域查询(空qname)大量大量N/A
PTR反向查询风暴N/AN/A数百次/39秒
外网视角的确定性证据:
内网 DNS 服务器 10.x.x.x 对来自 10.x.x.x10.x.x.x/39 的所有 DNS 查询返回 rcode: Query Refused
外网 DNS 服务器 10.x.x.x 也对来自 10.x.x.x 的查询返回 Query Refused

影响范围:云平台所有对外业务(微信小程序、支付宝小程序、Web门户、API接口)均无法解析域名,导致业务完全不可用。
P0 故障二: TCP 连接风暴 — 内网防火墙 NAT 连接表耗尽
拓扑上下文:10.x.x.x 是内网防火墙 inbound 接口,所有云平台服务器对外发起的连接都经过它做 NAT 转换后出去。因此以下 TCP 风暴实际上是云平台内部服务器 → 内网防火墙 NAT → 外网 的流量。
时间流方向包数字节耗时速率
5/18 15:21:2810.x.x.x:81 → 10.x.x.x:150035,0037.0 MB0.48秒10,422 pps
5/18 15:21:2810.x.x.x:81 → 10.x.x.x:652674,9787.0 MB0.52秒9,573 pps
5/19 09:50:1310.x.x.x:34264 → 10.x.x.x:804,2535.7 MB0.16秒26,581 pps
5/19 09:50:1310.x.x.x:55678 → 10.x.x.x:814,2675.7 MB0.16秒26,669 pps
5/19 10:48:0910.x.x.x:45752 → 10.x.x.x:815,2227.1 MB0.46秒11,352 pps

分析(结合拓扑):
① DNS 解析失败 → 云平台业务服务器无法解析外部域名
② 应用层无退避重试 → 服务器反复尝试建立连接到外部服务
③ 每次连接经过内网防火墙(10.x.x.x)做 NAT → 防火墙 NAT 连接表条目暴增
④ 0.16秒内 26,581 pps → NAT 连接表迅速耗尽
⑤ 新连接无法建立 NAT 映射 → 连接失败 → 应用层再次重试 → 正反馈循环
⑥ 内网防火墙 CPU 过载 → 正常业务连接也受影响 → 全面瘫痪

P0 故障三: iSCSI 存储同步误入外网链路
拓扑异常:iSCSI (端口3260) 流量出现在外网交换机上,说明存储同步流量错误地经过了外网链路。iSCSI 应走独立的存储网络或至少隔离的内网 VLAN,不应出现在互联网出口链路上。
源IP目的IP:端口包数字节占总流量方向
10.x.x.x:3108810.x.x.x:3260186,785228,973,994
21.9%
内→外

分析:10.x.x.x 位于办公网段(10.x.x.x/16),10.x.x.x 位于基础设施网段(10.x.x.x/16)。两者之间的 iSCSI 同步流量绕过了内网直连路径,错误地经过外网交换机,占用外网出口 21.9% 带宽。这可能是路由配置错误 VLAN 划分不当导致。

P0 故障四: ICMP 双向轰炸 — 外网链路 MTU/路由问题
源IP目的IP包数字节
10.x.x.x10.x.x.x13,2051,320,462
10.x.x.x10.x.x.x13,1261,312,596
10.x.x.x10.x.x.x11,5561,155,612
10.x.x.x10.x.x.x12,9771,297,686
合计50,8645,086,356

分析(结合拓扑):10.x.x.x~16 和 10.x.x.x 均属于云平台内网段(10.x.x.x/16),但 ICMP 流量却出现在外网交换机上。这意味着这些 ICMP 包经过了"内网→内网防火墙→外网交换机→...→外网交换机→内网防火墙→内网"的绕路路径。可能原因:
① 云平台内部路由配置错误,导致内网互通流量被引流到外网链路
② 内网防火墙策略配置不当,导致 ICMP 包被 NAT 转发到外网
③ 50,864 个 ICMP 包进一步加剧外网交换机 CPU 负载

P1 故障五: Oracle 数据库连接异常
源IP目的IP:端口包数持续时间
10.x.x.x:2121110.x.x.x:152134,728~3分39秒
10.x.x.x:2273810.x.x.x:15211,917~3分36秒

分析:10.x.x.x:1521 是云平台的 Oracle 数据库。10.x.x.x 的 34,728 个包连接出现在外网交换机上,说明数据库访问也错误地经过了外网链路。可能原因:连接池泄漏导致 TCP 连接长期占用、DNS 故障导致应用层反复重试数据库连接。

P1 故障六: 外网端口流量异常分布

5-19-4s01G.pcap 外网交换机 TOP 异常流分布(39秒内 1,721,407 包):

流量类型包数字节占比(包数)说明
iSCSI (3260)186,785229 MB
10.9%
存储同步误入外网
ICMP50,8645 MB
3.0%
路由绕路/MTU问题
Oracle (1521)36,64532 MB
2.1%
数据库连接异常
Web (80/81) 风暴~50,000~60 MB
~2.9%
DNS故障→TCP重试风暴
其他正常流量~1,397,113~690 MB
81.1%
正常对外服务
🎯 综合根因分析(拓扑修正版)

根因链: DNS 故障 → 应用重试 → NAT 表耗尽 → 叠加路由错配 → 全面拥塞

  1. [触发] DNS 递归解析链路完全断裂 — 内网DNS(10.x.x.x)与上下游DNS互相 Query Refused,云平台所有对外业务域名无法解析
  2. [放大] 应用层无退避重试 — 云平台业务服务器在 DNS 失败后立即重试,无指数退避,形成 DNS 查询风暴
  3. [爆发] 内网防火墙 NAT 连接表耗尽 — 云平台服务器每次重试都经过内网防火墙(10.x.x.x)做 NAT,0.16秒内26,581 pps 的瞬时速率迅速耗尽 NAT 连接表
  4. [并发] 路由配置错误导致流量绕路 — iSCSI 存储同步(229MB)、ICMP 双向轰炸(50,864包)、Oracle 数据库连接(34,728包) 均错误地出现在外网交换机上,说明存在严重路由错配
  5. [恶化] 外网交换机/防火墙 CPU 过载 — 海量 ICMP 包 + NAT 表耗尽 + 异常流量叠加,导致网络设备 CPU 过载,正常业务丢包
  6. [结果] 对外服务全面中断 — 云平台对外提供的微信小程序、支付宝小程序、Web门户、API接口全部不可用
✅ 修复建议
优先级措施详细说明
P0修复 DNS 递归解析链路检查 10.x.x.x ↔ 10.x.x.x ↔ 10.x.x.x 之间的区域传输/转发配置,消除 Query Refused
P0配置 DNS 缓存/转发器在云平台内部署 DNS 缓存服务器,避免每台业务服务器直连外网 DNS
P0应用层添加指数退避所有云平台业务系统在 DNS 解析失败时实施指数退避重试(初始1秒,最大30秒)
P0排查路由配置iSCSI 存储同步、ICMP、Oracle 数据库流量不应出现在外网链路,检查 VLAN 划分和路由表配置
P1内网防火墙 NAT 连接数限制配置内网防火墙最大 NAT 连接数,设置连接速率限制,防止风暴时 NAT 表耗尽
P1配置 ICMP 速率限制在外网交换机/防火墙上对 ICMP 包实施 rate-limit,防止 CPU 过载
P1iSCSI 存储网络隔离将 iSCSI 存储同步迁移到独立存储网络或隔离 VLAN,严禁经过外网链路
P2排查 Oracle 数据库连接池检查 10.x.x.x→10.x.x.x:1521 的异常长连接,排查连接池泄漏
P2统一 DNS 策略云平台内部统一 DNS 配置,禁止业务服务器直接使用 8.x.x.x/114.x.x.x 等外网 DNS