企业园区网络高级工程师 · 技术面试题与知识点学习手册

Campus Network Senior Engineer — Technical Interview & Knowledge Manual
覆盖范围:APAC 园区有线/无线网络设计 · 大规模部署 · BGP/EVPN-VXLAN · NAC 认证 · 下一代防火墙 · 负载均衡 · SD-WAN/IPsec · 网络自动化 · Linux/抓包 · 割接与项目管理
TCP/IP 与路由交换 无线与 RF 规划 园区 Fabric / VXLAN 802.1X / RADIUS / TACACS+ Palo Alto 防火墙 F5 / Citrix 负载均衡 SD-WAN / IPsec VPN Python / Ansible / Netmiko Linux / Wireshark 割接与跨团队协作

0. 使用说明与能力模型

本手册针对岗位「APAC 园区网络高级工程师(Campus Network Senior Engineer)」量身编写。该岗位要求 10 年以上 渐进式网络工程经验,强调整体园区有线/无线网络的设计、大规模部署、生产割接、自动化与高级排障能力。手册将招聘信息拆解为 15 个技术知识域,每个知识域均包含:

  • 深度教学(Depth Teaching):系统化的原理讲解,便于自学者建立知识框架;
  • 面试可能问到的问题(Interview Q&A):以「问题 + 期望回答要点」形式呈现,模拟真实技术面场景。

建议用法:先按「深度教学」系统复习,再用「面试问答」做自测;回答时遵循「先原理、再实践、后权衡(trade-off)」的三段式结构,最能打动高级面试官。

15
核心技术知识域
10+
年经验门槛
5
主流平台 Cisco/Arista/Juniper Mist/Aruba/Cumulus
自动化可重复性追求

岗位能力雷达(面试重点)

能力维度岗位要求强度对应章节
园区有线/无线整体设计核心4、5
路由交换底层功底 (TCP/IP)核心1、2、3
生产割接与排障 (3 级)核心11、13
NAC 与认证安全核心6
防火墙/安全策略核心7
网络自动化 (Python/Ansible)核心10
BGP / EVPN-VXLAN进阶3、4
负载均衡 F5/Citrix进阶8
SD-WAN / IPsec加分9
RF 规划/现场勘测加分5
跨团队沟通/业务翻译软技能14
面试官视角:该岗位是「技术深度 + 工程广度 + ownership」的复合体。高级面试官不会只考命令,而会考察:你是否能在不确定中做架构取舍、能否把割接风险降到最低、能否用自动化把重复劳动产品化。

1. TCP/IP 与网络基础

这是所有网络工程的根基,也是岗位的「Strong fundamentals」硬要求。面试官常以 OSI/TCP-IP 模型、子网划分、TCP 机制、MTU/分片为切入点,层层深入。

1.1 分层模型与封装

OSI 七层(物理/数据链路/网络/传输/会话/表示/应用)是教学框架,而 TCP/IP 四层(网络接口/网际/传输/应用)更贴近实现。实际排障时,工程师应能在脑中映射每层的关键协议与故障现象:

  • L1 物理层:线缆、光模块、速率/双工、信号衰减——故障表现为 link down、CRC 错误、丢包。
  • L2 数据链路:以太网、MAC、VLAN、STP、ARP——故障表现为 MAC 震荡、环路、ARP 不解析。
  • L3 网络层:IP、ICMP、路由协议——故障表现为不可达、路由黑洞、非对称路径。
  • L4 传输层:TCP/UDP、端口——故障表现为连接 reset、重传、端口不可达。
  • L5-7 应用层:HTTP/DNS/TLS 等——故障表现为业务超时、证书错误。
封装(Encapsulation):数据从应用层向下,每经一层加上该层头部(TCP 段→IP 包→以太网帧)。排障时「抓到的帧」是最终形态,需逐层剥离还原。面试常问「ping 通但应用不通」——这就是 L1-L3 正常、问题在 L4+ 的典型症状。

1.2 IP 寻址、子网与 CIDR

IPv4 地址 32 位,点分十进制。CIDR(如 10.10.0.0/16)用前缀长度表达网络位。熟练的子网划分能力是园区地址规划的前提:管理网、用户 VLAN、无线 VLAN、设备带外管理、WAN 互联各自需要独立的地址块与汇总(summary)策略。

  • 子网数 / 主机数:借 h 位做子网,则子网数 2^h,每子网可用主机 2^(32-prefix-h) − 2。
  • VLSM(变长子网掩码):按实际需求分配不同大小子网,避免浪费。园区中 VOICE VLAN 可能只需 /26,而用户 VLAN 用 /22。
  • 私有地址段:10.0.0.0/8、172.16.0.0/12、192.168.0.0/16;IPv6 中用 ULA(fc00::/7)。
  • IPv6:128 位,双栈部署已成园区标配;需掌握 SLAAC、DHCPv6、NDP(替代 ARP)、PMTU。
# 经典面试题:判断 10.10.5.0/24 与 10.10.6.0/24 能否汇总为 /22?
# 10.10.4.0/22 覆盖 10.10.4.0 - 10.10.7.255,包含两个 /24,可汇总。
# 但若中间被其他区域占用,则需更精细的汇总或保持明细。

1.3 ARP 与邻居发现

IPv4 靠 ARP 把 IP 解析为 MAC;同网段通信先查 ARP 缓存,未命中则广播 ARP Request。常见问题:ARP 泛洪(ARP poisoning/扫描)、代理 ARP 误开导致次优路径、免费 ARP(Gratuitous ARP,用于网关故障切换/VRRP)。IPv6 用 NDP(Neighbor Discovery),含 RS/RA/NS/NA,并承担地址自动配置与重复地址检测(DAD)。

1.4 TCP 机制深度

TCP 是面向连接、可靠、字节流的传输层协议,园区中绝大多数业务(HTTP/HTTPS、数据库、RADIUS 部分)依赖它。

  • 三次握手:SYN → SYN-ACK → ACK,确立双向序列号与窗口。面试常问「为什么不是两次?」——两次握手无法确认客户端的接收能力,且易因旧 SYN 造成无效连接资源占用。
  • 四次挥手:FIN-ACK 双向各一次,因 TCP 全双工,关闭需双向。TIME_WAIT 持续 2×MSL,防止旧报文干扰新连接,但也带来端口占用问题(高并发短连接服务需调优 tcp_tw_reuse 或开启端口复用)。
  • 序列号/确认号:确认号 = 收到数据的最后字节序号 + 1,实现累计确认。
  • 滑动窗口:接收窗口(rwnd)由对端通告,控制流量;发送窗口取 rwnd 与拥塞窗口(cwnd)最小值。
  • 拥塞控制:慢启动(cwnd 指数增)、拥塞避免(线性增)、快重传/快恢复;现代常用 Cubic(Linux 默认)、BBR(Google,对抗丢包型 bufferbloat 更优)。
  • 重传:超时重传(RTO)与快速重传(收到 3 个重复 ACK)。重传率高通常是链路丢包或 buffer 溢出的信号。

UDP 与 TCP 的取舍

UDP 无连接、低延迟、无重传,适合 DNS 查询、SNMP、音视频流、VXLAN(UDP 4789)、某些 SD-WAN 数据面。选 TCP 还是 UDP 本质是「可靠性 vs 延迟」的权衡。

1.5 MTU、MSS 与分片

MTU 是链路层一帧能承载的最大 IP 包(以太网默认 1500 字节)。IP 包超过路径 MTU 时,若 DF(Don't Fragment)位未置则分片,否则丢弃并返回 ICMP「需要分片」(Type 3 Code 4)——这正是 PMTUD(路径 MTU 发现)机制。

VXLAN 实战坑:VXLAN 增加 50 字节头部(20 IP + 8 UDP + 8 VXLAN + 14 内层以太),若底层 MTU 仍为 1500,内层业务 IP 包需 ≤1450,否则分片。正确做法是把 Underlay MTU 设为 1600 或 9000(jumbo),并在 TCP 侧用 MSS 钳制(MSS clamping,如 ip tcp adjust-mss 1360)避免分片。面试必考。

1.6 ICMP 与基础排障

ICMP 承载差错与控制(Type/Code),用于 ping(Echo)、traceroute(利用 TTL 过期或端口不可达)、PMTUD。防火墙上常被限制,导致 ping 不通但业务通,需在排障时区分「可达性」与「策略放行」。

Q1. 请解释 TCP 三次握手,并说明为什么不能用两次握手?
期望要点:① 三次握手同步双方初始序列号与窗口参数;② 两次握手无法确认客户端能正确接收服务端报文,且历史延迟 SYN 会造成服务端凭空建立半开连接、浪费资源(SYN flood 风险);③ 第三次 ACK 同时完成客户端的接收能力确认。可补充:现代实现还有 SYN Cookie 防御 SYN flood。
Q2. 客户端 ping 网关通,但访问 HTTPS 业务慢且偶发失败,你的排查思路?
期望要点:① ping 通说明 L1-L3 可达、基础路由 OK;② 应用层问题优先查 L4(端口是否放行、是否有 ACL 拦 TCP 443)、TLS/证书、MTU/MSS 导致的 HTTPS 大包被悄悄丢弃(典型「小文件能下、大文件卡死」,用 ping -s 1472 -M do 测 DF 包验证);③ 抓包看是否大量 TCP 重传/RST/乱序;④ 检查中间设备(防火墙、LB、IPS)策略与状态表。
Q3. 什么是 MTU 与 MSS?为什么 VXLAN Overlay 网络要特别关心 MTU?
期望要点:MSU 概念 + VXLAN 封装 50 字节开销 + Underlay 应开 jumbo(≥1600,推荐 9000)+ MSS clamping 防止分片 + 端到端 PMTUD 失效时的兜底方案。
Q4. 简述 ARP 的工作过程,以及免费 ARP(Gratuitous ARP)的作用。
期望要点:ARP 请求广播解析 MAC;免费 ARP 是发送方主动用自己 IP 广播「我是 X 的 MAC」,用于重复地址检测与网关切换(VRRP/HSRP 主备切换时通知交换机刷新 CAM 表与主机 ARP 缓存,减少流量中断)。
Q5. IPv6 中 ARP 被什么取代?NDP 还承担了哪些额外职责?
期望要点:NDP(邻居发现协议)取代 ARP;额外职责:路由器发现(RS/RA,实现 SLAAC 无状态地址自动配置)、前缀发现、重复地址检测(DAD)、邻居不可达检测(NUD)。

2. 二层交换技术

园区网络以交换为核心,岗位要求「Strong fundamentals in TCP/IP, routing, and switching」。本节覆盖 VLAN、Trunk、STP 家族、EtherChannel、二层安全。

2.1 以太网与 MAC 学习

交换机基于 MAC 地址表(CAM 表)做转发决策:未知单播泛洪、已知单播精确转发、广播/组播泛洪(除非 IGMP Snooping)。MAC 表有老化时间(默认 300s)。广播域由 VLAN 划分,一个 VLAN = 一个广播域 = 一个逻辑子网(惯例)。

2.2 VLAN、Trunk 与 802.1Q

  • VLAN:将物理交换机逻辑分割成多个广播域,VLAN ID 1-4094(0 和 4095 保留)。
  • Access 口:归属单一 VLAN,连接终端;Trunk 口:承载多 VLAN,打 802.1Q 标签(4 字节:TPID 0x8100 + PRI/DEI + 12 位 VLAN ID)。
  • Native VLAN:Trunk 上不打标签的 VLAN(默认 1),是安全弱点——应改为未使用 VLAN 并设 switchport trunk native vlan tag(Cisco 的 vlan dot1q tag native)防止 VLAN 跳跃攻击。
  • Voice VLAN:同一接入口同时承载数据 VLAN(untagged)与语音 VLAN(tagged,COS 5),IP 电话通过 CDP/LLDP 发现。
interface GigabitEthernet1/0/10
  switchport mode access
  switchport access vlan 100
  switchport voice vlan 200
  spanning-tree portfast
  spanning-tree bpduguard enable

2.3 生成树协议 (STP/RSTP/MSTP)

STP(802.1D)防止二层环路,通过阻塞冗余端口形成无环树。核心概念:

  • 选举:根桥(Root Bridge,Bridge ID 最小)→ 根端口(到根开销最小)→ 指定端口(每段链路朝向根的一侧)→ 阻塞非指定端口。
  • Port Cost / Priority:调整以影响拓扑。
  • RSTP(802.1w):收敛从 30-50s 降到秒级,端口角色更细(替代/备份),Proposal/Agreement 快速转移。
  • MSTP(802.1s):多实例,把多个 VLAN 映射到同一生成树实例(MSTI),平衡负载与资源。
  • PVST+:Cisco 每 VLAN 一棵树的私有实现。
现代园区趋势:在 Spine-Leaf + VXLAN 的 Fabric 架构下,二层不再跨设备延伸,STP 的作用被限制在单台机架交换机或单链路域,环路风险天然降低。但传统三层架构中 STP 仍是必考项,且排查「双上联接入交换机」的 STP 仍时有发生。

2.4 EtherChannel / LAG / LACP

把多条物理链路捆绑成逻辑链路,提升带宽与冗余。LACP(802.3ad)是标准协商协议(active/passive),PAgP 为 Cisco 私有。负载分担基于源/目的 MAC、IP 或端口(hash)。注意:跨设备 EtherChannel 需 VPC(Cisco)、MC-LAG(Arista/Juniper)或链路聚合组支持,否则需用 STP 防环的单设备方案。

2.5 二层安全

  • BPDU Guard:接入口收到 BPDU 立即 err-disable,防私接交换机环路。
  • Root Guard:防止非授权交换机成为根桥。
  • Port-Security:限制端口学习 MAC 数量,违规 shutdown/restrict。
  • DHCP Snooping:信任 DHCP 服务器端口,构建绑定表,防 DHCP 欺骗;也是 DAI(动态 ARP 检测)与 IP Source Guard 的基础。
  • 风暴控制:限制广播/组播/未知单播速率。
Q1. 一台接入交换机的两个上联口都连到核心,为什么需要 STP?如果用 LACP 捆绑,STP 还会阻塞端口吗?
期望要点:① 双上联形成物理环路,STP 必须阻塞其一防广播风暴;② 若用跨设备(VPC/MC-LAG)把两上联捆绑为单逻辑口,则 STP 视其为一条链路、不阻塞,既冗余又无环;③ 区分「单设备 EtherChannel(本地捆绑)」与「跨设备 MC-LAG(需 special 协议)」。
Q2. Native VLAN 有什么安全隐患?最佳实践是什么?
期望要点:① Native VLAN 不打标签,攻击者若接入 Trunk 可借 Native VLAN 跨 VLAN 通信(VLAN hopping);② 最佳实践:把 Native VLAN 改为一个专用、未使用的 VLAN(如 999),且全局开启 vlan dot1q tag native 让所有帧都带标签。
Q3. RSTP 相比 STP 收敛快的根本原因是什么?
期望要点:角色提前确定(替代端口/备份端口热备)、Proposal-Agreement 机制使点到点全双工链路瞬时进入转发、边缘端口(PortFast)直接转发、无听/学状态的固定定时器等待。
Q4. 什么是 DHCP Snooping?它和 IP Source Guard 的关系?
期望要点:DHCP Snooping 仅信任指定端口的 DHCP 响应,建立「MAC-IP-端口-VLAN」绑定表;IP Source Guard 利用该表过滤非法源 IP 的报文;二者配合防 DHCP 欺骗与 IP 欺骗。

3. 三层路由与 BGP

岗位要求「Strong fundamentals in routing」且明列「BGP」为现代设计必备、「EVPN/VXLAN」为加分。本节覆盖静态/动态路由、IGP(OSPF/EIGRP/IS-IS)、BGP 深度、重分发、首跳冗余。

3.1 路由基础

路由器依据最长前缀匹配(longest-prefix match)查 FIB 转发。路由来源优先级(AD,管理距离):直连 0 > 静态 1 > EIGRP 汇总 5 > eBGP 20 > 内部 EIGRP 90 > OSPF 110 > IS-IS 115 > RIP 120 > iBGP 200。理解 AD 才能解释「为什么静态路由覆盖了 OSPF」。园区中常用:用户 VLAN 间路由在核心/汇聚(SVI),WAN/分支用 BGP 或 OSPF,默认路由指向防火墙/边界。

3.2 OSPF

链路状态协议,用 SPF(Dijkstra)算无环树,靠 LSA 泛洪同步数据库(LSDB)。

  • 区域:Area 0 为骨干,所有非骨干须与 Area 0 相连(或虚链路 VL);ABR 做区域间路由汇总。
  • 类型:区域内用 Type-1/2,区域间 Type-3,外部 Type-5(ASBR),NSSA Type-7 转 5。
  • 邻接:Down→Init→2-Way(邻居)→ExStart→Exchange→Loading→Full(邻接,仅在 DR/BDR 与 DROther 间建 Full)。
  • DR/BDR:广播/NBMA 网段选举,减少 LSA 泛洪;P2P/P2MP 不选举。
  • 开销:基于带宽(参考带宽默认 100Mbps,现代应调 auto-cost reference-bandwidth 10000)。

3.3 EIGRP 与 IS-IS

EIGRP 是 Cisco 的混合协议(DUAL 算法,快收敛、无环),使用 FD/AD、Successor/Feasible Successor。IS-IS 在大型 SP/运营商及部分园区 Fabric(尤其与 Segment Routing 结合)中常见,基于 CLNS、分层(L1/L2)、更简洁。Arista/Cumulus 等白盒生态对 IS-IS 友好。

3.4 BGP 深度(重点)

BGP 是互联网与大规模园区 Fabric 的「胶水」。岗位明确要 BGP 经验。

  • eBGP vs iBGP:eBGP 跨 AS(默认 TTL 1,直连或 ebgp-multihop);iBGP 同 AS 内,不传 iBGP 学到的路由给另一 iBGP 邻居(防环),需全互联或路由反射器(RR)/联盟(Confederation)。
  • 消息:OPEN(建邻,协商 AS/hold/RID)、UPDATE(NLRI+属性)、KEEPALIVE、NOTIFICATION(断邻)、Route-Refresh。
  • 关键属性与选路(面试必考顺序):权重(Cisco 本地)→ 本地优先级(Local Pref,出 AS 方向,越大越优)→ 本地始发 → AS-Path(越短越优)→ Origin → MED(入 AS,越小越优)→ eBGP > iBGP → IGP 度量 → 最老 eBGP → RID 最小。
  • Route Reflector:打破 iBGP 全互联,RR 反射路由(需理解 RR 集群、Originator-ID/Cluster-ID 防环)。
  • 地址族:IPv4 Unicast、VPNv4(MPLS L3VPN)、L2VPN EVPN(VXLAN 控制面)——这正是 EVPN-VXLAN 的基石。
  • 策略:route-map 操控属性、prefix-list 过滤、community(含 well-known 如 no-export、no-advertise,以及自定义 community 做批量策略)。
router bgp 65001
  neighbor 10.0.0.2 remote-as 65001
  neighbor 10.0.0.2 update-source Loopback0
  neighbor 192.0.2.1 remote-as 65000
  address-family l2vpn evpn
    neighbor 10.0.0.2 activate
    neighbor 10.0.0.2 send-community extended
  !
园区场景:现代「收编式」园区 Fabric(如 Cisco SDA、Aruba CX、基于 EVPN-VXLAN 的自建 Fabric)用 iBGP(常 Underlay 用 OSPF/IS-IS,Overlay 用 BGP EVPN)在两台 Spine 与多台 Leaf 间传递主机路由与 VNI 信息。理解 BGP 属性与 RR 是设计可扩展 Fabric 的前提。

3.5 重分发与路由环路

多协议共存需重分发(redistribution)。风险:次优路径、路由反馈(loop)。缓解:用 route-tag 标记、distance 调整、prefix-filter、仅重分发特定路由。园区中常见「OSPF↔BGP」「静态↔OSPF」。

3.6 首跳冗余 (FHRP)

  • HSRP(Cisco):虚拟 IP+MAC,Active/Standby,组 0-255,可多个组做负载分担(不同 VLAN 主备错位)。
  • VRRP(标准):类似 HSRP,Master/Backup,虚拟 MAC 00:00:5e:00:01:XX。
  • GLBP(Cisco):负载分担到多台网关(AVG 分配 AVF)。

在 VXLAN Anycast Gateway 架构下,FHRP 被「任意播网关」(同 IP 同 MAC 在每台 Leaf 上)取代,避免 FHRP 的 Active/Standby 单点。

Q1. 请完整描述 BGP 选路决策顺序,并举例说明如何用 Local Preference 影响出站流量?
期望要点:① 顺序:权重→本地优先级→本地始发→AS-Path→Origin→MED→eBGP 优于 iBGP→IGP 度量→最老 eBGP→RID;② Local Preference 在 AS 内传播、越大越优先,作用于「出 AS(出站)」方向;③ 例:对从 ISP-B 学到的路由设更高 LP,使本 AS 流量优先走 ISP-B。
Q2. 为什么 iBGP 需要全互联或路由反射器?RR 如何防环?
期望要点:① iBGP 水平分割(不向 iBGP 邻居转发 iBGP 路由)避免 AS 内环路,但导致 N² 全互联;② RR 打破该规则,向客户端反射;③ 防环:Originator-ID(反射器写入 originator 的 RID,若收到自己的 RID 丢弃)+ Cluster-ID(集群 ID,检测到自己集群 ID 丢弃)。
Q3. OSPF 中 ABR 与 ASBR 的区别?为什么 Area 0 是骨干?
期望要点:ABR 连接多个区域、做 Type-3 汇总;ASBR 引入外部路由(Type-5);Area 0 作为传输骨干,所有区域间流量必须经它,保证无环(SPF 树以 Area 0 为根)。
Q4. 在 VXLAN Anycast Gateway 方案中,为什么不再需要 HSRP/VRRP?
期望要点:任意播网关在每台 Leaf 上配置相同 VIP 与虚拟 MAC,主机 ARP 解析到的网关就在本地 Leaf,流量本地转发,无需 Active/Standby 选举,消除网关单点并减少东西向绕行。
Q5. 路由重分发最容易出什么问题?如何避免?
期望要点:次优路径、路由环路(相互重分发反馈)、路由抖动;用 route-tag 防环、精确 prefix-list、调整 AD/distance、只双向重分发必要路由、配合默认路由收敛边界。

4. 园区网络架构与 EVPN/VXLAN

这是岗位的「Lead the comprehensive design… of complex wired and wireless campus network infrastructures」核心职责。本节覆盖传统三层架构、Spine-Leaf、VXLAN、EVPN 控制面、任意播网关,以及 Cisco SDA / Aruba / Juniper Mist 的思路对照。

4.1 传统三层园区架构

核心(Core)— 汇聚(Distribution)— 接入(Access)三层:

  • 核心层:高速转发、路由边界,通常 L3,连接 DC/WAN/防火墙。
  • 汇聚层:VLAN 间路由(SVI)、网关、ACL、策略、 redistribution 收敛点。
  • 接入层:终端接入、VLAN 划分、PoE、Port-Security。

缺点: Spanning Tree 阻塞端口造成带宽浪费、二层广播域大、跨园区二层扩展难、故障域大。因此催生 Fabric 化。

4.2 Spine-Leaf (Clos) 架构

源于数据中心、现进入园区。Leaf 接用户/无线控制器,Spine 做高速互联。任意 Leaf 到 Leaf 经过「Leaf→Spine→Leaf」一跳。优势:等价多路径(ECMP)充分利用带宽、无 STP 阻塞、横向扩展线性、适合 VXLAN Overlay。

4.3 VXLAN 原理

VXLAN(RFC 7348)用 MAC-in-UDP 在 L3 网络上传送 L2 帧,解决 VLAN(4094 上限)、跨子网/跨站点二层扩展、租户隔离问题。

  • VTEP:VXLAN 隧道端点(通常是 Leaf),负责封装/解封装,用 IP 标识。
  • VNI:24 位网络标识符(约 1600 万),替代 12 位 VLAN ID。
  • 封装:外层 IP(VTEP 间)+ UDP 4789 + VXLAN 头(含 24 位 VNI)+ 内层原始帧。开销 50 字节。
  • 控制面:可用组播(老式,难运维)、静态 HER(头端复制,小网络)、或 BGP EVPN(现代标准)。

4.4 EVPN 控制面(重点)

BGP EVPN(RFC 7432,L2VPN EVPN 地址族)用 BGP 在多 VTEP 间分发「MAC/IP 可达性」,取代泛洪学习。关键路由类型(RT-2/3/4/5):

  • Type-2(MAC/IP Advertisement):通告主机 MAC 与 IP(含 ARP 抑制信息),实现控制面学习、减少泛洪。
  • Type-3(Inclusive Multicast):建立 BUM(广播/未知单播/组播)转发树(指定 RD/RT)。
  • Type-5(IP Prefix):通告外部/子网路由(L3 VNI),用于分布式任意播网关与外部路由互通。
  • Type-4(Ethernet Segment):多归属(multi-homing)场景的 ES 冗余与防环(ESI)。
对称 IRB vs 非对称 IRB:分布式任意播网关做三层转发时,需在入口 Leaf 先桥接(L2)到 L3 VNI、跨 Leaf 后解封装再做路由,再桥接到目标 VLAN。现代最佳实践是用对称 IRB(入口/出口都经同一 L3 VNI),更节省 VNI 资源、可扩展。

4.5 任意播网关 (Anycast Gateway)

每台 Leaf 上配置相同的 SVI 虚拟 IP 与虚拟 MAC(如 0000.0c9f.fxxx),主机网关就在本地,跨子网流量本地路由后直接 VXLAN 到对端 Leaf,避免「网关热备」单点与绕行。

4.6 厂商方案对照

厂商方案/思路考点
CiscoSD-Access (SDA):基于 EVPN-VXLAN + LISP(控制平面由 DNAC 管理),宏分段、SGT 微分段理解 Fabric、Border/Edge/CP/Border 角色、LISP 用 EID/RLOC 映射
AristaCloudVision + EOS,原生 EVPN-VXLAN,CVX 做状态化_ANYcast了解 EOS 配置模型、MLAG、EVPN 多租户
Juniper MistMist AI 驱动,EX 交换机 + SRX + Mist 云,Marvis 助手,基于 EVPN-VXLAN 的园区 Fabric了解 Mist 的 AI/ML 运维、Apstra(收购)意图网络
Aruba (HPE)Aruba CX + Aruba Central,CX 交换机原生 VXLAN,Central 云管VSX(类似 MLAG)、CX REST API
Cumulus Linux (NVIDIA)Linux 原生网络(FRR + switchd),白盒,EVPN-VXLAN 用 FRR熟悉 Linux 网络栈、FRR、NetDev/ifupdown2
面试加分:能讲清「为什么选 EVPN-VXLAN 而非传统 STP+VRRP」「Underlay 与 Overlay 分离的好处」「多租户 VRF 如何在 Fabric 中隔离」会显著加分,因为这正是该岗位要「Lead design」的内容。
Q1. 用一句话说明 VXLAN 解决了传统 VLAN 的哪些问题?
期望要点:① VNI 24 位解决 4094 VLAN 上限;② 基于 UDP/IP 隧道可在任意 IP 网络上传送 L2,实现跨子网/跨站点二层扩展与租户隔离;③ 配合 EVPN 控制面可做大规模、低泛洪的 Fabric。
Q2. VXLAN 的 Underlay 和 Overlay 分别指什么?Underlay 通常用什么路由协议?
期望要点:Underlay 是承载 VXLAN 隧道的基础 IP 网络(Spine-Leaf 的物理/L3 互联),Overlay 是 VXLAN 之上构建的逻辑二层/三层网络;Underlay 常用 OSPF 或 IS-IS 提供 VTEP 间 IP 可达,Overlay 用 BGP EVPN。
Q3. EVPN Type-2 和 Type-5 路由分别通告什么?
期望要点:Type-2 通告主机 MAC/IP(含 ARP 信息,支撑控制面学习+ARP 抑制);Type-5 通告 IP 前缀(子网/外部路由),用于 L3 VNI 的分布式路由与外部互通。
Q4. 在 EVPN-VXLAN Fabric 中,一台双归属服务器上联两台 Leaf,如何防环与实现主备?
期望要点:① 用 Ethernet Segment(ESI)标识同一多归属链路;② ESI 防环:Leaf 收到来自 ES 的 BUM 帧不会从同一 ES 回传;③ 通过 DF(Designated Forwarder)选举决定哪台 Leaf 负责该 ES 的 BUM 转发,实现冗余与负载分担。

5. 无线局域网与 RF 规划

岗位覆盖「wired and wireless campus」,且加分项明确要求「RF planning, site surveys, hands-on Wi-Fi troubleshooting in large campus deployments」。本节覆盖 802.11 家族、RF 基础、勘测、控制器/云架构、漫游、排障。

5.1 802.11 标准演进

标准频段关键能力
802.11a/b/g5GHz / 2.4GHz早期,54Mbps 级
802.11n (Wi-Fi 4)2.4/5MIMO、40MHz 信道、吞吐数百 Mbps
802.11ac (Wi-Fi 5)5GHzMU-MIMO(下行)、80/160MHz、波束成形
802.11ax (Wi-Fi 6)2.4/5OFDMA、上行 MU-MIMO、BSS Coloring、TWT,高密度优
802.11be (Wi-Fi 7)2.4/5/6320MHz、MLO 多链路、4K QAM,极致吞吐

6GHz 频段(Wi-Fi 6E / 7)提供大量连续信道,显著降低 2.4/5GHz 拥塞,是大型园区新部署热点。

5.2 RF 基础

  • 频率与波长:2.4GHz 穿透好但信道少(仅 3 个非重叠 20MHz)、干扰多;5GHz 信道多、干扰少但穿透弱;6GHz 更干净。
  • 信道绑定:40/80/160MHz 提升吞吐但减少可用信道数,高密度场景需权衡。
  • 功率与 EIRP:EIRP = 发射功率 + 天线增益 − 馈线损耗(dBm)。法规限制 EIRP 上限(如室内 2.4G 一般 ≤30dBm EIRP,依地区)。
  • RSSI / SNR:RSSI 是接收信号强度(越小越好负),SNR = RSSI − 噪声底,决定可用调制。一般语音需 SNR≥25dB、数据≥20dB。
  • 调制与 MCS:越高阶调制(如 1024-QAM)速率越高但需更好 SNR;MCS 索引对应不同调制+编码率+空间流组合。
  • DFS:5GHz 某些信道与气象/雷达共享,需 DFS 检测避让,部署时影响信道规划。

5.3 架构:控制器、云与 CAPWAP

传统:瘦 AP + WLC(无线控制器),AP 通过 CAPWAP 隧道(UDP 5246/5247)注册到 WLC,集中转发或本地转发(FlexConnect)。现代:云管(Juniper Mist、Aruba Central、Cisco Meraki)或控制器集群(Cisco 9800、Aruba Mobility Conductor)。

  • 集中转发:所有用户流量经 CAPWAP 到 WLC 再出网络,策略集中但 WLC 成瓶颈;
  • 本地转发 (FlexConnect/Bridge):AP 本地解封装,适合分支/大园区降低回传压力。

5.4 站点勘测 (Site Survey)

RF 规划不是拍脑袋,而是基于建筑图纸、材料衰减、容量需求做 AP 布点:

  • 被动勘测:用工具(Ekahau、AirMagnet、Tamograph)走测接收各信道 RSSI/噪声,绘覆盖热力图。
  • 主动勘测:实际关联 AP 测吞吐、漫游延迟。
  • 预测性勘测:建模仿真(依建筑材料衰减系数),施工前规划。
  • 容量规划:每 AP 支持并发终端数(高密度会议室/礼堂需更多 AP 或 Wi-Fi 6/7 + 小蜂窝)、每终端带宽需求。
  • 信道复用:同信道 AP 间距要足够(CII 同信道干扰 vs CCI 邻信道干扰),2.4G 只用 1/6/11。

5.5 漫游

客户端在 AP 间移动需无缝漫游。关键:

  • Layer-2 漫游:同子网,客户端 MAC 不变,上下文在 WLC/云间迁移。
  • Layer-3 漫游:跨子网,需锚定(anchor)到原 WLC 或用隧道,否则 IP 重获取会断流。
  • 802.11k/v/r:k(邻居列表)、v(BSS 过渡管理)、r(快速 BSS 过渡 FT,基于 802.1X 的快漫游),大幅提升 VoIP/视频漫游体验。
  • Okumura/Sticky 客户端:客户端不愿切到更好 AP(粘性),需用最小 RSSI 踢除(如 −75dBm 强制重关联)。

5.6 Wi-Fi 排障

常见症状与根因:

  • 覆盖空洞:RSSI 低 → 加 AP / 调功率 / 改布点。
  • 同信道干扰 (CCI):过多 AP 用同信道 → 重规划信道、降功率。
  • 非 Wi-Fi 干扰:蓝牙、微波炉、无绳电话、Zigbee、雷达 → 频谱仪(如 MetaGeek Wi-Spy)定位。
  • 邻频干扰:信道重叠(非 1/6/11 的 2.4G)→ 严格信道计划。
  • 吞吐低:低 SNR 导致低 MCS、信道拥挤、老终端拖累(Wi-Fi 4 终端拉低整体)→ 分频段/SSID 隔离。
  • 漫游掉线:未开 11r/k/v、锚点配置错、WLC 间 mobility 组未建。
Q1. 2.4GHz 和 5GHz 各有什么优劣?为何大型园区推荐双频/三频?
期望要点:2.4G 覆盖远、穿透好但仅 3 非重叠信道、干扰严重;5G 信道多、干净、速率高但覆盖弱;6G 更干净。双频兼顾覆盖与容量,三频(含 6G)进一步释放高密度容量。
Q2. 什么是 DFS 信道?部署时为什么要小心?
期望要点:DFS(动态频率选择)信道与雷达共享,AP 检测到雷达信号须停用并切换信道;后果是 5G 可用信道突然减少、用户体验瞬断;规划时需评估雷达环境并合理选择信道/避开高 DFS 比例。
Q3. 用户抱怨在办公楼里走动时 VoIP 通话会断,如何排查和修复?
期望要点:① 检查是否开启 802.11k/v/r(尤其 r 快速过渡);② 检查 L3 漫游锚点/ mobility 组;③ 调最小 RSSI 踢除粘性客户端;④ 确认语音 SSID 用 WPA2/3-Enterprise + 适当 QoS(WMM/802.11e,语音 UP 6);⑤ 抓包看重关联与 DHCP 耗时。
Q4. 集中转发与本地转发 (FlexConnect) 的取舍?
期望要点:集中转发策略统一、安全强但 WLC 带宽/时延瓶颈;本地转发 AP 本地出流量,降低回传、适合分支与高密园区,但策略需在 AP 本地执行、对 AP 资源要求高。
Q5. 容量规划时,一个会议室(200 人)和开放办公区(40 人/区)的 AP 布点思路有何不同?
期望要点:会议室属「高密度并发」,按终端数×单终端带宽/每 AP 容量算 AP 数,常需小蜂窝+低功率+信道复用;开放区属「覆盖为主、中等并发」,按覆盖半径布点兼顾容量,必要时 Wi-Fi 6/7 多 AP 错频。

6. NAC 与身份认证

岗位明确:「Experience with NAC and authentication technologies: 802.1X, RADIUS, TACACS+, EAP, and CoA (wired and wireless)」。这是安全接入的命脉,必考。

6.1 802.1X 框架

802.1X 是端口级访问控制框架,三方角色:

  • Supplicant(客户端):终端上的 802.1X 客户端(Windows Wired AutoConfig、macOS、ISE/NAC agent)。
  • Authenticator(认证者):交换机/无线控制器,把端口默认置于未授权状态,中继 EAP 到服务器。
  • Authentication Server(认证服务器):RADIUS(如 Cisco ISE、Aruba ClearPass、FreeRADIUS),校验凭证并下发授权(VLAN、ACL、SGT、CoA)。

流程:Supplicant 发 EAPOL-Start → Authenticator 发起 Identity 请求 → EAP 在 Supplicant 与 Server 间隧道传输(Authenticator 仅中转)→ 成功则端口授权(open),失败则保持关闭/置于 Guest VLAN。

6.2 EAP 方法

EAP 类型机制适用
PEAP-MSCHAPv2外层 TLS 隧道保护,内层用户名/密码最普遍,用户凭证
EAP-TLS双向证书认证,最强高安全、机器认证、BYOD
EAP-TTLS外层 TLS,内层可各种灵活
EAP-FASTCisco,PAC 保护无证书 PKI 替代
EAP-MD5明文哈希,不安全仅测试
证书 vs 密码:EAP-TLS 需要 PKI 签发客户端证书,部署成本高但抗钓鱼、可机器认证(设备上线即认证)。PEAP 部署简单但依赖用户密码且需信任服务器证书(防中间人)。

6.3 RADIUS 与 TACACS+

  • RADIUS (UDP 1812/1813):用于设备接入认证(NAC/802.1X)和拨号/VPN,加密仅口令字段(传统),可扩展属性(Vendor-Specific,VSA)下发 VLAN/ACL/SGT。计费(Accounting)用 1813。
  • TACACS+ (TCP 49, Cisco):用于设备管理员登录(命令行授权与审计),全报文加密,支持命令级授权(每命令需服务器批准)与细粒度 accounting(记录每条命令)。

二者分工:RADIUS 管「谁/什么能接入网络」,TACACS+ 管「网络工程师能在这台设备上执行什么命令」。

6.4 CoA (Change of Authorization)

CoA(RADIUS 标准,RFC 5176,UDP 3799)允许服务器在会话已建立后动态修改授权,无需重新认证。典型场景:终端通过 Posture 评估(合规扫描)从隔离 VLAN 提升到业务 VLAN;或检测到异常后降权/断开。交换机需配 aaa server radius dynamic-author 接受 CoA。

6.5 MAB、Guest、BYOD

  • MAB(MAC Authentication Bypass):无 802.1X 客户端的哑终端(打印机、IP 电话、摄像头)用 MAC 作身份,RADIUS 比对资产库。
  • Guest:访客门户(Captive Portal)临时授权到隔离 Guest VLAN,限时。
  • BYOD:自带设备经注册/双 SSID 流程,EAP-TLS 下发证书,纳入合规策略。
  • posture/健康检查:ISE/ClearPass 评估补丁/杀毒,合规才放行,配合 CoA。

6.6 有线与无线 NAC 差异

有线:端口级 802.1X,失败后入 Guest VLAN 或 shutdown;无线:SSID 级,结合 WPA2/3-Enterprise(即 802.1X over EAP),同一 RADIUS 后端统一策略。无线还可按 SSID 区分员工/访客/BYOD。

Q1. 用 802.1X 时,交换机(Authenticator)和 RADIUS 服务器之间传的是什么?为什么说交换机"看不到"密码?
期望要点:交换机与服务器之间是 EAP 中继(EAPOL→RADIUS 的 EAP-Message 属性),EAP 方法(如 PEAP 的 TLS 隧道)在 Supplicant 与 Server 间端到端建立,交换机只中转,无密钥/密码可见;服务器独立完成凭证校验并回 Access-Accept + 授权属性。
Q2. RADIUS 和 TACACS+ 分别管什么?为什么不能同时用一个?
期望要点:RADIUS 主用网络接入(用户/终端入网认证、计费),TACACS+ 主用管理员 CLI 授权与审计;协议(UDP vs TCP)、加密范围(口令 vs 全包)、授权粒度(会话级 vs 命令级)不同;虽可共用后端目录,但职责分离是安全最佳实践。
Q3. 什么是 CoA?举一个必须使用它的真实场景。
期望要点:CoA 是会话中动态改授权的 RADIUS 扩展;场景:终端初连只给隔离 VLAN 做健康扫描(posture),通过后服务器发 CoA 把它移到业务 VLAN 并应用业务 ACL,全程无需重连。
Q4. 打印机这类无 802.1X 的哑终端如何做网络准入?
期望要点:用 MAB(MAC 认证旁路),交换机先试 802.1X,无响应则把 MAC 发 RADIUS;RADIUS 比对资产/端点库,匹配则放入打印机专属 VLAN 并限制(如仅允许打印端口),否则 Guest/拒绝。可结合端口画像。
Q5. EAP-TLS 与 PEAP 在安全模型上的根本区别?什么场景必须上 EAP-TLS?
期望要点:EAP-TLS 双向证书、无口令、抗钓鱼、可机器认证;PEAP 外层 TLS 保护内层口令、依赖用户密码与服务器证书信任。合规/无口令钓鱼风险/机器身份/高安全行业(金融、政府)应上 EAP-TLS。

7. 下一代防火墙与安全

岗位要求「Security experience including hands-on work with Palo Alto firewalls, enterprise firewall policies, and troubleshooting」。本节聚焦 Palo Alto NGFW 架构、策略、NAT、排障。

7.1 下一代防火墙 (NGFW) 与传统防火墙区别

传统防火墙基于「五元组」(源/目的 IP、端口、协议)做状态过滤。NGFW(Palo Alto 为代表)引入应用识别(App-ID)、用户识别(User-ID)、内容识别(Content-ID),策略可基于「谁、用什么应用、什么内容」而非仅端口。

7.2 Palo Alto 架构

  • 数据面:流水线检查(PARC:Parse, App-ID, Policy, Forward, etc.),单通道(single-pass)并行处理,效率高。
  • 管理面:控制平面、配置(running-config / candidate-config)。
  • 接口类型:L3、L2、虚拟线(Virtual Wire,透明桥接、零改造接入)、TAP(镜像监听)、HA 链路。
  • Zone(安全域):策略的最小边界单位,接口划入 Zone,策略定义 Zone 间规则。
  • VSYS:单设备多虚拟系统,租户/部门隔离。

7.3 安全策略 (Security Policy)

策略自上而下匹配,首匹配生效。每条规则包含:源/目的 Zone、源/目的地址、用户、应用(App-ID)、服务(端口)、动作(allow/deny)、Profile(威胁/URL/文件阻断/病毒/漏洞防护)。

最佳实践:① 用 App-ID 而非服务端口定义应用(防止「端口伪装」绕过);② 默认拒绝(cleanup rule deny any/any log);③ 基于用户/组做最小授权;④ 开启日志与策略命中率审计,定期清理 unused rules。

7.4 App-ID / User-ID / Content-ID

  • App-ID:深度包检测 + 应用签名,识别 Skype/Office365/SSL 加密应用(含基于 SNI/证书的应用识别),甚至 decryption 后识别。
  • User-ID:把 IP 映射到用户(通过 AD 轮询、syslog 解析、终端 agent、TACACS+/RADIUS 映射),策略可写「HR 组可访问薪酬系统」。
  • Content-ID:威胁防护(IPS/漏洞、防病毒、反间谍、URL 过滤、文件阻断、C2 防护)。

7.5 NAT

  • Source NAT (SNAT):内网出公网做 IP 隐藏(动态 IP/端口,或静态);
  • Destination NAT (DNAT):公网 IP 映射到内网服务器(端口映射);
  • U-Turn / Hairpinning:同接口进出(如内部用户经公网域名访问内部服务器),需放通同 Zone 策略并正确 NAT;
  • Policy-Based Forwarding (PBF):按条件改下一跳(如特定流量走分流链路)。

7.6 解密 (Decryption)

现代流量多 HTTPS,NGFW 需做 SSL/TLS 解密(解密策略 + 受信任根证书推到终端)才能对加密流量做 App-ID 与威胁检测。注意合规与隐私边界(不解密金融/医疗等高敏)。

7.7 排障方法论

  • 数据包捕获:防火墙内置 packet capture(tcpdump 风格),可抓 manage/DP 流,结合 filter。
  • 流量排序(test security-policy-match / packet capture + session):确认命中哪条规则。
  • 会话查看show session all filter 看状态、NAT 转换、应用识别。
  • 计数器show counter global 看 drop 原因(如 flow_policy_deny、appid 失败)。
  • 丢包分层:路由 → 安全策略 → NAT → 内容检测 → 接口/MTU。
Q1. 传统防火墙和下一代防火墙在策略模型上最大的区别是什么?
期望要点:传统基于五元组(IP/端口/协议);NGFW 引入 App-ID(应用)、User-ID(用户)、Content-ID(内容/威胁),策略可写为「某用户组用某应用访问某资源并做威胁检测」,并非依赖端口。
Q2. 为什么建议安全策略用 App-ID 而非服务端口?会有什么副作用?
期望要点:App-ID 防端口伪装/隧道绕过、精确识别加密应用;副作用:需解密才能识别部分加密应用、可能误识别需调签名、CPU 开销更高,需平衡性能与可见性。
Q3. 内部用户通过公网域名访问内部服务器(U-Turn)不通,常见原因?
期望要点:① 需要 Destination NAT 把公网 IP 转内网 + 源也可能需 SNAT(否则非对称路由);② 安全策略需放行同 Zone( intrazone)或正确 Zone 间;③ 有时更优解是内部 DNS 直接解析内网 IP(split DNS)避免绕防火墙。
Q4. 如何排查「策略明明 allow 了但仍不通」?
期望要点:test security-policy-match 看实际命中规则;② 查会话是否建立、是否被内容检测丢弃;③ show counter global 找 drop 原因;④ 确认路由/NAT/区分配正确、App-ID 是否识别出预期应用(有时识别成 unknown-tcp 导致不匹配)。
Q5. SSL 解密有什么收益与风险?怎样划边界?
期望要点:收益:对加密流量做 App-ID 与威胁检测;风险:隐私/合规、性能、证书信任链。边界:排除金融/医疗/政府等高敏类别,仅解密业务必要流量,且终端需信任防火墙根证书并符合法规。

8. 负载均衡 (F5 / Citrix)

岗位要求「Familiarity with load balancers (e.g., F5, Citrix) and how they integrate into enterprise network services」。本节覆盖 L4/L7 负载、F5 BIG-IP 对象模型、持久化、iRules、健康检查、GSLB。

8.1 负载均衡位置与价值

LB 位于服务端前,把客户端请求分发到多台真实服务器(pool member),实现高可用、横向扩展、运维友好(灰度/下线)。常串联在「防火墙之后、应用之前」,或作为应用交付控制器(ADC)含 SSL 卸载、压缩、缓存。

8.2 L4 vs L7

  • L4(传输层):基于 IP+端口(及 TCP/UDP)分发,性能好、不解析内容,适合通用 TCP/UDP 服务。
  • L7(应用层):基于 HTTP 头/URL/Cookie/主机名分发,可实现内容路由(如 /api → 服务A,/static → 服务B)、SSL 卸载、重写。

8.3 F5 BIG-IP 对象模型

F5 TMOS 的对象层级(面试常考能否讲清):

  • Virtual Server (VS):对外监听的 IP:端口(如 10.0.0.10:443),流量入口。
  • Pool:后端服务器组(members),含负载算法。
  • Pool Member / Node:单台真实服务器(node 是 IP,member 是 IP:port)。
  • Profile:定义处理行为(TCP、HTTP、SSL、HTTP 压缩、持久化、健康检查),VS 引用。
  • iRules:基于 TCL 的事件脚本(when CLIENT_ACCEPTED / HTTP_REQUEST),实现任意流量改写与路由逻辑。
  • Monitor:健康检查(HTTP GET、TCP、外部脚本),决定 member 上下线。
  • SNAT / NAT:保证回包经 F5(源地址转换),避免服务器直回客户端造成非对称。
ltm pool app_pool {
  members { 10.1.1.11:443 { } 10.1.1.12:443 { } }
  monitor http_mon
  load-balancing-mode least-connections-member
}
ltm virtual app_vs {
  destination 10.0.0.10:443
  pool app_pool
  profiles { tcp http clientssl serverssl }
  persist { cookie }
}

8.4 负载算法与持久化

  • 算法:轮询(Round Robin)、加权轮询、最少连接(Least Connections)、最快响应、源地址哈希(会话保持)、观察法等。
  • 持久化(Persistence):保证同一客户端持续命中同一 member。常见:源地址持久(但 NAT 后用户共享不利)、Cookie 插入(L7,最准)、SSL ID、MSRD(JSESSIONID)。

8.5 健康检查

Monitor 决定 member 可用性。注意「节点 UP 但应用 500」需应用层 monitor(HTTP 期望特定状态码/关键字);误配 monitor 会导致流量打到故障节点或健康节点被误踢。F5 支持「动作 on service down」(如重定向到 sorry page)。

8.6 SSL 卸载与重写

F5 常做 SSL 终端(client SSL 解密、server SSL 可选),减轻后端压力;可改写 Host、URL、插入 X-Forwarded-For 头(后端拿到真实客户端 IP)。

8.7 GSLB / DNS 负载

跨数据中心全局负载(F5 GTM / BIG-IP DNS,Citrix GSLB):基于 DNS 解析把用户导向最近/最健康的数据中心,结合健康监控、地理/延迟策略,实现容灾与就近接入。

8.8 Citrix ADC 对照

Citrix ADC(原 NetScaler)对象:VIP(虚拟服务器)、Service/Service Group、Monitor、CSW(Content Switching,类 L7 路由)、Responder/Rewrite policies。概念与 F5 高度对应。

Q1. F5 的 Virtual Server、Pool、Node、Member 是什么关系?请按流量路径描述。
期望要点:客户端访问 VS(对外 IP:端口)→ F5 按 VS 的负载算法从 Pool 的 Member(Node:Port)中选一台 → 经 SNAT 转发到后端;回包经 F5 回客户端。Node 是 IP,Member 是 Node+Port,Pool 是 Member 集合,VS 是入口。
Q2. 一个电商购物车场景,为什么必须做持久化(Persistence)?用源地址哈希有什么坑?
期望要点:购物车状态常存于单台应用服务器会话,无持久化会跳到不同服务器丢购物车;源地址哈希在用户经 NAT/代理(大量用户共享同一公网 IP)时会全部命中同一 member 导致不均,且用户出口变化会失效;稳妥用 Cookie 插入持久化。
Q3. 后端服务器健康(HTTP 200)但应用返回 500,F5 还把流量分过去吗?如何避免?
期望要点:若 monitor 仅 TCP 或只查 200,则 500 仍视为 UP;应使用应用层 HTTP monitor 检查期望状态码与响应关键字(如返回特定 OK 文本),或写 external monitor 调业务接口,异常则把 member 置 DOWN。
Q4. 为什么负载均衡场景下常需要 SNAT?不做会怎样?
期望要点:SNAT 把源 IP 改为 F5 自身,确保后端回包回到 F5 再由 F5 回客户端,维持会话状态;不做则后端直回客户端,客户端收到非 VS IP 的包会丢弃(非对称路径),且 F5 无法做连接复用/卸载。
Q5. GSLB 与本地负载均衡的区别?它解决什么问题?
期望要点:本地 LB 在单 DC 内分发;GSLB 通过 DNS 在多个 DC 间按地理位置/健康/延迟引导,解决跨数据中心容灾、就近接入、全局扩容,是「DNS 层」的负载与高可用。

9. SD-WAN 与 IPsec VPN

岗位加分项:「Strong experience with SD-WAN and IPsec VPNs, including design, deployment, and operationalization」。本节覆盖 SD-WAN 架构、Overlay/Underlay、IPsec 两个阶段、应用感知路由。

9.1 SD-WAN 概念

SD-WAN 把「控制平面与数据平面分离」,集中编排(控制器/编排器)下发策略到边缘(Edge/vEdge),在多种物理链路(MPLS、互联网、4G/5G)上构建加密 Overlay 隧道,按应用策略选路。

  • Underlay:底层物理链路(各运营商传输)。
  • Overlay:边缘间逻辑隧道(IPsec/GRE/VXLAN),业务跑其上。
  • Orchestrator / Controller / Management:集中配置、监控、策略(如 Viptela/ Cisco、VeloCloud/VMware、Fortinet、Versa)。
  • 零接触部署 (ZTP):设备上线自动从控制器拉配置,显著加速分支部署。

9.2 应用感知路由 (Application-Aware Routing)

SD-WAN 实时探测各链路质量(丢包、抖动、延迟,SLA 指标),按应用 SLA 要求选路:语音/视频走低延迟链路,大数据走廉价互联网链路,链路劣化自动切换(无缝)。这是相对传统路由「只看可达性」的本质提升。

9.3 IPsec 深度

IPsec 提供机密性、完整性、认证。两阶段:

  • IKE Phase 1(ISAKMP/IKEv1 或 IKEv2):建立安全关联(SA),认证对等体、协商加密/哈希/DH 组,生成密钥。IKEv2 更简、抗 DoS、支持 MOBIKE。
  • Phase 2(快速模式 / CREATE_CHILD_SA):协商 IPsec SA(ESP/AH),定义受保护的数据流(Proxy-ID / 感兴趣流)、封装模式(传输/隧道)。
  • ESP vs AH:ESP 加密+认证(最常用);AH 仅认证不加密。
  • 模式:隧道模式(整包封装,VPN 站点间)vs 传输模式(仅载荷,主机间)。
  • 感兴趣流不匹配:两端 Proxy-ID 不一致是 VPN 起不来的最常见原因。
# 排错 IPsec 思路:
# 1) Phase1 SA 是否建立  -> show crypto isakmp sa
# 2) Phase2 SA / 感兴趣流是否匹配 -> show crypto ipsec sa
# 3) 加解密计数是否增长 -> 若无,则可能路由/ACL/感兴趣流问题
# 4) 中间设备是否放行 UDP 500/4500、ESP(50)

9.4 与 DMVPN / 传统 VPN 对比

方案特点适用
Site-to-Site IPsec点对点静态隧道少量固定站点
DMVPN动态多点(mGRE + NHRP), spoke 间动态建隧道多分支、无控制器
SD-WAN集中编排+应用感知+多链路大规模、多链路、需 SLA
Q1. SD-WAN 相对传统路由+IPsec 的核心价值是什么?
期望要点:① 控制与转发分离、集中策略编排;② 多链路(MPLS+互联网+4G)统一 Overlay;③ 应用感知路由按 SLA(延迟/抖动/丢包)动态选路与故障切换;④ ZTP 加速分支上线;⑤ 可视化与端到端监控。
Q2. IPsec 的 Phase 1 和 Phase 2 各建立什么?常见起不来的原因?
期望要点:Phase1 建 ISAKMP SA(认证+密钥材料),Phase2 建 IPsec SA(实际数据加密流);常见失败:① 感兴趣流(Proxy-ID)不匹配;② 预共享密钥/IKE 策略(加密/哈希/DH/PSK)不一致;③ 中间 ACL 未放行 UDP 500/4500 与 ESP;④ 路由未指向隧道。
Q3. 什么是应用感知路由?它依据哪些指标做决策?
期望要点:SD-WAN 对各 Overlay 链路实时测丢包/延迟/抖动,按应用定义的 SLA 阈值(如语音要求延迟<50ms 抖动<30ms 丢包<1%)选择合规链路,劣化即切,保证体验。
Q4. Overlay 和 Underlay 在 SD-WAN 中分别指什么?为什么分离重要?
期望要点:Underlay 是物理传输(各运营商链路),Overlay 是边缘间逻辑加密隧道;分离使业务不依赖具体链路、可多链路冗余与策略选路,且故障切换对应用透明。

10. 网络自动化 (Python / Ansible / Netmiko)

这是岗位硬要求:「Drive network automation… Python, Ansible, Netmiko」「Demonstrated ability to automate workflows (at least medium proficiency)」。本节覆盖 Python 网络编程、Netmiko、Ansible、NAPALM、Salt、模板与 CI/CD、声明式意图。

10.1 为什么要自动化

大规模园区(数十站点、上千设备)手工配置不可持续:易错、不可审计、不可重复。自动化目标:可重复、可验证、可回滚的站点构建(岗位加分项「repeatable, automated site builds using standardized templates, validation gates, deployment pipelines」)。

10.2 Python 基础与网络库

  • Paramiko / Netmiko:SSH 连接设备。Netmiko(基于 Paramiko)抽象了厂商差异,提供 send_commandsend_config_set,自动处理提示符,是入门首选。
  • Napalm:统一 API 获取/对比/替换配置(get_configload_replace_candidate),厂商中立。
  • Requests / NetBox SDK:对接 IPAM/CMDB(NetBox/Nautobot 作 SOT 唯一事实源)。
  • 文本处理:正则解析 show 输出,或用 ntc-templates(TextFSM)结构化。
from netmiko import ConnectHandler

device = {
    "device_type": "cisco_ios",
    "host": "10.0.0.1",
    "username": "admin",
    "password": "secret",
}
with ConnectHandler(**device) as net:
    out = net.send_command("show version")
    net.send_config_set(["vlan 100", "name USERS"])
    net.save_config()

10.3 Ansible 与网络模块

Ansible 用 YAML playbook 声明「期望状态」,对网络友好(无需 agent,走 SSH/API)。

  • Inventory:主机/分组(按站点、角色)。
  • Modulesios_configeos_configjunos_configvyos_config;或用 netconf/restconf 模块;NAPALM 集成 napalm_*
  • Idempotency(幂等):重复执行结果一致,是自动化的安全基石。
  • Jinja2 模板:用变量渲染配置,实现「一套模板 + 每站点变量 = 标准化配置」。
- hosts: access_switches
  gather_facts: no
  tasks:
    - name: 部署标准接入端口
      cisco.ios.ios_config:
        lines:
          - switchport mode access
          - switchport access vlan 100
          - spanning-tree portfast
        parents: interface {{ item }}
      loop: "{{ access_ports }}"

10.4 Salt

Salt(SaltStack)事件驱动,master-minion 或 proxy-minion(网络无 agent,用 proxy),适合大规模、实时(反应式)自动化与配置强制(state 持续对齐)。岗位提及 Salt 作为可选框架。

10.5 声明式与 SOT(单一事实源)

成熟自动化不以「脚本改配置」为终点,而以「意图(intent)」驱动:

  • SOT:NetBox/Nautobot 存 IP、VLAN、设备、连线——配置由 SOT 生成,避免漂移。
  • Git:配置即代码(GitOps),PR 评审、可追溯。
  • CI/CD:提交配置→自动语法校验→干跑(--check)→部署;流水线含验证门(validation gates)。
  • 验证门:部署后自动跑连通性/路由/策略检查(如 Batfish、pyATS/Genie),失败则告警/回滚。

10.6 自动化工程实践

  • 分阶段:先只读采集(inventory/backup)→ 再配置推送 → 最后闭环验证。
  • 错误处理:超时、认证失败、幂等校验、配置差异(diff)预览。
  • 安全:密钥用 Vault/环境变量,不硬编码;最小权限账号。
  • 可观测:日志、执行报告、配置版本。
Q1. Netmiko 和 Ansible 各自适合什么场景?它们和 NAPALM 的区别?
期望要点:Netmiko 适合自定义 Python 脚本做交互/解析;Ansible 适合声明式 playbook、批量、幂等、易评审;NAPALM 提供厂商中立的统一配置 API(get/compare/replace),更偏「配置管理」而非「命令执行」。常组合:Ansible 调 Netmiko/NAPALM 模块。
Q2. 什么是幂等(idempotency)?为什么网络自动化必须重视它?
期望要点:幂等指多次执行结果一致、不产生副作用;网络若脚本每次都追加命令会累积错误配置、甚至冲突;幂等保证「已达期望状态则不再改动」,是安全、可重复部署的前提。用 Ansible 模块/NAPALM 或先 diff 再应用来实现。
Q3. 如何用 Jinja2 + 变量实现"标准化站点模板"?请描述数据流。
期望要点:① 写一份接入交换机 Jinja2 模板(含 VLAN/接口/STP/AAA 占位变量);② 每站点一份变量文件(site.yaml:管理 IP、VLAN 号、上联口);③ 渲染出该站点专属配置;④ 经 review/CI 校验后推送。这样数十站点共用逻辑、差异仅变量,降低人为错误。
Q4. 什么是 validation gate(验证门)?为什么自动化部署后必须有它?
期望要点:部署后自动运行的合规/连通性检查(如 Batfish 仿真、pyATS 实测),确认配置生效且未破坏现有服务;不通过则阻断或回滚。没有验证门,自动化会把错误快速复制到大面积设备,风险被放大。
Q5. 为什么用 NetBox/Nautobot 作为 SOT(单一事实源)比直接用 Excel 好?
期望要点:SOT 是机器可读、带关系模型(设备-接口-IP-VLAN-连线)、可 API 驱动、版本可控;避免 Excel 多份副本漂移;配置由 SOT 生成确保「文档=现实」,且可被自动化直接消费,是 GitOps/声明式的基础。

11. Linux 与抓包排障

岗位要求「Proficiency in Linux for troubleshooting, tooling, and deploying/operating network services; comfort with packet capture tools (e.g., Wireshark)」。本节覆盖 Linux 网络命令、Wireshark 抓包与报文分析、排障方法论。

11.1 Linux 网络排障工具

  • ipip addrip routeip neigh(替代老 ifconfig/route/arp)。
  • ss / netstatss -tunlp 看监听/连接(比 netstat 快)。
  • ping / traceroute / mtr:可达性与路径/丢包(mtr 持续测每跳丢包)。
  • tcpdump:命令行抓包,tcpdump -i eth0 host 10.0.0.1 and port 443 -w cap.pcap
  • dig / nslookup:DNS 解析与排错。
  • curl / telnet / nc:应用层连通性(nc -vz host 443 测端口)。
  • ethtool:网卡速率/双工/光模块(ethtool -i 驱动,-m 光模块信息)。
  • iptables / nftables:主机防火墙与 NAT(理解对排障重要)。

11.2 Wireshark 抓包与分析

Wireshark 是排障利器,关键能力:

  • 捕获过滤(capture filter):BPF 语法,抓前过滤(如 host 10.0.0.1tcp port 443),减少量级。
  • 显示过滤(display filter):抓后过滤(如 tcp.analysis.retransmissiontcp.flags.reset==1dnshttp.response.code==500)。
  • Follow TCP Stream:重组某连接的双向数据,看应用层交互。
  • 专家信息(Expert Info):自动标重传、乱序、零窗口、快速重传等异常。

11.3 典型报文分析

  • TCP 重传 (retransmission):丢包信号,结合 tcp.analysis.retransmission
  • 重复 ACK / 快速重传:可能乱序或丢包。
  • RST:连接被对端/中间设备强制关闭(防火墙、LB、应用崩溃)。
  • 零窗口 (Zero Window):接收方缓冲满,发送方暂停,性能瓶颈在接收端。
  • 乱序 (Out-of-Order):多路径/重组,少量正常,大量说明链路问题。
  • TCP 握手未完成:SYN 无响应→防火墙拦/路由不可达/服务未起;SYN 有 SYN-ACK 但无 ACK→客户端侧或中间问题。

11.4 排障方法论(结构化)

高阶排障要「分而治之」:

  1. 界定现象:谁、什么应用、何时、间歇还是持续。
  2. 分层定位:L1 物理(灯/CRC)→ L2(MAC/STP)→ L3(路由/ACL)→ L4(端口/状态)→ L7(应用/证书)。
  3. 对比法:好/坏路径对比、变更前后对比、同类设备对比。
  4. 取证:抓包、日志、计数器、配置 diff。
  5. 假设验证:一次只改一个变量,验证是否解决。
  6. 复盘:根因、预防(监控/告警/自动化校验)。
作为 3 级(L3)升级终点:该岗位是复杂问题的升级点,意味着前面 1/2 线解决不了时你接手。面试官会重点考察你能否在信息不全、跨部门扯皮时,用抓包与数据说话、快速收敛根因。
Q1. 用户说"网页打不开",你在 Linux 跳板上如何一步步定位?
期望要点:ping 测 L3 可达;② ss -tunlp/nc -vz 测目标 443 通否;③ dig 查 DNS;④ curl -v 看 TLS/HTTP 阶段卡在哪;⑤ 必要时 tcpdump 抓交互看 SYN/RST/证书。分层排除,避免盲猜。
Q2. 抓包发现大量 TCP Retransmission 和 Dup ACK,说明什么?下一步?
期望要点:表明路径存在丢包(或严重乱序);下一步:用 mtr 定位哪一跳丢包、查接口错包/拥塞、查 MTU、查中间设备(防火墙/LB 状态表满或限速)、是否无线干扰(若经 Wi-Fi)。
Q3. 显示过滤器和捕获过滤器有什么区别?各何时用?
期望要点:捕获过滤器在抓包前用 BPF 限制抓取量(省资源/存储),但会丢失其他包;显示过滤器抓全量后筛选分析,不丢数据。生产排障常先宽抓(必要时环形缓冲),后用显示过滤分析。
Q4. 收到 RST 包,可能的原因有哪些?如何区分是应用还是中间设备?
期望要点:RST 可由应用主动关闭、崩溃、防火墙/IPS 拦截(如策略 deny 发 RST)、LB 后端不可达、TCP 校验错触发;区分:看 RST 的 TTL/源 MAC 是否像中间设备、是否所有连接同目的都被 RST(策略特征)、应用日志是否异常。
Q5. 为什么现代排障要懂 Linux 网络栈?举一个只能用 Linux 工具发现的例子。
期望要点:很多网络设备本身就是 Linux(Cumulus/白盒、某些控制器),且排障常借助 Linux 跳板/服务器;例:主机侧 ss 发现大量 TIME_WAIT 占满端口、ethtool -m 读出光模块收光过低导致随机丢包——这些在交换机 CLI 不一定直观,Linux 工具直接定位。

12. 文档、标准与模板

岗位要求「Create, maintain, and enforce robust network documentation (diagrams, standards, templates) and best practices」。这是「Lead」角色区别于个人贡献者的关键——把经验沉淀为组织资产。

12.1 文档体系

  • 逻辑拓扑图:展示 VLAN、路由、Zone、信任边界,面向架构与排障。
  • 物理拓扑图:设备、机柜、线缆、光模块、上联,面向实施与运维。
  • IP/VLAN 规划表(IPAM):地址分配、用途、所属站点,单一事实源。
  • 标准(Standards):命名规范(设备/接口/VLAN)、QoS、AAA、镜像、NTP/DNS、syslog。
  • 模板(Templates):接入/汇聚/核心/无线/防火墙基准配置,确保一致性与可审计。
  • Runbook / 操作手册:常用变更、割接、应急步骤。
  • HLD/LLD:高层设计(HLD)与底层设计(LLD)文档。

12.2 命名与编号规范

例:SITE-ROLE-NN(如 HKG-CORE-01、SGN-ACC-12)、接口描述 to-HKG-CORE-01_Gi1/0/1、VLAN 命名语义化。规范让任何人读配置都能快速理解,降低误操作。

12.3 模板驱动的可重复性

把「标准」落成「配置模板 + 变量」,既是文档也是可执行产物——与第 10 章自动化闭环。模板需随版本评审演进,避免「文档和现实两张皮」。

Q1. 为什么文档对大规模园区网络如此重要?你如何保证文档"不过期"?
期望要点:多人/多站点协作、人员流动、应急需快速理解;保证不过期:① 文档与自动化同源(SOT 生成);② 变更流程强制更新(PR 含文档);③ 定期审计 diff 现实 vs 文档;④ 关键图自动化生成。
Q2. 一份好的接入交换机"标准模板"应包含哪些内容?
期望要点:主机名/域名、管理 VLAN 与带外、NTP/DNS/syslog、AAA(TACACS+/RADIUS)、SSH 加固、VLAN 与 trunk、STP(PortFast/BPDU Guard/Root Guard)、端口安全/DHCP Snooping、QoS、镜像、"接口描述"规范、保存与合规检查。
Q3. 逻辑拓扑图和物理拓扑图分别给谁看、解决什么问题?
期望要点:逻辑图给架构/排障人员看流量与策略(VLAN/路由/Zone);物理图给实施/运维看设备位置与连线(机柜/线缆/光模块),割接与硬件故障处理依赖物理图。

13. 部署生命周期与割接 (Cutover)

岗位核心职责:「Manage and implement end-to-end site deployments… cutover… operational handover」「Proactively manage project timelines and resources… regular status updates」。割接是网络工程最高风险动作,面试官必深挖。

13.1 站点部署生命周期

  1. 需求收集:业务/容量/合规/现有痛点。
  2. 架构设计 (HLD):拓扑、寻址、协议、高可用、安全边界。
  3. 底层设计 (LLD):端口映射、VLAN、配置、线缆表。
  4. 配置与 staging:模板渲染、离线校验、实验室/模拟验证。
  5. 实施与测试:上架、连线、配置、单元/集成测试。
  6. 割接 (Cutover):变更窗口、按计划切换,含回滚。
  7. 验证与移交:业务验证、文档更新、运维移交(runbook、监控告警)。

13.2 割接 (Cutover) 方法论

  • 变更窗口:与业务约定低峰期,明确开始/结束时间。
  • 回滚计划(Rollback):每步可回退,预存上一版配置/快照,定义触发回滚的阈值。
  • 验证门:割接后自动/手动检查清单(连通性、路由、关键业务、监控)。
  • 沟通:事前通告、事中状态同步、事后复盘(post-mortem)。
  • 分批/灰度:先非核心、再核心;先单站点试点再推广。
  • 演练:关键割接先在 lab 跑通。
# 割接检查清单(示例)
# 1. 备份当前运行配置 (show run / netmiko save)
# 2. 确认变更窗口与审批
# 3. 应用新配置(预演 dry-run)
# 4. 验证:ping 网关、路由表、关键业务端口、监控无告警
# 5. 观察 15min 稳定
# 6. 异常 → 立即 rollback 到备份
# 7. 关闭窗口、发复盘

13.3 项目时间线与资源

作为 Owner 需做:WBS 拆解、关键路径、依赖(与 DC/安全/设施协同)、风险登记、定期状态报告(给业务领导,用「业务语言」而非命令)。

Q1. 描述一次你主导的高风险割接,你如何把风险降到最低?
期望要点:展现结构化:明确窗口与审批、详尽回滚(配置快照/预演)、实验室验证、分批灰度、自动化验证门、实时沟通、事后复盘。强调「可回退」和「可验证」两个关键词。
Q2. 割接进行到一半发现新配置导致部分业务中断,你的处理顺序?
期望要点:① 先判断是否触及回滚阈值;② 若已显著影响核心业务且回滚快——立即回滚保业务,再 offline 分析;③ 若影响有限且有把握快速修复——按预案小步修复并验证;④ 全程同步干系人;⑤ 事后复盘根因。
Q3. 如何向非技术的业务领导汇报项目状态?应避免什么?
期望要点:用业务影响/里程碑/风险/所需决策表达,避免堆砌命令与技术细节;用红黄绿状态、预计完成时间、阻断项。领导要的是「是否按时、有何风险、要不要他拍板」。
Q4. 为什么"验证门"在割接后不可或缺?
期望要点:割接配置应用成功 ≠ 业务正常;验证门用客观检查(连通性、路由、应用端口、监控)确认真实可用,避免"以为成功、实际用户已受影响"的盲区,也是 SLA 与责任边界的依据。

14. 跨团队协作与表达

岗位要求「Collaborate cross-functionally with internal IT teams, security, data center teams, facilities, and external vendors」且加分项强调「translate complex technical concepts… into clear, easy-to-understand terms for business leadership」。

14.1 跨团队协作

  • 与安全团队:NAC/防火墙策略需联合设计,避免过度放开或过度封堵。
  • 与 DC 团队:边界路由、VXLAN 与数据中心 Fabric 衔接、Anycast/服务互通。
  • 与设施团队:机柜空间、供电、制冷、光纤路由、施工窗口。
  • 与外部厂商:明确 SOW、验收标准、责任边界(厂商 vs 自有)。

14.2 技术翻译(Tech Translation)

高级工程师的价值之一:把「核心交换机 CPU 高、STP 收敛慢」翻译成「网络可能在高峰时出现短暂卡顿,影响交易系统,建议 X 月前完成架构升级,投入 Y 人天,回报是故障率下降 Z%」。用业务语言争取资源与共识。

14.3 沟通原则

  • 对齐目标:先确认业务目标,再谈技术。
  • 数据说话:用指标(可用性、时延、丢包)而非感觉。
  • 给选项与权衡:不只抛问题,给 A/B 方案与利弊,请领导决策。
  • 主动同步:状态、风险、阻塞项提前讲,不等人问。
Q1. 安全团队要求封锁某端口,但业务团队说会影响系统,你怎么协调?
期望要点:不站队、用数据核对真实流量与依赖;寻找满足安全目标的替代(如限定源、加监控、限期、用 NAC/零信任);组织三方对齐,给出风险与缓解方案,由业务负责人拍板,并记录决策。
Q2. 如何向 CTO 解释"为什么要做园区网络 Fabric 改造"?
期望要点:从业务痛点出发(扩容慢、故障域大、新站点上线周期长),量化收益(上线周期从 X 周降到 Y 天、可用性提升到 Z%),说清投入与风险,用路线图分阶段,而不是讲 VXLAN 技术细节。
Q3. 与外部厂商协作时,如何界定责任边界避免扯皮?
期望要点:合同/SOW 写清交付物与验收标准(含可量化指标);实施前对齐设计评审;问题出现用日志/抓包客观定位归属;关键节点联合测试签字;保留沟通记录。

15. 认证与进阶路径

岗位加分项:「CCNP/CCIE (Enterprise Infrastructure or Wireless) or comparable advanced industry certifications」「RF planning/site surveys」「SD-WAN/IPsec」「自动化站点构建」。本节梳理认证价值与学习路径。

15.1 认证体系

层级代表价值
中级CCNP Enterprise (ENCOR + ENARSI/ENWLSI)证明路由交换/无线系统能力,面试硬通货
专家CCIE Enterprise Infrastructure / Wireless设计+排障深度,岗位明确加分;需 Lab 实操
厂商专项Juniper JNCIP/JNCIE、Aruba ACDX、Palo Alto PCNSE/PCNSC对应岗位平台,加分
安全/自动化CISSP(管理)、DevNet Associate/Professional(自动化)安全框架/自动化认证

认证是能力的「外部背书」,但面试官更看重「能不能解决真实问题」。建议以岗定证:园区为主 → CCNP/CCIE EI;无线强 → CCIE Wireless;安全深 → PCNSE;自动化 → DevNet Pro。

15.2 学习路径建议(自测用)

  • 打底:TCP/IP、路由交换(CCNA→CCNP ENCOR 范围)。
  • 深化:BGP、MPLS/EVPN-VXLAN、无线 RF、NAC、防火墙策略。
  • 动手:用 EVE-NG/GNS3/CML 搭实验室,跑 OSPF/BGP/VXLAN/802.1X。
  • 自动化:Python + Netmiko/Ansible 做配置推送与采集。
  • 排障:Wireshark 分析真实抓包,刻意练习分层定位。
Q1. 你有 CCIE,但对方环境是 Arista/Juniper,认证还有用吗?
期望要点:有用——CCIE 证明的是网络原理、设计与排障思维(协议、拓扑、故障定位),可迁移;厂商 CLI 差异是表面,原理相通;但应展现快速学习新平台的能力(看配置对照、实验室验证)。
Q2. 在没有条件考 CCIE Lab 的情况下,如何向面试官证明等价能力?
期望要点:用项目证据:主导的设计文档、割接复盘、自动化产出、排障案例(含抓包/数据)、开源/POC 实验室;把「做了什么、解决了什么、量化收益」讲清楚,比证书更有说服力。

16. 综合情景案例 (Scenario Cases)

以下情景题跨多个知识域,模拟岗位真实工作中「信息不全、需在约束下做取舍、并用数据说服他人」的情境。回答时建议套用本手册的高分结构:界定问题 → 原理 → 实践/命令 → 权衡 → 兜底。每个案例给出「场景 + 追问 + 期望分析思路」。

16
综合情景案例
4
类别:设计/割接/排障/协作
跨域
多数涉及 2+ 知识域

16.1 设计规划类

情景 1 · 新建 5000 人大型园区(绿地部署)
考察:园区架构、寻址、无线、安全、自动化、分阶段

公司要在新加坡新建一座 8 层、5000 名员工的总部大楼,要求支持有线/无线一体、访客隔离、BYOD、物联设备(摄像头/门禁),并能在 2 年内平滑扩容到 1.2 万人。你被任命为网络设计负责人。

面试官追问:① 你选传统三层还是 Spine-Leaf Fabric?为什么?② 如何规划 VLAN/地址与无线?③ 怎样保证可重复交付?

期望分析:
架构取舍
  1. Spine-Leaf + EVPN-VXLAN Fabric:横向扩展线性、ECMP 不浪费带宽、无 STP 阻塞、Overlay 支持跨楼层/跨站点二层与租户隔离,契合 2 年翻倍。
  2. Underlay 用 OSPF/IS-IS(VTEP 可达),Overlay 用 BGP EVPN;网关用 Anycast Gateway 消除 FHRP 单点。
寻址与分段
  1. 按「功能+楼层」分 VRF/VLAN:员工、无线员工、访客(隔离、仅出互联网)、BYOD、IoT(摄像头/门禁独立、最小权限)、管理(带外)。
  2. IPv4 双栈 + IPv6;用 NetBox 作 SOT 统一分配,避免漂移。
无线
  1. Wi-Fi 6/6E,2.4/5/6GHz;按容量(非仅覆盖)布点;开 802.11k/v/r;员工/访客/BYOD 分 SSID 统一 RADIUS 后端。
可重复交付
  1. Jinja2 标准模板 + 每设备变量,Ansible 推送;CI 校验 + 验证门;文档由 SOT 生成。
情景 2 · 高密度会议室 Wi-Fi 容量规划
考察:RF 规划、容量 vs 覆盖、信道复用

一栋楼里有一个 800 人礼堂,一场全员大会时所有人同时连 Wi-Fi 做直播互动。现有 AP 在平日办公区表现良好,但大礼堂内用户频繁掉线、速率极低。

追问:从 RF 角度,你会怎么重新设计这个礼堂?要算什么?

期望分析:① 这是容量瓶颈而非覆盖问题——单 AP 并发终端与空口时间有限;② 按「终端数 × 单终端带宽 / 单 AP 可用容量」算 AP 数,800 人需多 AP 小蜂窝、低发射功率、错开信道减少 CCI;③ 用 5/6GHz(信道多、速率高),必要时 Wi-Fi 6/7 OFDMA 提升并发;④ 2.4GHz 仅作兼容、限速;⑤ 现场 predictive + passive 勘测验证;⑥ 客户端限速/每 SSID 限速防止少数终端占满空口。
情景 3 · 业务领导要求"零停机核心扩容"
考察:高可用设计、灰度、业务翻译

现有核心是一对老交换机(HSRP 主备),CPU 常年 70%,领导要求"不能有任何停机"地把容量翻倍,并让你向 CTO 汇报方案。

追问:技术上怎么实现不停机?你怎么向 CTO 讲?

期望分析:① 技术:引入 Spine-Leaf 或 VSS/堆叠/vPC 双活,先并行新建 Fabric、用新设备做 L2/L3 并行(迁移式),逐 VLAN/逐楼层割接到新核心,旧核心作回退;全程在变更窗口 + 回滚预案;② 用 Anycast Gateway / 路由重分布平滑过渡,避免"硬切";③ 对 CTO:用业务语言——"分 4 个周末窗口、每窗口影响 ≤1 个楼层、任何异常 5 分钟回退、总投入 X 人天、可用性与容量提升 Y%",给决策而非堆命令。

16.2 割接运维类

情景 4 · 核心交换机升级引发 STP 震荡
考察:割接风险、STP、回滚、根因

周五变更窗口,你给一台接入交换机升级 IOS 并改了 STP 优先级。重启后整个楼层网络出现周期性闪断,Ping 丢包 30%,多台交换机 CPU 飙升。

追问:最可能的原因?你的处理顺序?如何避免?

期望分析:
定位
  1. 周期性丢包 + 多设备 CPU 高 = 二层环路/STP 震荡;你改的 STP 优先级可能让该接入交换机意外成为根桥,拓扑重组,或新版本 STP 默认行为变化导致 BPDU 异常。
  2. show span rootshow span inconsistentports、log 看 TC(Topology Change)频次。
处理
  1. 若影响核心业务且回滚快 → 立即回退到升级前版本/配置快照;② 临时恢复根桥到原核心(调优先级/开 root guard);③ 验证稳定后复盘。
避免
  1. 升级前 lab 验证、先做非核心、变更单一变量、Root Guard/BPDU Guard 到位、监控 TC 计数、定义回滚阈值。
情景 5 · 自动化批量推送把 30 台接入交换机配错
考察:自动化幂等、验证门、回滚、SOT

你用 Ansible 给 30 台接入交换机批量应用新 AAA 模板,其中 5 台因变量缺失导致 `aaa new-model` 后 TACACS+ 服务器 IP 为空,管理员 SSH 登录被拒(锁在门外)。

追问:怎么应急处理?怎么从设计上杜绝?

期望分析:
应急
  1. 通过带外管理(OOB/console server)或本地账号(若保留)登录那 5 台,回退 AAA 配置;② 临时开本地授权兜底;③ 用控制台服务器批量恢复,避免逐台跑机房。
设计杜绝
  1. 变量缺失应在 CI 阶段 fail(必填校验),而非部署时才发现;② 用 SOT(NetBox)保证变量完整;③ 先 dry-run(--check)看 diff;④ 分批(先 2 台试点再全量);⑤ 关键变更保留本地 break-glass 账号 + OOB;⑥ 部署后自动验证门(能 SSH 且 TACACS 正常)才标记成功。
情景 6 · 跨站点 VXLAN 大文件传输失败,小文件正常
考察:MTU/MSS、VXLAN、PMTUD

总部与分支通过 EVPN-VXLAN 互联。用户反馈:访问分支文件服务器,小文档能下,大文件(>1MB)必失败;Ping 正常。

追问:根因?如何验证?如何永久修复?

期望分析:① 典型 MTU 问题:VXLAN 加 50 字节,Underlay MTU 仍是 1500,大包(带 DF 位,如 TCP MSS 1460)超过路径 MTU 被丢弃,小包不受影响;② 验证:ping -s 1472 -M do 分支IP(DF 大包)应失败;③ 永久修复:Underlay 交换机 MTU 设为 ≥1600(推荐 9000 jumbo),并在 SVI/Tunnel 做 ip tcp adjust-mss 1360 钳制 MSS,确保不分片;④ 检查中间防火墙/ WAN 设备 MTU 一致;⑤ 若 PMTUD 被中间设备阻断,MSS clamp 是兜底。

16.3 排障定位类

情景 7 · 无线 VoIP 通话走动就断
考察:无线漫游、802.11k/v/r、L3 漫游、QoS

客服团队边走边用 Wi-Fi 电话通话,在办公区移动时每过一两分钟通话就断 2-3 秒。

追问:你的排查清单?最可能的 2 个根因?

期望分析:① 抓包/控制器日志看重关联耗时与是否 L3 漫游;② 最可能因一:未开 802.11r(快速 BSS 过渡),每次跨 AP 全量 802.1X 重认证导致断流;因二:跨子网 L3 漫游未配 mobility/anchor,IP 重获取;③ 次要:粘性客户端(开最小 RSSI 踢除)、语音 SSID 未配 WMM/UP6 QoS;④ 修复:开 k/v/r、建 mobility 组/锚定、调 RSSI 阈值、语音 SSID 独立 QoS。
情景 8 · 防火墙策略已 allow,业务仍不通
考察:Palo Alto 策略命中、App-ID、NAT、计数

你按工单在 Palo Alto 上加了 `trust → untrust allow app web-browsing`,但用户访问仍失败。策略列表里这条显示 hit count 为 0。

追问:为什么 hit count 是 0?还可能是什么?

期望分析:① hit count 0 说明流量根本没匹配到这条规则——可能:a) 流量实际是加密 HTTPS,App-ID 识别为 `ssl` 而非 `web-browsing`,应用不匹配;b) 源/目的 Zone 或地址写错;c) 上方有条更具体的 deny 先命中;② 用 test security-policy-match 看实际命中规则;③ 另查:是否需解密才能识别应用、NAT 是否正确、是否有 U-Turn 需同 Zone 放行、会话是否被内容检测丢弃(show counter global 看 drop 原因)。
情景 9 · F5 后端返回 500,monitor 却显示 UP
考察:健康检查深度、L7 monitor、SNAT

电商站点用户下单报 500,但 F5 池成员状态全是绿(UP),其他流量正常。

追问:为什么 monitor 没发现?怎么让 F5 自动摘掉坏节点?

期望分析:① 若 monitor 仅 TCP 或只查 HTTP 200,则应用层 500 仍判 UP;② 应改用 L7 HTTP monitor 检查期望状态码(如仅 200/300 算健康)或响应关键字(返回特定 OK 文本),异常即把 member 置 DOWN;③ 也可能是只测了 `/health` 健康检查接口正常、但真实下单路径(连数据库)故障——monitor 应贴近真实业务路径;④ 配合 `action on service down` 重定向到 sorry page,并告警。
情景 10 · SD-WAN 视频会议卡顿,链路已切换
考察:SD-WAN SLA、应用感知、抖动/丢包

分支用 SD-WAN(MPLS + 互联网双链路)。上午视频会议频繁卡顿马赛克,但系统显示"已切到 MPLS 优质链路"。

追问:为什么切了还卡?你怎么查?

期望分析:① "已切换"不代表链路真健康——可能 MPLS 本身也拥塞/抖动超阈值,或 SLA 探测与应用实际路径不一致(探测用 ICMP、应用用 UDP 视频,路径/优先级不同);② 查 SD-WAN 各链路实时 SLA 指标(丢包/抖动/延迟)、应用实际走哪条、是否频繁抖动切换(flapping)反而更卡;③ 视频对抖动极敏感,阈值设太宽会"达标但体验差";④ 调严 SLA 阈值、为视频设独立策略(固定低延迟链路)、排查 MPLS QoS 与拥塞。
情景 11 · IPsec VPN 建不起来(分支新上线)
考察:IKE 两阶段、感兴趣流、中间 ACL

新分支路由器配好 IPsec 连总部,隧道起不来,日志报 Phase 2 失败。

追问:你的排错清单?Phase1 通但 Phase2 失败最常见原因?

期望分析:① 先确认 Phase1 SA 已建立(show crypto isakmp sa);② Phase2 失败最常见是感兴趣流(Proxy-ID / 加密 ACL)两端不匹配——总部写 `10.0.0.0/8`,分支写 `10.1.0.0/16`,协商不成;③ 次因:IPsec 提议(加密/哈希/PFS 组)不一致;④ 中间设备未放行 ESP(50)/UDP500/4500;⑤ 路由未指向隧道、或 NAT 穿透(NAT-T)未开导致 UDP4500 不通。逐层验证即可定位。
情景 12 · 抓包发现大量 TCP 重传,定位丢包点
考察:Wireshark/Linux、分层定位、MTU/拥塞

某应用访问慢,你在 Linux 跳板 tcpdump 抓包,发现客户端→服务器方向大量 Retransmission 和 Dup ACK,服务器→客户端正常。

追问:说明问题在哪一向?下一步怎么精确找到丢包设备?

期望分析:① 单向重传说明客户端→服务器方向路径存在丢包(反向 OK 排除双端);② 用 mtr 服务器IP 持续测每跳丢包,定位具体哪一跳丢;③ 常见:该方向经过的防火墙/LB 状态表满或限速、无线空口丢包(若客户端走 Wi-Fi)、MTU 不一致导致大包丢弃(重传集中在大数据段);④ 查该方向接口 CRC/错包、QoS 丢包计数;⑤ 用显示过滤器 tcp.analysis.retransmission 量化重传率。
情景 13 · NAC 部署后部分终端无法入网(证书 vs 哑终端)
考察:802.1X、MAB、EAP 方法、CoA、Guest

你推行 802.1X 后,员工笔记本正常,但打印机、IP 电话、一批旧工位 PC(无 supplicant)全部拿不到网络,部分 PC 还弹不出认证窗。

追问:怎么让这些终端恢复?架构上该怎么设计混合环境?

期望分析:① 打印机/电话:用 MAB(MAC 认证旁路),RADIUS 比对资产库放对应 VLAN;② 旧 PC 无 802.1X 客户端:装 supplicant 或临时 MAB/Guest,长期推动合规;③ 弹不出窗:可能是 PEAP 需先信任服务器证书、或 supplicant 未启用/服务未起;④ 架构:端口配 `authentication order dot1x mab`,先 1X 后 MAB;未认证入受限 Guest VLAN + 可选 Posture;⑤ 用 CoA 在合规后提升权限。
情景 14 · NAC CoA 不生效,终端隔离后不提升
考察:CoA 机制、RADIUS dynamic-author、授权

终端初连被放进隔离 VLAN 做健康检查,合规后 ISE 发了 CoA,但交换机没反应,终端仍困在隔离 VLAN。

追问:为什么交换机"没反应"?怎么修?

期望分析:① 交换机需配 aaa server radius dynamic-author(CoA 监听端口 UDP 3799)并接受 ISE 为客户端,否则丢弃 CoA;② 检查共享密钥、源 IP 是否匹配、CoA 的 NAS-IP/端口标识是否正确;③ 确认会话仍存在(终端未重连导致会话 ID 失效);④ 验证:`debug radius coa` 看是否收到;⑤ 修复后终端被重新授权到业务 VLAN + ACL。

16.4 跨部门协作类

情景 15 · 多厂商混部:Cisco 核心 + Aruba 无线 + Palo Alto 安全
考察:集成排障、责任边界、协议互通

新员工连 Aruba Wi-Fi 后无法访问数据中心业务,三团队互相推诿:无线说"已关联"、安全说"策略放通了"、DC 说"路由没问题"。

追问:你怎么打破僵局、用数据定位?

期望分析:① 不站队,端到端分层画路径:终端→Aruba AP→无线控制器→核心(Cisco)→防火墙(PA)→DC;② 用数据定位:在终端抓包看 DHCP/ARP/路由是否拿到;在核心看用户 VLAN 路由与 SVI;在 PA 用 test policy-match 看是否真放通、会话是否建立;③ 常见根因:无线用户 VLAN 未在核心起 SVI/未指默认网关、或 PA 未放行该无线 Zone 到 DC Zone、或用户 IP 被 PA 识别错 Zone;④ 用抓包+日志客观指认归属,组织三方对齐修复。
情景 16 · 安全要封端口,业务说会停摆
考察:跨团队协作、权衡、技术翻译、决策

安全团队发现某旧服务用明文端口,要求立即全网封锁;业务团队说该端口是核心生产系统依赖,封了当天停产。矛盾激化,双方等你(网络)表态。

追问:你怎么处理?最终谁拍板?

期望分析:不单方决定,先核对真实流量:该端口全网实际有多少会话、来自哪些主机、是否真有明文敏感数据(抓包/NetFlow 说话);② 找折中:限定源地址/加 TLS 包装/限期迁移/先监控后封/用 NAC 零信任缩窄暴露面;③ 量化风险与业务影响,给 A/B 方案 + 利弊,请业务负责人与安全负责人共同拍板,并记录决策与时限;④ 体现"技术翻译":把安全语言和业务语言都转化成同一套指标(停产概率、泄露概率、合规要求),推动共识而非对抗。
情景题评分要点:高级面试官看重的不是"答出标准答案",而是:① 是否先界定问题边界;② 是否用分层/对比/数据方法收敛根因;③ 是否给出权衡与兜底(回滚、监控、验证门);④ 是否在跨部门场景里展现ownership 与技术翻译能力。这四点比背命令值钱得多。

附录 A. 模拟面试清单(30 天自测计划)

按知识域分配复习与自测,建议每天 1-2 域,第 30 天做综合模拟。

主题自测动作
1-2TCP/IP 基础口述三次握手+MTU;做子网题
3-4交换画出 STP 选举;解释 LACP 跨设备
5-7路由与 BGP默写 BGP 选路;配置 RR 实验
8-10园区与 VXLAN画 Spine-Leaf+EVPN;讲 Type-2/5
11-13无线与 RF做一次预测性勘测;解释 11r/k/v
14-16NAC画 802.1X 流程;配 PEAP+CoA 实验
17-19防火墙写 Palo Alto 策略;test policy match 排障
20-21负载均衡配 F5 VS/Pool/持久化;解释 SNAT
22-23SD-WAN/IPsec讲 Overlay/Underlay;排 IPsec 起不来
24-26自动化写 Ansible playbook + Jinja2 模板
27-28Linux/抓包tcpdump 分析重传;Wireshark 复盘
29割接/软技能讲一次割接案例;做业务汇报演练
30综合模拟限时答 10 道混合情景题
高分答法模板:问题 → 原理(一句话)→ 实践(怎么做/命令)→ 权衡(为什么这样而不是那样)→ 兜底(出错了怎么办)。这套结构贯穿全手册。

附录 B. 术语速查表

术语含义
APAC亚太区(Asia-Pacific)
VLAN / Trunk虚拟局域网 / 多 VLAN 承载链路
STP/RSTP/MSTP生成树协议族,防二层环路
VXLANMAC-in-UDP Overlay,L2 over L3
EVPNBGP 控制面,分发 MAC/IP 可达性
VTEPVXLAN 隧道端点
Anycast GW各 Leaf 同 IP/MAC 的分布式网关
802.1X端口级访问控制框架
EAP可扩展认证协议(PEAP/TLS/TTLS)
RADIUS / TACACS+接入认证 / 设备管理授权审计
CoA会话中动态改授权
NAC网络准入控制
NGFW下一代防火墙(App/User/Content-ID)
App-ID / User-ID应用识别 / 用户识别
F5 VS/Pool/Member虚拟服务器/池/成员
iRulesF5 TCL 流量脚本
SD-WAN软件定义广域网(应用感知选路)
IPsec SAIPsec 安全关联(阶段1/2)
Netmiko / NAPALMPython SSH 库 / 厂商中立配置 API
SOT单一事实源(如 NetBox)
Cutover生产割接
RF / DFS射频 / 动态频率选择
CAPWAPAP 与控制器隧道协议
ZTP零接触部署

本手册为技术学习/面试准备用途,命令示例基于通用厂商语法,落地前请对照具体平台文档与版本核实。