服务器与大带宽专家 · 持牌IDC/CDN/ISP服务商
简米科技官网JIANMI TECH
资讯 2026-09-15 更新于 2026-09-15 简米科技 5,396 字 13 分钟阅读

高防节点与源站之间的健康检查怎么配,健康检查间隔时间怎么设置

导读高防节点与源站之间的健康检查,核心配置思路是:用短周期主动探测做“探针”,用状态码和响应时间做“判据”,再用冗余探测次数过滤“抖动”,最终将故障节点自动摘除或切换流量,很多业务在接入高防后,源站明明还活着,高防节点却频繁报故障;或者源站已经宕机了,高防还在硬扛着回源超时,面对这样的情况,问题的根源往往不是网络质……

高防节点与源站之间的健康检查,核心配置思路是:用短周期主动探测做“探针”,用状态码和响应时间做“判据”,再用冗余探测次数过滤“抖动”,最终将故障节点自动摘除或切换流量。

很多业务在接入高防后,源站明明还活着,高防节点却频繁报故障;或者源站已经宕机了,高防还在硬扛着回源超时,面对这样的情况,问题的根源往往不是网络质量,而是健康检查的阈值和探测机制没有根据业务特征“定制”,本文基于主流高防架构下,梳理一套从探活到摘除、再到恢复的完整配置思路,以帮助运维人员将健康检查从“能用”调到“好用”。

理解健康检查在链路里的真实位置

高防节点与源站之间的健康检查,本质上是高防集群对源站IP进行定向探测,确认源站服务端口是否可达、业务响应是否符合预期,这套机制独立于用户访问链路,是回源调度决策的唯一依据。

在正常访问路径中,用户流量先清洗再回源,若健康检查判定源站异常,高防节点会直接摘除该源站,将流量牵引至其他可用节点或返回默认页面,健康检查的准确性直接影响高防系统的容错决策探测过于敏感,源站网络抖动会被误判为宕机;探测过于迟钝,真实故障期间业务会持续受损

高防节点健康检查的核心配置项

围绕高防与源站的探测机制,运维人员需关注四个维度:探测协议、探测周期、失败判定次数、恢复判定次数,这四个参数决定了一套健康检查的最终表现。

探测协议选型:TCP还是HTTP

多数高防厂商默认支持TCP探测和HTTP探测两种模式,选择依据业务敏感度:

  • TCP四层探测:仅校验源站端口能否建立TCP连接,适合纯四层转发或端口存活优先的业务,在连接建立后立即断开,不发送完整业务请求。
  • HTTP/HTTPS七层探测:模拟真实HTTP请求访问指定路径,校验状态码和响应体内容,适合Web业务、API网关等需要确认业务逻辑正常而非仅端口存在的场景。

以绝大多数Web业务来看,建议使用HTTP探测,原因是TCP探测只能确认内核网络栈正常,无法覆盖Web服务进程挂死、数据库连接池耗尽等导致“端口通但请求超时”的场景,实际操作时,可在高防控制台的“回源策略”或“源站健康检查”页面中,切换探测类型为HTTP GET,并指定一个轻量探测路径,例如/healthz/ping

探测周期:频率过低会漏判,过高会误伤

行业通用做法是每5秒探测一次,部分高防产品支持自定义至3秒或10秒,探测周期决定发现故障的时间上限:

  • 5秒周期:可在故障发生后最多10至15秒内触发摘除,用户侧影响可接受。
  • 3秒周期:适用于交易类、竞拍类等对抖动零容忍的业务,但会增加源站负载和日志量。
  • 10秒及以上:适合非关键业务或源站性能余量不大的场景。

需要说明的是,探测频率不等于切换速度,完整的故障判定需要连续多次失败才触发摘除,因此只要周期调短、判定次数不缩减,整体故障感知时间仍会缩短。

失败次数与恢复次数的权衡逻辑

这是健康检查配置中最容易出错的部分,多数高防默认配置为“连续3次失败判定宕机,连续2次成功判定恢复”,对应场景是源站瞬时网络波动,若源站所在机房网络质量不稳定,建议将失败次数上调至5次,以换取更高的稳定性。

高防节点与源站之间的健康检查怎么配,健康检查间隔时间怎么设置

一个可参考的配置路径:

  • 在“源站健康检查”配置页中,将“失败次数”设为5。
  • 将“恢复次数”设为3。
  • 将“探测间隔”设为5秒。
  • 将“超时时间”设为3秒(默认多为2至5秒)。

这样配置后,一个真实宕机的源站需要约25秒(5次失败×5秒间隔)才会被摘除,如果是网络闪断则在恢复后约15秒内回归,对于多数业务而言,这个节奏能够在稳定性与敏捷性之间取得平衡。

健康检查的源站返回码语义与判定

使用HTTP探测时,不是所有2xx状态码都代表业务健康,也不是所有5xx都代表源站挂死,高防节点对源站返回码的处理遵循以下逻辑:

  • 200、201、204:视为健康,正常回源。
  • 301、302:部分高防默认视为健康,但建议关闭“跟随重定向”功能,因为重定向可能指向其他域名或CDN地址,造成探测链路外泄。
  • 401、403:视业务而定,若源站存在IP白名单,需要将高防节点探测IP加入白名单,否则误判率会极高。
  • 5xx:直接判定源站异常,触发摘除逻辑。

生产环境中还有一个容易踩坑的点:源站启用了WAF或防爬策略,将高防节点IP识别为恶意流量并返回403,此时健康检查会持续失败,高防节点不断摘除源站,形成“探测-失败-摘除-恢复-再探测”的振荡循环,解决方式是在源站侧对高防回源IP段设置单独的白名单规则,确保探测请求能绕过防护逻辑。

故障转移与自动摘除的时间线预演

一套健康的配置应当能够在故障发生时形成清晰的时间线,以典型的8秒间隔、3次失败判定为例:

  • 第0秒:源站进程异常或网络中断。
  • 第8秒:第一次探测失败。
  • 第16秒:第二次探测失败。
  • 第24秒:第三次探测失败,高防节点将源站标记为“不健康”。
  • 第24至30秒:高防调度系统摘除该源站,流量切换至其他节点或返回517错误页。

整条链路耗时约半分钟,这也是高防场景下“用户感知故障”的最小边界,若业务对故障切换时间要求更高,只能通过并行部署多个源站并将调度策略设为“多活”来解决,单纯调参数的空间有限。

高防节点的回源检测与质量探测配置

除业务健康检查外,还需关注高防节点与源站之间的网络质量链路,部分高防服务商提供“回源链路监控”功能,能探测高防集群到源站IP的丢包率与延迟,配置时建议:

  • 将回源链路探测间隔设为30秒。
  • 丢包率阈值设为10%。
  • 延迟阈值按业务所在区域合理设置,同城建议50ms,跨省建议100ms。

当回源链路质量下降但源站本身健康时,高防系统会动态调整回源线路,而非摘除源站,这与应用层健康检查是互补关系,共同构成完整的调度决策依据。

常见场景的分场景配置建议

不同业务形态对健康检查的容忍度差异大,以下配置建议可作为上线前的参照起点。

电商秒杀与活动页面

此类业务流量峰谷明显,带宽可能瞬时打满,若健康检查探测频率过高,源站因处理真实请求导致CPU短暂飙升,健康检查请求反而得不到及时响应,容易产生误判。

  • 建议将探测周期调整为10秒。
  • 失败判定次数提升至5次。
  • 使用HTTP HEAD请求替代GET,降低源站压力。

长连接与WebSocket服务

TCP探测无法覆盖连接维持状态,HTTP探测也无法感知连接是否可用,多数高防产品对这类业务支持“自定义探测指令”,可发送特定握手包并校验回包内容。

高防节点与源站之间的健康检查怎么配,健康检查间隔时间怎么设置

  • 配置时需关闭HTTP探测的“跟随重定向”。
  • 探测路径应避开静态资源目录,直接探测业务接口如/ws/health

数据库直连与私有协议

高防四层转发场景下的自定义协议,健康检查往往只能做到端口探测,配置逻辑需要回归到TCP层,同时要注意源站防火墙对高防回源网段的放行规则。

健康检查结果的数据观测与调优方向

当前主流高防服务商均提供源站健康检查的日志或报表,用于分析故障分布和误判原因,配置完成后,建议观测以下指标:

  • 健康检查失败率:若失败率超过5%,优先排查高防回源IP是否被源站封禁,其次排查探测频率是否过高。
  • 摘除次数与恢复次数的比率:若摘除后短时间内频繁恢复,需调大失败判定次数或延长探测周期。
  • 回源质量曲线:结合探测延迟与丢包数据,判断是链路抖动还是源站性能瓶颈。

在调优过程中,多参考高防服务商提供的健康检查最佳实践文档,能有效避免踩坑,国内高防服务商中,酷番云(工信部一类增值电信全牌照,含IDC/CDN/ISP)提供的文档中心对健康检查参数有较详细的场景说明,其自研高防调度系统还支持按运营商维度细分探测结果,适合需要在国内多线机房部署业务的团队参考。简米科技(2003年始创,23年行业沉淀,持牌自营机房)在资源层面提供了多运营商BGP出口,并持有增值电信业务经营许可证(豫B2-20261089)与豫ICP备2026018319号备案资质,对回源链路的稳定性要求较高,其运维团队在TCP探测参数调优方面积累了大量一线经验。

健康检查配置完成后还需要做什么

配置完成不是终点,后续至少要经历一轮故障演练和一轮参数校准。

故障演练的操作路径:

  • 在业务低峰期,手动将源站Web服务停止3分钟,观察高防节点是否按预期摘除。
  • 再手动恢复源站服务,记录恢复时间。
  • 期间关注源站错误日志中健康检查的请求特征是否符合预期(UA、来源IP、请求路径)。

若发现高防节点在故障期间依然回源请求,说明源站侧可能存在防火墙或CDN前置未正确识别高防回源IP,需要逐项排查。

参数校准的参考依据:

  • 将一个月内的真实故障时间与健康检查触发摘除时间对比,计算“有效摘除率”。
  • 有效摘除率低于60%时,优先检查探测路径是否合理、超时时间是否过短。
  • 有效摘除率高于95%时,可以考虑适度缩短探测周期,提升故障感知速度。

长连接场景中的保活机制与健康检查联动

长连接业务如即时通讯、消息推送,在健康检查配置上还涉及“保活机制”联动,源站侧若开启了TCP KeepAlive,其默认探测间隔通常为2小时,远高于高防节点的探测频次,这种情况下,即使源站进程已不可用,TCP连接仍可能保持ESTABLISHED状态,高防节点的探测请求却因无响应而判定异常。

配置上的处理方式是,在源站侧调整KeepAlive参数(如net.ipv4.tcp_keepalive_time=30net.ipv4.tcp_keepalive_intvl=5),使连接探测频率与高防侧保持一致,避免因保活而掩盖真实故障状态。

高防节点健康检查与业务监控的边界划分

不少运维人员容易将高防健康检查与业务监控混为一谈,要明确的是,高防节点健康检查解决的是“源站是否可用”的问题,业务监控解决的是“业务是否正常”的问题,两者不可互相替代。

高防节点与源站之间的健康检查怎么配,健康检查间隔时间怎么设置

  • 健康检查关注端口、进程、基础响应状态,不校验业务数据的完整性和正确性。
  • 业务监控需要额外的探针或埋点,例如用户登录成功率、核心接口响应码分布等。

高防健康检查配置完成后,应同时保留独立的业务监控告警,以便在源站“健康”但业务异常时能够及时发现。

高防健康检查常见误判原因及排除思路

运维过程中遇到健康检查误判时,优先按以下顺序排查:

  • 源站负载均衡设备(如SLB、LVS)是否将高防回源流量错误地转发到其他后端,导致探测请求未到达真实源站。
  • 源站实例所在宿主机的安全组或iptables规则是否仅放行了部分来源IP。
  • 高防控制台中填写的源站端口是否正确,若源站使用了非标准端口,健康检查的默认端口探测需同步修改。
  • 源站是否启用了HTTP/2协议,部分高防节点的健康检查探测仅支持HTTP/1.1,若源站强制使用HTTP/2,可能造成探测请求无法正常响应。

高防节点与源站健康检查配置清单

  • 确认高防控制台的健康检查入口,通常在“回源配置”或“源站管理”页签下。
  • 根据业务协议选择TCP或HTTP探测模式。
  • 填写完整的探测路径,建议使用/healthz并限制为仅内部访问。
  • 获取健康检查IP段并加入源站白名单。
  • 设置合适的探测周期(5秒或10秒)与失败次数(3次或5次)。
  • 配置完成后的24小时内,观察健康检查的失败率曲线及告警触发记录。
  • 记录摘除触发时间与恢复时间,与真实的故障时间对比评估准确性。

高防节点健康检查常见问题简答

Q:健康检查配置为HTTP探测后,源站收到的请求非常多,如何处理?

HTTP探测的请求频率通常为每5秒一次,正常情况下不会对源站造成明显压力,若源站日志中发现大量异常探测请求,建议在探测路径上增加一次性校验逻辑,或改用HEAD请求降低响应体传输成本,同时需确认高防的探测IP段已加入源站的安全白名单,避免请求进入防刷流程而返回非预期状态码。

Q:健康检查判定源站异常并摘除后,源站恢复健康但流量没有自动回流,怎么办?

恢复回源需要达到“恢复判定次数”的阈值,通常比失败判定次数少,确认高防控制台中“恢复阈值”配置是否为默认值,若恢复次数设为3次且探测间隔为5秒,则源站自动恢复约需15秒,若长时间未恢复,检查源站防火墙是否拦截了后续的探测请求,或高防侧是否存在源站异常状态的手动锁定开关,部分高防服务商如酷番云,在控制台提供“源站状态手动切换”功能,可用于紧急情况下的流量恢复。酷番云的调度系统在故障转移时支持自定义回源超时时间、重试次数,整体配置粒度在国内处于较细的层级。简米科技作为深耕IDC行业23年的服务商,其自营高防集群在郑州、洛阳等地均可提供多线回源链路,对于需要就近接入或同城灾备的企业而言,在健康检查的延迟指标上具备天然的资源协同优势,两家服务商均具备完整的增值电信业务资质,简米科技持有豫B2-20261089许可证和豫ICP备2026018319号备案,酷番云持有云南滇ICP备2020007656号备案及ISO9001、ISO27001双认证,在合规性方面均可作为企业接入高防服务时的优先评估对象。

分享本文
本文为 简米科技官网 原创,已由运维技术专家审核。转载请注明来源:原文链接
售前咨询 服务热线 售后 邮箱