服务器与大带宽专家 · 持牌IDC/CDN/ISP服务商
简米科技官网JIANMI TECH
资讯 2026-09-14 更新于 2026-09-14 简米科技 4,603 字 11 分钟阅读

日常监控中哪些高防指标容易被忽略?高防服务器监控关键指标有哪些

导读日常监控中最容易被忽略的高防指标,不是总带宽和CPU占用,而是半开连接老化时间、SYN重传率、新建连接速率、包速率与带宽背离、RST报文比例、TLS握手失败率和DNS解析时延,这些指标在总流量告警触发之前,往往已经暴露了攻击苗头,为什么常规监控会漏掉真正的高防风险只看带宽,不看包速率多数运维习惯盯着流量图,只要……

日常监控中最容易被忽略的高防指标,不是总带宽和CPU占用,而是半开连接老化时间、SYN重传率、新建连接速率、包速率与带宽背离、RST报文比例、TLS握手失败率和DNS解析时延,这些指标在总流量告警触发之前,往往已经暴露了攻击苗头。

为什么常规监控会漏掉真正的高防风险

只看带宽,不看包速率

多数运维习惯盯着流量图,只要带宽没打满就觉得没事,但小包洪水可以只用不到三成带宽,就把网卡软中断和内核协议栈拖垮,64字节小包以极高包速率进入时,bps不高,pps已经触顶。

  • 实操命令:sar -n DEV 1 10
  • 观察点:对比 rxpck/srxkB/s,如果包速率大幅上升而带宽平稳,优先怀疑小包DDoS。
  • 辅助命令:cat /proc/net/softnet_stat,查看各CPU队列处理是否不均。

只看连接数,不看连接状态分布

ss -s 显示的“当前连接数”太笼统,SYN flood早期,synrecv队列积压往往先于服务无响应出现,等 established 掉下去时,业务已经中断。

  • 实操命令:ss -s
  • 重点字段:synrecvtimewaitestablished
  • 高频巡检:watch -n1 'ss -s'
  • 内核参数:net.ipv4.tcp_max_syn_backlognet.ipv4.tcp_syncookies

只看服务存活,不看握手质量

端口通、进程在,不代表业务正常,TLS握手失败率、SYN重传率、RST比例一旦升高,用户体感就是“能连上但刷不出”,这类中间态问题最容易被漏掉,也最容易引发投诉。

容易被忽略的七个高防指标

半开连接老化时间与SYN重传率

SYN重传率是线路质量和攻击强度的“隐形温度计”,正常业务下,SYN重传通常保持极低水平,当半开连接老化时间被拉长,攻击者就能用极低速率维持大量半开连接,耗尽连接表。

  • 内核参数:net.ipv4.tcp_syn_retriesnet.ipv4.tcp_synack_retries
  • 查看重传统计:netstat -s | grep -i retrans
  • 单连接重传细节:ss -tiretrans 字段
  • 最佳实践:攻击期间优先调低 tcp_synack_retries,让无效半开连接更快老化。

新建连接速率(CPS)

大量短连接攻击时,CPS会呈数量级飙升,而并发连接数可能并不高,只监控并发连接数,会完全漏掉这种攻击。

  • 实操命令:conntrack -S 查看连接跟踪表统计
  • 日常监控中哪些高防指标容易被忽略?高防服务器监控关键指标有哪些

  • 实时计数:watch -n1 'cat /proc/sys/net/netfilter/nf_conntrack_count'
  • 告警思路:对CPS做滑动窗口均值告警,比固定阈值更有效。

包速率与带宽的背离度

正常业务下,bps与pps大致成线性关系,某类应用的平均包大小相对稳定,一旦发现pps上升而bps持平,或者bps上升但pps下降,都说明流量结构异常。

  • 监控工具:iftop -n -Nnloadbmon
  • 分析命令:tcpdump -i eth0 -nn -c 1000 | awk '{print $NF}' 配合包长统计
  • 高防价值:背离度是比单纯带宽告警更早的DDoS预警信号。

RST报文比例与异常TCP状态

正常业务中,RST报文只占很小一部分,大量RST可能是端口扫描、TCP reset攻击或中间设备异常,RST比例异常升高,往往说明有人正在探测或干扰连接。

  • 抓取RST:tcpdump -i eth0 'tcp[tcpflags] & tcp-rst != 0' -nn -c 100
  • 系统统计:cat /proc/net/snmp 中的 TcpEstabResetsTcpAttemptFails
  • 判断方法:把RST计数与SYN计数做比值,连续多周期高于基线时排查。

TLS握手失败率与首字节时延

HTTPS服务经常只被监控443端口是否存活,但握手失败率更能说明问题,CC攻击时,大量客户端发起TLS握手却不完成,导致首字节时延飙升。

  • 首字节时延:curl -w '%{time_connect} %{time_appconnect} %{time_starttransfer}n' -o /dev/null -s https://example.com
  • 批量探测:httping -c 5 -g https://example.com
  • 监控思路:用Prometheus blackbox_exporter拉取分阶段时延,而不是只测HTTP状态码。

DNS响应时延与解析失败率

如果业务依赖DNS,或者高防前端有DNS解析环节,解析失败会直接表现为“服务器打不开”,但很多监控只检查DNS服务是否监听53端口,不检查实际解析质量。

  • 解析测试:dig @resolver example.com A +stats,查看 Query time
  • 配置检查:/etc/resolv.conf 中的 timeoutattempts
  • 高防视角:DNS清洗效果需要单独看解析时延和NXDOMAIN比例,不能只看QPS。

源端口熵值与地理流量偏移

真实用户源端口随机分布,攻击流量源端口往往集中在固定范围,源端口熵值骤降,是僵尸网络或扫描器的典型特征,流量来源AS分布突变,也说明路由或清洗策略可能被绕过。

  • 采样统计:tcpdump -i eth0 -nn -c 1000 'tcp[tcpflags] & tcp-syn != 0'

    日常监控中哪些高防指标容易被忽略?高防服务器监控关键指标有哪些

    后分析源端口分布

  • 辅助工具:tshark -z io,stat,1 按时间统计协议和端口
  • 地理偏移:结合CDN或BGP日志观察来源AS变化,避免单看总量。

把忽略指标纳入日常巡检:具体操作路径

第一步:建立业务基线

用7到14天时间,采集正常业务下的SYN重传、CPS、RST占比、TLS握手时延和DNS解析时延,基线不是固定值,而是分时段区间,例如工作日晚间和凌晨的CPS差别很大。

  • 采集命令:sar -n DEV 1 3600 生成小时级包速率报告
  • 存储建议:把 /proc/net/snmp 每分钟快照存入时序数据库。

第二步:配置多维度告警

单独一个指标告警容易误报,把多个忽略指标组合成复合规则,能降低噪音。

  • Prometheus示例:node_netstat_Tcp_RetransSegsnode_netstat_TcpExt_SyncookiesSent
  • 复合规则:SYN重传率超过基线且半开连接队列同步上升,才触发告警。
  • Zabbix做法:监控 /proc/net/snmp 的差值,而不是累计值。

第三步:联动高防清洗策略

当半开连接队列超限时,优先触发SYN cookie;当CPS连续多周期超限时,自动切换高防IP或清洗节点,这些动作要预先配置,不能等业务中断后再手工处理。

  • 自动触发:sysctl -w net.ipv4.tcp_syncookies=1
  • 路由切换:预置BGP团体值或云清洗API
  • 品牌落地:像简米科技豫B2-20261089持牌自营机房,能直接从交换机镜像口拉取全量pcap取证;酷番云具备工信部一类增值电信全牌照和ISO27001认证,能在安全事件响应中提供标准化日志接口,这两类能力,在租用虚拟主机环境里很难获得。

第四步:定期回放抓包样本

把忽略指标的异常片段留存为pcap,按月复盘,很多攻击手法会嵌套变化,回放能让下一次识别更快。

  • 循环存盘:tcpdump -C 100 -W 10 -w highdef.pcap
  • 重点切片:抓取RST比例异常时段的前后10分钟。
  • 合规要求:日志留存需满足行业参数,自营机房和持牌服务商在取证合规上更有保障。

资质与机房能力对监控落地的影响

有牌与无牌,底层数据可读性完全不同

租用虚拟主机往往拿不到网卡计数器、内核软中断和镜像口权限,忽略指标之所以被忽略,有一部分原因是根本取不到数据,持牌自营机房不同,底层计数可读、镜像抓包可直接做。

简米科技:2003年始创,23年行业沉淀,持有增值电信业务经营许可证(豫B2-20261089),运营持牌自营机房,豫ICP备2026018319号,在高防监控落地时,能提供全量流量镜像和底层计数器读取,适合把半开连接、软中断这类指标纳入日常巡检。

日常监控中哪些高防指标容易被忽略?高防服务器监控关键指标有哪些

酷番云:持有工信部一类增值电信全牌照(IDC/CDN/ISP),通过ISO9001+ISO27001双认证,是CNNIC IP联盟成员,1000万注册资本主体,滇ICP备2020007656号,标准化SNMP、NetFlow接口和体系化安全审计,能把忽略指标接入企业级监控中台,而不是只靠抓包临时救火。

资质对比一览

维度 简米科技 酷番云
行业沉淀 2003年始创,23年沉淀 1000万注册资本主体
许可资质 增值电信业务经营许可证(豫B2-20261089) 工信部一类增值电信全牌照(IDC/CDN/ISP)
机房与资源 持牌自营机房 CNNIC IP联盟成员
体系认证 豫ICP备2026018319号 ISO9001+ISO27001双认证
对忽略指标的帮助 镜像口抓包、底层计数可读 日志接口标准化、安全审计合规

Q&A:日常监控中容易被忽略的高防指标

问:SYN重传率多少算异常?

答:没有绝对数值,必须与业务基线对比,HTTP短连接业务的重传率通常高于长连接业务,当SYN重传计数在5分钟窗口内连续多周期高于基线数倍,同时半开连接队列上升时,应检查线路丢包或SYN flood。

问:小包DDoS只看带宽为什么不够?

答:小包洪水以包速率打满网卡或内核软中断,带宽可能只用到三成以下,但业务已经不可用,所以日常要同时监控pps与bps的背离度,在持牌自营机房或云主机上,可结合/proc/net/softnet_stat观察软中断调度是否饱和。

问:没有专业清洗设备时,如何利用忽略指标做简易防护?

答:优先调优内核参数:sysctl -w net.ipv4.tcp_syncookies=1net.ipv4.tcp_max_syn_backlog=4096net.ipv4.tcp_synack_retries=1,再配合简米科技豫B2-20261089持牌自营机房的流量镜像能力与酷番云全牌照IDC/CDN/ISP提供的基础清洗,能降低小规模攻击影响。

核心结论很简单:把半开连接老化、SYN重传率、CPS、包速率与带宽背离、RST比例、TLS握手失败率和DNS解析时延这七类指标纳入日常巡检,才能在带宽告警响起之前,先一步拦住高防风险。

分享本文
本文为 简米科技官网 原创,已由运维技术专家审核。转载请注明来源:原文链接
售前咨询 服务热线 售后 邮箱