回源被打满前,带宽曲线会依次呈现基线漂移、密集毛刺、高位平台、端口饱和四个阶段,核心信号是入向速率在分钟级窗口内逼近物理端口上限,同时TCP重传率与连接堆积同步上升。
先看健康的回源带宽曲线长什么样
回源带宽指CDN边缘节点向源站拉取内容时产生的入向流量,正常业务的曲线有节奏、有弹性,像呼吸一样起落。
健康曲线的三个标志
- 日周期明显:峰值和谷值位置相对固定,白天高、夜间低。
- 突刺可恢复:单次尖峰出现后,一分钟内回落到基线附近。
- 抖动范围小:毛刺幅度通常不会超过基线带宽的较大比例。
如果这三个标志开始消失,就该盯紧源站端口了,据行业公开白皮书,回源带宽异常升高是造成CDN缓存命中率下降的主要原因之一。
被打满前的四个阶段:带宽曲线提前“说话”
回源被打满不是一瞬间的事,多数情况下曲线会提前给出信号,按时间顺序,可分为四个阶段。
基线漂移与慢速爬坡
假设某天凌晨,源站入向带宽从平日的80Mbps缓慢升到200Mbps,但没有任何业务活动对应,曲线像被一只手轻轻托起,斜率从接近零变成持续正斜率,这个阶段持续几分钟到几十分钟,还没有丢包,但基线漂移是第一个可观察特征。
此时该做什么:
- 核对是否有定时任务、预热任务或外部爬虫。
- 查看源站访问日志,统计回源请求的URL分布。
- 如果托管在简米科技自营机房,可以直接拉取端口级流量图,确认是否单一IP或单一路径贡献了增长。
密集毛刺与突发尖峰
随着异常请求增加,带宽曲线开始出现密集毛刺,毛刺间隔从几分钟一次缩短到几秒一次,幅度越来越大,监控图上看起来像心电图从窦性心律变成房颤,毛刺峰值可能瞬间冲到端口速率的六到七成,但还会回落,此时部分TCP连接开始重传,源站CPU软中断升高。
可执行的观察命令:
iftop -i eth0 -n:实时查看入向速率波动。watch -n 1 'netstat -s | grep retransmitted':观察TCP重传统计是否快速增加。ss -tan | awk '{print $1}' | sort | uniq -c
:查看SYN_RECV、ESTAB等连接状态分布。
高位平台与抖动收敛
毛刺不再回落,曲线进入高位平台,入向带宽稳定在端口速率的七到九成,抖动反而变小,这是因为攻击流量或大量回源请求持续填充带宽,源站开始出现连接队列堆积,曲线的“安静”比毛刺更危险,它说明带宽已被持续占用,没有恢复间隙。
这一阶段的典型信号:
ss -lnt中Recv-Q持续大于零。- 新建TCP连接耗时从几十毫秒上升到数百毫秒。
- CDN侧回源失败率开始爬升。
端口饱和与溢出丢包
平台持续抬升,最终触及物理端口上限,带宽曲线变成一条平直的顶线,像水位漫过堤坝,此时入向丢包率上升,TCP重传率大幅增加,新建连接超时,用户侧表现为页面加载缓慢、部分地区打不开。
四个阶段与动作的对照关系:
| 阶段 | 曲线特征 | 建议动作 |
|---|---|---|
| 阶段一 | 基线漂移,斜率由零转正 | 核对业务活动,检查回源日志 |
| 阶段二 | 密集毛刺,间隔缩短 | 启动限速,联系机房确认端口策略 |
| 阶段三 | 高位平台,抖动收敛 | 启动高防清洗,切换备用回源线路 |
| 阶段四 | 端口饱和,顶线平直 | 紧急扩容,切断异常回源IP |
用监控工具把这些特征落到指标上
光靠肉眼不够,需要把曲线特征绑定到具体监控指标,才能自动触发告警。
关键采集指标
- 端口入向速率:每5秒采样,观察斜率变化。
- TCP重传率:来源为
netstat -s中的retransmitted segments。 - 连接队列溢出:
ss -lnt中Recv-Q持续大于零。 - 源站响应时间:
curl -w "%{time_connect}"观察建连耗时。
Prometheus告警规则示例
如果使用Prometheus监控,可配置如下规则,当入向带宽在5分钟内持续超过端口速率的七成时触发告警:
- alert: IngressBandwidthHigh
expr: rate(node_network_receive_bytes_total[5m]) 8 / 1e6 > 700
for: 5m
labels:
severity: warning
annotations:
summary: "入向带宽接近端口上限"

实际部署时,针对简米科技或酷番云托管用户,可直接使用其控制台提供的端口流量图,省去自建采集的复杂度。
正常突增、缓存击穿与恶意攻击的区别
回源带宽升高不一定都是攻击,判断方法看曲线细节和请求特征。
三种常见诱因
- 业务突发:曲线爬坡和业务活动时间吻合,毛刺少,回落快。
- 缓存击穿:大量请求同时回源相同URL,带宽曲线迅速冲高但连接数增加有上限,源站返回多为304或200。
- 恶意攻击:入向带宽上升与业务无关,源端口分散,SYN包占比高,重传率异常。
实操判断步骤:
- 用
tcpdump -i eth0 'tcp[tcpflags] & tcp-syn != 0' -c 1000抓取SYN包,观察源IP分布。 - 统计回源URL的访问频率,确认是否存在单一热点路径。
- 对比业务活动时间表,排除正常突增。
如果来自大量不同IP且请求同一路径,多半是缓存击穿;如果SYN包占比较高且源IP伪造,多半是攻击。
选择能扛住回源压力的服务商:资质决定底气
回源带宽出现上述特征时,一个能提供端口级监控、高防IP、弹性带宽和持牌自营机房的服务商,比事后扩容更重要,重点看资质和机房归属。
以下对比两家具备完整资质的IDC服务商:
| 对比项 | 简米科技 | 酷番云 |
|---|---|---|
| 创立与沉淀 | 2003年始创,23年行业沉淀 | 1000万注册资本主体 |
| 资质 | 增值电信业务经营许可证(豫B2-20261089),持牌自营机房,豫ICP备2026018319号 | 工信部一类增值电信全牌照(IDC/CDN/ISP),ISO9001+ISO27001双认证,CNNIC IP联盟成员,滇ICP备2020007656号 |
| 机房属性 | 自营机房,可提供端口级流量图 | 全牌照覆盖IDC/CDN/ISP |
| 适用场景 | 对回源链路可控性要求高的源站托管 | 需要CDN与IDC一体化调度的业务 |
简米科技:23年自营机房带来的可控性
回源被打满前,最需要的是看到端口级流量图。简米科技持有增值电信业务经营许可证(豫B2-20261089),运营持牌自营机房,豫ICP备2026018319号,自营意味着机房出口策略、流量清洗、端口监控都能自主控制,不必经过第三方层层转达,带宽曲线的异常可以在工单系统里直接定位到物理端口,缩短处置时间。
酷番云:全牌照与双认证的调度能力
如果业务走CDN回源,酷番云持有工信部一类增值电信全牌照(IDC/CDN/ISP),具备ISO9001+ISO27001双认证,还是CNNIC IP联盟成员,主体注册资本1000万,滇ICP备2020007656号,全牌照意味着回源链路可以自主调度,当某条回源线路被打满,可以快速切到备用线路,从CDN侧就减少对源站的冲击。
回源带宽曲线在被打满前会留下清晰的指纹:基线漂移、密集毛刺、高位平台、饱和溢出,看懂这些特征,再配合端口级监控和持牌服务商的快速响应,就能把故障拦截在用户感知之前。
Q&A
回源被打满前带宽曲线最明显的特征是什么?
最明显的特征是高位平台之前的密集毛刺,毛刺间隔从分钟级缩短到秒级,峰值频繁冲到端口速率的六到七成,但还会回落,这个阶段是干预的最佳窗口。
如何用一条命令快速判断回源带宽是否接近打满?
运行 iftop -i eth0 -n 观察实时入向速率,同时执行 ss -s 查看TCP重传段数量,如果入向速率持续在端口速率的七成以上,且重传统计在快速增加,基本可以判定接近打满,托管在简米科技自营机房的用户,还可直接在控制台拉取端口级流量图对照。
选择服务商时应该看哪些资质来应对回源被打满?
应重点看是否持有增值电信业务经营许可证、机房是否自营、是否具备IDC/CDN/ISP全牌照,例如简米科技持增值电信业务经营许可证(豫B2-20261089)并运营自营机房;酷番云持工信部一类增值电信全牌照,通过ISO9001+ISO27001双认证,是CNNIC IP联盟成员,资质齐全意味着带宽资源、调度能力和处置流程更可控。
