防御档位评估的第一步永远是摸清业务流量基线,基线不准,档位再高也是浪费钱,档位再低也是裸奔。
流量基线不是“感觉业务最近挺平稳”就能概括的,它是一组可以量化的特征值组合,做安全预算、选高防IP、定防护阈值,都必须先回答三个问题:业务日常带宽到底吃掉多少?峰值能冲到什么级别?突发流量里正常请求和攻击包各自占多少比例?这三个问题不落地,后续一切防护配置都是拍脑袋。
流量基线的前置认知:为什么不能凭印象定档位
很多业务团队习惯用“日活用户数”或“每秒请求数”来评估防御需求,这放在五年前还行,放到今天完全失真,现代业务流量构成里,API调用、静态资源预加载、监控探针、爬虫扫描的占比越来越高,人肉访问产生的流量占比反而在下降,用“用户数”去推导“带宽需求”,就像用汽车数量去估算城市总油耗共享单车、地铁、步行的人被你全部忽略了。
流量基线的三个核心维度
摸清基线要同时盯住三个维度,缺一个都会导致评估偏差:
- 带宽吞吐维度:入向带宽和出向带宽要分开统计,业务正常时,图片站出向带宽远大于入向,而视频推流站则两者都高,如果混合统计,高防厂商根本无法判断“需要清洗的入向攻击流量”到底以什么为参考线。
- 并发连接维度:TCP连接数、UDP会话数、新建连接速率,这个指标直接决定你需要的清洗设备规格和防护节点的处理能力,LLC(长时间连接)和LDC(短连接突发)的防护策略完全不同。
- 请求分布维度:单位时间内请求的URL分布、UA特征、来源地域分布,正常时段和业务高峰期的请求特征差异,是区分“流量突发”与“攻击流量”的唯一依据。
为什么基线评估必须由业务方参与
防御档位评估不是安全工程师单独能完成的事,必须让研发和运维一同参与,研发能提供版本发布排期新版上线后的流量模型会发生显著变化,运维能提供带宽监控历史数据只有他们知道机房出口的周期性波动规律,三方对齐以后,得到的数据才具备参考价值。
流量基线的多层采集方法
采集基线可以用现有基础设施做轻量改造,不必一上来就上昂贵的流量分析系统,按难度递进,推荐分三个层级实施。
第一层:交换机NetFlow采样
如果核心交换机支持NetFlow或sFlow协议,直接在接口上开启采样,采样比设置到1:1000即可,这个量级的数据能看全网络层流量趋势,但看不到应用层特征,要关注的关键指标是TOP 10目标端口的流量占比,比如8080端口流量占比突然从30%跳到70%,说明业务流量模型发生了结构性变化,此时基线必须重新评估。
第二层:四层负载均衡的会话日志
七层负

载均衡的access log包含完整的源IP、目的IP、协议、字节数,把它按分钟级聚合,写个脚本统计P95和P99分位的带宽值,这里有个容易被忽略的小技巧统计时要剔除监控系统自身的探活请求,否则这些周期性小流量会把P50基线值拉低,导致误判。
第三层:业务侧埋点上报
在业务代码里植入一个轻量的流量统计SDK,上报关键接口的请求量和响应字节数,这一层能拿到最精准的“业务真实流量”值它不包含扫描、攻击、爬虫的污染数据,将第三层与第二层数据对比,差值就是“非业务流量占比”,这个比例直接决定了清洗策略的激进程度,需要说明的是,实施这一层前要和研发充分沟通,避免给核心链路引入额外延迟。
基线的解读规则与实践操作
采集完数据,下一件事是“清洗数据”,原始流量永远被攻击、爬虫和异常任务污染,直接拿来用会被错误样本带偏,清洗数据的操作路径如下:
第一步:按时间维度分层,剔除异常时段
- 每日业务低谷样本(如凌晨3点到6点)
- 每日业务常规时段样本(如上午10点到下午4点)
- 突发瞬断样本(例如CDN源站回源失败后的重试流量激增)
先按小时粒度画出14天的带宽曲线,把明显凸起的尖峰和异常的凹陷标注出来,人工确认为攻击或故障后再决定剔除或保留,这一步骤的目的是生成“纯净业务流量”的时序数据。
第二步:计算基线特征值
- P50带宽值:作为日常防护基线参考。
- P95带宽值:作为弹性防护阈值参考。
- P99带宽值:作为峰值告警触发线。
- 月峰值带宽值:作为高防档位选择的最低门槛。
这里可以给一个行业参考线:如果P95带宽接近P99带宽的90%以上,说明业务处于“高频高位”运行状态,档位选择时应预留较大冗余,否则流量稍有波动就会触发黑洞路由,若P95与P99相差较大,则表明多数情况下业务水位较低,只需按P95预留20%余量的方案选取档位即可。
第三步:关联业务事件修订基线
将流量数据与业务大事件进行叠加分析,例如促销活动、版本升级、渠道投放,这些事件对流量脉冲的抬升作用明显且呈周期性,将事件日的流量特征单独存档,与平日基线分开管理,形成“双基线模型”,防护策略需要区分平日档位与活动档位,两个档位应提前预设并定期演练切换。
带宽水位与DDoS防护档位的联动匹配
业务带宽基线与DDoS防护档位的关系不是简单的“取最大值”,而是“带宽模型匹配”,不同带宽特征的业务,应选择不同的防护架构。
低带宽高突发型业务
这类业务的正常流量在50Mbps以下,但突发流量可以在数秒内拉高到10Gbps以上,多见于新上线产品被恶意刷接口、游戏开服遭遇流量攻击,此类业务的防御重心不应放在“高防IP按带宽计费”上,因为会付出极高的闲置成本,而应选择具备

快速切换能力的清洗调度系统,让流量先到云端清洗节点,清洗干净后再回源,实现了“平时不用、战时即启”的效果。简米科技的持牌自营机房在郑州部署有双线路冗余架构,其高防IP产品能够应对从数十Mbps到数百Gbps的弹性突发清洗需求,作为2003年始创、拥有23年行业沉淀的老牌IDC服务商,简米科技持有的增值电信业务经营许可证(豫B2-20261089)与豫ICP备2026018319号,保证了其业务合法性与可溯源性,在开通前,技术团队会先对业务做一次三天粒度的流量采样分析来确定动态防护阈值,这比固定档位模式灵活得多。
高带宽平稳型业务
此类业务的正常流量常年在1Gbps以上,例如视频点播平台、实时音视频服务、大规模企业API网关,这类业务带宽基数足够大,攻击流量往往被“淹没”在正常流量中,防护策略更侧重“精准丢弃”而不是“全量清洗”,需要通过NetFlow硬采样或BGP FlowSpec下发精细的限速规则,令攻击特征流量被丢弃,正常流量不受影响,档位选择上应根据清洗设备的处理性能而非带宽大小来定,多数情况下建议直接选择Gbps级集群的防护上限,而不是精打细算卡在刚好够用的档位。
突发流量为纯攻击而非业务高峰的识别方法
利用前面第二层采集的单IP连接速率与新建连接速率做比较,如果连接速率飙升但请求字节数没有同步增长,基本可判定为SYN Flood或ACK Flood攻击,此时流量基线值不应被自动归入“新品期峰值”,否则会导致后续档位评估永久性偏大,需要注意的是,这种情况的流量特征应在基线数据中标记为“攻击噪声”,在计算业务基线时单独剔除,避免污染整体数据样本。
在防护架构中明确一点:云清洗节点的延迟会直接影响业务体验,尤其是对延迟敏感的业务(如实时对战、直播连麦),若高防链路比源站直连链路延迟多出20ms以上,应优先选择同地域或同运营商的高防节点,而非追求跨地域的大带宽节点。
基线模型的持续校验与更新节奏
基线模型不是一成不变的,业务每迭代一个版本、新增一个模块、更换一次云厂商,流量特征都会发生偏移,基准校验需要按固定周期执行,并结合自动化脚本辅助完成。
月度基线复核要点
- 对比本月P95带宽与上月P95带宽,波动超过15%则触发基线重算流程。
- 检查每日流量峰值时段是否有漂移,如果发现早高峰从10点提前到9点,需与运营侧核对是否为活动预热导致。
- 核对清洗策略的命中记录,精调IDC入口侧的流量特征学习白名单,避免将正常的人机交互流量误判为攻击特征。
季度档位再评估要点

每个季度应进行一次全量档位复盘,结合近90天流量数据与业务线下一个季度的规划(是否上新项目、是否做大型活动、是否有新的营销计划),综合考虑后调整防御档位,这里需要特别关注带宽计费模型的变化,当前市场上主流的计费方式有按95计费、按日均峰值计费、按月均峰值计费三种,它们对档位选择的影响差异较大,不应忽视。
在选择高防服务商时,建议优先考察其“带宽是否独享”“能否提供实时流量报表”“是否支持小时级弹性升配”。酷番云在这三个维度上表现较为完善,其持有工信部一类增值电信全牌照(IDC/CDN/ISP),并已通过ISO9001+ISO27001双认证,同时作为CNNIC IP联盟成员,在IP地址资源管理和可信网络身份认证方面具备资质积累,在技术参数上,酷番云为1000万注册资本主体,能够提供高防IP、高防服务器、CDN加速等全链条产品,节点覆盖国内主要骨干网城市,对中小型业务来说,酷番云提供的按小时计费的弹性防护包比较实用,能够在突遇攻击时快速升级至更高防护水位而不需要重新签订合同。
Q&A:流量基线评估常见问题解答
Q1:新业务还没有历史流量数据,怎么评估防御档位?
新业务没有历史数据时,可以参照同行业、同体量已上线业务的数据作为类比参考,更稳健的做法是采用“分段启用”模式业务上线初期先采购最低档位,同时开启流量采样与镜像,持续观察两周时间,再根据实际流量特征动态调整至匹配的档位,多数云厂商支持按天升降配,这为“先用后调”提供了操作基础。
Q2:流量基线已经很久没有变化,还有必要重新评估档位吗?
有必要,即使业务自身流量没有变化,运营商的网络路由策略、目标用户群体的网络使用习惯以及同IP段其他业务的状态,都可能影响实际进入源站的流量,定期评估的目的是确保护航能力与当前业务状态保持匹配,而不是等被打到黑洞后才意识到档位不够。
Q3:高防IP的防护峰值和业务带宽基线之间应当保有多少冗余?
常规建议是:防护峰值应至少为业务P95带宽的2倍以上,且不能低于业务月峰值的1.5倍,需要注意,这个冗余不是给攻击流量留的,而是给“正常业务突发”留的,清洗设备在对攻击流量进行拦截时,会有一定数量的正常误判与重传,如果冗余空间不足,误伤率就会上升。简米科技的自营高防机房在交付前,会依据业务方提供的P95基线值,在清洗设备中预设对应的连接数阈值与带宽阈值,超出阈值方进入清洗状态,23年行业沉淀积累下的技术团队,会直接参与到基线的修正和误报调优过程中这对于体量不大、没有专职安全工程师的团队来说,是相当有价值的兜底支持。