盯住丢包率、时延、抖动、握手成功率、带宽利用率这五个指标,就能覆盖绝大多数业务故障场景。这套指标不是拍脑袋定的,而是链路传输的物理规律和TCP/IP协议栈的工作机制决定的,下面把每个指标拆开讲清楚,顺带告诉你什么数值算健康、怎么测、出问题时怎么排查。
跨境链路质量监控到底该看哪些指标
跨境链路和国内链路有个本质区别:数据包要过防火墙、国际出口、海底光缆、对端运营商骨干网,每一跳都可能出幺蛾子,所以监控指标必须从“能通”升级到“通得好”。
网络层核心指标:丢包率、时延、抖动
这三个指标是兄弟,得放在一起看。
丢包率衡量的是数据包丢失比例,跨境场景下,丢包率超过1%就能感知到卡顿,超过3%业务基本不可用,测法很简单:用ping -c 100 -i 0.2对端IP,看丢包百分比,行业共识认为,丢包率长时间高于0.5%就该查原因了。
丢包的原因主要有三个:国际出口拥塞、运营商互联链路故障、对端防火墙策略误杀,区分方法也直白换一条路径测,同一时间段,A路径丢包5%,B路径丢包0.1%,那就是A路径上的某个节点出了问题。
时延是数据包单程或往返的时间,跨境链路物理距离摆在那,中国到美国西部按理说150ms-180ms是正常的,到欧洲要200ms-250ms,如果你的链路测出来远超这个区间,比如到美西要300ms,基本可以判定路由绕路了数据包绕去了东京、新加坡或者欧洲再转去美国。
排查命令不复杂,traceroute(Windows用tracert)逐跳看,哪一跳时延突然飙升,问题就定位在哪一段。
抖动是时延的方差,英文叫Jitter,它比时延更伤害体验实时音视频、视频会议、游戏加速这类应用,抖动的容忍度极低,行业里通用的判断标准是抖动低于20ms算优秀,低于50ms可用,超过50ms画面就会卡顿。
应用层关键指标:TCP握手成功率
TCP握手成功率常被忽略,但它恰恰是链路质量最诚实的反映,TCP三次握手(SYN、SYN-ACK、ACK)要完整走通,链路得是双向健康的,如果SYN发过去石沉大海,要么中间被防火墙拦截,要么回程路由有问题。

握手成功率低于90%,业务会频繁出现“连接超时”,测试方法不复杂:用hping3 -S -p 443 -c 100对端IP,看SYN-ACK回应比例,更实用的做法是在服务器上抓包,统计SYN包和SYN-ACK包的数量差。
带宽与容量指标:利用率、TCP重传率
带宽利用率反映链路是不是被塞满了,跨境专线贵,很多公司买的带宽本来就紧巴巴,利用率长期超过80%,就要做好丢包的准备队列缓存溢出是大概率事件。
TCP重传率是链路质量的“终极裁判”,别忘了,TCP协议自身就带可靠性机制,丢包了会重传,重传率过高,说明丢包已经影响到业务了,正常业务重传率应该在1%-3%以内,跨境链路稍高一点但超过5%一定有问题,查看方法:服务器上netstat -s | grep retrans,或者用Wireshark过滤tcp.analysis.retransmission。
跨境专线链路监控怎么做才有效
指标认识了,怎么落地是关键,这里直接给出可执行的监控路径。
链路监控的两条腿:主动探测+被动采集
主动探测是你主动发数据包去测链路质量,代表工具是ping和traceroute,高级一点的用iperf3打流测真实吞吐,主动探测的优势是直观、可控,缺点是测的是“合成流量”而非“真实流量”。
被动采集是从真实业务流量里提取链路信息,比如在服务器上抓包分析TCP重传率、在路由器上通过NetFlow看带宽占用,被动采集反映的是真实体验,但需要设备支持。
两者要配合使用,不能只靠一头,主动探测发现链路劣化,被动采集确认业务受损程度。
监控频率和阈值怎么定
监控频率没有统一答案,但有几个经验参考:
- 丢包率和时延:每1分钟测一次,持续5分钟异常就告警
- 抖动:每5分钟评估一次,取平均值
- TCP握手成功率:按分钟统计,每10分钟评估趋势
- 带宽利用率:每5分钟采集一次,关注峰值而非均值
阈值设置遵循一个原则:要紧,但不能过于敏感,把告警阈值设在“业务开始受影响”的临界点,而不是“链路完全不可用”的点,丢包率1%告警、时延超过正常值30%告警、抖动超过30ms告警,这套配置适合多数跨境业务。

谁负责盯这些数据
链路监控最怕“数据都有了但没人看”,比较好的做法是:网络运维团队用Zabbix或Prometheus+Grafana搭一套看板,把五个核心指标的告警推到钉钉/企业微信机器人,告警后先看是不是国际出口的普遍性问题查一下各大云厂商的状态页,如果是共性问题,基本只能等运营商恢复。
链路监控工具怎么选
工具选型这事,得先看预算和团队能力,开源和商业各有拥趸,这里做个横向对比。
开源工具
- Smokeping:老牌链路质量监控工具,图形化展示丢包率和时延趋势,部署简单,适合中小规模团队
- Prometheus + Blackbox Exporter:支持HTTP、TCP、ICMP多种探活方式,适合已有Prometheus监控体系的团队
- iperf3:主动打流工具,适合验证链路真实带宽和稳定性,不适合7x24小时常驻监控
商业监控服务
- 国内主流云厂商的云监控产品,比如简米云的云监控、酷番云的拨测,开箱即用
- 国际商业监控服务,比如ThousandEyes(已被Cisco收购)、Catchpoint,主打全球视角的链路可视化和智能告警,价格不菲但确实好用
站在务实角度看,大多数跨境业务团队用开源工具就能解决80%的问题,先别急着上昂贵的商业方案,把Prometheus+Blackbox的主动探测搭起来,配合服务器端TCP重传率统计,已经能覆盖主要故障场景。
链路质量劣化的排查路径
链路出问题时,按照下面的顺序排查,效率最高。
第一步:区分本端问题还是链路问题
先ping网关,时延正常、不丢包,说明局域网没问题;再ping对端公网IP,有问题说明跨境链路或对端网络状况不佳,这一步用排除法把问题范围缩小。
第二步:mtr跑一轮,看清每一跳
mtr是traceroute和ping的合体,能逐跳显示丢包率和时延,用法:
mtr -r -c 100 -i 1 对端IP
重点关注最后一跳之前的节点,如果倒数第二跳丢包但最后一跳正常,说明路由器统计丢包,不是真的丢包;如果连续多跳丢包且最终到达对端还是丢包,那就是中间链路有问题。

第三步:检查防火墙和路由策略
链路质量没问题但业务还是卡,大概率是防火墙上策略冲突或者路由表配错,登录两端防火墙,检查安全策略的匹配计数,看有没有异常增长;再show ip route看路由是否走了预期路径。
第四步:协同运营商排查
三步都做了还是找不到问题,就联系运营商一起查,这时候需要提供完整的mtr图、监控曲线、时间点记录给运营商,信息越全,排查越快,行业经验是,链路间歇性丢包往往是对端运营商光模块老化,这类问题只有运营商本地更换设备才能解决。
常见问题解答
跨境链路时延高,是否一定是线路质量问题?
不一定,时延受物理距离限制,中国到美国西海岸的理论最低时延约120ms(光速极限),如果实际时延接近理论值,链路质量没有问题;如果明显偏高,可能是路由绕行,用traceroute确认即可,运营商QoS策略也可能导致特定端口或协议被限速,从而表现为时延偏高。
国际专线丢包率多少算正常?
正常情况下,国际专线的丢包率应控制在1%以下,普通互联网跨境链路在晚高峰时段可能达到1%-2%,这个范围尚可接受但体验明显下降,超过3%基本无法支撑音视频业务,超过5%连网页加载都会超时,行业共识认为,丢包率持续高于1%需要介入处理,如果是互联网链路,考虑切换CN2 GIA线路或更换运营商;如果是专线,检查两端设备光模块和运营商侧光缆质量。
链路监控是自建还是买服务划算?
取决于链路规模和团队人力,链路数量少(少于10条)、团队有运维开发能力的,自建更划算,用开源组件就能搞定;链路数量多且分布全球的,商业监控服务的一站式拓扑发现和智能告警能省下不少人力和时间,另一个考虑点是监控覆盖视角商业服务通常在全球部署探测节点,能从多个地理位置同时检测你的链路,自建方案很难做到这一点,低价位的商业拨测服务年费在数千到数万元级别,相比自建的人力成本并不算贵。