误码发生在物理层,丢包体现在接口转发统计里,两者经常同时出现但归因路径完全不同。运维体系要做的第一件事,是让所有班组用同一套计数器口径报故障,再按层次往下剥。
先把计数器口径对齐到一张表
常用指标包括输入错误帧、CRC 校验错、输出丢弃计数与光口告警秒数。抓取一次现象要同时留下两端设备读数、时间戳和该链路承载的业务类型,因为上层应用重传会掩盖真实丢包位置。服务器侧也要核对网卡驱动统计,例如 PCI-EX8 25G双光口光纤网卡(英特尔Intel E810芯片) 的丢包计数是否与交换机端口同步增长,两边对不上说明中间还有汇聚环节没查。这张对照表建议贴在机房门口,人手一份。
按面、段、点三层往下剥
- 面:多台设备同侧出现丢包,方向指向主干链路、汇聚端口或机房供电异常。
- 段:单条链路持续误码,重点查端面清洁度、跳线弯曲半径与收光余量。
- 点:只有某一主机或某组地址异常,多为驱动、双工或速率档位不匹配。
- 间歇性故障额外安排一轮长时间抓包,短时观察很容易把问题误判为正常。
自环在前,换件在后
EB-LINK 技术支持在现场遇到的常见做法是先换模块,但更省时间的顺序是先自环:在同侧用短跳线把端口自环,误码计数停止增长说明设备侧正常,故障在光缆或配线架;自环仍有错,再排查端口、模块与写码匹配度。换下来的模块贴标签记录序列号与现象,回库统一复测后再判定好坏,避免把可用件当故障件报废。整轮定界过程写进故障单并由交接双方签字,下一班组才不用从头再来一遍。