在 Windows 主机上报告"IO operation Error 153"
适用于
- Ontap
- FC
- iSCSI
- Brocade Fabric OS v7.4.2d
- Windows
- Aix
问题
IO operation Error 153在 Windows 主机上报告,Disk Operation Error在 AIX 端报告,路径和 LUN 在几分钟内无法访问并自动恢复。- Windows host在主机端生成disk pause错误,同时观察到 IO 延迟,且主机无法读取或写入磁盘。
- Aix host在主机端报告路径抖动,且在报告磁盘操作错误的路径上磁盘不可访问。
- iSCSI 驱动器从 Windows 服务器间歇性地消失
- Windows 系统事件日志指示事件 ID 153:
"The I/O operation at logical block address was retried." Network port statistics在端口上显示出大量的数据包丢弃 (87,727) 和队列丢弃 (86,492)。
- Windows 系统事件日志指示事件 ID 153:
- 未观察到存储端错误、LUN 离线事件、ISCSI 会话断开或端口故障
- 存储在存储端的同一 FC 端口上报告
IO WQE error,扩展状态为0x2或0x1d。 - 两台主机均使用相同的 FC 端口访问存储。
Tue Nov 30 20:17:47 +07 [NetApp: fct_tpd_work_thread_0: fcp.io.status:debug]: STIO Adapter:2b IO WQE failure, Handle 0x1, Type 8, S_ID: 79Dxx0, VPI: 275, OX_ID: B63, Status 0x3 Ext_Status 0x1d
Mon Sep 26 13:26:52 +07 [NetApp: fct_tpd_work_thread_0: fcp.io.status:debug]: STIO Adapter:2b IO WQE failure, Handle 0x1, Type 8, S_ID: 79Dxy0, VPI: 275, OX_ID: 8AD, Status 0x3 Ext_Status 0x1d
Tue Jan 03 16:36:22 +07 [NetApp: fct_tpd_work_thread_0: fcp.io.status:debug]: STIO Adapter:2b IO WQE failure, Handle 0x1, Type 8, S_ID: 79Dxx0, VPI: 275, OX_ID: DA3, Status 0x3 Ext_Status 0x2
Fri Jan 13 12:05:37 +07 [NetApp: fct_tpd_work_thread_0: fcp.io.status:debug]: STIO Adapter:2b IO WQE failure, Handle 0x1, Type 8, S_ID: 79Dxy0, VPI: 275, OX_ID: 459, Status 0x3 Ext_Status 0x1d
- 除了 IO WQE 错误外,存储端没有看到其他错误事件。
- 在Brocade 交换机端,长距离 E-port 被手动禁用,且存储端出现 IO WQE 错误的端口关联了过多区域。
switchshow :
switchName: XXXXY
switchType: 62.0
switchState: Online
switchMode: Native
switchRole: Principal
switchDomain: 102
Index Slot Port Address Media Speed State Proto
============================================================
150 2 22 661400 id 8G No_Light FC LS Disabled (Persistent)
- Brocade 交换机上存在端口抖动迹象,且在
Fabriclog输出下看到ELP,EFP拒绝:
00:19:55.386609 *ELP Snd ACC:rev=2,flow=1,flen=80,sz=164 .. F0,P1 F0,P2 166 0x8937
00:19:55.386610 op_mode=0x5580 F0,P1 F0,P2 166 0x8937
00:19:55.386803 BF ACC Rcv F0,P3 F0,P3 318 0x6ad3
00:19:55.386852 SCN Domain 102 invalid F0,NA F0,NA NA NA
00:19:55.386877 ELP RJT Rcv - ct prfrm,in prgs,vu=0 F0,P2 F0,P2 166 0x6ad4
00:19:55.391604 SCN Port Offline;g=0x1c F0,P2 F0,P0 150 NA
00:19:55.391611 *Removing all nodes from port F0,P0 F0,P0 150 NA
在继续之前,请考虑以下内容
- 如果 FOS 版本较旧, 应考虑升级。升级 FOS 将有助于修复 Fabric 上的许多已知漏洞和问题。
- 由于连接到大量设备的区域太多,如果交换机间发生任何问题,最有可能导致我们在此观察到的无序帧问题。
- 清理不必要的区域,仅保留必要的区域。
- NetApp 建议采用 1:1 分区,确保 AIX 主机和 Windows 主机不分区到相同的目标端口。
- 状态
0x02和0x1d均表示 FC 帧序列乱序,这通常表明 Fabric 存在问题。