本文介绍替换不可热交换的硬件组件的常规过程。 实际更换步骤因 OEM 硬件供应商不同而有所差异。 有关特定于Azure Stack Hub集成系统的详细步骤,请参阅供应商的现场可更换单元(FRU)文档。
Caution
固件调配对于本文中所述的操作的成功至关重要。 缺少此步骤可能会导致系统不稳定、性能降低、安全威胁或防止Azure Stack Hub自动化部署操作系统。 更换硬件时,请始终咨询硬件合作伙伴的文档,以确保应用固件与Azure Stack Hub管理员门户中显示的 OEM 版本匹配。
Warning
Azure Stack Hub要求解决方案中的所有服务器具有相同的配置。 此要求包括 CPU 模型和核心、内存数量、NIC 和链接速度以及存储设备。 Azure Stack Hub不支持在硬件更换期间或添加缩放单元节点期间更改 CPU 模型。 CPU 更改(例如升级)需要在每个缩放单元节点中统一 CPU 并重新部署Azure Stack Hub。
| 硬件合作伙伴 | Region | URL |
|---|---|---|
| 思科 | 全部 |
适用于Azure Stack Hub操作指南的 Cisco 集成系统 适用于 Azure Stack Hub 的 Cisco 集成系统的发行说明 |
| Dell EMC | 全部 |
适用于 Azure Stack Hub 14G 的云(需要账户并登录) Cloud for Azure Stack Hub 13G(需要账户并登录) |
| HPE | 全部 | HPE ProLiant for Azure Stack Hub |
| 联想 | 全部 | ThinkAgile SXM 最佳食谱 |
| Wortmann |
OEM/固件包 terra Azure Stack Hub 文档(包括 FRU) |
不可热交换的组件包括以下项:
- CPU(必须为相同类型(型号、核心数)*
- 内存*
- 母板/基板管理控制器 (BMC)/视频卡
- 磁盘控制器/主机总线适配器 (HBA)/背板
- 网络适配器 (NIC)
- 图形处理单元 (GPU)
- 操作系统磁盘*
- 数据驱动器(不支持热交换的驱动器,例如 PCI-e 加载项卡)*
*这些组件可能支持热交换,但可能会因供应商实现而异。 有关详细步骤,请参阅 OEM 供应商的 FRU 文档。
以下流程图显示更换非热插拔硬件部件的一般 FRU 流程。
- 根据硬件的物理条件,可能不需要此操作。
** OEM 硬件供应商是否负责组件更换和固件更新,可能取决于您的支持合同。
查看警报信息
Azure Stack Hub运行状况和监视系统跟踪存储空间直通控制的网络适配器和数据驱动器的运行状况。 它不会跟踪其他硬件组件。 对于所有其他硬件组件,警报会在硬件生命周期主机上运行的供应商专用硬件监控解决方案中生成。
组件更换过程
以下步骤提供了组件更换过程的概要概述。 在参考 OEM 提供的 FRU 文档之前,请勿执行这些步骤。
使用“关闭”操作可以正常关闭缩放单元节点。 根据硬件的物理条件,可能不需要此操作。
如果关闭操作确实失败(虽然这种情况极少发生),请使用 排空 操作将缩放单元节点置于维护模式。 根据硬件的物理条件,可能不需要此操作。
Note
在任何情况下,只有一个节点可以同时禁用和关闭,而不会中断 S2D (存储空间直通)。
横向扩展单元节点进入维护模式后,请使用 关机 操作。 根据硬件的物理条件,可能不需要此操作。
Note
在关闭电源操作不起作用的情况下,请改用基板管理控制器 (BMC) Web 界面。
替换损坏的硬件组件。 OEM 硬件供应商是否进行组件更换可能会因支持合同而异。
更新固件。 使用硬件生命周期主机,按照供应商特定的固件更新流程操作,以确保更换后的硬件组件已应用经批准的固件版本。 OEM 硬件供应商是否执行此步骤可能会因支持合同而异。
使用 “修复 ”操作将缩放单元节点重新引入缩放单元。
使用特权端点来检查虚拟磁盘修复状态。 使用新的数据驱动器时,完整的存储修复作业可能需要几个小时,具体取决于系统负载和消耗的空间。
修复操作完成后,验证是否已自动关闭所有活动警报。