Azure Database for PostgreSQL灵活服务器的高可用性(HA)运行状况监视

Azure Database for PostgreSQL 灵活服务器包含一项高可用性(HA)健康状态监视功能,该功能使用 Azure 的资源运行状况检查(RHC)框架。 此服务持续深入了解已启用 HA 的实例的运行状况,并通知你可能影响连接和可用性的事件。 以下各节介绍了每种运行状况及相关场景,以帮助您排查问题并维护 HA 的稳定性。

健康状况

该服务通过表示特定条件的各种内部信号监视每个 HA 状态。 以下列表说明了可能的高可用性(HA)状态,以及可能影响 Azure Database for PostgreSQL 灵活服务器的可视化指示和相关情形。

就绪 - HA 正常

就绪状态指示已启用 HA 的服务器正常运行,且未检测到影响故障转移就绪情况的问题。 所有必需的配置都保持不变,并且不存在严重的错误条件。

显示 HA 就绪状态的屏幕截图。

降级 - 网络安全组 (NSG) 或虚拟设备阻止连接

当 NSG 规则或虚拟设备阻止高可用性所需的基本连接时,可能会出现 降级 状态。 此配置问题可防止完整的 HA 功能。 通过调整 NSG 设置来更正问题。

屏幕截图显示由于 NSG 阻止连接而导致 HA 降级状态。

已降级 - 只读状态

如果 PostgreSQL 灵活服务器进入只读状态,则 降级 状态反映此限制。 此状态通常需要预配其他资源或解决导致只读设置还原完整功能的条件。

屏幕截图显示由于只读状态而导致 HA 降级状态。

已降级 - 处于降级状态的高可用性

当高可用性(HA)服务遇到性能下降(可能是由于暂时性问题或系统级条件)时,会出现此状态。 实现重试逻辑有助于缓解这些临时连接中断的影响。 降级状态并不意味着服务器不可用。 相反,这表示整个 HA 配置和健康检查尚未全部完成。 尽管存在此状态,但服务器可能仍可运行且可访问。

若要在此类时间段内准确监视数据库的可用性,请使用 is_db_alive 指标作为 数据库可用性指标的一部分。 此指标提供数据库可用性的可靠指示器,可帮助你区分临时不完整的 HA 设置和实际停机时间。

屏幕截图显示由于性能问题而导致 HA 降级状态。

已降级 - 已启动计划的故障转移

在为服务器启动的计划内故障转移事件期间,将显示“降级”状态,表明 HA 故障转移进程处于活动状态。 此过程一般是简短和控制的,服务应很快恢复。

屏幕截图显示由于计划内故障转移而导致 HA 降级状态。

降级 - 计划外故障转移已启动

对于计划外故障转移,此状态指示意外情况触发了活动的故障转移事件。 此场景可能涉及短暂的连接中断,直到服务器完成故障转移过程。

屏幕截图显示由于计划外故障转移而导致 HA 降级状态。

性能下降 - 已启动升级故障切换

在系统升级期间,HA 服务器可能会经历升级故障转移以应用必要的更新。 处于此状态时,服务器可能会暂时限制新连接。 实现重试逻辑以有效处理暂时性问题。

屏幕截图显示由于升级故障转移而导致 HA 降级状态。

配置资源运行状况警报

设置资源运行状况警报,以便在启用 HA 的 PostgreSQL 实例的运行状况发生任何更改时获取实时通知。 可以通过Azure门户或使用 ARM 模板配置这些警报。 这样,就可以随时了解 HA 状态更新,而无需主动监视门户。

通过门户配置资源运行状况警报的步骤

  1. 转到Azure门户并选择 PostgreSQL 灵活服务器。
  2. 在左侧菜单中的 “监视 ”部分下,选择“ 警报”。
  3. 选择“新建警报规则”,并根据资源运行状况信号配置警报逻辑。
  4. 设置操作组以指定要如何收到通知(电子邮件、短信等)。
  5. 查看并创建警报规则。

使用 ARM 模板创建资源运行状况警报的步骤

  1. 资源运行状况警报 ARM 模板指南下载 ARM 模板。
  2. 使用特定的服务器详细信息和警报首选项自定义模板。
  3. 使用Azure CLI或Azure PowerShell部署 ARM 模板。
  4. 验证部署并确保警报处于活动状态。

有关设置警报的更多详细信息,请参阅以下指南:

通过使用 HA 运行状况监视,可以获得有关 PostgreSQL 服务器的 HA 性能的必要见解,从而主动管理运行时间和可用性。