使用 Azure Monitor 代理和数据收集规则配置 Service Fabric 群集遥测

本文介绍了一种适用于 Service Fabric 群集的受支持遥测方法,该方法使用 Azure Monitor 代理(AMA)和数据收集规则(DCR)。

如果你要开始使用新的监视方案,或者要从旧的诊断配置(例如 Windows Azure 诊断 (WAD)、Linux Azure 诊断 (LAD) 或 Log Analytics 代理(也称为 MMA/OMS))迁移,请参考本指南。

为什么使用此方法

  • WAD 和 LAD 已弃用,并将于 2026 年 3 月 31 日停用。
  • Log Analytics 代理(MMA/OMS)已弃用,且不再受支持。
  • AMA + DCR 是Azure Monitor中来宾日志和性能数据的受支持的引入模型。

有关Azure Monitor迁移指南,请参阅从Azure 诊断扩展迁移到 Azure Monitor 代理

使用分阶段推出来降低风险。

  1. 验证 AMA + DCR 管道。
  2. 添加 Service Fabric 专属信号。
  3. 剪切并删除已弃用的代理。

阶段 1:验证 AMA + DCR 管道

  1. 在集群 VM 扩展集或计算机上安装 AMA。
  2. 创建并关联至少一个 DCR。 数据收集仅在关联后启动。
  3. 验证遥测数据是否流入Azure Monitor日志。
  • 将 Windows 事件日志导入到 Event 表中。
  • 将 Linux syslog 写入 Syslog 表中。
  • 将性能计数器添加到 Perf 表中。

关键参考:

阶段 2:添加 Service Fabric 信号

映射所需的服务Fabric信号并增量更新 DCR 范围(例如,按节点类型 Canary)。

  • Windows 群集:从 Windows 事件日志中收集与 Service Fabric 相关的事件通道。
  • Linux 群集:收集用于 Service Fabric 事件的 syslog 设施类型和严重级别。
  • 添加所需的 OS 和进程性能计数器,以便进行基础结构监视。

使用Service Fabric 事件列表来确定警报和故障排除所需的事件 ID 和通道。

阶段 3:剪切和删除已弃用的代理

在可通过 AMA + DCR 获取所需信号后:

  1. 删除 WAD/LAD 扩展。
  2. 删除 Log Analytics 代理程序 (MMA/OMS) 扩展。
  3. 验证警报、仪表板和查询是否可继续工作。
  4. 确认没有永久性 DCR 引入、转换或传递错误。

最小验证查询

Windows事件

Event
| where TimeGenerated > ago(30m)
| where Source has "ServiceFabric" or RenderedDescription has "Service Fabric"
| take 50

Linux syslog

Syslog
| where TimeGenerated > ago(30m)
| where ProcessName has "ServiceFabric" or SyslogMessage has "ServiceFabric"
| take 50

性能计数器

Perf
| where TimeGenerated > ago(30m)
| summarize AvgValue = avg(CounterValue) by ObjectName, CounterName, InstanceName
| top 50 by AvgValue desc

后续步骤