在 Microsoft Purview 中连接和管理 Hive 元存储数据库

本文概述了如何注册 Hive 元存储数据库,以及如何在 Microsoft Purview 中对 Hive 元存储数据库进行身份验证和交互。 有关 Microsoft Purview 的详细信息,请阅读简介文章

支持的功能

扫描功能

元数据提取 完全扫描 增量扫描 范围扫描
Yes Yes Yes

支持的 Hive 版本为 2.x 到 3.x。 支持的平台是 Apache Hadoop、Cloudera 和 Hortonworks。 如果要扫描 Azure Databricks,建议使用 Azure Databricks 连接器,该连接器更兼容且用户更友好。

扫描 Hive 元存储源时,Microsoft Purview 支持:

  • 提取技术元数据,包括:

    • 服务器
    • Databases
    • 包含列、外键、唯一约束和存储说明的表
    • 包含列和存储说明的视图
  • 提取表和视图之间的资产关系的静态世系。

设置扫描时,可以选择扫描整个 Hive 元存储数据库,或将扫描范围限定为与给定名称 () 或名称模式 () 匹配的架构子集。

其他功能

有关 分类策略实时视图,请参阅 受支持的功能列表

已知的限制

从数据源中删除对象后,后续扫描目前不会自动删除 Microsoft Purview 中的相应资产。

Prerequisites

  • 必须具有具有活动订阅的 Azure 帐户。 创建帐户

  • 你必须具有有效的 Microsoft Purview 帐户

  • 需要拥有数据源管理员和数据读取者权限才能在 Microsoft Purview 治理门户中注册和管理源。 有关权限的详细信息,请参阅 Microsoft Purview 中的访问控制

  • 如果数据源不可公开访问,请设置最新的自承载集成运行时。

    • 为方案选择适当的集成运行时
      • 若要使用自承载集成运行时:
        • 按照文章创建和配置自承载集成运行时
        • 确保在安装了自承载集成运行时的计算机上安装 JDK 11。 在新安装 JDK 后重启计算机,使其生效。
        • 确保在运行自承载集成运行时的计算机上安装 Visual C++ 可再发行程序包(Visual Studio 2012 更新 4 或更新版本)。 如果尚未安装此更新,请立即下载
        • 在运行自承载集成运行时的计算机上下载 Hive 元存储数据库的 JDBC 驱动程序。 例如,如果数据库为 mssql,请下载 Microsoft 的适用于 SQL Server 的 JDBC 驱动程序。 记下用于设置扫描的文件夹路径。
      • 若要使用支持 Kubernetes 的自承载集成运行时:
        • 按照文章创建和配置 Kubernetes 支持的集成运行时
        • 在运行自承载集成运行时的计算机上下载 Hive 元存储数据库的 JDBC 驱动程序。 例如,如果数据库为 mssql,请下载 Microsoft 的适用于 SQL Server 的 JDBC 驱动程序。 记下用于设置扫描的文件夹路径。

    备注

    JDBC 驱动程序应可由自承载集成运行时访问。 默认情况下,自承载集成运行时使用本地服务帐户“NT SERVICE\DIAHostService”。 确保它具有驱动程序文件夹的“读取和执行”和“列出文件夹内容”权限。

Register

本节介绍如何使用 Microsoft Purview 治理门户 在 Microsoft Purview 中注册 Hive Metastore 数据库。

Hive 元存储数据库唯一支持的身份验证是基本身份验证。

  1. 使用以下方法打开 Microsoft Purview 治理门户:

  2. 在左侧窗格中选择“数据地图”。

  3. 选择注册

  4. 注册源中,选择 Hive 元存储>继续

  5. “注册源(Hive 元存储)”页面上,执行以下操作:

    1. 对于 Name,请输入Microsoft Purview将列为数据源的名称。

    2. 对于 Hive 群集 URL,请输入从 Ambari URL 获取的值。 例如,输入 hive.azurehdinsight.cn

    3. 对于 Hive 元存储服务器 URL,请输入服务器的 URL。 例如,输入 sqlserver://hive.database.chinacloudapi.cn

    4. 从列表中选择一个集合。

    显示注册 Hive 源方框的屏幕截图。

  6. 选择“完成”

扫描

Tip

若要排查与扫描有关的任何问题,请执行以下操作:

  1. 确认已满足所有先决条件
  2. 查看 扫描故障排除文档

使用以下步骤扫描 Hive 元存储数据库以自动标识资产。 若要大致了解有关扫描的更多信息,请参阅 Microsoft Purview 中的扫描和引入

  1. 在管理中心,选择“集成运行时”。 确保设置了本地托管集成运行时。 如果未设置,请使用 先决条件中的步骤。

  2. 转到来源

  3. 选择已注册的 Hive 元存储数据库。

  4. 选择+ 新建扫描

  5. 提供以下详细信息:

    1. 名称:输入扫描的名称。

    2. 通过集成运行时进行连接:选择已配置的自承载集成运行时。

    3. 凭据:选择用于连接到数据源的凭据。 请确保:

      • 创建凭据时选择“基本身份验证”。
      • 在相应的输入框中输入 Metastore 用户名。
      • 将 Metastore 密码存储在 Secret 键中。

      有关详细信息,请参阅 Microsoft Purview 中用于源身份验证的凭据

    4. 元存储 JDBC 驱动程序位置:指定运行自承载集成运行时的计算机上 JDBC 驱动程序所在的路径。 例如,D:\Drivers\HiveMetastore

      1. 对于本地计算机上的自承载集成运行时: D:\Drivers\HiveMetastore。 它是有效 JAR 文件夹位置的路径。 该值必须是有效的绝对文件路径,并且不包含空格。 确保自承载集成运行时可以访问驱动程序;;有关详细信息,请参阅 先决条件部分
      2. 对于受 Kubernetes 支持的自承载集成运行时:./drivers/HiveMetastore 它是有效 JAR 文件夹位置的路径。 该值必须是有效的相对文件路径。 请参阅文档,使用 外部驱动程序设置扫描 ,以便提前上传驱动程序。
    5. 元存储 JDBC 驱动程序类:提供连接驱动程序的类名称。 例如,输入 \com.microsoft.sqlserver.jdbc.SQLServerDriver

    6. 元存储 JDBC URL:提供连接 URL 值并定义与元存储数据库服务器 URL 的连接。 例如: jdbc:sqlserver://hive.database.chinacloudapi.cn;database=hive;encrypt=true;trustServerCertificate=true;create=false;loginTimeout=300

      备注

      hive-site.xml复制 URL 时,从字符串中删除 amp; ,否则扫描将失败。

      将 SSL 证书下载 到自承载集成运行时计算机,然后在 URL 中更新 SSL 证书在计算机上位置的路径。

      在扫描配置中输入本地文件路径时,请将 Windows 路径分隔符字符从反斜杠 () \ 更改为正斜杠 (/) 。 例如,如果将 SSL 证书放置在本地文件路径 D:\Drivers\SSLCert\BaltimoreCyberTrustRoot.crt.pem,请将 serverSslCert 参数值更改为 D:/Drivers/SSLCert/BaltimoreCyberTrustRoot.crt.pem

      元存储 JDBC URL 值将类似于以下示例:

      jdbc:mariadb://samplehost.mysql.database.chinacloudapi.cn:3306/XXXXXXXXXXXXXXXX?useSSL=true&enabledSslProtocolSuites=TLSv1,TLSv1.1,TLSv1.2&serverSslCert=D:/Drivers/SSLCert/BaltimoreCyberTrustRoot.crt.pem

    7. 元存储数据库名称:提供 Hive 元存储数据库的名称。

    8. 架构:指定要导入的 Hive 架构的列表。 例如: schema1;schema2

      如果该列表为空,则会导入所有用户架构。 所有系统架构 (例如,默认情况下,SysAdmin) 和 对象将被忽略。

      使用 SQL LIKE 表达式语法的可接受架构名称模式包括百分号 (%) 。 例如, A%; %B; %C%; D 表示:

      • 以 A 开头或
      • 以 B 结尾或
      • 包含 C 编程语言或
      • 等于 D

      使用 NOT 和特殊字符是不被接受的。

    9. 最大可用内存:客户计算机上可供扫描进程使用的最大内存 (GB)。 此值取决于要扫描的 Hive 元存储数据库的大小。

      备注

      根据经验,应该为每 1000 个表提供 1GB 内存。

    显示扫描详细信息框的屏幕截图。

  6. 选择 继续

  7. 对于“扫描触发器”,可以选择是设置一个计划还是运行一次扫描。

  8. 查看您的扫描结果,然后选择“保存并运行”。

查看扫描和扫描运行情况

若要查看现有扫描,请执行以下操作:

  1. 转到 Microsoft Purview 门户。 在左窗格中,选择“数据映射”。
  2. 选择数据源。 可以在“最近使用的扫描”下查看该数据源上的现有扫描列表,或者可以在“扫描”选项卡上查看所有扫描。
  3. 选择您想查看的扫描结果。 窗格会显示先前的所有扫描运行,以及每次扫描运行的状态和指标。
  4. 选择运行 ID 来查看 扫描运行详细信息

管理扫描

若要编辑、取消或删除扫描:

  1. 转到 Microsoft Purview 门户。 在左窗格中,选择“数据映射”。

  2. 选择数据源。 可以在“最近使用的扫描”下查看该数据源上的现有扫描列表,或者可以在“扫描”选项卡上查看所有扫描。

  3. 选择要管理的扫描。 然后你可以执行以下操作:

    • 请通过选择“编辑扫描”来进行编辑。
    • 通过选择“取消扫描运行”来取消正在进行的扫描。
    • 选择删除扫描以删除您的扫描。

备注

  • 删除您的扫描文件不会删除从以前的扫描中创建的目录条目。

后续步骤

现在你已经注册了源,请按照以下指南来详细了解 Microsoft Purview 和你的数据: