教程:在 Azure 机器学习工作室 中使用无代码自动化机器学习预测需求

了解如何在 Azure 机器学习工作室 中使用自动化机器学习创建时序预测模型,而无需编写单行代码。 此模型将预测自行车共享服务的租赁需求。

本教程中未编写任何代码。 相反,您应使用 Studio 界面进行训练。 你将了解如何执行以下任务:

  • 创建并加载数据集。
  • 配置并运行自动化 ML 试验。
  • 指定预测设置。
  • 浏览试验结果。
  • 部署最佳模型。

若要尝试其他模型类型的自动化机器学习,请参阅:

先决条件

登录到工作室

在本教程中,你将在 Azure 机器学习工作室中创建自动化 ML 试验运行。 Azure 机器学习工作室是一个合并的 Web 界面,其中包括机器学习工具,用于针对所有技能级别的数据科学从业者执行数据科学方案。

  1. 登录到 Azure 机器学习工作室

  2. 选择创建的订阅和工作区。

创建试验

  1. 在左侧菜单中的 “创作 ”部分,选择“ 自动化 ML

    显示 Azure 机器学习工作室中自动化机器学习“创作概览”页面的屏幕截图。

  2. 选择 “新建自动化 ML 作业 ”以启动 “提交自动化 ML 作业 ”过程。

    默认情况下,该过程会在“训练方法”选项卡上选择“训练”自动选项,并继续执行配置设置。

  3. “基本信息设置 ”选项卡上,输入所需设置的值,包括 作业 名称和 试验 名称。 对于本教程,请使用 automl-bikeshare 试验名称。 还可以根据需要为可选设置提供值。

  4. 选择 “下一步 ”以继续。

配置任务类型和数据集

“任务类型和数据 ”选项卡上,指定试验的数据资产和用于训练数据的机器学习模型。 在本教程中,请使用 bike-no.csv 文件。 如果未下载该文件,请立即下载该文件。

  1. “任务类型和数据 ”窗体上,选择 “时序预测 ”作为任务类型。

  2. 选择“ 创建 ”,从下载的文件创建新的数据资产。

  3. “数据类型 ”页上,输入数据集的名称并提供可选说明。 将数据集类型设置为 表格。 选择 “下一步 ”以继续。

  4. “数据源 ”页上,选择“ 从本地文件”。

可在左侧菜单中显示其他选项,以便配置数据源。

  1. 选择 “下一步 ”以继续转到 “目标存储类型 ”页,可在其中指定要上传数据资产的 Azure 存储位置。

    1. 对于 数据存储类型,请选择 “Azure Blob 存储”。
    2. 在数据存储列表中,选择工作区创建过程自动设置的默认数据存储: workspaceblobstore
    3. 选择“下一页”。
  2. 在“文件和文件夹 选择 ”页上,使用 “上传文件”或“文件夹 ”下拉菜单,然后选择“ 上传文件 ”选项。

    1. 选择本地计算机中的bike-no.csv文件。 此文件是作为 先决条件下载的文件。

    2. 上传文件后,选择“ 下一步”。

  3. “设置” 页上检查上传的数据的准确性。 页面上的字段会根据您的数据文件类型预先填充:

    字段 说明 教程值
    文件格式 定义文件中存储的数据的布局和类型。 带分隔符
    分隔符 一个或多个字符,用于指定纯文本或其他数据流中不同的独立区域之间的边界。 逗号
    编码 指定用于读取数据集的位到字符映射表。 UTF-8
    列标题 指示如何处理数据集的标头(如果有)。 仅第一个文件包含标头
    跳过行 指示要跳过数据集中的多少行(如果有)。
  4. 选择 “下一步 ”以继续转到 “架构 ”页。 此页面也会根据您在设置中的选择预先填充。

    1. 在本教程中,选择忽略 临时 列和 已注册 列。 这些列是 cnt 列的细分,因此不要包含它们。

    2. 对于本教程,请保留 “属性 ”和 “类型”的默认值。

    3. 选择 “下一步 ”以继续查看 + 创建 页面。

  5. 查看数据资产的设置。 如果一切正常,请选择“ 创建 ”以创建数据资产。

配置任务和预测设置

数据资产准备就绪后,机器学习工作室将返回到“提交自动化 ML 作业”过程的“任务类型和数据”选项卡。 新数据资产将显示在页面上。

按照以下步骤完成作业配置:

  1. 展开 “选择任务类型 ”下拉菜单,然后选择 “时序预测”。

  2. 指定训练模型后,在列表中选择数据集。 选择 “下一步 ”以继续转到 “任务设置 ”选项卡。

  3. “目标列 ”下拉列表中,选择要用于模型预测的 cnt 列。

  4. 选择“日期”作为时间列,将“时序标识符”留空。

  5. 频率是指收集历史数据的频次。 保留选择“自动检测”。

  6. 预测时域是您想要预测的未来时间长度。 取消选中 Autodetect,然后在字段中键入 14。

  7. 保持 启用深度学习 处于未选中状态。

  8. 选择“查看其他配置设置”并按如下所示填充字段。 这些设置可帮助你更好地控制训练作业并指定预测的设置。 否则,将根据实验选择和数据采用默认设置。

    其他配置 说明 教程值
    主要指标 机器学习算法的评估指标。 规范化均方根误差
    解释最佳模型 自动显示由自动化机器学习创建的最佳模型的可解释性。 启用
    已屏蔽的模型 要从训练作业中排除的算法 极端随机树
    其他预测设置 这些设置有助于提高模型的准确度。

    预测目标滞后阶数: 要向前回溯多远来构造目标变量的滞后项
    目标滚动窗口:指定用于生成特征(如 最大值最小值总和)的滚动窗口大小。


    预测目标滞后:无
    目标滚动窗口大小:无
    Limits 如果满足条件,训练作业将停止。 最大并发试验数:6
    指标分数阈值:无
    实验超时(分钟):180
  9. [可选] 验证和测试 表单上:

    1. 选择 k 折交叉验证 作为 验证类型

    2. 选择 5 作为 交叉验证数

  10. 选择“保存”。

配置计算目标

加载和配置数据后,设置远程计算目标。

  1. 按如下方式填写 计算 表单:

    1. 使用 “选择计算类型 ”下拉列表选择 计算群集 作为计算类型。

    2. 选择 +新建 以配置计算目标。 自动 ML 仅支持 Azure 机器学习计算。

      1. 填充 “选择虚拟机 ”窗体以设置计算:

        字段 说明 教程值
        虚拟机层 选择试验应具有的优先级 专属
        虚拟机类型 为计算选择虚拟机类型 CPU(中央处理单元)
        虚拟机大小 选择计算资源的虚拟机大小。 根据数据和试验类型提供了建议的大小列表。 Standard_DS12_V2
      2. 选择 “下一步 ”以填充 “配置设置 ”窗体:

        字段 说明 教程值
        计算名称 用于标识计算上下文的唯一名称。 bike-compute
        最小/最大节点数 要分析数据,必须指定一个或多个节点。 最小节点数:1
        最大节点数:6
        缩减前的空闲秒数 群集自动缩减到最小节点数之前的空闲时间。 120(默认值)
        高级设置 用于为试验配置虚拟网络并对其进行授权的设置。
      3. 选择 “创建 ”以创建计算目标。

        此步骤需要几分钟才能完成。

      4. 创建后,从下拉列表中选择新的计算目标。

    3. 选择 “下一步 ”以继续转到 “审阅 ”页。 查看此作业的配置设置摘要。

运行试验

若要运行试验,请选择“ 提交训练作业”。 作业详细信息页面打开后,顶部的作业编号旁边会显示作业状态。 此状态随着试验的进行而更新。 通知还会显示在工作室右上角,告知你实验的状态。

重要

准备实验作业需要 10-15 分钟。 运行以后,每个迭代还需要 2-3 分钟

在生产环境中,这个过程需要一些时间,你可能会先离开一会儿。 等待期间,您可以先在“模型”选项卡中查看已完成测试的算法。

浏览模型

导航到“ 模型 + 子作业 ”选项卡以查看已测试的算法(模型)。 默认情况下,这些模型在完成后按指标分数排序。 在本教程中,根据所选 规范化根均方误差 指标评分最高的模型显示在列表顶部。

在等待所有试验模型完成的时候,可以选择已完成模型的“算法名称”,以便浏览其性能详细信息。

以下示例演示如何从作业创建的模型列表中选择模型。 然后,选择“ 概述 ”和“ 指标 ”选项卡以查看所选模型的属性、指标和性能图表。

浏览模型浏览界面的屏幕截图,其中显示了用于查看模型属性和性能图表的“概述”和“指标”选项卡。

部署模型

Azure 机器学习工作室中的自动化机器学习可帮助你在几个步骤中将最佳模型部署到实时联机终结点。 部署是模型的集成,因此它可以对新数据进行预测并识别潜在的机会领域。

对于此试验,部署到实时终结点意味着自行车共享公司现在具有一个可缩放的 Web 解决方案,用于预测自行车共享租赁需求。

“自动化 ML ”页进行部署时,无需准备评分脚本或环境。 Azure 机器学习自动生成模型,并在完全托管的联机终结点上托管模型。

作业完成后,选择屏幕顶部的 作业 1 ,返回到父作业页。

“最佳模型摘要 ”部分中,根据 规范化根均方误差 指标选择此试验上下文中的最佳模型。

部署此模型。 部署需要数分钟才能完成。 部署过程注册模型、自动生成评分脚本和环境,并预配联机终结点。

  1. 选择该最佳模型,以打开特定于模型的页。

  2. 选择部署>实时终结点

    Azure 机器学习生成部署所需的模型和环境。

  3. 在部署向导中,提供以下值。 保留未列出的任何字段的默认值。

    字段
    端点名称 输入唯一名称,例如 bikeshare-endpoint
    部署名称 输入名称,例如 bikeshare-deploy
    虚拟机 保留建议的默认虚拟机大小。
    实例计数 1
    身份验证类型 保留默认身份验证(基于密钥的身份验证)。
  4. 完成向导中的剩余步骤,然后选择“ 部署”。

    通知确认部署已成功启动。 在“部署状态”下的“模型摘要”窗格中跟踪进度。

部署成功后,你有一个可生成预测的操作实时终结点。

若要详细了解如何调用新终结点,以及如何使用 Power BI 内置的 Azure 机器学习 支持来测试预测结果,请参阅后续步骤

有关更多部署选项,包括Azure CLI和Python SDK,请参阅将 AutoML 模型部署到联机终结点

清理资源

部署文件比数据文件和试验文件更大,因此它们的存储成本也更大。 仅当你想要最大程度地降低帐户成本,或者想要保留工作区和试验文件时,才删除部署文件。 否则,如果不打算使用任何文件,请删除整个资源组。

删除实时终结点

若要保留资源组和工作区进行其他教程和探索,请仅从Azure 机器学习工作室中删除实时终结点。 删除终结点也会删除其关联的部署。

  1. 转到 Azure 机器学习工作室。 转到您的工作区,然后在左侧的 资产 窗格下,选择 终结点。

  2. 选择要删除的终结点,然后选择“ 删除”。

  3. 选择“继续”。

删除资源组

重要

已创建的资源可用作其他 Azure 机器学习教程和操作方法文章的先决条件。

如果你不打算使用已创建的任何资源,请删除它们,以免产生任何费用:

  1. 在 Azure 门户的搜索框中输入“资源组”,然后从结果中选择它

  2. 从列表中选择你创建的资源组。

  3. 在“概述”页面上,选择“删除资源组”

    用于在 Azure 门户中删除资源组的选项的屏幕截图。

  4. 输入资源组名称。 然后选择“删除”。

后续步骤

在本教程中,你已使用 Azure 机器学习工作室中的自动化 ML 创建并部署了一个可预测单车共享租赁需求的时序预测模型。

注意

本教程修改了此自行车共享数据集。 此数据集是作为 Kaggle 竞赛的一部分提供的,最初通过 Capital Bikeshare 提供。 还可以在 UCI 机器学习 数据库中找到它。

来源:Fanaee-T,Hadi;Gama,Joao,《结合集成检测器和背景知识的事件标注》,《人工智能进展》(2013):第1-15页,Springer Berlin Heidelberg。