Azure Databricks有一个统一的平台,用于完整的数据科学(DS)和机器学习(ML)生命周期,从原始数据引入到特征工程、模型训练、部署和生产监视。 Azure Databricks与常用的开源 ML 框架集成,添加企业级治理、可观测性和运营工具,统称为 MLOps。
此页面列出了按工作流阶段组织的主要 DS 和 ML 功能。
探索性数据分析
Azure Databricks通过为数据科学家提供交互式、协作和 AI 辅助工具,简化了探索数据分析(EDA)。 数据科学家可以使用自然语言聊天、UI 或代码浏览数据,并且可以使用实时共同编辑和基于 Git 的代码共享进行协作。
| 类别 | Features |
|---|---|
| 用户界面 | |
| 协作 |
|
准备和提供功能
Azure Databricks 通过统一治理数据和机器学习工作负载,简化了机器学习的数据管理。 借助在 Unity Catalog 中通过细粒度访问控制统一管理的所有数据,您可以灵活调整数据工程与机器学习之间的边界,以适应您的组织需求。 可以使用任何 数据工程工具 (如 Lakeflow Spark 声明性管道)为 ML 做好准备。 功能在 功能存储 中管理,用于批量和实时服务,并且功能具有一个受管理的事实来源。
| 功能类型 | Features |
|---|---|
| 批处理功能 | |
| 实时功能 |
训练 ML 模型
Azure Databricks具有用于训练 ML 和深度学习模型的灵活工具。 预配置和可自定义的环境允许使用自定义 ML 库,无服务器 CPU 和 GPU 加速计算资源允许按需纵向扩展和横向扩展。
| 类别 | Features |
|---|---|
| 机器学习的类型 | Azure Databricks支持所有类型的 ML,包括:
|
| 计算 | |
| 环境和库 |
|
跟踪和管理试验
Azure Databricks托管的 MLflow为可重现、可审核的 ML 开发提供了基础。 其与 Unity Catalog 和 Git 的集成为数据和代码资产提供跟踪及沿袭关系。 注册表中的每个模型版本都可追溯到生成该版本的训练运行、数据集、环境和 Git 提交,从而为任何已部署的模型提供完整的审计追踪。
| 类别 | Features |
|---|---|
| 试验跟踪 | MLflow 跟踪功能会为每次训练运行记录参数、指标和工件。 比较 MLflow UI 中的运行,以确定性能最佳的配置。 |
| 模型注册表 |
Unity 目录中的模型 提供与 Unity 目录集成的 MLflow 模型注册表。 版本化的模型工件通过生命周期别名(Staging、Production)、访问控制、血缘关系和跨工作区共享进行管理。 |
| 可复现性 | 笔记本和代码可以使用 Databricks Git 文件夹 进行版本控制,并与任何 Git 提供程序集成。 |
评估和监视
Azure Databricks为生产的培训和持续监视提供灵活的评估。 将实时服务日志写入由 Unity Catalog 管理的推理表。
| 类别 | Features |
|---|---|
| Evaluation |
|
MLOps 和治理
Azure Databricks提供了用于 ML 操作(MLOps)和治理的完整工具套件。 MLOps Stacks 提供了模板,用于使用基础结构即代码实现从开发到生产的自动化可重复升级。 数据、功能、模型和终结点完全受 Unity 目录控制。
| 类别 | Features |
|---|---|
| 用于 ML 的 CI/CD | MLOps Stacks 基于 声明性自动化捆绑包,提供基于代码的管理和部署 ML 基础结构和工作流。 这包括用于自动执行训练、评估和部署的 CI/CD 模板。 |
| 工作流管理 | Lakeflow 作业 以计划管道或触发管道的形式编排多步骤机器学习工作流。 |
| 数据和模型资产治理 | Unity 目录 为数据、功能和已注册的模型提供统一的治理。 精细的访问控制、世系跟踪和审核日志适用于所有资产。 |
开源支持
Azure Databricks为开源 ML 生态系统提供完全支持。
可以在 Azure Databricks上使用任何开源 ML 框架:scikit-learn、XGBoost、LightGBM、PyTorch、TensorFlow、Hugging Face Transformers、Ray 等。 MLflow 或您的自定义工具可以以开放格式存储模型工件,这些格式可导出并在 Azure Databricks 外部运行。
MLflow是开源的,由Azure Databricks创建,由 10,000 多个组织使用。 您的实验跟踪数据、模型工件和管道定义均以开放格式存储。
数据和 AI 治理基于开源 Unity 目录 API 构建,数据存储基于开放式 Delta Lake 格式。 您的特征数据和训练数据集仍以开放、可移植的文件格式保存。