适用于:API 管理的所有层级
Azure API 管理中的 AI 网关是一组功能,可帮助你有效地管理 AI 后端。 使用这些功能来保护、缩放、监视和管理支持智能应用和工作负载的 AI 模型、代理和工具。
使用 AI 网关管理各种 AI 端点,包括:
- 远程 MCP 服务器 和 A2A 代理 API
- 自托管 模型和端点
注释
为何使用 AI 网关?
组织中的 AI 采用涉及几个阶段:
- 定义要求并评估 AI 模型
- 构建需要访问 AI 模型和服务的 AI 应用和代理程序
- 将 AI 应用和后端实现和部署到生产环境
随着 AI 采用的成熟,尤其是在大型企业中,AI 网关有助于应对关键挑战。 它可以帮助你:
- 对 AI 服务访问进行身份验证和授权
- 跨多个 AI 终结点进行负载均衡
- 监视和记录 AI 交互
- 跨多个应用程序管理令牌使用情况和配额
- 为开发人员团队启用自助服务
交通中介和控制
通过使用 AI 网关,可以:
- 控制聊天完成、响应和实时 API。
- 将现有的 REST API 公开为 MCP 服务器,并支持向 MCP 服务器传递。
- 导入和管理 A2A 代理 API。
详细信息:
API Management中的本机缩放功能
API Management还提供内置的扩展功能,以帮助网关处理大量对人工智能API的请求。 这些功能包括自动或手动添加网关 缩放单元 ,以及为多区域部署添加区域网关。 特定功能取决于API Management服务层级。
详细信息:
- 升级和扩展 API 管理实例
- 在多个区域中部署 API 管理实例
注释
虽然API Management可以缩放网关容量,但还需要缩放流量并将其分发到 AI 后端以适应增加的负载(请参阅 Resiliency 部分)。 例如,若要在多区域配置中利用系统的地理分布,应在与API Management网关相同的区域中部署后端 AI 服务。
安全和安全
AI 网关可保护和控制对 AI 接口的访问。 通过使用 AI 网关,可以:
- 使用托管标识向 Azure 中的 AI 服务进行身份验证,因此无需 API 密钥进行身份验证。
- 使用 API 管理的凭据管理器为 AI 应用和代理配置 OAuth 授权以访问 API 或 MCP 服务器。
详细信息:
复原能力
构建智能应用程序时,一个难题是确保应用程序能够应对后端故障,并能够承受高负载。 通过在 Azure API 管理 中使用 backends 配置 LLM 终结点,可以均衡它们之间的负载。 还可以定义断路器规则,以在请求不响应时停止将请求转发到 AI 服务后端。
负载均衡器
后端负载均衡器(load balancer)支持轮循、加权、基于优先级和会话感知的负载均衡。 可以定义满足特定要求的负载分发策略。 例如,在负载均衡器配置中定义优先级,以确保特定 Microsoft ai-services 终结点(尤其是作为 PTU 实例购买的终结点)的最佳利用率。
断路器
后端 断路器 具有动态行程持续时间,应用后端提供的标头中的值 Retry-After 。 此功能可确保后端的精确和及时恢复,最大限度地利用优先级后端。
详细信息:
可观测性和治理
API 管理提供全面的监视和分析功能,用于跟踪令牌使用模式、优化成本、确保符合 AI 治理策略以及排查 AI API 问题。 使用这些功能可以:
- 将提示和完成记录到 Azure Monitor 中。
- 在 Application Insights 中跟踪每个使用者的令牌指标。
- 查看内置监视仪表板。
- 使用自定义表达式配置策略。
- 跨应用程序管理令牌配额。
AI 网关功能的提前访问
作为 API 管理客户,可以通过 AI 网关早期发布渠道提前访问新功能。 通过此访问权限,您可以在最新的 AI 网关创新普遍发布之前进行试用,并提供反馈以帮助完善产品。 目前,AI 网关早期发布通道在经典Azure API 管理层中可用。
详细信息:
实验室和代码示例
体系结构和设计
- AI 网关参考体系结构使用 API Management
- AI 中枢网关启动区加速器
- 使用 Azure OpenAI 资源实现网关解决方案