
在 Google Cloud 上运行的大多数团队不会只选择一种计算模型然后止步不前。一些服务部署在 GKE 上,因为它们需要细粒度的控制、sidecar 或 GPU 调度。另一些服务则运行在 Cloud Run 上,因为无状态的 HTTP API 不需要一个集群来照看它。越来越多的第三类工作负载加入其中:LLM 调用、MCP 工具服务器和自主代理,它们各自具有不同的流量模式和风险特征。
企业正在快速从传统的请求-响应 API 转向复合的 AI 原生生态系统。标准的 REST 和 GraphQL 端点不再仅仅被前端消费;它们被自主代理、LLM 流水线和 Model Context Protocol(MCP)服务器动态地作为工具进行查询。
与此同时,计算资源在 Google Cloud 的各个平台之间被划分。微服务运行在 Google Kubernetes Engine(GKE)上,而无服务器 API 则运行在 Cloud Run 上。

这种碎片化引发了一个关键的基础设施问题:您如何在 GKE 和 Cloud Run 之间统一执行身份验证、可观测性和成本治理,而无需维护重复的安全栈?
Kong AI Gateway 2.0 通过将 AI 基元——模型、提供者、代理和 MCP 服务器——视为一等控制平面实体,而非通用 HTTP 插件来解决这一问题。
为什么 AI 流量会打破传统 API 网关
传统 API 网关通过确定性的视角来评估流量:客户端 → 请求 → 上游 API → 响应。
相比之下,AI 架构执行的是非线性的、代理驱动的循环:

管理此流量需要标准代理层所缺乏的能力:
基于令牌的速率限制: 根据输入/输出令牌量而不是原始请求次数来执行配额。
语义防护: 实时提示检查、模型路由和凭证抽象。
动态工具治理: 保护工具的运行时发现,而不仅仅是它们的直接 HTTP 调用。
AI 网关 2.0 抽象模型
Kong AI Gateway 2.0 使用专用的架构抽象取代下游插件附加:
AI 模型提供者 & 模型: 解耦的后端,负责管理上游连接池、故障转移和凭证路由。
AI MCP 服务器: 代表工具提供者的一等实体。
AI 代理 & A2A 路由: 用于多代理协商的安全通道。
AI 消费者 & 策略: 感知身份的边界,用于管控消费、提示防护和访问权限。

通过将配置(Kong Konnect)与数据平面解耦,运行时操作可以在私有网络中独立扩展,而不会将配置平面直接暴露给数据流。
在 Google Cloud 运行时环境中部署

Google Kubernetes Engine (GKE)
GKE 作为复杂的有状态微服务、内部代理和编排引擎的骨干。
Kubernetes 原生配置: 通过 Kong Kubernetes Operator (KKO) 部署数据平面,并直接通过 CRDs 配置模型或策略。
工作负载身份联合: 数据平面通过 Workload Identity 继承 Google Cloud IAM 角色,在上游身份验证时消除静态服务帐户密钥。
Cloud Run
Cloud Run 为事件驱动的 Webhook、短暂的 MCP 工具和轻量级推理端点提供高密度执行。
Centralized Security Layer: 将 Cloud Run 服务锁定到私有内部入口,通过 Kong AI Gateway 路由所有入站客户端和代理请求以进行身份验证和日志记录。
Unified Surface: 基于 GKE 的服务和 Cloud Run 端点位于同一面向消费者的命名空间下。
Integrating Vertex AI and Gemini Models
与其将 Google Cloud 服务帐户密钥分发给各个应用,不如通过 Kong AI Gateway 路由模型消费:

IAM-Backed Egress: 网关通过 GCP Workload Identity 管理 OAuth 令牌的生成,以直接与 Vertex AI 标准版和企业版端点交互。
Virtual Models & Fallbacks: 在网关层配置回退链(例如,主 Gemini Ultra 回退到 Gemini Flash),无需更改客户端代码。
Identity-Aware Routing: 将内部团队路由到标准层级,同时为关键任务应用分配高吞吐、低延迟的资源。
Advanced AI Controls: MCP 捆绑 & 代理间安全
MCP Server Bundling & Scoped Discovery
与其让代理与数十个独立的工具端点建立连接,Kong 将工具命名空间聚合到一个统一的端点:

Discovery Filtering: 网关拦截工具列表协商。如果代理缺少计费工具的权限,则该功能会从 MCP 发现响应中移除,以防止幻觉或未经授权的执行。
Agent-to-Agent (A2A) Governance
当专门的代理在微服务边界之间进行通信时,Kong AI Gateway 会建立相互身份验证,追踪执行图,并应用速率限制策略以防止无限制的递归循环:


生产环境多运行时架构
在 Google Cloud 上部署 Kong AI Gateway 2.0,可以将运行时基础设施的选型与 AI 治理需求解耦。GKE 负责容器编排,Cloud Run 提供弹性的无服务器执行环境,Vertex AI 则为模型推理提供算力。Kong AI Gateway 2.0 将整个生态串联起来,提供一个统一的控制平面,用于保障并路由现代 AI 流量。

