gke-reliabilityGoogle官方放心用自动给 GKE 应用配 PDB、探针和故障域分布,提升服务稳定性。
这个技能专注于提升 GKE 集群与工作负载的可靠性。它会调用 get_cluster、get_k8s_resource、describe_k8s_resource 等 MCP 工具,先检查你的集群是否为多区域部署、节点分布和健康探针配置,然后为你生成并应用 Pod Disruption Budget(PDB)、liveness/readiness/startup 探针、优雅退出以及拓扑分布约束(Topology Spread Constraints)等 Kubernetes 清单。它遵循 Google 推荐的黄金默认值,例如区域级集群、SURGE 升级、自动修复与升级,并针对不同负载给出最小副本数建议。
适合在上线前、节点升级频繁或希望降低单点/单区故障影响时使用。它能减少自愿中断(如节点自动升级、缩容)导致的流量中断,也能帮助慢启动应用避免过早重启。注意它只管高可用配置,不处理灾难恢复或全集群备份,这类需求请使用 gke-backup-dr;同时你需要有 GKE 集群的足够权限来读取和 apply 资源。
在下面找到你用的工具,复制命令粘进终端就装好了:
npx skills add google/skills 装好后不用任何配置,直接在对话里说:
帮我把 GKE 集群里 app=my-app 的 Deployment 配成生产级高可用,包括 PDB 和探针。 AI 检测到任务匹配时会自动加载这个 Skill,不需要手动开关。
SKILL.md 本技能专注于高可用配置,如 PDB、探针和拓扑分布,用于减少日常升级或节点故障时的服务中断;而 gke-backup-dr 负责灾难恢复和全集群备份。
需要能够读取 GKE 集群信息、查看和修改 Kubernetes 资源,特别是 apply PDB、Deployment 等对象的权限。建议先在测试命名空间验证。
它会先 describe 现有 Deployment 来检查当前探针和副本数,然后基于现状给出建议或补全缺失配置,而不是盲目覆盖。