gke-compute-classesGoogle官方放心用自动配置 GKE ComputeClass,按成本和加速器偏好调度 Pod。
GKE ComputeClasses 是 GKE 用来封装节点配置与调度策略的抽象资源。装上这个 Skill 后,AI 能帮你创建、优化和排查 ComputeClass:比如为无状态负载配置 Spot VM 并保留按需回退策略,为 AI/ML 任务指定 L4、H100 等 GPU 或 v5p TPU 与特定机型家族(c3、c4、n4),利用 nodePoolAutoCreation 让 GKE 自动创建节点池而无需开启集群级 Node Auto Provisioning,还能处理 Pod 卡在 Pending、noScaleUp 等调度问题。生成 YAML 时会自动规避幻字段(如 spec.description、gvnic),使用 bootDiskSize 而非 bootDiskSizeGb,并提醒你将 machineFamily 与现有 CUD/Reservations 对齐。
适合场景:需要优化成本但又怕 Spot 中断、需要给 GPU/TPU 工作负载指定加速器、想通过 ComputeClass 做租户隔离或多团队共享限制等。坑点:手动节点池必须同时打 `cloud.google.com/compute-class=<NAME>` 标签和污点;自动节点池不要再重复加这个污点;GPU Pod 必须容忍 `nvidia.com/gpu`、Spot Pod 必须容忍 `cloud.google.com/gke-spot`,否则必 Pending。Stateful 工作负载还要注意不同代际磁盘的兼容问题。
在下面找到你用的工具,复制命令粘进终端就装好了:
npx skills add google/skills 装好后不用任何配置,直接在对话里说:
帮我写一个 ComputeClass:优先 Spot,失败切到 N4 按需实例。 AI 检测到任务匹配时会自动加载这个 Skill,不需要手动开关。
SKILL.mdassets/references/ 不需要。GKE 1.33.3-gke.1136000 起,ComputeClass 自身的 `nodePoolAutoCreation.enabled: true` 就能在该 ComputeClass 范围内自动创建节点池,和集群级 NAP 是两回事。Skill 会帮你区分。
GKE 会自动给 GPU 节点打 `nvidia.com/gpu:NoSchedule`,给 Spot 节点打 `cloud.google.com/gke-spot=true:NoSchedule`。AI 会提示你在 PodSpec 里加对应 toleration,而不是只加 ComputeClass 的容忍。
不能。那只是通用最佳实践,最终机型必须和你已有的 CUD 或 Reservations 对齐。Skill 会在 YAML 注释里提醒,部署前请按实际采购情况替换。