gke-batch-hpcGoogle官方放心用在 GKE 上跑批量任务和 HPC 计算,自动排队、并行执行与资源调度。
该技能帮你把批处理和高性能计算(HPC)工作负载部署到 GKE 上。它基于 Kubernetes Job、JobSet 和 Kueue 实现任务的并行执行与队列调度,支持 MPI 作业的分布式运行,并可通过紧凑放置(Compact Placement)降低节点间通信延迟。你只需告诉 AI 任务需求和资源配置,它就能帮你生成并应用 YAML 清单、查看 Pod 日志与事件、管理队列配额,适合 CFD、分子动力学、金融建模和 ML 训练等场景。
适合已有 GKE 集群、需要周期性跑批量任务或分布式计算的团队。使用前请确认集群已启用 JobSet 监控、Kueue 队列或 MPI Operator 等组件;同时建议为 Job 设置资源请求/限制、backoffLimit 和 checkpoint 机制,配合 Spot VM 与 scale-to-zero 进一步降低成本。
在下面找到你用的工具,复制命令粘进终端就装好了:
npx skills add google/skills 装好后不用任何配置,直接在对话里说:
帮我创建一个并行的 GKE 批处理 Job,用 Kueue 队列分配 CPU 和内存资源。 AI 检测到任务匹配时会自动加载这个 Skill,不需要手动开关。
SKILL.md 本技能专注批处理和 HPC 工作负载,如 Job、Kueue 队列和 MPI 作业;gke-app-onboarding 用于部署常驻的 Web 应用、无状态服务等标准应用。
根据场景需要 Kueue、MPI Operator 或启用 JobSet 监控。AI 会通过 kubectl apply 帮你应用 YAML 清单,但前提是集群已有对应 CRD 和权限。
建议为 Job 设置 backoffLimit,并在应用层实现 checkpoint(如 PyTorch checkpointing),同时可利用 Spot VM 的 activeMigration 在资源恢复后切回。