agent-platform-eval-flywheelGoogle官方放心用自动评测云上 AI 智能体,从建数据集到分析失败并迭代优化。
这个 Skill 基于 Google Cloud Agent Platform 的 GenAI Evaluation SDK,帮你在本地或 Notebook 里系统性评测模型与智能体。它会带你走「质量飞轮」五步:先准备 EvalCase 列表、Pandas DataFrame 或 ADK 会话轨迹等评测数据;缺数据时还能调用 generate_user_scenarios 合成场景;再执行 client.evals.evaluate() 跑推理与打分;然后分析评分细则、失败聚类和损失模式;最后给出可落地的 prompt 或代码改进建议,循环迭代直到质量达标。
适合在上线前验证智能体效果、对比修复前后指标,或冷启动无评测数据时使用。需要 GOOGLE_CLOUD_PROJECT 与 GOOGLE_CLOUD_LOCATION 环境变量,部分 Gemini 模型要设 location="global";调用评估接口会产生云端计算费用,首次运行前会先征求你的确认。
在下面找到你用的工具,复制命令粘进终端就装好了:
npx skills add google/skills 装好后不用任何配置,直接在对话里说:
我 Agent 在数学题上总出错,帮我建一个评估数据集并跑一轮评测,看哪类失败最多。 AI 检测到任务匹配时会自动加载这个 Skill,不需要手动开关。
SKILL.mdreferences/scripts/ 可以。Skill 支持用 generate_user_scenarios 根据环境描述合成场景,也支持把 ADK 会话轨迹、CSV 或 BigQuery 表转成 EvaluationDataset,三种方式按需选择。
会。client.evals.evaluate() 等调用会消耗云端 LLM 或评测服务资源,首次执行前我会询问确认;只读脚本如 inspect_results.py、compare_results.py 无需确认。
本 Skill 专注评测与迭代改进;若要做模型微调用 agent-platform-tuning,正式生产部署用 agent-platform-deploy,三个 Skill 可串联使用。