GPT中文GPT中文论坛社区AI工具软件大全 GPT.CC Claude Fable 5 · GPT-5.6 直连,不用连国际网 去看看 →
AI工具软件大全
首页 / Skill 技能 / 智能体评估飞轮

智能体评估飞轮agent-platform-eval-flywheelGoogle官方放心用

自动评测云上 AI 智能体,从建数据集到分析失败并迭代优化。

作者:Google 仓库 google/skills ★ 15,198 核对于 2026-07-24
01

智能体评估飞轮 是干什么的

这个 Skill 基于 Google Cloud Agent Platform 的 GenAI Evaluation SDK,帮你在本地或 Notebook 里系统性评测模型与智能体。它会带你走「质量飞轮」五步:先准备 EvalCase 列表、Pandas DataFrame 或 ADK 会话轨迹等评测数据;缺数据时还能调用 generate_user_scenarios 合成场景;再执行 client.evals.evaluate() 跑推理与打分;然后分析评分细则、失败聚类和损失模式;最后给出可落地的 prompt 或代码改进建议,循环迭代直到质量达标。

适合在上线前验证智能体效果、对比修复前后指标,或冷启动无评测数据时使用。需要 GOOGLE_CLOUD_PROJECT 与 GOOGLE_CLOUD_LOCATION 环境变量,部分 Gemini 模型要设 location="global";调用评估接口会产生云端计算费用,首次运行前会先征求你的确认。

批量评测智能体效果从会话日志建数据集自动聚类分析失败对比修复前后指标
02

怎么装 — 一行命令

在下面找到你用的工具,复制命令粘进终端就装好了:

其他兼容 Agent
npx skills add google/skills
通用安装器,列表里选 agent-platform-eval-flywheel
03

装完第一句话怎么说

装好后不用任何配置,直接在对话里说:

我 Agent 在数学题上总出错,帮我建一个评估数据集并跑一轮评测,看哪类失败最多。

AI 检测到任务匹配时会自动加载这个 Skill,不需要手动开关。

04

安全体检 — 放心用

官方或可信来源出品,无危险脚本,按说明用即可。
装进来的是这些文件:
SKILL.mdreferences/scripts/
想装前先看一眼?去仓库读源码 →
05

配这些工具用

06

常见问题

我没有评测数据,能直接开始吗?

可以。Skill 支持用 generate_user_scenarios 根据环境描述合成场景,也支持把 ADK 会话轨迹、CSV 或 BigQuery 表转成 EvaluationDataset,三种方式按需选择。

评估会收费吗?需要每次确认吗?

会。client.evals.evaluate() 等调用会消耗云端 LLM 或评测服务资源,首次执行前我会询问确认;只读脚本如 inspect_results.py、compare_results.py 无需确认。

它和部署、微调 Skill 有什么关系?

本 Skill 专注评测与迭代改进;若要做模型微调用 agent-platform-tuning,正式生产部署用 agent-platform-deploy,三个 Skill 可串联使用。

回 Skill 技能市集,或看 Claude Code 档案 了解宿主工具。