bigquery-bigframesGoogle官方放心用让 AI 用 BigQuery DataFrames 写 Python,在 BigQuery 上做 pandas 式的数据清洗、转换和机器学习。
该技能让 AI 按照 BigQuery DataFrames(BigFrames)的 pandas 风格 API 生成 Python 代码。你可以在 Notebook 里像操作本地 DataFrame 一样读取 BigQuery 表、完成数据清洗、转换、聚合统计,甚至调用 bigframes.bigquery.ml 训练线性/逻辑回归等模型。它会遵循 BigFrames 最佳实践:开启 partial ordering 模式以加速计算,用 peek() 随机采样预览数据而非 head(),优先使用 str/dt 等内置访问器而不是 UDF 或 lambda,主动用 .dtypes 与 .peek() 校验 Schema,并尽量把计算留在 BigQuery 云端延迟执行,避免把大数据拉到本地。
适合已经在使用 BigQuery、需要处理超出本地内存的大数据集,或习惯 pandas 语法又想利用 BigQuery 弹性算力的数据分析师和机器学习用户。不适合 SQL-first 工作流或需要直接调用 google-cloud-bigquery 客户端的场景,那种情况请选 bigquery-basics。使用前需要准备好 GCP 项目、BigQuery 权限和计费;注意在 partial ordering 模式下未排序时 head() 会失败,也不要轻易对大数据调用 to_pandas(),否则容易内存溢出。
在下面找到你用的工具,复制命令粘进终端就装好了:
npx skills add google/skills 装好后不用任何配置,直接在对话里说:
帮我把 public_dataset 里的 sales 表用 BigFrames 读取,并按 region 分组统计销售额。 AI 检测到任务匹配时会自动加载这个 Skill,不需要手动开关。
SKILL.mdreferences/ 它优先用 DataFrame API 生成 Python 代码。如果你的工作流以 SQL 为主,或需要直接操作 google-cloud-bigquery 客户端,应该选 bigquery-basics。
只要遵循最佳实践、不随意 to_pandas(),计算都会下推到 BigQuery 执行,本地不会加载全量数据。需要本地绘图时先聚合或采样。
不需要。应该用 bigframes.bigquery.ml,训练由 BigQuery ML 完成;旧的 bigframes.ml 已不建议用于新项目。