闲社

标题: Google将TabFM接入BigQuery:一条SQL完成表格预测 [打印本页]

作者: fleaf32    时间: 2026-9-7 12:02
标题: Google将TabFM接入BigQuery:一条SQL完成表格预测
【事件概述】
Google Cloud 于 2026 年 9 月 1 日把 Google Research 的表格基础模型 TabFM 以预览形式接入 BigQuery。用户可以直接用 AI.PREDICT 和 AI.EVALUATE 两个 SQL 函数完成表格分类或回归,不必为每个数据集单独训练、调参和部署传统机器学习模型。

【模型与开发者】
模型:TabFM
开发者:Google Research
本次事件:TabFM 在 BigQuery 中开放预览
官方上线日期:2026 年 9 月 1 日
原始模型介绍日期:2026 年 6 月 30 日
任务类型:表格数据分类、回归
调用方式:BigQuery AI.PREDICT、AI.EVALUATE
当前状态:Preview,受 Pre-GA 条款约束

日期核对说明:Google Research 最早在 2026 年 6 月 30 日介绍并开放 TabFM;本轮最近动态是 Google Cloud 于 9 月 1 日宣布 TabFM 已原生进入 BigQuery 预览。本文不会把 9 月 1 日误写成模型首次问世日期,也不会把 6 月的旧发布当作最近七天新模型。

【关键能力与改动】
1. 无需单独训练:TabFM 把带标签的历史表格和待预测表格当作上下文示例,在一次前向过程中学习列与行之间的关系并生成预测,不更新底层模型权重。
2. SQL 直接调用:AI.PREDICT 接收历史训练表和预测表,可执行回归或分类;AI.EVALUATE 用于计算回归的 R2、平均绝对误差等指标,或分类的准确率、精确率、召回率和 F1。
3. 自动处理表格特征:Google Cloud 称 BigQuery 中的 TabFM 会处理缺失值、类别编码等特征化工作,减少额外建立特征工程流水线的需求。
4. 分布式推理:BigQuery 使用分布式并行推理、训练数据采样与分布式执行来处理大规模预测表。官方称可在数分钟内处理最高达百万行级别的推理表,但实际耗时仍取决于数据量、配额和查询环境。
5. 支持智能体应用:业务智能体可通过 BigQuery MCP Server 连接表格数据,再调用 TabFM 完成客户流失、购买意向、风险分数等预测,省去单独维护训练服务。
6. 零样本表格基础模型:TabFM 使用交替的行注意力和列注意力表示表格关系,把每一行压缩成向量,再由专门的 Transformer 在行向量序列上执行上下文学习。
7. 合成数据预训练:Google Research 介绍,模型完全在数亿个由结构因果模型动态生成的合成数据集上训练,以覆盖不同分布和特征关系,同时避免依赖企业私有表格。

【适用对象】
适合数据已经存放在 BigQuery、希望快速建立分类或回归基线的分析师和数据团队。例如客户流失预测、购买意向、欺诈风险、运营分群和质量评分等任务,可以先通过 SQL 验证模型是否有用,再决定是否投入完整机器学习工程。

Google 建议在历史数据规模为小到中等、数据变化频繁、需要经常重新适配,或需要为对话式与智能体流程临时生成预测时考虑 TabFM。若拥有超大历史数据、需要精细调参、特征数量很多,或必须解释每个特征对结果的贡献,传统 XGBoost 等模型可能更合适。

【实际影响】
过去,表格预测通常需要数据抽取、特征处理、训练、超参数搜索、模型注册和在线部署。TabFM 接入 BigQuery 后,分析人员可以在数据仓库内部提交一条 SQL,把带标签样例作为上下文并直接获得新行预测,缩短从分析问题到初步结果的路径。

这并不意味着数据科学流程被完全替代。可靠上线仍需要划分训练与测试时间窗口、避免标签泄漏、选择业务相关指标、设置决策阈值并监控数据漂移。TabFM 更适合作为快速预测能力和强基线,而不是跳过验证的捷径。

【使用方式简述】
AI.PREDICT 需要一张含标签列的历史表,以及列结构匹配的待预测表;如果标签列不叫 label,可以通过 label_col 指定。生成预测后,可用 AI.EVALUATE 在留出数据上读取回归或分类指标,再与现有模型及简单规则进行比较。

BigQuery 文档把这项功能标记为预览。预览期间,Enterprise 或 Enterprise Plus 版按 Slot 计费,按需用户按查询扫描字节计费;官方计划后续增加 TabFM Token 计费。实际收费规则可能变化,使用前应查阅最新定价文档。

【限制与使用提醒】
第一,当前每份数据最多支持 20 个特征列,分类任务最多 10 个类别。特征或类别超过限制时不能直接照搬,应联系 Google 支持或改用其他方案。

第二,TabFM 在 BigQuery 中仍是 Preview,适用 Pre-GA 条款,可能存在功能变化、区域差异和有限支持。关键生产业务不应在没有回退方案的情况下依赖预览功能。

第三,零训练不等于零数据准备。历史表仍需要正确标签、统一列类型、合理时间切分和缺失值检查;错误标签、未来数据泄漏或分布偏移会让评估结果虚高。

第四,模型完全使用大规模合成数据预训练。合成训练提升了覆盖面,但真实企业中的极端分布、罕见类别、监管规则和业务因果关系未必能被正确表示,必须用真实留出集验证。

第五,Google 官方给出的基准结论来自 TabArena 等指定数据集与评测配置,不代表对每一张业务表都优于经过专家调优的传统模型。本文不把官方排名改写成普遍保证。

第六,TabFM 不适合要求完整特征重要性解释的场景。贷款、医疗、保险、招聘和执法等高风险决定应使用可审计流程、人工复核和领域合规评估,不能仅凭模型分数自动作出结论。

第七,BigQuery 中的敏感数据应继续遵守访问控制、数据驻留、最小权限和审计要求。通过 MCP 或智能体调用预测函数时,还要限制可访问的数据集和可执行的 SQL。

第八,分类和回归指标必须与业务损失对应。准确率在类别不平衡时可能具有误导性,回归的平均误差也可能掩盖少数高风险样本,应同时检查分组表现、置信度与实际业务成本。

【官方来源】
Google Cloud 官方公告:https://cloud.google.com/blog/products/data-analytics/tabfm-adds-predictive-ml-to-bigquery
Google Cloud AI.PREDICT 文档:https://docs.cloud.google.com/bigquery/docs/reference/standard-sql/bigqueryml-syntax-ai-predict
Google Research TabFM 原始介绍:https://research.google/blog/introducing-tabfm-a-zero-shot-foundation-model-for-tabular-data/




欢迎光临 闲社 (https://www.xianshe.com/) Powered by Discuz! X5.0