结构化数据的基座模型:关系深度学习如何重塑企业预测建模
中文主题
本期播客深入探讨了企业关系型数据库和结构化数据在AI时代下的技术变革。嘉宾剖析了传统预测建模依赖人工特征工程的局限性,并阐述了“关系深度学习”(Relational Deep Learning)如何通过将多表数据库建模为图结构,并利用图Transformer(Graph Transformer)实现端到端的特征自适应学习,从而开创表格式数据基座模型的新范式。
基本信息
- 节目:Software Engineering Daily
- 嘉宾:Jure Leskovec(Stanford University 计算机科学教授,Kumo.AI 联合创始人,曾任 Pinterest 首席科学家)
- 日期:2026-06-23
- 来源:Software Engineering Daily
- 链接:https://softwareengineeringdaily.com/2026/06/23/foundation-models-for-structured-data/
核心观点
企业中最具商业价值的结构化关系数据,长期受困于“单任务单模型”和繁重人工特征工程的旧有技术范式。关系深度学习(Relational Deep Learning, RDL)通过将多表关系数据库映射为统一的图拓扑结构,使自注意力机制能够跨表、跨Schema自动学习特征表征。这终结了数据科学家手动编写SQL提取特征的繁重工作,并让结构化数据拥有了类似于自然语言处理(NLP)领域的泛化基座模型,使得跨任务的零样本预测与快速微调在企业核心预测业务中成为现实。
Highlights
- 人工特征工程的生产力瓶颈:传统企业预测模型(如XGBoost、CatBoost等树模型)的性能上限取决于数据科学家手动编写SQL聚合特征的质量,导致开发和维护单个任务模型通常需要两名全职员工的持续投入,极大地限制了企业AI的规模化部署。
- 关系深度学习(RDL)的图表征机制:RDL将关系数据库的表视为图的节点,外键关联视为图的边,从而将关系型数据库整体转换为一张异构图。图Transformer可直接在多表网络中通过自注意力机制进行端到端的信息聚合与表征学习,避免了人工拼接(Join)表格时的信息流失。
- 与Text-to-SQL的技术分水岭:Text-to-SQL主要辅助人类对历史数据进行定性检索和聚合,无法直接进行未来的行为概率预测;而RDL模型旨在直接从多表拓扑中捕获潜在分布,解决欺诈检测、流失预测等需要定量推理的预测性建模任务。
- 跨Schema的结构化基座模型泛化:表格式数据基座模型通过在大量多样化的关系图结构上进行预训练,学习局部子图的信息传播和结构规律。在应用时,该模型能以“模式无关”(Schema-agnostic)的机制快速连接不同的数据库,通过预测查询(Predictive Query)直接输出预测值。
长文笔记
1. 传统企业预测建模的瓶颈与特征工程困局
在现代企业决策系统中,预测性建模(如反欺诈检测、贷款审批、推荐系统)通常运行在保存在关系型数据库中的结构化数据之上。然而,与计算机视觉和自然语言处理经历的端到端深度学习变革不同,结构化数据的建模在过去几十年中依然停留在“特征工程+树模型”(如XGBoost、CatBoost、LightGBM)的阶段。
在这种传统范式下,一个预测任务的生命周期是极度割裂和低效的。数据科学家必须基于自身的领域知识,手动编写大量的SQL查询,跨越数十张相互关联的表格进行拼接和聚合。例如,为了预测用户的流失率,开发人员需要手动构建特征:“该用户在过去7天内登录了多少次?”“过去30天的平均消费额是多少?”“其常用设备在特定时段的交易频次如何?”
这种模式存在两个核心致命缺陷:
- 开发与维护成本极其昂贵:平均而言,企业中每两名全职员工(FTE)仅能支持和维护一个生产环境中的预测模型。如果企业需要运行数十个甚至数百个预测模型,人力成本将呈指数级增长。
- 特征选择的局限性与信息丢失:手动定义的特征只是数据科学家对客观事实的近似假设,而在多表连接和数据降采样、聚合的过程中,大量富含预测价值的微观行为和关联信息已经被永久丢弃。
2. 关系深度学习(RDL):从“表格连接”到“图拓扑表征”
为了打破这一僵局,关系深度学习(Relational Deep Learning)提出了全新的视角:不要将数据库看作是孤立的数据表,而是将其视为一张天然的异构图。
在这个新框架中:
- 关系型数据库中的每一行数据(如具体的某个用户、某件商品、某笔交易)都是图中的一个节点(Node)。
- 数据库表之间的主外键关联(Primary-Foreign Key Relationships)直接定义了节点之间的边(Edge)。
例如,用户表(Users Table)中的一个用户节点,通过“交易表(Transactions Table)”中的交易记录节点,与商品表(Products Table)中的商品节点相连。这样,原本分散在多张表中的断裂数据,便在图空间中被有机地编织成了一个高度互联的网络。
为什么传统的语言大模型(LLM)无法直接解决这个问题?
许多人直觉上认为,可以通过将表格数据序列化为文本(如JSON格式),然后直接输入给LLM进行推理。Jure Leskovec 明确指出了这种方法的局限性:
- 定性推理 vs 定量推理:LLM的设计目标是进行定性的、符合人类常识的语言推理,而企业数据库中充斥着大量的数值信息、时间序列和交易频率。LLM并不擅长在缺乏结构上下文的情况下对大规模数字和高维关联关系进行精准的定量推理。
- Schema展平与信息泛滥:将具有复杂拓扑结构的数据库展平成一维的文本数据输入,会导致输入长度迅速爆炸,不仅超出了大模型的上下文窗口限制,也破坏了原有的多维网络路径,使得自注意力机制难以在离散的文本标记中有效重建表格之间的网状关联。
3. 图Transformer如何泛化注意力机制
图神经网络(GNN)是处理图结构数据的经典架构,但传统GNN在处理大规模多表关系数据时同样面临挑战。传统的GNN采用消息传递(Message Passing)机制,其信息流动受限于物理图的直接连边。
为了克服这些限制,研究人员将自注意力机制(Self-Attention)泛化到结构化数据库的异构图拓扑之上,引入了**图Transformer(Graph Transformer)**架构。这一演进带来的核心技术提升包括:
- 动态相关性学习:不同于GNN仅能在直接相邻的节点间传播信息,图Transformer允许节点不仅关注其直接相连的实体,还能在一个更广泛的局部子图(Local Sub-graph)上下文中,动态计算不同节点之间的注意力权重。
- 结构化位置编码(Structural Position Encoding):为了让模型理解数据库中不同表之间的层级和路径关系,图Transformer结合了结构化位置编码技术,使得模型能够区分“一直接相连的交易节点”和“通过两层关系相连的商户类别节点”在空间距离和逻辑深度上的差异。
- 端到端的自适应特征提取:图Transformer直接对图进行端到端的梯度反向传播。这意味着,模型不再依赖人工设计“过去30天消费均值”这样的特征,而是能够在大规模网络参数中自动学习如何组合时间戳、数值和外键关系,从而提取出对最终预测目标最有利的表征。
4. 表格式数据基座模型的构建与在屏推理机制
在自然语言处理中,我们可以使用一个预训练好的大模型来回答各类完全不同的问题。在结构化数据领域,实现这种“一个模型服务多个不同Schema和不同预测任务”的关键,在于构建模式无关(Schema-agnostic)的表格式数据基座模型。
基座模型的泛化原理与预训练方式
基座模型之所以能跨越不同的数据库Schema工作,是因为它在预训练阶段被输入了海量、多样化的多表图结构(包含合成数据和真实数据库)。模型在训练中所学习的,并不是某张特定表的列名含义,而是结构化的元模式(Meta-patterns):
- 信息如何在异构分支结构中传导和聚合。
- 不同实体(如用户、实体对象)交互时展现的拓扑行为模式。
- 数值和时间序列的局部分布规律。
在训练时,研究人员基于图中的实体特征和拓扑结构定义各种自监督学习任务,迫使网络去理解局部图结构的语义特征。
预测查询(Predictive Query)的工业实践
在实际生产中部署此类基座模型时,数据的接入与推理流程得到了极大的简化。整个过程不再涉及复杂的特征开发,而是转变为类似LLM的“Prompt”机制,在RDL中这被称为预测查询(如 Kumo.AI 使用的声明式预测查询语言):
- 直接接入数据库:将基座模型连接到企业当前的多表关系数据库,将其自动解析为图拓扑结构。
- 声明预测目标:用户无需编写特征提取SQL,只需声明业务目标。例如,使用声明式语言描述:“预测每一个
User实体,在未来30天内,Transactions表中关联记录数量是否为零(即流失预测)。” - 模型推理与生成预测:基座模型会自动根据目标实体(User)在数据库图中的局部子图,运行图Transformer的前向传播过程,直接输出每个用户的流失概率。
对于延迟要求极高或吞吐量极大的工业生产线(如实时在线反欺诈),虽然可以使用超大型基座模型进行直接推理,但工程上的主流实践是:将大型基座模型作为出色的表征学习器,针对具体任务进行少样本微调(Few-shot Fine-tuning)或知识蒸馏,生成轻量级的专用模型部署到前线,从而在确保预测精度的同时,实现低延迟和低推理成本。
