跳转到正文
bhwa233 博客
返回

Software Engineering Daily:结构化数据的基座模型:关系深度学习如何重塑企业预测建模

更新于:8 分钟阅读
编辑页面
Software Engineering Daily:结构化数据的基座模型:关系深度学习如何重塑企业预测建模

结构化数据的基座模型:关系深度学习如何重塑企业预测建模

中文主题

本期播客深入探讨了企业关系型数据库和结构化数据在AI时代下的技术变革。嘉宾剖析了传统预测建模依赖人工特征工程的局限性,并阐述了“关系深度学习”(Relational Deep Learning)如何通过将多表数据库建模为图结构,并利用图Transformer(Graph Transformer)实现端到端的特征自适应学习,从而开创表格式数据基座模型的新范式。

基本信息

核心观点

企业中最具商业价值的结构化关系数据,长期受困于“单任务单模型”和繁重人工特征工程的旧有技术范式。关系深度学习(Relational Deep Learning, RDL)通过将多表关系数据库映射为统一的图拓扑结构,使自注意力机制能够跨表、跨Schema自动学习特征表征。这终结了数据科学家手动编写SQL提取特征的繁重工作,并让结构化数据拥有了类似于自然语言处理(NLP)领域的泛化基座模型,使得跨任务的零样本预测与快速微调在企业核心预测业务中成为现实。

Highlights

长文笔记

1. 传统企业预测建模的瓶颈与特征工程困局

在现代企业决策系统中,预测性建模(如反欺诈检测、贷款审批、推荐系统)通常运行在保存在关系型数据库中的结构化数据之上。然而,与计算机视觉和自然语言处理经历的端到端深度学习变革不同,结构化数据的建模在过去几十年中依然停留在“特征工程+树模型”(如XGBoost、CatBoost、LightGBM)的阶段。

在这种传统范式下,一个预测任务的生命周期是极度割裂和低效的。数据科学家必须基于自身的领域知识,手动编写大量的SQL查询,跨越数十张相互关联的表格进行拼接和聚合。例如,为了预测用户的流失率,开发人员需要手动构建特征:“该用户在过去7天内登录了多少次?”“过去30天的平均消费额是多少?”“其常用设备在特定时段的交易频次如何?”

这种模式存在两个核心致命缺陷:

2. 关系深度学习(RDL):从“表格连接”到“图拓扑表征”

为了打破这一僵局,关系深度学习(Relational Deep Learning)提出了全新的视角:不要将数据库看作是孤立的数据表,而是将其视为一张天然的异构图。

在这个新框架中:

例如,用户表(Users Table)中的一个用户节点,通过“交易表(Transactions Table)”中的交易记录节点,与商品表(Products Table)中的商品节点相连。这样,原本分散在多张表中的断裂数据,便在图空间中被有机地编织成了一个高度互联的网络。

为什么传统的语言大模型(LLM)无法直接解决这个问题?

许多人直觉上认为,可以通过将表格数据序列化为文本(如JSON格式),然后直接输入给LLM进行推理。Jure Leskovec 明确指出了这种方法的局限性:

3. 图Transformer如何泛化注意力机制

图神经网络(GNN)是处理图结构数据的经典架构,但传统GNN在处理大规模多表关系数据时同样面临挑战。传统的GNN采用消息传递(Message Passing)机制,其信息流动受限于物理图的直接连边。

为了克服这些限制,研究人员将自注意力机制(Self-Attention)泛化到结构化数据库的异构图拓扑之上,引入了**图Transformer(Graph Transformer)**架构。这一演进带来的核心技术提升包括:

4. 表格式数据基座模型的构建与在屏推理机制

在自然语言处理中,我们可以使用一个预训练好的大模型来回答各类完全不同的问题。在结构化数据领域,实现这种“一个模型服务多个不同Schema和不同预测任务”的关键,在于构建模式无关(Schema-agnostic)的表格式数据基座模型

基座模型的泛化原理与预训练方式

基座模型之所以能跨越不同的数据库Schema工作,是因为它在预训练阶段被输入了海量、多样化的多表图结构(包含合成数据和真实数据库)。模型在训练中所学习的,并不是某张特定表的列名含义,而是结构化的元模式(Meta-patterns)

在训练时,研究人员基于图中的实体特征和拓扑结构定义各种自监督学习任务,迫使网络去理解局部图结构的语义特征。

预测查询(Predictive Query)的工业实践

在实际生产中部署此类基座模型时,数据的接入与推理流程得到了极大的简化。整个过程不再涉及复杂的特征开发,而是转变为类似LLM的“Prompt”机制,在RDL中这被称为预测查询(如 Kumo.AI 使用的声明式预测查询语言):

  1. 直接接入数据库:将基座模型连接到企业当前的多表关系数据库,将其自动解析为图拓扑结构。
  2. 声明预测目标:用户无需编写特征提取SQL,只需声明业务目标。例如,使用声明式语言描述:“预测每一个 User 实体,在未来30天内,Transactions 表中关联记录数量是否为零(即流失预测)。”
  3. 模型推理与生成预测:基座模型会自动根据目标实体(User)在数据库图中的局部子图,运行图Transformer的前向传播过程,直接输出每个用户的流失概率。

对于延迟要求极高或吞吐量极大的工业生产线(如实时在线反欺诈),虽然可以使用超大型基座模型进行直接推理,但工程上的主流实践是:将大型基座模型作为出色的表征学习器,针对具体任务进行少样本微调(Few-shot Fine-tuning)或知识蒸馏,生成轻量级的专用模型部署到前线,从而在确保预测精度的同时,实现低延迟和低推理成本。


编辑页面
分享这篇文章:

上一篇
Software Engineering Daily:打造人们喜爱的软件:工程与设计的协同艺术
下一篇
最高法院再次擴張總統權力:如何在行政效能與機構獨立間尋求平衡?