← 最新论文
💬 NLP

LakeHopper: Knowledge-Aware Adaptation of Column Type Annotators across Data Lakes

LakeHopper 通过将适配过程重新定义为一个知识管理问题,并采用标签集重对齐、LLM 验证的差异发现以及基于聚类的传播这一三步机制,解决了列类型标注器在不同数据湖之间迁移时性能退化的问题,从而在仅需极少目标监督的情况下实现了接近全量数据的质量,并避免了提示词驱动的大语言模型中常见的幻觉问题。

原作者: Yushi Sun, Xujia Li, Nan Tang, Quanqing Xu, Chuanhui Yang, Lei Chen

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Yushi Sun, Xujia Li, Nan Tang, Quanqing Xu, Chuanhui Yang, Lei Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在互联网广袤且无序的仓库中,数据静静地躺在表格里,等待着被使用。这些表格包含了从电影发行日期到大学名称的一切信息,但如果没有一个标签告诉计算机这一列究竟代表什么,这些数据就只是一堆杂乱无章的文本。系统无法得知一组名字是指“科学家”而非仅仅是“人”,也无法得知一串数字是“年份”而非“电话号码”。这种为列赋予语义含义的过程被称为列类型标注(column type annotation)。它是允许计算机搜索、清洗并合并来自不同来源数据的基石。多年来,这项工作的最佳工具是针对特定数据集训练的专门计算机程序。它们在自己的原生环境中表现出色,但一旦移动到新的数据仓库就会表现得极其糟糕,因为新环境使用了不同的标签和不同种类的信息。为每一个新的数据湖重新训练这些程序需要耗费大量的人力和财力,这往往使得数据无法被利用,从而导致大量数据被锁在其中,无法使用。

香港科技大学与蚂蚁集团的研究人员开发了一种名为 LakeHopper 的新方法,通过改变这些程序适应新环境的方式来解决这一问题。他们并没有尝试从头开始重新训练整个系统,也没有要求强大的人工智能去猜测标签,而是将这项任务视为一种知识管理问题。他们意识到,当把一个程序从一个数据湖移动到另一个数据湖时,旧知识中的一部分是无用的,必须丢弃;一部分仍然有用,但需要进行调整;还有一部分则是必须学习的新知识。他们的方法仔细地将这三种类型的知识进行了分离。它保留了程序中运行良好的部分,更新了需要调整的部分,并使用大语言模型(LLটি LLM)不作为最终决策者,而是将其作为一名严格的验证者。这个验证者负责检查程序的猜测,并仅标记出程序不确定或可能出错的列,从而确保系统只在真正需要人类帮助的具体项目上请求协助。

结果表明,该系统可以获取一个在某组数据上训练过的程序,并使其在完全不同的另一组数据集上高效运行,而仅需极小比例的常规投入。在测试中,研究人员将程序在三个不同的数据湖之间进行迁移,其中包括一个包含公共商业数据的湖,以及另一个包含科学表格的湖。他们发现,LakeHopper 能够达到几乎与在整个新数据集上进行训练相同的质量,但其所需的人工标签量不到通常情况的 6%。这实现了成本和时间的巨大缩减。此外,由于该系统依赖于专门的程序来做出最终标签,而非通用的人工智能,因此它永远不会产生超出允许类型列表之外的标签。通用人工智能模型经常会产生“幻觉”,即发明不存在的标签,导致其输出无法用于自动化流水线。LakeHopper 完全避免了这种情况,从结构上保证了每一项输出都符合要求的格式。

研究人员证明,这种方法在不同的难度水平下都能奏效。在某些情况下,新的数据湖只是在旧有的标签列表中增加了新的类型,这是一个简单的扩展。在其他情况下,新的数据湖要求系统忘记已学习的旧标签并学习全新的标签,这是一个更具挑战性的任务。即使在这些困难的场景下,LakeHopper 与标准方法相比,也能将底层程序的性能提高高达 71%。该系统也非常迅速,适应新数据的速度比其他试图对大语言模型进行微调的方法快 27 到 131 倍。这种速度源于系统不需要重新学习一切,它只需要学习已知知识与所需知识之间的特定差距。

这项工作的核心洞察在于分配给大语言模型的特定角色。以往的尝试通常要求这些模型充当主要标注员,直接猜测列的类型。研究人员发现,虽然这些模型具备广泛的通用知识,但在处理数据标注所需的特定、严苛规则方面表现较差,并且经常编造出不符合系统模式(schema)的标签。LakeHopper 扭转了这种动态关系。大语言模型仅用于验证专门程序做出的猜测。它回答的是一个简单的“是/否”问题:“这个标签正确吗?”对于模型来说,回答这个问题比从数百个选项中选择正确的标签要容易得多。通过将模型限制在验证环节,系统既能利用模型的广泛知识来识别错误,又不会冒着引入无效标签的风险。

整个过程涉及一个检查与学习的循环。系统首先调整其内部结构以匹配新的标签列表,移植与新环境共享的知识,并重置其不了解的部分。然后,它遍历新数据,寻找感到不确定的列。对于这些不确定的列,它请求验证者检查其工作。如果验证者判定标签错误或无法确定,系统会将该列标记为“困难列”。随后,它会寻找与其他困难列相似的列,并为整个这类分组请求人工标签。这使得系统能够从一个具有高度信息量的样本,而非随机样本中进行学习。在学习过程中,它在处理新数据的同时,也会记住仍需使用的旧数据,从而确保不会遗忘已掌握的知识。

这种方法解决了数据管理中的一个根本性瓶颈:标注成本。在许多现实场景中,专家们要么太忙,要么成本太高,无法为新数据湖中的每一列进行标注。LakeHopper 表明,通过聪明地分配有限的人力投入,是可以获得高质量结果的。该系统非常稳健,即使使用较小的本地运行模型作为验证器也能正常工作,这意味着它并不依赖昂贵的外部服务。这使得该技术对于那些需要管理自身敏感数据、而不愿将其发送给第三方的组织而言,具有很高的可用性。

研究证实,该方法在不同类型的数据和不同的底层程序上均能保持一致的效果。无论数据来自公共仪表板、科学表格还是代码库,系统都能有效适应。它能够处理从简单扩展现有数据到复杂转变(即整个数据性质发生变化)的各种过渡。研究人员指出,虽然该系统非常有效,但它并不是一个能完全消除人工监督需求的“万灵药”。在最困难的场景下,其准确率仍低于可以使用无限人工标注所能达到的水平,但它已足够接近实用应用的程度。这项工作代表了一种转变:不再试图构建一个适用于所有数据的单一完美模型,而是创造一个能够高效地在不同语境间转移知识的灵活流程。

通过将数据工具的适配视为一个知识管理问题,研究人员为数据集成提供了一条清晰的路径。他们表明,通过仔细识别差异并用针对性学习来填补差距,可以架起计算机已知知识与所需知识之间的桥梁。这种方法尊重了当前人工智能的局限性,将其用于擅长的领域,并避开其薄弱之处。其结果是一种实用、高效且可靠的方式,用于释放此前因成本过高而难以利用的数据湖的价值。随着数据在容量和多样性上的持续增长,像 Lake Hopper 这样的方法对于将原始信息转化为可操作的知识将变得至关重要,且无需耗费无法承受的人力劳动。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →