An Agentic Hybrid Top-Down and Bottom-Up Approach to Knowledge Graph Generation
本文提出了一种智能体混合流水线,该流水线结合了 Wikidata 的自上而下对齐与自下而上的反思,旨在从嘈杂、非结构化的 HR 数据中自主生成一个可扩展、具备自愈能力的跨语言技能知识图谱。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,互联网是一个巨大的、混乱的图书馆,每个人都在大声喊叫着自己的专长。有些人说完美的英语,有些人说法语、德语或西班牙语,还有些人使用的是尚未发明的俚语。在招聘的世界里,这个图书馆简直一团糟。如果一家公司想要寻找一名“项目经理”(Project Manager),他们可能会错过一位优秀的候选人,因为对方写的是“Web Project Management”(网页项目管理)或“Gestion de Projet”(法语中的项目管理),而计算机并不知道这些词组表达的是同一个意思。这正是**知识图谱(Knowledge Graphs)**发挥作用的地方。把知识图谱想象成一张高度有序的地图,它将各种概念连接在一起。它不仅仅是一个单词列表,而是一个网络,其中“项目管理”(Project Management)是一个巨大的中心枢纽,而“网页项目管理”(Web Project Management)则是悬挂在其上的一个较小的分支。其目标是将那个嘈杂喧嚣的混乱图书馆转化为一张清晰、准确的地图,从而让计算机真正能够帮助人类找到合适的工作。
但构建这张地图非常困难。你可以尝试“自上而下”地绘制它,使用一套严格的规则手册(比如政府发布的职业清单),但这会错过那些尚未被收录在规则手册中的酷炫、新颖且奇特的职业。或者,你可以尝试“自下而上”地构建它,让计算机自行猜测并进行分组,但这往往会导致一个混乱的局面,计算机可能会凭空捏造出虚假的职业,或者将同一个职业拆分为十个不同的名称。本文介绍了一种巧妙的新方法来构建这张地图,它结合了两种方法的优点:为已知事物提供严格的规则手册,并为新事物配备一个智能的、具备自我纠错能力的机器人团队。
研究人员与欧洲自由职业者平台 Malt 合作,构建了一个表现得像“侦探机器人团队”一样的系统。他们称之为“代理混合式”(Agentic Hybrid)方法。其运作方式如下:首先,系统接收到一个由人类输入的杂乱技能描述,例如“gestion de projet web”(法语中的网页项目管理),并尝试将其匹配到一个受信任的、预先存在的地图——Wikidata。把 Wikidata 想象成“事实的维基百科”,是机器人完全信任的权威来源。如果该技能与 Wikidata 中的内容相匹配,太棒了!机器人会将其锁定到位,确保其在他们关注的五种语言(英语、法语、德语、荷兰语和西班牙语)中保持准确且一致。
但如果这个技能是全新的,在 Wikidata 中并不存在呢?这就是“代理式”(Agentic)部分大显身手的地方。系统不会直接放弃或胡编乱造,而是使用一种特殊的“反思”(reflection)循环。想象一个机器人写了一份草稿,然后停下来问自己:“等等,这对吗?它符合其他技能吗?”如果机器人意识到某个技能过于具体,无法归入主要的“项目管理”范畴,它并不会将其丢弃。相反,它会为该技能创建一个新的、特殊的“孤儿”分支。它会给这个新分支一个唯一的 ID 和一个清晰的名称,比如“Web Project Management”,并将其链接回主枢纽。系统随后会反复运行这个过程,检查自己的工作,合并重复项,并清理混乱,直到地图尽可能准确为止。
论文显示,这种方法效果非常好,但它并非魔法——它是严谨的。他们利用来自真实自由职业者的超过 36,000 条原始且杂乱的技能描述进行了测试。系统成功组织了其中的绝大部分,但也诚实地对待了它无法处理的部分。在总数中,大约有 19% 的技能匹配尝试属于“错误猜测”,因为输入内容过于混乱或具有歧义。此外,系统还主动拒绝了另外 13.7% 的输入,因为系统判定它们并非有效的技能(例如出现“NOT_A_SKILL”错误)或属于语义噪声。然而,对于那些成功处理的数据,结果令人印象深刻:它清理并组织了 27,743 条输入,将其归类为约 13,300 个清晰、标准的技能类别。这意味着对于有效数据,它将混乱程度降低了一半以上,将数千个令人困惑的变体转化为了一个整齐、结构化的列表。更棒的是,该系统能够完美地使用所有五种语言,创建了 66,490 个标准化的标签,使得法语使用者和德语使用者能够找到同一份工作。
研究人员发现,他们的“混合式”方法比单纯使用严格规则手册或仅仅让计算机自行猜测要好得多。通过将已知技能锚定在 Wikidata 上,他们避免了计算机捏造虚假职业的问题(即“幻觉”问题)。通过使用针对新技能的“反思”循环,他们没有错过那些规则手册尚未捕捉到的新兴职业。其结果是一个活生生的、可以随着就业市场变化而更新的技能地图,这使得公司更容易找到合适的人才,人们也更容易找到合适的工作。这就像拥有一位不仅熟悉图书馆里每一本书,而且能瞬间知道如何归档刚刚到货的新书的图书管理员,确保无论人们使用哪种语言都能找到它——同时,在不确定时,她也能准确地说出“我不确定这是什么”,而不是盲目猜测。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。