← 최신 논문
💬 NLP

An Agentic Hybrid Top-Down and Bottom-Up Approach to Knowledge Graph Generation

이 논문은 노이즈가 있는 비정형 HR 데이터로부터 확장 가능하고 자가 치유가 가능한 다국어 스킬 지식 그래프를 자율적으로 생성하기 위해, Wikidata의 하향식 그라운딩(top-down grounding)과 상향식 성찰(bottom-up reflexion)을 결합한 에이전트 기반 하이브리드 파이프라인을 제안한다.

원저자: Emma Jouffroy, Warren Jouanneau, Marc Palyart

게시일 2026-08-10
📖 4 분 읽기☕ 가벼운 읽기

원저자: Emma Jouffroy, Warren Jouanneau, Marc Palyart

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인터넷을 모든 사람이 자신이 잘하는 것을 소리 높여 외치는 거대하고 혼란스러운 도서관이라고 상상해 보십시오. 어떤 사람들은 완벽한 영어를 사용하고, 어떤 이들은 프랑스어, 독일어, 스페인어를 사용하며, 또 어떤 이들은 아직 발명되지도 않은 속어를 사용합니다. 채용의 세계에서 이 도서관은 엉망진창입니다. 만약 어떤 회사가 "프로젝트 매니저(Project Manager)"를 찾으려 한다면, 컴퓨터가 "웹 프로젝트 관리(Web Project Management)"나 "Gestion de Projet"라는 문구가 같은 의미라는 것을 알지 못하기 때문에 유능한 후보자를 놓칠 수도 있습니다. 바로 이 지점에서 **지식 그래프(Knowledge Graphs)**가 등장합니다. 지식 그래프를 아이디어들을 연결하는 매우 체계적인 지도라고 생각하십시오. 단순히 단어들의 목록이 아니라, "프로젝트 관리(Project Management)"가 커다란 중심 허브이고 "웹 프로젝트 관리(Web Project Management)"는 그곳에 매달린 작은 가지가 되는 웹 구조입니다. 목표는 소리 지르는 목소리들로 가득한 이 무질서한 도서관을 깨끗하고 정확한 지도로 바꾸어, 컴퓨터가 실제로 인간이 적합한 직업을 찾도록 돕는 것입니다.

하지만 이 지도를 만드는 것은 까다로운 일입니다. 엄격한 규칙집(예: 정부의 직업 목록)을 사용하여 위에서 아래로 내려다보며 그려낼 수도 있지만, 이 방식은 아직 규칙집에 존재하지 않는 멋지고 새롭고 기묘한 직업들을 놓치게 됩니다. 또는, 컴퓨터가 스스로 무언가를 추측하고 그룹화하도록 하여 밑에서부터 위로 쌓아 올릴 수도 있지만, 이는 종종 컴퓨터가 가짜 직업을 만들어내거나 하나의 직업을 열 개의 서로 다른 이름으로 쪼개버리는 혼란스러운 엉망진창을 초래합니다. 이 논문은 이 두 세계의 장점을 결집하여 이 지도를 구축하는 영리한 새로운 방법을 소개합니다. 즉, 알려진 것들에 대해서는 엄격한 규칙집을 사용하고, 새로운 것들에 대해서는 똑똑하고 자기 수정이 가능한 로봇 팀을 사용하는 방식입니다.

유럽의 프리랜서 플랫폼인 Malt와 협력하여 연구를 진행한 연구진은 "에이전틱 하이브리드(Agentic Hybrid)"라고 부르는, 마치 탐정 로봇 팀처럼 작동하는 시스템을 구축했습니다. 작동 방식은 다음과 같습니다. 먼저, 시스템은 "gestion de projet web"(웹 프로젝트 관리를 뜻하는 프랑스어)과 같이 인간이 작성한 무질서한 기술(skill)을 가져와서, **위키데이터(Wikidata)**라는 신뢰할 수 있는 기존의 지도와 매칭을 시도합니다. 위키데이터를 로봇들이 전적으로 신뢰하는 "사실의 위키피디아"라고 생각하십시오. 만약 해당 기술이 위키데이터에 존재한다면, 아주 좋습니다! 로봇은 이를 고정시켜, 그들이 다루는 5개 언어(영어, 프랑스어, 독일어, 네덜란드어, 스페인어) 전체에서 정확성과 일관성을 확보합니다.

하지만 만약 그 기술이 완전히 새롭고 위키데이터에 존재하지 않는다면 어떻게 될까요? 바로 그 지점에서 "에이전틱(Agentic)"한 부분이 빛을 발합니다. 시스템은 단순히 포기하거나 마음대로 지어내는 대신, 특별한 "성찰(reflection)" 루프를 사용합니다. 마치 초안을 작성한 뒤 멈춰 서서 "잠깐, 이게 맞나? 다른 기술들과 잘 어울리나?"라고 스스로에게 묻는 로봇을 상상해 보십시오. 만약 로봇이 특정 기술이 메인 "프로젝트 관리" 범주 아래에 들어가기에 너무 구체적이라는 것을 깨닫는다면, 그것을 버리는 대신 새로운 특별한 "고아(orphan)" 가지를 만듭니다. 이 가지에 고유한 ID와 "웹 프로젝트 관리"와 같은 명확한 이름을 부여하고, 메인 허브에 다시 연결합니다. 그런 다음 시스템은 지도가 가능한 한 정확해질 때까지 중복된 것을 병합하고, 정리를 하고, 스스로의 작업을 검토하며 이 과정을 반복합니다.

이 논문은 이 방법이 매우 효과적이라는 것을 보여주지만, 이것은 마법이 아니라 엄격한 과정입니다. 연구진은 실제 프리랜서들의 무질서하고 가공되지 않은 36,000개 이상의 기술 설명을 대상으로 테스트를 진행했습니다. 시스템은 방대한 양의 데이터를 정리해냈지만, 처리할 수 없는 부분에 대해서는 솔직했습니다. 전체 시도 중 약 19%는 입력값이 너무 혼란스럽거나 모호했기 때문에 기술을 지도와 매칭하는 데 실패한 "잘못된 추측"이었습니다. 또한, 시스템은 입력값이 유효한 기술이 아니거나(예: "NOT_A_SKILL" 오류) 의미론적 노이즈라고 판단하여 다른 13.7%의 입력을 능동적으로 거부했습니다. 그러나 성공적으로 처리된 데이터에 대해서는 결과가 인상적이었습니다. 시스템은 27,743개의 입력을 정리하고 조직하여 약 13,300개의 명확하고 표준화된 기술 카테고리로 그룹화했습니다. 이는 유효한 데이터에 대해 혼란을 절반 이상 줄였음을 의미하며, 수천 개의 혼란스러운 변형들을 깔끔하고 구조화된 목록으로 탈바꿈시켰음을 뜻합니다. 더욱이, 시스템은 5개 언어를 완벽하게 구사하여 66,490개의 표준화된 레이블을 생성함으로써, 프랑스어 사용자와 독일어 사용자가 동일한 직업을 찾을 수 있도록 했습니다.

연구진은 자신들의 "하이브리드" 접근 방식이 단순히 엄격한 규칙집을 사용하거나 컴퓨터가 추측하게 두는 것보다 훨씬 뛰어나다는 것을 발견했습니다. 알려진 기술들을 위키데이터에 고정함으로써, 컴퓨터가 가짜 직업을 만들어내는 문제(환각 현상)를 피했습니다. 또한, 새로운 기술을 위해 "성찰" 루프를 사용함으로써, 규칙집이 아직 포착하지 못한 멋진 신흥 직업들을 놓치지 않았습니다. 그 결과는 직업 시장이 변화함에 따라 스스로 업데이트될 수 있는 살아있는 기술 지도이며, 이를 통해 기업이 적합한 사람을 찾고 사람들이 적합한 일을 찾는 것을 훨씬 쉽게 만듭니다. 이는 마치 도서관의 모든 책을 알고 있을 뿐만 아니라, 방금 도착한 완전히 새로운 책을 어떻게 분류해야 할지도 즉각적으로 알며, 동시에 "이것이 무엇인지 잘 모르겠습니다"라고 말해야 할 때를 정확히 알아서 잘못된 추측을 하지 않는 사서와 같습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →