← 최신 논문
🤖 AI

Knowledge-Centric Agents for Workflow Generation

본 논문은 실제 사례로부터 계층적 지식을 역전, 주입 및 추론하는 법을 학습함으로써 기존의 직접적인 텍스트-투-JSON 방식보다 우수한 구조적 일관성과 실행 성공률을 달성하여, 시각적 생성 시스템에서의 워크플로 생성을 향상시키는 지식 중심 프레임워크를 제안한다.

원저자: Zhendong Li, Lei Sun, Ruibo Ming, He Zhang, Danda Pani Paudel, Luc Van Gool, Jinjin Gu

게시일 2026-07-20
📖 4 분 읽기☕ 가벼운 읽기

원저자: Zhendong Li, Lei Sun, Ruibo Ming, He Zhang, Danda Pani Paudel, Luc Van Gool, Jinjin Gu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 레고 브릭으로 복잡한 기계를 만들려고 노력 중이라고 상상해 보세요. 하지만 손으로 직접 조립하는 대신, 오직 말로만 로봇에게 전체 설계도를 설명해야 합니다. 이것이 바로 인기 있는 인공지능 이미지 생성 도구인 ComfyUI의 세계입니다. 이 시스템에서 색상을 바꾸거나, 얼굴을 선명하게 하거나, 이미지를 더 크게 만드는 것과 같은 모든 창의적 단계는 각각 별개의 "블록" 또는 "노드"가 됩니다. 훌륭한 결과를 얻으려면, 거대하고 정교한 회로 기판처럼 매우 특정한 순서대로 수백 개의 블록을 연결해야 합니다. 만약 잘못된 두 블록을 연결하거나, 전원 코드(파라미터)를 연결하는 것을 잊어버린다면, 기계는 덜컥거리며 멈춰버릴 것입니다.

오랫동안 사람들은 이러한 설계도를 자동으로 구축하기 위해 거대 언어 모델(LLM)—이야기를 쓰거나 질문에 답하는 것과 같은 똑똑한 AI—을 사용하려고 시도했습니다. 아이디어는 간단했습니다. AI에게 "스팀펑크 비행선을 그려줘"라고 말하면 완벽한 레고 조립 설명서를 내놓게 하는 것이었습니다. 하지만 문제는, 이 AI 모델들은 문장을 쓰는 데는 뛰어나지만 복잡한 구조물을 만드는 데는 서투르다는 점입니다. 이들은 블록이 어떻게 연결되는지 자주 잊어버리고, 지침을 뒤섞거나, 종이 위에서는 그럴싸해 보이지만 실제로 만들려고 하면 무너져 버리는 설계도를 만들어냅니다. 이들은 단순히 "연결해야 한다"는 사실을 아는 것을 넘어, "왜" 블록 A를 블록 B에 연결해야 하는지를 아는 인간 전문가의 "경험"이 부족합니다.

이 지점에서 Zhendong Li와 그의 팀이 발표한 새로운 논문은 AI가 어떻게 숙련된 설계사가 될 수 있는지 가르치는 영리한 새로운 방법을 제안합니다. 그들은 AI에게 최종 설계도를 단순히 추측하게 하는 대신, 전문가인 인간 디자이너처럼 생각하도록 가르칩니다. 그들은 이를 지식 중심(Knowledge-Centric) 접근 방식이라고 부릅니다. 이렇게 생각해 보세요. 만약 당신이 학생에게 완벽한 케이크를 굽는 법을 가르치고 싶다면, 완성된 케이크를 보여주며 "이것을 똑같이 따라 해"라고 말하는 것이 아닙니다. 당신은 전략(왜 달걀을 먼저 섞어야 하는지), 골격(정확한 계량 없이 단계별 목록), 그리고 마지막으로 레시피(밀가루 몇 그램인지와 같은 정확한 수치)를 가르칩니다.

저자들은 기존의 AI 방식들이 실패하는 이유가 사용자의 요청에서 곧바로 최종적인 복잡한 코드로 건너뛰려 했기 때문이라는 것을 발견했습니다. 이를 해결하기 위해, 그들은 **지식 역전(Knowledge Inversion), 주입(Injection), 추론(Inference)**이라고 부르는 3단계 과정을 고안했습니다.

먼저, 그들은 인간이 만든 수천 개의 실제 작동하는 설계도를 가져와 "역설계" 과정을 거쳤습니다. 그들은 숨겨진 패턴을 찾기 위해 복잡한 세부 사항들을 제거했습니다. 이는 마치 수천 대의 자동차를 분해하여 엔진이 작동하는 일반적인 규칙을 파악하는 것과 같습니다. 단순히 특정 자동차의 모양을 암기하는 것이 아니라 말이죠. 그들은 이 설계도들을 세 가지 층위로 정제했습니다:

  1. 상위 수준 전략: "큰 그림" 계획 (예: "먼저 얼굴을 수정하고, 그다음 스타일을 변경한다").
  2. 골격 의사코드(Skeleton Pseudo-code): 구체적인 숫자 없이 단계들의 대략적인 윤곽.
  3. 전체 의사코드(Full Pseudo-code): 제작 준비가 된 완전하고 상세한 지침.

다음으로, 그들은 이 정제된 지식을 AI 모델에 주입했습니다. 그들은 단순히 데이터를 입력한 것이 아니라, AI가 이 층위들을 통해 추론하도록 가르쳤습니다. 그들은 모델에게 다음과 같이 보여주었습니다: "여기에 작업이 있고, 여기에 전문가가 사용할 전략이 있으며, 그 전략이 어떻게 골격으로 변하는지 보라." 이는 마치 학생에게 단순한 레시피가 아니라 요리의 논리를 설명하는 요리책을 주는 것과 같습니다.

마지막으로, 사용자가 새로운 이미지를 요청하면 AI는 단순히 추측하지 않습니다. 학습한 층위들을 통해 역순으로 작업하며 해결책을 추론합니다. 먼저 상위 수준의 전략을 파악하고, 그다음 골격을 구축하며, 마지막으로 구체적인 세부 사항을 채워 넣습니다. 논문에는 AI가 작업을 완료하기 전에 스스로에게 "내가 이 블록들을 올바르게 연결했나?"라고 물으며 자신의 작업을 재검토하는 "자기 정제(self-refinement)" 단계도 포함되어 있습니다.

결과는 인상적입니다. 팀은 900개 이상의 실제 작업 데이터셋을 사용하여 이들의 방법을 다른 AI 도구들과 테스트했습니다. 다른 방법들은 절반도 안 되는 빈도로 작동하는 설계도를 만들어낸 반면, 이 새로운 "지식 중심" 에이전트는 **86.9%**의 경우에서 성공했습니다. 복잡하고 다양한 구조물을 구축하는 측면에서, 이들의 방법은 다양성 척도에서 152점을 기록한 반면, 차점 방법은 42점에 그쳤습니다. 심지어 한 번도 본 적 없는 어렵고 새로운 작업에 대해 테스트했을 때도, 이 모델은 **66.7%**의 성공률을 기록하며 경쟁 모델들을 압도했습니다.

저자들은 AI에게 패턴을 암기하게 하는 대신, 작업의 구조추론을 이해하도록 가르침으로써 훨씬 더 신뢰할 수 있는 에이전트를 만들 수 있다고 제안합니다. 그들은 시스템이 학습 데이터에 없던 매우 희귀하거나 특이한 블록을 사용하라는 요청을 받을 때 여전히 약간 어려움을 겪는다는 점을 인정하지만, 전반적으로 전문가의 사고방식이라는 "멘탈 모델"을 제공하는 것이 더 나은, 더 복잡한 창의적 도구를 만드는 핵심임을 보여주었습니다. 이는 로봇에게 "정답을 맞혀봐"라고 요구하는 것에서 "생각하는 법"을 가르치는 것으로의 전환이며, 취약하고 오류가 잦은 과정을 견고하고 전문가 수준의 기술로 바꾸어 놓았습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →