← 최신 논문
🤖 AI

COMFYCLAW: Self-Evolving Skill Harnesses for Image Generation Workflows

이 논문은 구성을 타입형 그래프 편집으로 취급하고, 수정을 위해 시각-언어 모델 검증기를 활용하며, 과거 실행 데이터를 점진적으로 공개되는 스킬 라이브러리로 증류함으로써 에이전트의 신뢰성과 성능을 크게 향상시키는 자기 진화형 에이전트 프레임워크인 COMFYCLAW를 소개한다.

원저자: Zongxia Li, Dawei Liu, Fuxiao Liu, Yuhang Zhou, Xiyang Wu, Jingxi Chen, Jing Xie, Xiaomin Wu, Lichao Sun

게시일 2026-07-03
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zongxia Li, Dawei Liu, Fuxiao Liu, Yuhang Zhou, Xiyang Wu, Jingxi Chen, Jing Xie, Xiaomin Wu, Lichao Sun

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 친구의 설명을 바탕으로 매우 구체적이고 복잡한 케이크를 구우려고 한다고 상상해 보세요. 단순히 "케이크를 만들어"라고 적는 것이 아니라, 적절한 오븐을 고르고, 반죽을 섞고, 온도를 설정하고, 데코레이션을 하는 등 전체 레시피를 처음부터 직접 구축해야 합니다. 만약 케이크가 탔거나 프로스팅의 색상이 잘못되었다면, 당신은 왜 그런 결과가 나왔는지 파악하고 다시 시도하기 전에 레시피를 수정해야 합니다.

이것이 바로 COMFYCLAW가 하는 일입니다. 다만, 케이크를 굽는 대신 컴퓨터를 위한 **이미지 생성 워크플로우(image generation workflows)**를 구축하는 것입니다.

다음은 일상적인 비유를 사용하여 이 시스템이 어떻게 작동하는지 쉽게 설명한 내용입니다.

1. 문제점: "일회용" 요리사

보통 AI가 이미지를 만들 때는, 한 끼 식사를 마친 후 모든 것을 잊어버리는 요리사처럼 행동합니다. 만약 당신이 "파란색 도넛 6개"를 요청했는데 AI가 5개를 만들었다면, AI는 단순히 다음번에 문장을 다시 써보는 것에 그칠 수 있습니다. AI는 개수를 틀린 이유나 도넛이 왜 이상하게 보였는지 기억하지 못합니다. 이는 마치 토스트를 계속 태우면서도 토스터 설정을 조정하는 법을 배우지 못하는 요리사와 같습니다.

2. 해결책: "자기 진화형" 마스터 셰프

COMFYCLAW는 AI를 배운 교훈이 담긴 요리책을 가진 마스터 셰프로 변모시키는 시스템입니다. 이 시스템은 세 가지 주요 부분으로 구성됩니다:

  • 작업실 (하네스 - The Harness):
    단순히 문장을 쓰는 대신, AI는 시각적인 작업실(ComfyUI)에서 작업합니다. 이것은 거대한 레고 판과 같다고 생각하면 됩니다. 각 블록은 프로세스의 한 단계입니다 (예: "색상 추가", "모양 변경", "질감 추가"). AI는 이 블록들을 서로 끼워 맞추거나, 위치를 옮기거나, 교체할 수 있습니다. 이를 통해 AI는 단순히 프롬프트를 입력하는 것보다 훨씬 더 정교한 제어권을 갖게 됩니다.

  • 검사관 (검증기 - The Verifier):
    AI가 워크플로우를 구축하고 이미지를 생성한 후, 두 번째 AI(시각-언어 모델)가 엄격한 검사관 역할을 수행합니다. 이 검사관은 사진과 원래의 요청 사항을 대조하여 확인합니다.

    • 예시: 만약 당신이 "빨간 매트 위의 고양이"를 요청했는데 고양이가 파란 매트 위에 있다면, 검사관은 단순히 "나쁨"이라고 말하지 않습니다. 대신 "매트가 빨간색이 아니라 파란색입니다. 또한 고양이의 다리가 세 개가 아니라 네 개입니다"라고 구체적으로 지적합니다.
    • 결정적으로, 검사관은 제작자에게 파란 매트를 고치기 위해 어떤 레고 블록을 바꿔야 하는지 정확히 알려줍니다.
  • 요리책 (기술 진화 - Skill Evolution):
    이 부분이 마법 같은 부분입니다. AI가 실수를 하고 이를 수정하거나, 아주 좋은 요령을 터득했을 때, COMFYCLAW는 그 경험을 그냥 버리지 않습니다. 대신 그것을 디지털 요리책에 **"기술(Skill)"**로 기록합니다.

    • 시나리오: AI는 "도넛 6개"를 만들기 위해 레고 판에 특정 "개수 세기 블록"을 추가해야 한다는 것을 배웁니다.
    • 진화: 다음에 당신이 "도넛 6개"를 요청하면, AI는 처음부터 다시 시작하지 않습니다. 요리책을 펼쳐 "도넛 6개 기술"을 찾아내고 즉시 사용합니다. 시간이 흐를수록 요리책은 재사용 가능한 수백 가지의 유용한 요령들로 채워지며, 이는 AI를 더 빠르고 능숙하게 만듭니다.

3. 실제 적용 사례

이 논문은 복잡한 이미지 요청(예: "정확히 6개의 베이글이 있는 강아지" 또는 "세 마리의 유리 돼지")을 포함하는 네 가지 다른 "챌린지(벤치마크)"를 통해 이 시스템을 테스트했습니다.

  • COMFYCLAW 없이: AI는 레시피를 추측하려고 시도하며, 종종 개수를 틀리거나 색상을 잘못 맞추는 등 실패합니다. 과거의 교훈을 기억하지 못한 채 반복적으로 추측하고 확인하는 과정을 거칩니다.
  • COMFYCLA로: AI는 레고 판을 만들고, 검사관이 이를 확인하며, 만약 실패하면 특정 블록을 수정합니다. 그 후, 그 수정 사항을 요리책에 기록합니다. 테스트가 끝날 무렵, AI는 318개의 고유한 기술을 만들어냈습니다.

4. 결과

논문의 결과는 다음과 같습니다:

  • 더 나은 이미지: COMFYCLAW가 만든 이미지는 설명에 훨씬 더 정확했으며(예: 물체의 개수를 정확히 맞춤), 더 사실적이었습니다.
  • 인간의 선호도: 사람들이 이미지를 보았을 때, 기술 요리책을 유지하지 않는 시스템이 만든 이미지보다 COMFYCLAW가 만든 이미지를 더 선호했습니다.
  • 실제 학습: 시스템은 단순히 정답을 암기한 것이 아니라, **절차(procedure)**를 학습했습니다. 예를 들어, "애니메이션 스타일"의 캐릭터를 처리하거나 장면 내의 물체를 배치하는 구체적인 방법을 배웠으며, 이를 미래의 어떤 요청에도 재사용할 수 있었습니다.

요약하자면

COMFYCLAW는 AI에게 자기 업데이트가 가능한 지침서를 주는 것과 같습니다. 매번 시도할 때마다 실수를 잊어버리는 대신, AI는 실수로부터 배우고, 해결책을 기록하며, 그 지식을 사용하여 매번 더 훌륭하고 복잡한 이미지를 구축합니다. 이는 일회성 시행착오 과정을 지속적인 개선의 순환 과정으로 변화시킵니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →