← 최신 논문
🤖 AI

ToolSelf: Unifying Task Execution and Self-Reconfiguration via Tool-Driven Emergent Adaptation

이 논문은 정적 구성의 경직성을 극복하기 위해 작업 실행과 런타임 자기 재구성을 단일 정책 내로 통합하는 패러다임인 ToolSelf를 소개하며, 새로운 구성 인식 2단계 학습(Configuration-Aware Two-stage Training, CAT) 접근 방식을 통해 상당한 성능 향상을 달성한다.

원저자: Jingqi Zhou, Sheng Wang, Dezhao Deng, Junwen Lu, Junwei Su, Qintong Li, Jiahui Gao, Hao Wu, Jiyue Jiang, Lingpeng Kong, Dunhong Jin, Chuan Wu

게시일 2026-06-02
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jingqi Zhou, Sheng Wang, Dezhao Deng, Junwen Lu, Junwei Su, Qintong Li, Jiahui Gao, Hao Wu, Jiyue Jiang, Lingpeng Kong, Dunhong Jin, Chuan Wu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 매우 복잡하고 다단계적인 미스터리를 해결하기 위해 아주 똑똑한 비서를 고용한다고 상상해 보십시오.

과거의 방식 (정적 구성 - Static Configuration):
전통적인 AI 시스템에서는 비서가 일을 시작하기 전에 엄격한 "규칙집"을 작성해야 합니다. 당신은 그들에게 이렇게 말합니다: "당신은 탐정입니다. 이 5가지 특정 도구를 사용하세요. 당신의 메모는 이 특정한 노트 형식에 기록하세요. 당신의 목표는 사라진 고양이를 찾는 것입니다."

문제는 일단 일이 시작되면, 비서는 그 규칙집에 갇혀 버린다는 것입니다.

  • 만약 그들이 다른 도구(예: 돋경 대신 현미경)가 필요하다는 것을 깨닫더라도, 그것을 얻을 수 없습니다.
  • 만약 그들의 "탐정" 페르소나가 너무 경직되어 있어 "과학자"가 되어야 한다고 느낀다 해도, 바뀔 수 없습니다.
  • 만약 그들의 노트가 쓸모없는 메모로 너무 가득 차게 된다면, 이를 정리할 수도 없습니다.
    그들은 상황이 변했음에도 불구하고, 자신의 지침이 변하지 않았기 때문에 잘못된 도구와 잘못된 사고방식을 고수하며 문제를 풀려고 노력하다가 결국 실패하게 됩니다.

새로운 방식 (TOOLSELF):
이 논문은 비서가 단순히 규칙집을 따르는 것이 아니라, 일을 하는 동안 스스로 자신의 규칙집을 써 내려가는 시스템인 TOOLSELF를 소개합니다.

TOOLSELF를 다음과 같이 생각해보십시오: 비서에게는 특별한 "마법 지팡이"(reconfigure라는 도구)가 있습니다.

  1. 루프 (The Loop): 비서는 작업의 한 부분을 수행합니다. 벽에 부딪히거나 한 단계를 마치면, 잠시 멈춥니다.
  2. 체크인 (The Check-in): 비서는 스스로에게 질문합니다: "현재 계획이 제대로 작동하고 있는가? 나는 적절한 도구를 가지고 있는가? 내 노트가 너무 지저도한가?"
  3. 마법 지팡이 (The Magic Wand): 만약 대답이 "아니오"라면, 그들은 마법 지팡이를 휘두릅니다. 이 도구는 단순히 새로운 도구를 주는 것이 아니라, 다음 단계를 위한 자신의 전체 직무 기술서를 다시 쓰게 해줍니다.
    • "좋아, 다음 단계에서는 더 이상 탐정이 아니라, 데이터 분석가다."
    • "돋보기 대신 계산기로 교체해야겠다."
    • "기존의 메모를 모두 삭제하고 새로운 요약본으로 시작하자."
  4. 결과 (The Result): 비서는 즉시 이 새로운 정체성을 채택하고, 새로운 도구를 사용하며, 계속해서 작업을 이어갑니다. 그들은 상황에 맞춰 그 순간에 적응합니다.

비서에게 이 방법을 가르치는 법 (CAT 훈련):
당신은 이렇게 물을 수도 있습니다. "AI는 언제 마음을 바꾸고, 무엇으로 바꿀지를 어떻게 아는 걸까요?" 저자들은 CAT(Configuration-Aware Two-stage Training)라고 불리는 2단계 훈련법을 사용했습니다.

  • 1단계: "좋은 사례" 단계 (RFT): 그들은 AI에게 성공적인 임무를 수행했던 많은 사례를 보여주었습니다. 이 과정에서 비서가 스스로 적절한 변경 사항을 찾아낸 사례들입니다. AI는 이러한 좋은 행동들을 모방하는 법을 배웠습니다.
  • 2단계: "성적표" 단계 (KTO): 그들은 AI가 스스로 과업을 수행하도록 했습니다. 만약 AI가 전체 임무를 성공적으로 마쳤다면, "금메달"을 받았습니다. 만약 실패했다면, "빨간 X"를 받았습니다. 결정적으로, AI는 자신이 내린 모든 결정(스스로의 규칙을 바꾸기로 결정한 순간을 포함하여)이 최종적인 금메달이나 빨간 X에 기여한다는 것을 배웠습니다. 이를 통해 AI는 결과적으로 승리하기 위해 더 나은 자기 조절 선택을 하는 법을 배웠습니다.

결과:
이 논문은 심층 연구(여러 웹사이트에서 사실을 찾아내는 것), 일반 AI 보조, 소프트웨어 코드 수정와 같은 어려운 과업들을 통해 이를 테스트했습니다.

  • 추가 훈련 없이 (Zero-shot): 단순히 "마법 지팡이" 방식만 사용했을 때도, TOOLSELF 비서는 특정 작업을 위해 수동으로 프로그래밍된 전문 비서들보다 더 나은 성능을 보였습니다.
  • 훈련 후 (CAT): 2단계 훈련을 거친 후, TOOLSELF 비서는 기존의 "정적 규칙집" 비서들에 비해 평균 28.8 포인트라는 엄청난 성능 향상을 보였습니다.

요약하자면:
TOOLSELF는 AI에게 일을 하는 도중에 발생하는 실제 상황에 근거하여, 스스로 자신의 상사를 해고하고, 새로운 도구를 고용하며, 자신의 지침을 다시 쓸 수 있는 권한을 부여하는 직업을 주는 것과 같습니다. 이는 시작 전에 만들어진 계획에 갇혀 있는 시스템보다, 훨씬 더 유연하고 복잡한 문제를 해결하는 데 성공하게 만듭니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →