← 최신 논문
💬 NLP

How2How^{2}: How to learn from procedural How-to questions

본 논문은 LLM 기반 에이전트가 절차적 '방법' 질문을 요청하고 저장함으로써 대화형 환경에서 평생 계획을 개선할 수 있게 하는 메모리 에이전트 프레임워크인 How2How^{2}를 소개하며, 추상적이고 상태에 무관한 답변이 학습에 가장 효과적임을 입증합니다.

원저자: Gautier Dagan, Frank Keller, Alex Lascarides

게시일 2026-05-06
📖 4 분 읽기☕ 가벼운 읽기

원저자: Gautier Dagan, Frank Keller, Alex Lascarides

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

복잡한 가구를, 예를 들어 책장을 만들어 보려고 하지만 처음 해보는 상황을 상상해 보세요. 목재와 도구는 쌓여 있지만, 설명서는 없습니다.

인공지능 세계에서는 이러한 상황이 '에이전트'(지능형 컴퓨터 프로그램) 가 계획 문제를 해결하려 할 때 맞닥뜨리는 상황과 같습니다. 에이전트는 무엇을 만들지 알고 있지만, 조각들을 어떻게 조립할지는 모릅니다.

이 논문인 How2는 이러한 AI 에이전트들이 학습하는 새로운 방식을 제시합니다. 단순히 추측하고 실수를 반복하는 (시행착오) 대신, AI 는 '교사'(다른 AI 또는 인간 전문가) 에게 도움을 요청하고, 그 답을 기록하며, 그 메모를 활용하여 나중에 유사한 문제를 해결하도록 훈련받습니다.

다음은 간단한 비유를 통해 이 발견을 정리한 내용입니다:

1. 문제: '너무 구체적' vs '너모 모호한' 딜레마

"이 책장을 어떻게 만들까요?"라고 교사에게 물으면, 다양한 방식으로 답할 수 있습니다. 연구자들은 시간이 지남에 따라 학생이 가장 잘 학습할 수 있는 답의 유형을 확인하기 위해 네 가지 유형의 답을 테스트했습니다:

  • 'GPS'식 답 (실행 가능): 교사는 "손을 정확히 왼쪽으로 3 인치 움직인 다음, #12 번 슬롯에 있는 나사를 집으세요"라고 말합니다.
    • 장점: 지금 당장은 완벽하게 작동합니다.
    • 단점: 나사를 #15 번 슬롯으로 옮기면 지침은 쓸모없어집니다. 이전과 정확히 같은 교통 체증 상태에서만 작동하는 GPS 와 같습니다.
  • '하위 목표'식 답 (부분적 실행 가능): 교사는 "먼저 나사를 찾으세요. 그 다음 구멍에 넣으세요"라고 말합니다.
    • 장점: 더 유연합니다. 나사가 어디에 있든 찾을 수 있습니다.
  • '추상적' 답 (실행 불가): 교사는 "나무를 'T'자 형태로 배열하고 나사로 조립해야 합니다"라고 말합니다.
    • 장점: 가장 유연합니다. 특정 슬롯이나 숫자에 구애받지 않고 패턴을 설명합니다.
    • 단점: AI 는 정확히 어떤 조각들이 'T'자 모양에 맞는지 알아내야 합니다.

2. 주요 발견: 단기 vs 장기

연구자들은 테이크아웃 식사요리 배우기 사이를 선택하는 것과 같은 흥미로운 트레이드오프를 발견했습니다:

  • 즉각적인 성공을 위해: 'GPS'식 답 (구체적이고 단계별 지침) 이 가장 좋습니다. 책장을 지금 당장 만들어야 한다면 정확한 단계를 따르세요.
  • 평생 학습을 위해: '추상적' 또는 '하위 목표'식 답이 훨씬 더 좋습니다. 인생 동안 많은 책장을 만들고 싶다면, 특정 나사의 좌표가 아니라 패턴의 개념을 이해해야 합니다.

비유:
교사가 케이크를 만들기 위한 구체적인 재료 목록을 준다면 (예: "상단 선반에 있는 파란색 가방의 밀가루를 사용하세요"), 그 케이크 하나를 만들 수는 있습니다. 하지만 내일 파란색 가방이 비어 있다면 당신은 막히게 됩니다.
만약 교사가 "밀가루 두 컵을 사용하세요"라고 말한다면, 밀가루가 어디에 있든 가방 색이 무엇이든 케이크를 만들 수 있습니다. 이 논문은 AI 에이전트가 '파란색 가방' 규칙이 아니라 '밀가루 두 컵' 규칙을 배울 때 훨씬 더 잘 학습한다는 것을 보여줍니다.

3. 해결책: 'How2' 프레임워크

저자들은 이 학습 과정을 관리하기 위해 How2라는 시스템을 구축했습니다. 이를 AI 를 위한 스마트 노트라고 생각하세요.

다음은 네 단계로 작동하는 방식입니다:

  1. 노트북 확인: 무언가를 만들기 전에 AI 는 기억을 확인합니다. "이런 책장을 이전에 만들어 본 적이 있는가?"
  2. 교사에게 질문: 노트북이 비어 있거나 이전 메모가 현재 상황 (예: 목재 위치가 다름) 에 맞지 않으면, AI 는 교사에게 "이걸 어떻게 하나요?"라고 묻습니다.
  3. 답변 번역: 이것이 마법 같은 단계입니다. 교사가 답을 주면 AI 는 단순히 복사 - 붙여넣기를 하지 않습니다. 답을 번역합니다.
    • 예시: 교사가 "12 번 슬롯에서 나무를 옮기세요"라고 말하면, AI 의 노트북은 이를 "나무가 있는 곳에서 나무를 옮기세요"로 다시 씁니다. 이렇게 하면 메모가 현재 상황뿐만 아니라 모든 미래 상황에 유용해집니다.
  4. 저장 및 재사용: AI 는 이 '번역된' 메모를 저장합니다. 다음에 책장을 만들어야 할 때, 메모를 읽고 나무가 지금 어디에 있는지 파악한 후 일반적인 규칙을 따릅니다.

4. 결과: '마인크래프트' 테스트

연구자들은 AI 가 제작 그리드를 사용하여 유리병이나 붉은 염료 같은 물건을 만들어야 하는 Plancraft(마인크래프트 게임 기반) 라는 디지털 세계에서 이를 테스트했습니다.

  • 발견: 구체적이고 경직된 지침 (GPS 스타일) 만 따르는 에이전트들은 게임 설정이 조금만 바뀌어도 처참하게 실패했습니다. 그들은 적응할 수 없었습니다.
  • 승자: '번역된' 메모 (특정 슬롯 번호를 추상화) 를 사용한 How2 시스템을 적용한 에이전트들은 시간이 지남에 따라 훨씬 더 똑똑해졌습니다. 그들은 패턴을 학습했지 특정 동작만 학습하지 않았기 때문에 도움을 요청하는 횟수가 줄고 스스로 더 많은 과제를 해결했습니다.

요약

이 논문은 AI 가 평생 동안 진정으로 학습하고 계획 능력을 향상시키기 위해서는 구체적인 지침을 단순히 암기해서는 안 된다고 주장합니다. 대신 질문을 하고, 답을 얻은 후, 그 답들을 일반적인 규칙으로 요약해야 합니다.

이는 특정 전화번호를 외우는 것 (그 사람이 이사하면 쓸모없음) 과 전화번호부 작동 방식을 이해하는 것 (영구적으로 유용함) 의 차이입니다. How2 프레임워크는 AI 에게 정확히 그 일을 가르칩니다: 구체적인 '방법' 답변을 일반적이고 재사용 가능한 지식으로 전환하는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →