← 최신 논문
💻 computer science

PAIR: Prefix-Aware Internal Reward Model for Multi-Turn Agent Optimization

본 논문은 다중 턴 에이전트 최적화를 위한 조밀하고 비용 효율적인 단계별 보상을 생성하기 위해 고정된 은닉 상태 프로브와 경량의 어텐션 기반 헤드를 결합한 프리픽스 인식 내부 보상 모델인 PAIR 를 제안하며, 이를 통해 희소 결과 보한의 한계와 프리픽스 오염 하에서의 프로브 성능 저하를 효과적으로 극복합니다.

원저자: Wonjoong Kim, Yeonjun In, Sangwu Park, Dongha Lee, Chanyoung Park

게시일 2026-05-19
📖 3 분 읽기☕ 가벼운 읽기

원저자: Wonjoong Kim, Yeonjun In, Sangwu Park, Dongha Lee, Chanyoung Park

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇 도우미에게 복잡한 퍼즐을 해결하도록 가르친다고 상상해 보세요. 예를 들어, 비행기 예약, 호텔 예약, 저녁 주문을 한 번에 모두 처리하는 경우입니다. 로봇은 이 과정에서 많은 단계를 거쳐야 하며, 각 단계마다 결정을 내리고 도구를 사용해야 합니다.

현재의 교수법에서 큰 문제는 로봇이 전체 과정이 완전히 끝난 직후에만 "잘했다!" 또는 "다시 해봐!"라는 피드백을 받는다는 점입니다. 로봇이 1 단계에서 실수를 저질렀더라도 10 단계까지 완료한 후 전체 작업에 실패할 때까지 그 사실을 모릅니다. 이는 비디오 게임을 할 때 마지막에야 "게임 오버" 화면만 뜨고, 어떤 점프를 놓쳤는지 힌트도 전혀 주지 않는 것과 같습니다.

이 논문은 PAIR(Prefix-Aware Internal Reward Model, 접두사 인식 내부 보상 모델) 라는 새로운 로봇 교수법을 소개합니다. 간단한 비유를 통해 그 작동 원리를 설명하겠습니다.

문제: "혼란스러운 형사"

로봇에게 과정 중 (단계별로) 피드백을 제공하기 위해 연구자들은 로봇의 뇌 (내부 컴퓨터 상태) 를 들여다보며 로봇이 올바른 일을 하고 있는지 확인하려 했습니다.

그들은 두 가지 유형의 "뇌 신호"를 발견했습니다.

  1. "이야기꾼" (은닉 상태): 이 신호는 현재 단계가 이전에 일어난 일과 맞는지 확인합니다. 마치 이미 써 놓은 이야기와 현재 단서가 맞는지만 관심 있는 형사와 같습니다.
    • 결함: 로봇이 이전에 실수를 하여 (이야기를 오염시켜) 버렸다면, "이야기꾼"은 혼란에 빠집니다. "아, 이 새로운 단계는 틀린 이야기와 완벽하게 들어맞는군, 그러니 분명 좋은 거야!"라고 생각하며, 로봇이 잘못된 길을 계속 나아가도록 실수로 보상해 줍니다.
  2. "구조 설계자" (주의 패턴): 이 신호는 로봇이 어떻게 주의를 기울이고 있는지 살펴봅니다. 이야기 내용 자체는 중요하지 않으며, 구조에 집중합니다. 로봇이 올바른 도구를 보고 있는가? 관련 없는 잡음을 무시하고 있는가?
    • 강점: 이야기가 엉망이 되어도, 이 신호는 로봇이 올바른 것을 보고 있는지 여부를 여전히 판단할 수 있습니다. 견고합니다.
    • 약점: 완벽하고 깨끗한 이야기 앞에서는 "이야기꾼"만큼 날카롭지 않습니다.

해결책: "2 단계 코치" (PAIR)

저자들은 어떤 신호도 단독으로는 완벽하지 않다는 것을 깨달았습니다. "이야기꾼"은 일이 잘 풀릴 때는 훌륭하지만, 실수가 발생하면 실패합니다. 반면 "설계자"는 안정적이지만 깔끔한 작업에서는 덜 정밀합니다.

그래서 그들은 PAIR, 즉 2 단계 코치를 구축했습니다.

  1. 1 단계: 신념 확인. 코치는 먼저 "이야기꾼"(은닉 상태 프로브) 에게 질문합니다. "이 단계가 현재 이야기와 맞습니까?" 이를 통해 빠르고 초기 점수를 매깁니다.
  2. 2 단계: 현실 확인. 그다음 코치는 "설계자"(주의 프로브) 에게 질문합니다. "잠깐, 집중하는 방식을 보면, 실제로 문제를 해결하고 있는 건가, 아니면 망가진 이야기를 따르고 있는 건가?"

그들이 어떻게 협력하는가:

  • 이야기가 깨끗할 때: "설계자"가 "이야기꾼"의 의견에 동의합니다. 코치는 점수를 받아들입니다.
  • 이야기가 망가졌을 때 (오염되었을 때): "이야기꾼"은 "이건 실수와 잘 들어맞으니 좋은 것 같아!"라고 말합니다. 하지만 "설계자"는 "아니, 너는 잘못된 것을 보고 있어!"라고 말합니다. 코치는 "설계자"의 말을 듣고 점수를 수정하여 로봇에게 "사실 그 단계는 잘못되었어. 비록 옳은 것처럼 느껴졌더라도 말이야"라고 알려줍니다.

이것이 중요한 이유

PAIR 이전에는 단계별 피드백을 얻기 위해 다음 중 세 가지 비용이 많이 드는 방법 중 하나를 사용해야 했습니다.

  • 무엇이 작동하는지 보기 위해 게임을 100 번 실행 (매우 느리고 낭비적임).
  • 모든 단일 단계를 평가하기 위해 인간이나 초지능 AI 를 호출 (매우 비싸고 느림).
  • 단계를 채점하기 위해 정확한 정답을 미리 알고 있어야 함 (많은 현실 세계 작업에서는 불가능함).

PAIR 는 게임을 바꿉니다. 그 이유는:

  • 무료입니다: 로봇 자신의 뇌 신호를 사용합니다. 다른 사람을 호출하거나 추가 시뮬레이션을 실행할 필요가 없습니다.
  • 즉각적입니다: 로봇이 생각하는 순간, 눈 깜짝할 사이에 일어납니다.
  • 정직합니다: 로봇이 잘못된 길을 자신 있게 따라갈 때조차 실수를 잡아냅니다.

결과

실제 세계 도구 (비행기 예약이나 데이터베이스 검색 등) 를 사용하는 로봇들을 대상으로 테스트했을 때, PAIR 은 다른 어떤 방법보다 로봇들이 훨씬 빠르게 학습하고 더 많은 문제를 해결하도록 도왔습니다. 이는 학생에게 에세이가 끝난 후 "낙제"라고 말하는 대신, 쓰는 동안 실수를 지적해 줄 수 있는 선생님을 주는 것과 같습니다.

간단히 말해, PAIR 은 AI 에이전트들을 위한 똑똑한 내부 "거짓말 탐지기"로, 값비싼 외부 도움 없이 실시간으로 자신의 실수를 수정하도록 도와줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →