← 최신 논문
💬 NLP

Token-Level Off-Policy Learning for Faithful Generation Under Distribution Shift

이 논문은 요약 및 기계 번역과 같은 충실한 생성 작업 전반에 걸쳐 강력한 분포 외 일반화와 해석 가능한 모델 업데이트를 달성하기 위해, 사후 학습을 토큰 수준의 정답 예측 작업으로 재구성하는 훈련 패러다임인 토큰 수준 오프-폴리 레이블링(Token-Level Off-Policy Labeling, TOPL)을 제안한다.

원저자: Zitong Huang, Gustavo Lucas Carvalho, Deqing Fu, Robin Jia

게시일 2026-07-21
📖 4 분 읽기☕ 가벼운 읽기

원저자: Zitong Huang, Gustavo Lucas Carvalho, Deqing Fu, Robin Jia

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 환각 사냥: AI에게 자신의 실수를 찾아내는 법 가르치기

당신이 매우 똑똑하고 빠른 로봇에게 이야기를 쓰는 법을 가르치려 한다고 상상해 보세요. 당신은 로봇에게 책 한 권을 주고 요약본을 쓰라고 시킵니다. 하지만 가끔 로봇은 지나치게 창의력을 발휘하곤 합니다. 유명한 과학자가 엉뚱한 도시나 잘못된 날짜에 태어났다고 말할 수도 있죠. 우리는 이러한 실수를 "환각(hallucinations)"이라고 부릅니다. 인공지능(AI)의 세계에서 이것은 큰 문제입니다. 만약 로봇이 사실을 지어낸다면, 우리는 언어 번역이나 뉴스 요약 같은 실제 작업에 로봇을 신뢰하며 사용할 수 없기 때문입니다.

이를 해결하기 위해 과학자들은 다양한 훈련 방법을 시도해 왔습니다. 한 가지 인기 있는 방법은 "강화 학습(Reinforcement Learning)"인데, 이는 로봇이 좋은 답에는 점수를 얻고 나쁜 답에는 점수를 잃는 비디오 게임과 같습니다. 하지만 로봇이 배우기 위해 수백만 번 연습해야 하므로 이 방법은 종종 느리고 복로가 복잡합니다. 또 다른 방법은 "오프-폴리시(Off-Policy)" 학습으로, 이는 스스로 테스트를 연습하는 대신 선생님의 정답지를 공부하는 것과 같습니다. 이 방법은 더 빠르지만, 로봇이 본 적 없는 질문을 마주했을 때 여전히 혼란을 느낄 수 있습니다. 연구자들이 던지는 핵심 질문은 이것입니다: 어떻게 하면 이러한 빠르고 단순한 방법들이, 특히 로봇이 새롭고 까다로운 상황에 직면했을 때 더 잘 작동하게 만들 수 있을까?

새로운 전략: "토큰 탐정"

이 논문은 토큰 레벨 오프-폴리시 레이블링(Token-Level Off-Policy Labeling), 줄여서 TOPL이라 불리는 새로운 훈련 방법을 소개합니다. "토큰(token)"을 문장의 단일 단어나 단어의 작은 조각이라고 생각해 보세요. 보통 우리가 AI를 훈련할 때, 우리는 로봇에게 "빈칸 채우기" 게임처럼 문장의 다음 단어를 예측하도록 요청합니다. 하지만 TOPL은 이 게임의 판도를 완전히 바꿉니다. TOPL은 로봇에게 다음 단어를 쓰라고 요구하는 대신, 로봇을 탐정으로 변신시킵니다.

당신이 로봇이 쓴 요약본을 가지고 있다고 상상해 봅시다. 어떤 부분은 사실이지만(예: "마리 퀴리는 폴란드에서 태어났다"), 어떤 부분은 지어낸 거짓말입니다(예: "마리 퀴리는 슬로바키아에서 태어났다"). TOPL은 로봇이 그 요약본의 모든 단어 하나하나를 살펴보며 다음과 같이 묻도록 훈련합니다: "이 단어는 사실인가, 아니면 거짓인가?" 이는 각 단어에 대해 "예" 또는 "아니오"라는 단순한 레이블을 부여합니다. 이렇게 함으로써, 로봇은 단순히 시퀀스상의 다음 단어를 추측하는 것이 아니라, 사실적인 토큰과 환각된 토큰의 차이를 식별하는 법을 배웁니다.

작동 원리: "조종(Steering)"의 마법

연구자들은 로봇에게 이 탐정 기술을 가르치기 위해 **LoRA(Low-Rank Adaptation)**라는 특별한 도구를 사용했습니다. LoRA를 로봇의 뇌에 끼울 수 있는 작은 탈부착형 보조 바퀴나 "조종 키트"라고 생각하면 됩니다.

여기 영리한 부분이 있습니다. 연구자들은 로봇이 이런 방식으로 학습할 때 뇌가 자연스럽게 두 부분으로 나뉜다는 것을 발견했습니다.

  1. 탐지기 (LoRA-A): 이 부분은 레이더처럼 작동합니다. 로봇의 숨겨진 생각을 스캔하여 "이 특정 단어가 사실적으로 옳은가?"를 파악합니다. 즉, "좋은" 단어와 "나쁜" 단어를 분리합니다.
  2. 조종 핸들 (LoRA-B): 탐지기가 "나쁜" 단어를 포착하면, 조종 핸들에 명령하여 로봇의 생각을 다른 방향으로 밀어냅니다. 이는 마치 "당신은 거짓을 향해 가고 있습니다. 진실을 향해 왼쪽으로 도세요"라고 말해주는 GPS를 가진 것과 같습니다.

논문은 TOPL이 잘 작동하는 이유가 단순히 정답을 암기하는 것이 아니라, 새로운 주제를 접하더라도 거짓으로부터 자신의 생각을 조종하여 사실로 이끄는 법을 배우기 때문이라고 제안합니다.

연구 결과: 다른 방식보다 우수함

연구자들은 이 새로운 "탐정" 방법을 문서 요약과 관련된 11가지 서로 다른 데이터셋에 대해 테스트했습니다. 그들은 TOPL을 표준 훈련(SFT), 시퀀스 레벨 선호도 최적화(DPO), 그리고 다른 토큰 레벨 방법들을 포함한 다른 인기 있는 방법들과 비교했습니다.

  • 결과: TOPL은 특히 로봇이 보지 못한 새로운 데이터(out-of-distribution)로 테스트되었을 때, 모든 다른 방법보다 일관되게 우수한 성능을 보였습니다. TOPL은 요약본의 사실성을 유지하는 데 있어 가장 정확했습니다.
  • 놀라운 점: 연구자들은 또한 문장 전체를 바라보는 방식(SOPL이라 불림)으로 자신들의 방법을 변형하여 테스트했습니다. 결과는 기대에 미치지 못했습니다. 이는 "탐정" 접근법이 효과적이려면 개별 단어(토큰) 단위로 들여다봐야 한다는 것을 증명합니다. 큰 그림을 보는 것만으로는 충분하지 않으며, 한 번에 한 단어씩 거짓을 잡아내야 합니다.
  • 전이 가능성: 그들은 또한 이 기술을 기계 번역(한 언어를 다른 언어로 바꾸는 작업)에도 적용해 보았습니다. TOPL은 번역에서도 훌륭하게 작동했으며, 이는 이 "탐정" 기술이 요약뿐만 아니라 다양한 유형의 글쓰기 작업에 유용하다는 것을 시사합니다.

제외된 사항들

이 논문은 무엇이 효과가 없는지도 명확히 짚고 있습니다.

  • 무작위 추측: 만약 로봇에게 무작위 레이블(거짓을 참이라고 하고, 참을 거짓이라고 말하는 것)을 준다면, 로봇은 혼란에 빠져 성능이 저하됩니다. 이는 로봇이 단순히 패턴을 암기하는 것이 아니라, 진실과 거짓의 차이를 실제로 배워야 한다는 것을 보여줍니다.
  • 단순히 "토큰 레벨"인 것만으로는 부족함: 단순히 단어를 하나씩 보는 것 자체가 마법의 비결은 아닙니다. 단어를 하나씩 살펴보는 다른 방법들은 TOPL만큼의 성과를 내지 못했습니다. TOPL이 진실과 거짓을 구별하도록 로봇을 훈련시키는 특정한 방식이 차이를 만드는 핵심입니다.
  • "최종" 레이어: 연구자들은 만약 로봇의 뇌 마지막 레이어에 훈련용 보조 바퀴(LoRA)를 설치하려고 하면 오히려 상황이 악화된다는 것을 발견했습니다. 가장 좋은 결과는 "중간" 레이어를 훈련할 때 나왔습니다. 중간 레이어가 사실을 이해하는 데 있어 핵심적인 역할을 하는 반면, 마지막 레이어는 단지 최종 단어를 내뱉는 역할만 하기 때문인 것으로 보입니다.

결론

저자들은 TOPL이 AI를 더 정직하게 만드는 강력한 새로운 방법이라고 제唆합니다. 모델이 모든 단어의 진실성을 심판하는 비평가 역할을 하도록 훈련시키고, 그 판단을 사용하여 모델의 생각을 "조종"하게 함으로써, 그들은 속이기 훨씬 어려운 시스템을 만들어냈습니다. 비록 그들이 "환각" 문제를 영원히 해결한 것은 아니지만, 그들의 실험은 이 "토큰 레벨 탐정" 접근법이 AI가 사실에 충실하도록 가르치는 더 단순하고 효과적인 방법을 제시하는 중요한 진전임을 강력하게 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →