← 최신 논문
💬 NLP

LARFT: Closing the Cognition-Action Gap for Length Instruction Following in Large Language Models

LARFT 는 생성된 텍스트의 실제 길이를 식별하는 '사후 길이 인식'을 강화 학습에 통합하여 대형 언어 모델의 길이 인지 능력과 행동 간의 간극을 해소함으로써, 기존 방법들보다 정밀한 길이 지시 따르기를 가능하게 하는 새로운 훈련 프레임워크를 제안합니다.

원저자: Wei Zhang, Lintong Du, Yuanhe Zhang, Zhenhong Zhou, Kun Wang, Li Sun, Sen Su

게시일 2026-03-23
📖 3 분 읽기☕ 가벼운 읽기

원저자: Wei Zhang, Lintong Du, Yuanhe Zhang, Zhenhong Zhou, Kun Wang, Li Sun, Sen Su

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

📝 LARFT: "글자 수 맞추기"를 잘하는 AI 의 비밀

이 논문은 **"AI 가 사용자의 지시대로 글자 수를 정확히 맞추는 것"**이 왜 그렇게 어려운지, 그리고 이를 어떻게 해결했는지에 대한 이야기입니다.

🎯 문제: AI 는 왜 글자 수를 못 맞추나요?

생각해 보세요. "이 글자를 딱 100 자로 써줘"라고 요청하면, AI 는 보통 너무 길게 쓰거나 너무 짧게 씁니다. 왜 그럴까요?

  • 기존의 방식 (외부에서 강제로 조절): 예전 방법들은 AI 가 글을 쓰는 도중 "아, 100 자에 가까워졌네?"라고 생각하게 하거나, 강제로 문장을 잘라내는 방식을 썼습니다. 이는 마치 운전자가 핸들을 잡는 대신, 누군가 옆에서 "왼쪽으로 30 도, 오른쪽으로 20 도"라고 외치며 차를 조종하는 것과 같습니다. AI 스스로 길이를 '이해'하지 못하기 때문에, 긴 글을 쓰거나 복잡한 상황에서는 실패하기 쉽습니다.
  • 핵심 원인: AI 는 글자 수를 '숫자'로 인식하지 못합니다. 그냥 의미 있는 단어들의 나열일 뿐이죠. 길이에 대한 '감각 (인지)'이 부족한 것입니다.

💡 해결책: LARFT (AI 에게 '길이의 감각'을 심어주기)

저자들은 이 문제를 해결하기 위해 LARFT라는 새로운 방법을 만들었습니다. 이 방법은 AI 가 글을 쓰는 **행동 (Action)**과 길이를 **이해하는 능력 (Cognition)**을 동시에 훈련시킵니다.

🎨 비유로 설명하는 LARFT 의 3 가지 단계

LARFT 는 마치 요리사가 레시피 (지시사항) 를 보고 요리를 할 때, 단순히 재료를 섞는 게 아니라 '양'을 재는 법을 스스로 배우는 과정과 같습니다.

1. 목표 달성을 위한 보상 게임 (Length-Oriented Reinforcement Learning)

  • 비유: 요리사가 "소스 100ml"를 넣으라고 했을 때, AI 는 여러 번 시도해 봅니다. 100ml 에 가까우면 "잘했어!"라는 점수를 주고, 멀면 "아쉽네"라는 점수를 줍니다.
  • 역할: AI 가 원하는 길이에 맞춰 글을 쓰는 행동을 강화합니다.

2. "후회"를 통한 학습 (Hindsight Length Awareness)

  • 비유: 요리사가 실수로 소스를 150ml 넣었다고 가정해 봅시다. 기존 방식은 그냥 "틀렸어"라고 하고 넘어갑니다. 하지만 LARFT 는 **"잠깐! 방금 넣은 소스가 150ml 였구나. 이걸 기억해!"**라고 가르칩니다.
  • 핵심: AI 가 쓴 글 (실수 포함) 을 다시 보여주고, **"이 글이 몇 자였는지 직접 세어봐"**라고 시킵니다.
  • 효과: AI 는 자신이 쓴 글의 길이를 스스로 파악하는 **내면의 감각 (인지)**을 키웁니다. 실패한 시도조차 "내 글자 수를 세는 연습"으로 바꾸는 clever 한 방법입니다.

3. 두 가지를 균형 있게 섞기 (Unified Optimization)

  • 비유: 처음에는 "양을 재는 법 (인지)"을 먼저 배우게 하고, 나중에는 "맛있는 요리를 만드는 법 (행동)"에 집중합니다.
  • 효과: AI 가 길이를 이해하는 능력과 글을 쓰는 능력을 동시에 발전시켜, 이해한 대로 정확히 실행하게 만듭니다.

🚀 결과: 얼마나 잘해냈나요?

  • 정확도 대폭 향상: 기존 AI 들보다 평균 20 점 이상 더 길이를 정확히 맞추게 되었습니다. (예: "100 자로 써줘"라고 하면 95~105 자 사이를 매우 정확하게 맞춥니다.)
  • 다른 능력은 그대로: 길이를 잘 맞추기 위해 다른 능력 (수학, 논리, 일반 대화 등) 이 떨어지지 않았습니다. 오히려 글의 질은 더 좋아졌습니다.
  • 범용성: 다양한 크기의 AI 모델 (작은 모델부터 큰 모델까지) 에서 모두 효과가 입증되었습니다.

🌟 결론

이 논문은 AI 가 "길이를 숫자로 세는 법"을 스스로 깨우치게 함으로써, 사용자의 지시를 더 정확하게 따르게 만들었습니다.

마치 아이에게 "책장을 10 권만 정리해"라고 할 때, 단순히 "10 권만 가져와"라고 외치는 게 아니라, 아이에게 "책장을 세어보는 법"을 가르쳐 스스로 10 권을 맞춰보게 하는 것과 같습니다. LARFT 는 AI 에게 그 '세는 법'을 가르쳐, 더 똑똑하고 정확한 AI 를 만든 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →