← 최신 논문
💬 NLP

TextReg: Mitigating Prompt Distributional Overfitting via Regularized Text-Space Optimization

본 논문은 텍스트 기울기를 통해 표현의 비효율성을 제어함으로써 대규모 언어 모델에서 프롬프트 분포 과적합을 완화하는 정규화 프레임워크인 TextReg 를 소개하며, 이를 통해 기존 최적화 방법보다 분포 외 일반화를 크게 향상시킵니다.

원저자: Lucheng Fu, Ye Yu, Yiyang Wang, Yiqiao Jin, Haibo Jin, B. Aditya Prakash, Haohan Wang

게시일 2026-05-21
📖 3 분 읽기☕ 가벼운 읽기

원저자: Lucheng Fu, Ye Yu, Yiyang Wang, Yiqiao Jin, Haibo Jin, B. Aditya Prakash, Haohan Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 똑똑하지만 문자 그대로만 이해하는 로봇에게 퍼즐을 푸는 법을 가르친다고 상상해 보세요. 당신은 로봇에게 일련의 지시사항 (프롬프트) 을 제공합니다.

과거 연구자들이 로봇의 자체 피드백을 이용해 이러한 지시사항을 자동으로 개선하려 할 때, 기이한 문제가 발생했습니다. 지시사항은 점점 길어지며 "숫자가 7 이면 X 를 수행하라"와 "사과라면 Y 를 수행하라" 같은 작고 구체적인 규칙들로 가득 차게 되었습니다.

처음에는 로봇이 연습 퍼즐에서 완벽한 점수를 얻었기 때문에 이것이 훌륭한 것처럼 보였습니다. 하지만 로봇이 본 적 없는 새로운 퍼즐을 주면 처참하게 실패했습니다. 이는 특정 연습 시험의 정답을 암기했지만 수학을 이해하지 못해 약간 다른 문제를 풀지 못하는 학생과 같았습니다.

저자들은 이를**"프롬프트 분포 과적합 (Prompt Distributional Overfitting)"**이라고 부릅니다. 간단히 말해, 지시사항이 특정 연습 예제에 너무 매몰되어 현실 세계를 처리할 능력을 상실한 것입니다.

해결책: TextReg (스마트 편집자)

이 논문은 TextReg라는 새로운 방법을 소개합니다. TextReg 를 로봇의 지시사항 작성 과정을 지켜보며 혼란스러워지는 것을 막는 엄격하고 현명한 편집자로 생각하세요.

TextReg 가 작동하는 방식을 세 가지 간단한 비유로 설명합니다.

1. "이중 확인" 필터 (이중 증거 경도 정제)

로봇이 새로운 규칙을 제안한다고 가정해 봅시다: "항상 토마토를 채소로 계산하라."

  • 과거 방식: 로봇은 연습 시험의 특정 토마토 예제에서 작동했기 때문에 이 규칙을 그냥 받아들일 수 있습니다.
  • TextReg 방식: TextReg 는 두 가지 질문을 던집니다.
    1. "이 규칙이 이 특정 토마토 하나 때문에만 작동한 것은 아닌가?" (지역 확인)
    2. "이 규칙을 다른 과일이나 사물에 대해서도 본 적이 있는가?" (전역 확인)
      만약 규칙이 토마토에서만 작동하고 다른 곳에서는 관찰되지 않았다면, TextReg 는 이를 폐기합니다. 대신 *"모든 과일을 계산하라"*와 같이 넓고 유용한 규칙만 유지합니다.

2. "피트니스 트래커" (의미적 편집 정규화)

지시사항이 바뀔 때마다 TextReg 는 프롬프트의 "건강 상태"를 점검합니다. 두 가지 사항을 확인합니다.

  • 길이: 지시사항이 불필요하게 길어졌는가? (문장에 불필요한 단어를 너무 많이 추가하는 것과 같음)
  • 범위: 지시사항이 너무 좁아졌는가? (주요일에만 적용되는 규칙을 추가하는 것과 같음)
    지시사항이 너무 길거나 너무 구체적이 되면, TextReg 는 로봇에게 불필요한 부분을 잘라내고 규칙을 확장하라는 "수정 신호"를 생성합니다. 이는 개인 트레이너가 "식단에 쓰레기 음식을 추가하지 마라!"라고 외치는 것과 같습니다.

3. "가이드된 재작성" (정규화 유도 프롬프트 업데이트)

마지막으로, 로봇이 지시사항을 다시 작성할 때 단순히 작업 피드백 (퍼즐을 푸는 방법) 만 듣지 않습니다. "피트니스 트래커"의 의견도 듣습니다.

  • 작업이 "토마토에 대한 규칙을 추가하라"고 하지만, 피트니스 트래커가 "구체적으로 만들지 마라"고 말하면, TextReg 는 로봇이 중간 지점을 찾도록 강제합니다. 예를 들어, 토마토가 아닌 일반적인 "채소"에 대한 규칙으로 수정할 수 있습니다.

결과: 왜 중요한가

저자들은 논리 퍼즐과 수학 문제와 같은 다양한 추론 작업에서 이를 테스트했습니다. 그 결과 다음과 같은 사실을 발견했습니다.

  • 과거 방법들(TextGrad 나 REVOLVE 등)은 연습 시험에서는 잘 작동했지만, 동일한 작업의 새로운 더 어려운 버전에서는 실패하는 길고 지저분한 지시사항을 자주 생성했습니다.
  • TextReg는 더 짧고 깔끔한 지시사항을 생성했습니다. 규칙이 구체적 예제에 묶이지 않고 광범위했기 때문에, 로봇은 새롭고 본 적 없는 문제에서 훨씬 더 잘 수행했습니다 (연구자들이 "분포 외 (Out-of-Distribution)" 일반화라고 부르는 것).

사실, TextReg 는 어려운 작업에서 기존 방법 대비 최대 **16.5%**까지 정확도를 향상시켰습니다.

결론

TextReg 는 AI 를 위한 지시사항 작성을 좋은 교과서 작성과 동일하게 다룹니다. 좋은 교과서는 본 적 있는 모든 예시를 나열하는 것이 아니라, 본 적 없는 문제를 풀 수 있도록 일반 원리를 가르쳐야 합니다. TextReg 는 AI 의 지시사항이 이러한 원리에 집중하도록 보장하여, 연습 시험을 암기하는 것을 방지합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →