← 최신 논문
📊 statistics

Why is prompting hard? Understanding prompts on binary sequence predictors

본 논문은 프롬프팅을 시퀀스 예측기에서 최적의 조건부 시퀀스를 찾는 문제로 규정하여 그 과제를 탐구하며, 통제된 실험과 최첨단 모델 분석을 통해 최적의 프롬프트는 종종 직관적이지 않고 포괄적 탐색을 통しても 식별하기 어려우며 표준 데모 기반 방법을 사용할 경우 빈번히 비최적임을 밝힙니다.

원저자: Li Kevin Wenliang, Anian Ruoss, Jordi Grau-Moya, Marcus Hutter, Tim Genewein

게시일 2026-05-12
📖 5 분 읽기🧠 심층 분석

원저자: Li Kevin Wenliang, Anian Ruoss, Jordi Grau-Moya, Marcus Hutter, Tim Genewein

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 여러분은 초지능적이고 고도로 훈련된 앵무새를 가지고 있습니다. 이 앵무새는 수백만 권의 책을 읽고, 수없이 많은 영화를 보고, 지금까지 만들어진 모든 라디오 쇼를 들어봤습니다. 이 앵무새는 누구보다도 문장의 다음 단어를 예측하는 법을 알고 있습니다. 이것이 바로 여러분의 AI 모델입니다.

이제 여러분은 이 앵무새에게 특정한 재주를 보여주고 싶어 합니다. 농담을 하거나, 슬픈 시를 쓰거나, 수학 문제를 풀게 하는 것입니다. 여러분은 프롬프트(시작을 돕기 위한 몇 마디의 지시나 예시) 를 제공함으로써 이를 수행합니다.

이 논문은 단순하지만 깊은 질문을 던집니다: 왜 앵무새에게 줄 완벽한 단어를 찾는 것이 그토록 어려운가? 때로는 가장 잘 작동하는 지시문이 인간에게는 완전히 기이하고, nonsensical(의미 없는), 심지어 "틀린" 것처럼 보일 수 있습니다. 왜 명료하고 논리적인 지시문보다 말도 안 되는 것처럼 보이는 프롬프트가 더 잘 작동할까요?

저자들은 추측을 멈추고 실험을 시작하기로 결정했습니다. 앵무새의 뇌 안에서 실제로 무슨 일이 일어나는지 이해하기 위해 작고 통제된 세계를 구축한 것입니다.

실험: 동전 던지기 앵무새

실제 복잡한 AI 대신, 연구자들은 앞면뒷면 (동전 던지기처럼) 만 이해하는 간단한 "앵무새"를 만들었습니다.

  • 훈련: 그들은 이 앵무새에게 수천 번의 동전 던지기를 보여주며 가르쳤습니다. 하지만 여기에는 함정이 있었습니다. 그들은 공정한 동전만 보여준 것이 아니라, 다양한 방식으로 편향된 동전들을 보여주었습니다. 어떤 동전은 20% 의 확률로 앞면이 나왔고, 다른 것들은 90% 의 확률로 나왔으며, 어떤 것들은 둘의 혼합이었습니다. 앵무새는 훈련 과정에서 본 패턴을 바탕으로 다음 던지기를 추측하는 법을 배웠습니다.
  • 과제: 이제 그들은 앵무새가 70% 의 확률로 앞면이 나오는 특정 동전처럼 행동하기를 원했습니다. 그들은 물었습니다: "앵무새가 70% 확률로 앞면을 추측하게 만들기 위해 보여줘야 할 앞면과 뒷면의 가장 좋은 순서는 무엇인가?"

큰 놀라움: "틀린" 프롬프트가 가장 잘 작동함

앵무새에게 70% 확률로 앞면을 추측하도록 가르치는 가장 좋은 방법은 70% 앞면과 30% 뒷면으로 이루어진 긴 목록을 보여주는 것이라고 생각할 수 있습니다. 그건 논리적으로 보이죠, 그렇죠?

이 논문은 이것이 종종 잘못되었다는 사실을 발견했습니다.

많은 경우, 최적의 프롬프트(실제로 가장 잘 작동하는 것) 는 과업과 전혀 닮지 않은 순서였습니다.

  • 비유: 조용한 도서관에서 공부하는 데 익숙한 학생에게 시끄러운 카페테리아에서 공부하도록 가르치고 싶다고 상상해 보세요. 시끄러운 카페테리아의 녹음을 보여주는 것이 그들을 준비시키는 가장 좋은 방법이라고 생각할 수 있습니다. 하지만 이 논문은 때로는 그들을 준비시키는 가장 좋은 방법이 시끄러운 소리를 기대하도록 뇌를 미묘하게 속이는 침묵의 순서를 보여주는 것이라고 발견했습니다.
  • 현실: "최고의" 프롬프트는 전적으로 앵무새가 어떻게 훈련되었는지(사전 훈련 분포) 에 달려 있습니다. 앵무새가 특정 동전 편향의 혼합으로 훈련되었다면, 그것을 특정 방식으로 행동하게 만드는 "마법의 단어"는 앞면만 연속된 순서이거나, 10 개의 앞면과 2 개의 뒷면이 기이하게 섞인 순서일 수 있습니다. 과업만 보고 있는 인간에게는 이것이 실수로 보일 수 있습니다. 하지만 앵무새에게는 올바른 행동을 해방시키는 완벽한 열쇠입니다.

왜 이것이 파악하기 그렇게 어려운가?

이 논문은 이러한 "마법의 단어"를 찾는 것이 악몽 같은 세 가지 주요 이유를 강조합니다:

1. "숨겨진 레시피" 문제
앵무새의 행동은 우리가 보통 알지 못하는 비밀스러운 "레시피"(사전 훈련 분포) 에 의해 형성됩니다.

  • 비유: 라디오를 특정 방송국으로 튜닝하려고 한다고 상상해 보세요. 여러분은 그 방송국이 어떤 소리를 내는지 모르고, 라디오가 어떻게 만들어졌는지도 모릅니다. 여러분은 그냥 다이얼을 돌릴 뿐입니다. 때로는 "분명한" 위치로 돌리면 정전기 소리만 납니다. 여러분은 맑은 소리를 얻기 위해 기이하고 무작위적인 위치로 다이얼을 돌려야 합니다. 라디오의 내부 배선을 알지 못하면, 왜 그 기이한 위치가 작동하는지 설명할 수 없습니다.

2. "평탄한 지형" 문제
저자들은 최고의 프롬프트를 찾는 과정을 언덕진 지형을 걷는 것처럼 시각화했습니다.

  • 비유: 여러분은 가장 높은 봉우리 (최고의 프롬프트) 를 찾고 있습니다. 완벽한 세상에서는 하나의 날카로운 산봉우리가 있어 찾기 쉽습니다. 하지만 이 논문의 실험에서 "지형"은 종종 평평한 고원입니다. 거의 동등하게 좋은 수백 가지의 다른 프롬프트가 존재합니다.
  • 결과: 소량의 데이터 (작은 테스트 배치) 를 사용하여 최고의 프롬프트를 찾으려 한다면, 실제로는 진정한 최고의 것과 다른 "충분히 좋은" 프롬프트를 우연히 선택할 수 있습니다. 조금 다른 배치로 테스트를 다시 실행하면, 또 다른 "충분히 좋은" 프롬프트를 선택할 수 있습니다. 이로 인해 결과가 불안정해지고 해석하기 어려워집니다.

3. "전문가 시연" 함정
AI 를 가르치는 인기 있는 방법은 전문가가 과업을 수행하는 예시를 보여주는 것입니다 (예: "여기는 체스 그랜드마스터가 어떻게 두는지입니다").

  • 발견: 이 논문은 전문가 예시를 보여주는 것이 종종 기이하고 최적화된 프롬프트를 사용하는 것보다 효과가 낮다는 것을 보여주었습니다.
  • 비유: 로봇이 체스를 완벽하게 두게 하고 싶다고 상상해 보세요. 여러분은 그랜드마스터가 둔 100 개의 게임을 보여줄 수 있습니다. 또는, 로봇의 뇌를 "그랜드마스터 모드"로 강제하는 기이하고 짧은 코드를 줄 수 있습니다. 이 논문은 그 기이한 코드가 종종 100 개의 게임보다 더 잘 작동한다는 사실을 발견했습니다. 전문가 예시들은 너무 "전형적"이며 로봇의 특정 훈련 편향을 고려하지 못합니다.

실제 AI (예: 챗봇) 는 어떨까?

저자들은 영화 리뷰를 사용하여 실제 대규모 언어 모델 (GPT-2 및 Gemma 등) 에 대해 이러한 아이디어를 테스트했습니다.

  • 그들은 동일한 패턴을 발견했습니다: "긍정적인" 리뷰를 생성하는 데 가장 좋은 프롬프트가 항상 긍정적으로 들리는 단어는 아니었습니다. 때로는 짧고 기이하거나, 심지어 부정적으로 들리는 단어들이 어떤 식으로든 올바른 응답을 유발했습니다.
  • 그들은 또한 가장 좋은 프롬프트를 신뢰할 수 있게 찾기 위해서는 사람들이 일반적으로 사용하는 작은 배치 (약 200 개) 가 아니라 엄청난 양의 데이터(수천 개의 예시) 가 필요하다는 사실도 발견했습니다. 작은 배치로는 단순히 추측하는 것에 불과합니다.

결론

이 논문은 프롬프팅이 어려운 이유는 우리가 AI 의 전체 역사를 알지 못한 채 기계를 조종하려고 하기 때문이라고 결론지었습니다.

  • "최고의" 프롬프트는 상대적입니다: 보편적인 "최고의" 프롬프트는 존재하지 않습니다. 최고의 프롬프트는 AI 훈련 데이터의 특정이고 숨겨진 편향에 달려 있습니다.
  • 직관은 실패합니다: 인간에게는 논리적으로 보이는 것 (AI 에게 원하는 것을 보여주는 것) 은 종종 AI 의 내부 "수학"을 고려하지 않기 때문에 실패합니다.
  • 신뢰성은 낮습니다: 포괄적으로 검색하고 거대한 데이터 세트를 사용하지 않는 한, 여러분이 찾는 프롬프트는 일관되게 작동하지 않는 운 좋은 추측일 수 있습니다.

간단히 말해, 이 논문은 프롬프팅의 "마법"이 단순히 좋은 지시문을 작성하는 것에 관한 것이 아니라, 종종 우리에게 완전히 반직관적으로 보이는 방식으로 AI 의 숨겨진 통계적 편향을 해킹하는 것에 관한 것이라고 제안합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →