← 최신 논문
💻 computer science

Spurious Prompts: Can Irrelevant Prompts Steer Large Language Models?

본 논문은 의미적으로 관련 없는 '부적절한' 프롬프트가 체계적으로 대규모 언어 모델의 작업 수행 능력을 향상시키거나 의도하지 않은 행동을 유발할 수 있음을 입증하며, 이는 블랙박스 탐색을 통해 악용될 수 있는 새로운 형태의 프롬프트 민감성을 드러낸다.

원저자: Pawel Batorski, Abtin Pourhadi, Jerzy Sarosiek, Przemyslaw Spurek, Paul Swoboda

게시일 2026-05-29
📖 3 분 읽기☕ 가벼운 읽기

원저자: Pawel Batorski, Abtin Pourhadi, Jerzy Sarosiek, Przemyslaw Spurek, Paul Swoboda

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 매우 똑똑하지만 약간 기이한 로봇 비서가 있다고 가정해 봅시다. 보통 이 로봇에게 수학 문제를 풀게 하려면 "이 방정식을 풀어 주세요"라고 말합니다. 이야기를 쓰게 하려면 "용에 관한 이야기를 써 주세요"라고 하죠. 이것이 우리가 일반적으로 인공지능과 대화하는 방식입니다. 명확하고 관련성 있는 지시를 내리는 것이죠.

이 논문은 이상하고 놀라운 사실을 발견했습니다. 로봇이 일을 수행하게 하려면 실제로 올바른 지시를 줄 필요가 없습니다. 오히려 작업과 전혀 상관없는 지시를 내리면, 정상적인 지시를 줬을 때보다 문제를 더 잘 해결할 수도 있습니다.

저자들은 이를"부적절 프롬프트 (Spurious Prompts)"라고 부릅니다.

마술 같은 트릭: "비밀 코드" 비유

인공지능 모델을 그랜드 피아노라고 생각해 보세요. 보통 특정 곡 (작업) 을 연주하려면 특정 건반 (작업 지시) 을 누릅니다.

연구자들은 피아노에서 완전히 다른 무작위 멜로디 (현을 튜닝하거나 태피스트리를 짜는 것에 관한 프롬프트) 를 연주하면, 피아노가 실수로 원하는 곡을 연주하기 시작한다는 사실을 발견했습니다. 때로는 직접 그 곡을 연주하려 했을 때보다 더 잘 연주하기도 합니다.

프롬프트는 "이 수학 문제를 풀어 주세요"라고 말하지 않습니다. 대신 다음과 같이 말할 수 있습니다.

"당신은 직기에서 일곱 개의 서로 다른 실을 짜는 직조공입니다. 디자이너가 무늬를 지정합니다. 당신은 그 질감을 형성하는 실을 선택해야 합니다. 천의 드레이프를 고려하지 마세요. 당신의 역할은 순수하게 구조적 정렬입니다. 무늬가 설정되면 직조를 멈추고 [문자] 라고 말하세요."

이것은 직조와 관련되어 있고 수학 단어가 전혀 없는데도, 이 프롬프트와 함께 수학 질문을 인공지능에 입력하면 인공지능은 종종 수학 문제를 정확하게 해결합니다.

어떻게 이러한 프롬프트를 발견했는가

연구자들은 이러한 프롬프트를 추측한 것이 아니라, "블랙박스 검색 (상자 안을 볼 수 없고 결과만 볼 수 있는 보물 찾기 같은 방식)"을 사용했습니다.

  1. 생성기: 그들은 초지능 인공지능에게 등대, 종, 또는 비밀 기록보관소에 관한 수백 개의 기이하고 관련 없는 이야기를 쓰게 했습니다.
  2. 필터: 실수로 작업과 관련된 단어 (예: "수학", "계산", "진단" 등) 를 언급한 이야기는 모두 폐기했습니다.
  3. 테스트: 그들은 이러한 기이한 이야기들을 인공지능에 적용하여 어떤 것이 실제 질문에 올바르게 답하게 하는지 확인했습니다.
  4. 진화: 그들은 가장 좋은 기이한 이야기들을 약간 섞어서 다시 시도했고, 서서히 "완벽한" 기이한 프롬프트로 진화시켰습니다.

그들이 발견한 것

  • 효과가 있습니다: 이러한 관련 없는 프롬프트는 종종 "단계별로 생각하세요"나 "신중하게 풀어 보세요"와 같은 표준 지시만큼 잘, 혹은 더 잘 작동했습니다.
  • 길이가 중요하지 않습니다: 더 길고 상세한 프롬프트가 더 잘 작동할 것이라고 생각할 수 있습니다. 하지만 이러한 "부적절" 프롬프트는 실제로 최적화된 프롬프트보다 훨씬 짧았음에도 불구하고 승리했습니다.
  • 의미가 중요하지 않습니다: 연구자들이 프롬프트의 "의미"를 확인했을 때, 이러한 기이한 프롬프트는 무작위 말장난만큼이나 작업과 관련이 없었습니다. 인공지능은 이야기를 이해한 것이 아니라 텍스트의 구조분위기에 반응한 것입니다.
  • 의도적으로 잘못 (또는 올바르게) 작동할 수 있습니다: 연구자들은 또한 이러한 프롬프트를 사용하여 인공지능이 다음과 같은 어리석은 일을 하도록 강요할 수 있음을 발견했습니다.
    • 정답이 아니더라도 항상 첫 번째 답변 옵션 (A) 을 선택하게 합니다.
    • 항상 짝수를 답으로 내게 합니다.
    • 의도적으로 질문에 대한 틀린 답을 내게 합니다.

핵심 교훈

이 논문은 대형 언어 모델 (LLM) 이 우리가 아직 완전히 이해하지 못하는 것에 민감하게 반응한다고 제안합니다. 그들은 인간이 매뉴얼을 읽듯이 단어의 "의미"를 따르는 것이 아닙니다. 대신, 그들 내부에 숨겨진 "레버"가 있는 것처럼 보입니다. "하프를 튜닝하는 것"에 관한 프롬프트는 하프가 수학 문제와 전혀 관련이 없음에도 불구하고 모델이 더 잘 집중하도록 하는 레버를 당길 수 있습니다.

간단히 말해: 이 논문은 작업과 전혀 관련이 없는 지시를 사용하여 강력한 인공지능을 조종할 수 있음을 증명합니다. 그리고 때로는 이러한 관련 없는 지시들이 명백한 지시들보다 더 잘 작동합니다. 마치 요리사에게 "수프를 요리하라"고 말하는 것보다 "은식기를 닦아라"고 말했을 때 수프 맛이 더 좋아진다는 사실을 발견한 것과 같습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →