← 최신 논문
🤖 AI

Your Prompt Is Not the Only Prompt: How Much Do LLMs Weight Structured-Output Schema Descriptions?

이 논문은 시스템 프롬프트가 지시문 배치를 위한 가장 안전한 기본값으로 일반적으로 유지되는 반면, 스키마 설명은 프롬프트를 무력화할 수 있는 강력하고 모델 의존적인 지시 채널로서, 구조화된 출력 성능을 최적화하기 위해 통일된 스키마 설계와 실증적 검증이 매우 중요하다는 것을 입증한다.

원저자: Sin-Ying Lin

게시일 2026-08-11
📖 3 분 읽기☕ 가벼운 읽기

원저자: Sin-Ying Lin

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 아주 똑똑하지만 약간은 글자 그대로만 받아들이는 로봇에게 뒤섞인 장난감 더미를 분류하는 법을 가르치려 한다고 상상해 보세요. 당신에게는 두 가지 방법이 있습니다. 로봇에게 직접 말을 거는 방식(선생님이 강의를 하는 것처럼)이나, 상자들을 채울 수 있는 특별한 양식을 건네주며 상자 바로 옆에 지침을 적어두는 방식입니다. 이것이 바로 현대 AI 도구들의 두뇌 역할을 하는 '대규모 언어 모델(LLM)'의 세계입니다. 보통 사람들은 '말(프롬프트)'이 진짜 규칙이 담긴 곳이고, '양식(구조화된 출력 스키마)'은 로봇이 따르기 위한 지루한 템플릿일 뿐이라고 생각합니다. 하지만 최근 개발자들은 한 가지 의문을 품기 시작했습니다. 로봇이 실제로 양식에 적힌 메모를 읽는 것일까요, 아니면 그저 무시하고 선생님의 말만 듣는 것일까요? 이 질문은 매우 중요합니다. 만약 우리가 가장 중요한 규칙을 엉뚱한 곳에 둔다면, 로봇이 장난감을 완전히 잘못 분류하여 우리가 매일 사용하는 앱과 도구들을 망가뜨릴 수 있기 때문입니다.

린 신잉(알리나)이라는 연구자는 이 논쟁을 해결하기 위해 영리한 실험을 설계했습니다. 그녀는 단순히 논쟁하는 대신, 로봇이 짧은 메시지들을 네 가지 비밀 카테고리로 분류하는 게임을 설정했습니다. 이때 로봇이 실제 세상의 지식을 바탕으로 정답을 유추하지 못하도록 '토밀(tomil)', '바렉(varek)' 같은 가상의 이름을 사용했습니다. 그러고 나서 그녀는 지침의 위치를 바꾸는 '의자 뺏기 게임'을 진행했습니다. 즉, 선생님의 강의(시스템 프롬프트)에 있던 정의를 양식의 메모(스키마 설명)로 옮기거나, 때로는 사용자의 채팅창에 배치하며 똑같은 정의를 이리저리 옮겨본 것입니다.

그녀가 발견한 결과는 다소 놀라웠습니다. 로봇의 귀는 모두 같은 크기가 아니었습니다. GPT-4.1이나 GPT-5.4(특수 사고 모드 없이)와 같은 일부 모델의 경우, 선생님의 목소리가 왕이었습니다. 정의가 양식으로 옮겨졌을 때, 이 로봇들은 혼란에 빠졌고 정확도가 약 11~13%포인트 하락했습니다. 이들은 마치 "양식은 그저 채우기 위한 것일 뿐이고, 진짜 규칙은 말 속에 있다!"라고 생각하는 듯했습니다. 하지만 Claude Haiku 4.5와 같은 다른 모델의 경우, 양식이 오히려 대장이었습니다. 양식의 지침을 틀리게 바꾸었을 때, 이 로봇의 성능은 52.5%에서 처참한 7%로 폭락했습니다. 어떤 로봇들에게는 양식에 적힌 메모가 너무 커서 선생님의 올바른 지침을 집어삼킬 정도라는 사실이 드러난 것입니다.

또한 이 논문은 양식을 무시하는 로봇들을 고치는 '마법의 기술'을 발견했습니다. 로봇이 최종 답을 선택하기 전에 반드시 자신의 '추론 과정'을 상자에 먼저 적어야 하는 필수 단계를 추가함으로써, 성능이 15~24%포인트 급상승했습니다. 마치 로봇에게 "풀이 과정을 보여달라"고 강요하는 것이 양식에 적힌 규칙에 주의를 기울이게 만드는 효과를 준 것 같았습니다.

따라서 핵심적인 결론은 어느 한 곳이 항상 더 낫다는 것이 아닙니다. 대신, 이 논문은 모든 로봇 모델이 각자의 개성을 가지고 있으며, 서로 다른 채널을 서로 다른 볼륨으로 듣는다는 점을 시사합니다. 현재로서는 가장 안전한 방법은 가장 중요한 규칙을 시스템 프롬프트(선생님의 목소리)에 두는 것이지만, 양식에 상충하는 규칙을 적지 않도록 주의해야 합니다. 그렇지 않으면 어떤 로봇들은 잘못된 규칙을 따를 수도 있기 때문입니다. 진짜 교훈은 단순히 추측해서는 안 된다는 것입니다. 각 로봇이 어디에서 가장 잘 듣는지 테스트해야 하며, 때로는 지침을 통째로 다시 쓰는 것보다 '사고 단계'를 포함하도록 양식의 형태를 바꾸는 것이 더 강력한 해결책이 될 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →