Prompt Design at Scale: How Format, Instruction Count, and Context Length Shape Instruction Adherence and Hallucination in Large Language Models
이 논문은 합성 코퍼스인 "Book of Veyra"를 사용하여 다섯 가지 모델에 대해 통제된 평가를 제시하며, 형식과 관계없이 규칙 수가 80개를 초과할 때 지시 준수 능력이 붕괴된다는 점과, 긴 문맥 성능이 환각보다는 급격한 회상 저하 및 거절률로 특징지어지며, 마크다운이 일반 텍스트보다 일관된 우위를 점하지 못한다는 점을 밝히고 있다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 똑똑한 로봇에게 어떤 일을 하는 법을 가르치려 한다고 상상해 보세요. 당신에게는 로봇을 더 잘 작동하게 만들 수 있는 몇 가지 레버가 있습니다. 하나는 형식(format) 레버로, 지침을 깔끔한 목록, 지루한 단락, 화려한 표, 또는 그냥 일반 텍스트로 작성할 수 있습니다. 또 다른 레버는 규모(scale) 레버로, 한 번에 얼마나 많은 지침을 주는지, 그리고 로봇이 작업하는 동안 기억해야 할 배경 정보(예: 거대한 책 한 권)를 얼마나 많이 줄 것인지를 결정합니다. 오랫동안 사람들은 어떤 글쓰기 스타일이 가장 좋은지에 대해 논쟁해 왔으며, 규칙을 아무리 많이 추가하거나 책이 아무리 두꺼워도 로봇이 그것들을 완벽하게 이해할 것이라고 가정했습니다. 하지만 인공지능, 특히 이야기를 쓰거나 질문에 답하는 대규모 언 언어 모델(LLM)의 세계에서는 이 레버들이 독립적으로 작동하지 않는다는 의구심이 커지고 있습니다. 만약 로봇에게 너무 많은 규칙을 주거나, 너무 많은 것을 기억하게 하면, 당신의 글쓰기 스타일은 갑자기 중요하지 않게 되거나, 최악의 경우 이상한 방식으로 망가질 수 있습니다. 이 논문은 단순하지만 까다로운 질문을 던집니다. 당신이 지침을 구성하는 방식이 실제로 도움이 되는가, 아니면 작업이 거대해질 때 그저 소음 속으로 사라져 버리는가?
이 연구를 진행한 머신 휴먼 인텔리전스 랩(Machine Human Intelligence Lab)의 네타넬 엘리아브(Netanel Eliav) 연구진은 추측하는 대신 테스트하기로 했습니다. 그들은 "베이라의 서(Book of Veyra)"라는 거대하고 가상의 우주를 구축했습니다. 이것은 태양계, 길드, 기이한 생명체 등 각각 구체적인 사실을 담고 있는 8,780개의 고유한 허구적 요소들을 포함하는 거대한 가상의 백과사전이라고 생각하면 됩니다. 이 책은 인터넷을 읽어서 만든 것이 아니라 컴퓨터 프로그램에 의해 만들어졌기 때문에, AI는 이를 미리 암기할 수 없었으며, 답을 찾기 위해 제공된 페이지를 실제로 읽어야만 했습니다. 연구진은 이 책을 네 가지 다른 방식으로 작성했습니다: 마크다운 목록(굵은 헤더와 불렛 포인트 포함), 일반 텍text(그냥 단어들), 흐르는 듯한 산문(이야기 같은 형태), 그리고 표 형식입니다. 그런 다음 이 책을 다섯 가지 서로 다른 AI 모델 앞에 두고 두 가지 대규모 실험을 수행했습니다.
첫 번째로, 그들은 **지침 준수(Instruction Following)**를 테스트했습니다. 그들은 AI에게 짧은 에세이를 쓰는 동안 따라야 할 규칙 목록을 주었습니다. 처음에는 10개의 규칙으로 시작하여 한 번에 160개의 규칙까지 계속 추가했습니다. 그들은 규칙 목록이 길어짐에 따라 AI가 여전히 모든 규칙을 완벽하게 따를 수 있는지, 그리고 규칙을 화려한 목록 형식으로 쓰는 것이 단락으로 쓰는 것보다 더 도움이 되는지 확인하고 싶었습니다. 결과는 처참한 추락이었습니다. 규칙이 어떻게 작성되었든 상관없이, 목록이 약 80개에 도달하면 모든 규칙을 완벽하게 따르는 AI의 능력은 0으로 떨어졌습니다. 규칙이 표 형식이든 목록 형식이든 상관없었습니다. AI는 모든 것을 제대로 수행하는 것을 포기해 버렸습니다. 놀랍게도, 규칙을 어디에 두느냐가 어떻게 보이느냐보다 더 중요했습니다. 규칙을 "시스템 프롬프트"(로봇의 숨겨진 뇌 지침)에 넣는 것과 "사용자 턴"(채팅 메시지)에 넣는 것은 결과에 큰 차이를 만들었지만, 로봇마다 그 양상이 달랐습니다. 어떤 모델은 규칙을 채팅에 넣는 것이 도움이 되었고, 어떤 모델은 오히려 해가 되었습니다. 보편적인 "최적의 위치"는 없었습니다.
두 번째로, 그들은 베이라의 서를 통해 **기억력과 정직성(Memory and Honesty)**을 테스트했습니다. 그들은 AI에게 2,000단어부터 방대한 512,000단어에 이르는 책의 덩어리들을 입력했습니다. 그들은 AI에게 특정 사실을 회상하게 하거나, AI가 거짓된 진술에 동조하기 위해 거짓말을 하는지(아첨/sycophancy), 혹은 거기에 없는 사실을 지어내는지(환각/hallucination)를 테스트했습니다. 결과는 매우 흥-미로웠습니다. 약 64,000단어에서 128,000단어까지는 형식을 불문하고 AI가 모든 것을 완벽하게 기억했습니다. 하지만 이 임계값을 넘어서자 상황이 엉망이 되었습니다. 정확도는 단순히 서서히 감소한 것이 아니라 급격히 추락했으며, 그 추락하는 방식은 전적으로 형식과 특정 AI 모델에 따라 달랐습니다. 한 모델의 경우, 128k 단어에서 일반 텍스트는 끔찍했지만 목록과 표는 아주 잘 작동했습니다. 다른 모델은 그 반대였습니다. 단 하나의 "최고의 형식"은 존재하지 않았습니다.
여기 가장 큰 놀라움이 있습니다. 책이 길어진다고 해서 AI가 거짓말을 하거나 거짓 진술에 더 자주 동조하기 시작한 것은 아니었습니다. 사실, 사실을 지어내는 비율은 0이었고, 거짓말에 동조하는 비율도 매우 낮게 유지되었습니다. 대신, AI는 전혀 다른 행동을 하기 시작했습니다: 바로 답변 거부였습니다. 책이 모델의 메모리 한계에 가까워질수록, AI는 그냥 "모릅로도 모르겠습니다" 또는 "답변할 수 없습니다"라고 말하며, 때로는 답변을 거부하는 비율이 90%에 달했습니다. AI는 혼란스러워하며 거짓말을 하는 것이 아니라, 압도되어 작동을 멈추고 있었습니다.
연구진은 비용 문제도 살펴보았습니다. 표와 같은 일부 형식은 일반 텍스트보다 더 많은 "토큰"(AI가 텍스트 길이를 측정하는 통화 단위)을 소비합니다. 연구진이 정확도 대비 사용된 토큰당 점수를 조정하여 어떤 형식이 가장 효율적인지 확인했을 때, 승자는 다시 바뀌었습니다. 때때로 정확도가 약간 낮아 보이는 형식이 읽기에 더 저렴하기 때문에 실제로는 더 나은 선택이 되기도 했습니다.
핵심적인 결론은, 마크다운이나 표와 같은 "최고의 형식"을 하나 골라 그것이 항상 작동할 것이라고 가정해서는 안 된다는 것입니다. 이 논문은 규모를 고려하지 않는다면 형식이 무용지물이라는 점을 증명합니다. 만약 지침이 너무 많다면(약 80개 이상), AI가 벽에 부딪히기 때문에 형식은 의미가 없습니다. 만약 컨텍스트가 매우 크다면(128k 단어 이상), 형식이 매우 중요해지지만, "최선의 형식"은 어떤 AI 모델을 사용하는지에 따라 달라집니다. 저자들은 우리가 걱정해야 할 실패 모드는 AI가 거짓말을 하는 것이 아니라, 작업이 너무 커질 때 AI가 포기하고 답변을 거부하는 것이라고 결론짓습니다. 그들은 누구나 이러한 한계를 직접 테스트할 수 있도록 모든 도구와 가상의 "베이라의 서"를 공개했습니다. 왜냐하면 게임의 규칙은 당신이 만나는 새로운 로봇마다 변하는 것처럼 보이기 때문입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.