Optimization before Evaluation: Evaluation with Unoptimised Prompts Can be Misleading
본 논문은 정적 프롬프트에 의존하는 현재 LLM 평가 프레임워크가 프롬프트 최적화가 모델 순위에 상당한 변화를 일으키기 때문에 오해의 소지가 있으며, 특정 작업에 가장 적합한 모델을 정확하게 식별하려면 모델별 프롬프트 최적화가 필요하다고 주장한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
다음은 "평가 전 최적화: 최적화되지 않은 프롬프트로 평가하는 것은 오해의 소지가 있다"는 제목의 논문을 쉬운 언어와 일상적인 비유를 사용하여 설명한 내용입니다.
핵심 아이디어: "일률적 적용"의 함정
당신이 레스토랑을 운영하며 최고의 셰프를 구하려는 채용 담당자라고 상상해 보세요. 당신은 다섯 명의 다른 셰프 (모델 A, B, C, D, E 라고 부르겠습니다) 가 있습니다. 그들을 테스트하기 위해 모두에게 똑같은 레시피 카드를 줍니다: "스튜를 만드세요. 소금, 후추, 양파를 사용하세요."
그들이 요리하는 것을 지켜보고 스튜를 맛본 뒤 순위를 매깁니다. 셰프 B 가 승리합니다. 당신은 셰프 B 를 채용합니다.
문제점: 셰프 B 는 그 특정 레시피를 따르는 데 뛰어나지만, 어쩌면 셰프 D 가 실제로는 천재일지도 모릅니다. 다만 조금 다르게 레시피를 작성해야 빛을 발할 뿐입니다. 셰프 D 가 최고의 실력을 발휘하려면 지시문이 *"양파를 먼저 졸인 다음 소금을 넣으세요"*라고 되어야 할지도 모릅니다.
이 논문은 현재 대규모 언어 모델 (AI 모델) 을 테스트하는 방식이 바로 그런 채용 담당자와 같다고 주장합니다. 그들은 모든 AI 에게 **정확히 동일한 정적 프롬프트 (레시피 카드)**를 제공하고, 그 특정 카드로 가장 잘 수행한 사람을 기준으로 순위를 매깁니다.
저자들은 이것이 오해의 소지가 있다고 말합니다. 현실 세계에서 AI 를 채용한다면, 단순히 일반적인 프롬프트를 주는 것이 아니라 그 특정 AI 에서 최고의 성과를 끌어내기 위해 지시문을 수정할 것입니다. 이 논문은 그 과정을 **프롬프트 최적화 (Prompt Optimization, PO)**라고 부릅니다.
실험: 레시피를 수정하면 승자가 바뀐다
연구진은 다섯 가지 인기 있는 AI 모델을 다양한 작업 (수학 문제 해결, 비즈니스 질문 답변, 데이터 추출 등) 에 대해 테스트했습니다.
- 1 라운드 (구식 방식): 모든 모델에게 동일한 '기본' 프롬프트를 주었습니다. 그리고 순위를 매겼습니다.
- 2 라운드 (신규 방식): 자동화 도구를 사용하여 각 모델 individually 프롬프트를 '튜닝'했습니다. AI 에게 "어떻게 지시문을 다시 쓰면 당신이 가장 잘 이해할 수 있을까요?"라고 물은 뒤, 테스트를 다시 실행했습니다.
결과: 순위가 완전히 바뀌었습니다.
- 어떤 경우에는 1 라운드에서 꼴찌였던 모델이 2 라운드에서 1 위까지 뛰어올랐습니다.
- 구식 테스트에서 '최고'였던 모델은 특정 뇌 구조에 맞춘 지시문을 받았을 때 반드시 최고인 것은 아니었습니다.
비유: 트랙에서 달리는 선수를 테스트하는 것과 같습니다.
- 구식 방식: 모두에게 무거운 부츠를 신겨 달립니다. 무거운 부츠에 익숙한 선수 A 가 승리합니다.
- 신규 방식: 선수 A 에게 가벼운 스니커즈를, 선수 B 에게 맞춤형 오르토틱스 (교정 깔창) 를 줍니다. 갑자기 선수 B 가 승리합니다.
- 결론: 만약 무거운 부츠를 신긴 상태에서만 테스트했다면, 마라톤을 뛰게 할 올바른 선수를 잘못 채용했을 것입니다.
연구의 주요 교훈
1. "최고"인 모델은 프롬프트에 따라 달라집니다
이 논문은 경기의 '승자'가 지시문이 어떻게 작성되느냐에 따라 변한다는 사실을 발견했습니다. 특정 업무에 가장 적합한 AI 를 고르고 싶다면, 먼저 그 특정 AI 를 위해 지시문을 최적화해야 합니다. 그렇지 않으면 실제 필요에 비해 평범한 모델을 선택하게 될 수 있습니다.
2. 다른 모델은 다르게 반응합니다
사람들처럼 다른 AI 들도 서로 다른 '성격'이나 민감도를 가지고 있습니다.
- 일부 모델 (연구의 모델 B 와 같은) 은 프롬프트 변경에 매우 민감했습니다. 작은 수정만으로도 성능이 훨씬 향상되었습니다.
- 다른 모델들은 특정 작업 (예: 단순 라우팅) 에 이미 너무 능숙해서 프롬프트를 수정해도 도움이 되지 않거나, 때로는 혼란을 초래하기도 했습니다.
3. '비평가 (Critic)'가 혼란에 빠질 수 있습니다
연구진은 다른 모델들의 프롬프트를 다시 작성하는 데 '비평가' AI(GPT-4o) 를 사용했습니다. 보통은 매우 잘 작동했습니다. 그러나 때로는 비평가가 너무 영리해지거나 지시문이 너무 복잡해져서 모델이 실패하기도 했습니다.
- 예시: 한 사례에서 최적화된 프롬프트는 AI 에게 "단계별로 생각하라"는 지시를 너무 많이 내렸고, 그 결과 AI 는 실제 시험 문제가 아니라 프롬프트에 포함된 예시 질문에 답하기 시작했습니다. 마치 학생이 시험을 치르는 대신 연습문제 답안을 소리 내어 읽는 것과 같았습니다.
당신 (실무자) 에게这意味着하는 바
고객 이메일 답변이나 문서 분석과 같은 업무를 수행할 AI 를 선택하려는 기업이라면, 단순히 표준 벤치마크를 실행해서는 안 됩니다.
이 논문은 특정 작업에 대한 진짜 최고의 모델을 찾기 위해서는 다음을 수행해야 한다고 결론 내립니다.
- 당신의 작업을 정의하세요.
- 다양한 모델을 시도하세요.
- 각 모델이 진정으로 무엇을 할 수 있는지 보기 위해 각 모델 individually 프롬프트를 최적화하세요.
- 그런 다음 승자를 선택하세요.
3 단계를 건너뛰고 일반적인 프롬프트만 사용한다면, 오해의 소지가 있는 테스트를 바탕으로 잘못된 채용 결정을 내리게 될 가능성이 높습니다.
요약
이 논문은 경고입니다: 물고기를 나무를 오르는 능력으로 판단하지 마시고, AI 를 일반적인 프롬프트를 따르는 능력으로 판단하지 마세요. 누가 진정으로 가장 뛰어난지 알기 위해서는 그들의 언어로 말해야 합니다. 각 모델에 맞춰 프롬프트를 최적화하지 않는다면, 당신의 평가 결과는 틀릴 가능성이 높으며, 결국 잘못된 도구를 선택하게 될 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.