← 최신 논문
🤖 AI

Structured Prompts Improve Evaluation of Language Models

이 논문은 구조화된 프롬프트 기법을 HELM 평가 프레임워크에 통합하여 프롬프트 선택이 벤치마크 결과와 모델 순위 결정에 중대한 영향을 미칠 수 있음을 규명하고, 이를 위한 재현 가능한 DSPy+HELM 프레임워크를 오픈소스로 공개했습니다.

원저자: Asad Aali, Muhammad Ahmed Mohsin, Vasiliki Bikia, Arnav Singhvi, Richard Gaus, Suhana Bedi, Hejie Cui, Miguel Fuentes, Alyssa Unell, Yifan Mai, Jordan Cahoon, Michael Pfeffer, Roxana Daneshjou, Sanmi
게시일 2026-04-02
📖 3 분 읽기☕ 가벼운 읽기

원저자: Asad Aali, Muhammad Ahmed Mohsin, Vasiliki Bikia, Arnav Singhvi, Richard Gaus, Suhana Bedi, Hejie Cui, Miguel Fuentes, Alyssa Unell, Yifan Mai, Jordan Cahoon, Michael Pfeffer, Roxana Daneshjou, Sanmi Koyejo, Emily Alsentzer, Christopher Potts, Nigam H. Shah, Akshay S. Chaudhari

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🍳 핵심 비유: "요리 실력 평가"

상상해 보세요. 세계 최고의 요리사 (AI 모델) 들을 평가하는 대회에 나섰습니다. 하지만 심사위원 (평가 시스템) 이 **매번 똑같은 레시피 (프롬프트)**로만 요리를 시킵니다.

  • 문제점: 어떤 요리사는 '불에 구운 스테이크'는 잘하지만, '생선 요리'는 서툴 수 있습니다. 그런데 심사위원이 모든 요리사에게 **"생선 요리만 해보세요"**라고만 지시한다면? 생선을 잘하는 요리사는 1 등, 스테이크의 달인은 꼴찌가 됩니다.
  • 현실: 지금 우리가 보는 AI 순위표 (리더보드) 는 대부분 하나의 고정된 질문 방식으로만 평가합니다. 그래서 AI 의 진짜 실력이 아니라, **"어떤 질문을 던졌느냐"**에 따라 순위가 결정되는 경우가 많습니다.

🔍 이 연구가 한 일: "다양한 질문으로 다시 평가하다"

이 연구팀은 **"질문하는 방식 (프롬프트) 을 다양하게 바꿔보자"**고 생각했습니다. 마치 요리사에게 "스테이크도 해보고, 생선도 해보고, 디저트도 해보자"고 한 것과 같습니다.

그들은 DSPy라는 도구를 이용해 5 가지 다른 질문 전략을 만들어 6 개의 최신 AI 모델과 7 개의 시험 (일반 상식, 수학, 의학 등) 을 다시 치렀습니다.

1. 놀라운 결과: 순위가 뒤바뀌다!

  • 기존 방식: A 모델이 B 모델보다 10 점 더 잘했습니다.
  • 새로운 방식 (질문 전략 변경): B 모델이 A 모델보다 5 점 더 잘했습니다.
  • 결론: 질문하는 방식만 바꿔도 리더보드 순위가 7 개 중 5 개나 뒤바뀌었습니다. 즉, 우리가 보고 있는 "최고의 AI"는 단순히 질문을 잘 맞춰서 나온 결과일 뿐, 절대적인 실력이 아닐 수 있습니다.

2. 가장 강력한 무기: "생각하는 과정" (Chain-of-Thought)

연구팀은 여러 질문 전략 중 가장 효과가 좋은 것을 찾았습니다.

  • 비유: 요리사에게 "요리하세요"라고만 하면 (기존 방식) 실수가 많습니다. 하지만 **"먼저 재료를 손질하고, 불을 조절하고, 소스를 만드는 순서로 생각한 뒤 요리하세요"**라고 지시하면 (생각하는 과정 포함), 실력이 훨씬 좋아집니다.
  • 결과: AI 에게 "단계별로 생각해보라고 (Chain-of-Thought)" 지시하는 것만으로도 평균 점수가 6%나 올랐습니다.
  • 재미있는 점: 이 '생각하는 과정'만 추가하면, 더 복잡한 자동화된 최적화 도구를 쓰지 않아도 거의 같은 효과를 냈습니다. 즉, 복잡한 장비를 쓸 필요 없이, "생각해봐"라고만 해도 실력이 쑥쑥 올라갑니다.

3. 작은 AI 의 대역전극

가장 흥미로운 점은 작은 AI 모델이 큰 AI 모델을 따라잡는 경우가 많았다는 것입니다.

  • 비유: 거대한 주방을 가진 유명 요리사 (고성능 AI) 보다, 작은 주방을 가진 요리사 (작은 오픈소스 AI) 가 "단계별 조리법"을 알려주면, 오히려 더 맛있게 요리를 해냅니다.
  • 의미: 비용이 적게 드는 작은 AI 모델도, 질문 방식을 잘만 고르면 비싼 AI 모델과 맞먹는 실력을 낼 수 있습니다.

💡 이 연구가 우리에게 주는 교훈

  1. 순위를 맹신하지 마세요: "누가 1 등이다"라는 말은 "어떤 질문을 했을 때 1 등이다"라는 뜻일 뿐입니다. 질문을 바꾸면 순위가 바뀔 수 있습니다.
  2. 질문 (프롬프트) 은 중요하다: AI 를 쓸 때는 단순히 "답을 줘"라고 묻기보다, **"단계별로 생각해서 답을 줘"**라고 요청하는 것만으로도 결과가 훨씬 좋아집니다.
  3. 공정한 평가를 위해: 앞으로 AI 를 평가할 때는 하나의 질문으로만 점수를 매기지 말고, 다양한 질문 방식으로 테스트해봐야 합니다. 그래야 진짜 실력을 알 수 있습니다.

📝 한 줄 요약

"AI 의 실력을 평가할 때, 질문하는 방식 (프롬프트) 을 조금만 바꿔도 순위가 뒤바뀔 수 있습니다. 특히 '단계별로 생각해보라'고 지시하는 것만으로도 AI 의 실력이 크게 향상되므로, 우리는 고정된 평가 기준보다 다양한 질문 방식을 고려해야 합니다."

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →