← 최신 논문
💻 computer science

Evaluating Ill-Defined Tasks in Large Language Models

이 논문은 복잡한 지시 따기 및 자연어에서 Mermaid 다이어그램 생성과 같은 사례 연구를 통해, 모호한 정의의 작업을 평가하는 기존 벤치마크와 지표가 신뢰할 수 없거나 진단적 가치가 부족하며 다양한 실패 모드를 혼동한다는 점을 지적하고, 보다 견고하고 해석 가능한 평가 설계의 필요성을 강조합니다.

원저자: Yi Zhou, Basel Shbita

게시일 2026-03-19
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yi Zhou, Basel Shbita

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🎭 제목: "이게 진짜 더 잘한 건가? (I Can't Believe It's Not Better)"

이 워크숍 제목은 "이게 진짜 더 나은 거야?"라는 의문을 담고 있습니다. 논문은 **"지금 우리가 AI 를 시험하는 방식은 AI 가 실제로 얼마나 똑똑한지 알려주지 못하고, 오히려 혼란만 준다는 것"**을 보여줍니다.

🌪️ 문제 상황: "모호한 시험" (Ill-Defined Tasks)

대부분의 AI 시험은 수학 문제처럼 정답이 딱 하나인 경우 (예: "2+2 는 몇?" → 4) 에 적합하게 설계되었습니다. 하지만 현실 세계의 일은 그렇지 않습니다.

  • 비유: "맛있는 저녁 메뉴를 추천해 줘"라고 하면, 정답은 없습니다. 어떤 사람은 파스타를 원하고, 어떤 사람은 불고기를 원할 수 있죠.
  • 논문의 주장: AI 가 이런 **'정답이 없는 모호한 과제'**를 잘 수행하는지 평가하는 현재의 방법은 너무 형식적이고, 신뢰할 수 없으며, AI 가 왜 실패했는지 알려주지 못한다고 합니다.

저자들은 두 가지 대표적인 사례를 들어 이 문제를 파헤쳤습니다.


🔍 사례 1: 복잡한 지시 따르기 (Complex Instruction Following)

**"여러 가지 조건을 동시에 지켜야 하는 지시"**를 따르는 능력을 평가하는 것입니다.

  • 현재의 문제:
    • 비유: 선생님이 "글을 쓰되, 100 자 이상으로 하고, '사과'라는 단어를 3 번 포함하고, 마지막 문장은 물음표로 끝내라"고 했을 때, AI 가 내용은 엉망인데 조건만 딱 맞춰서 점수를 받는 경우가 많습니다.
    • 실제 예시: 논문에서 언급된 'IFEval'이라는 시험은 AI 가 'i'라는 알파벳을 몇 번 쓰는지만 체크합니다. 그래서 AI 가 의미 없는 글자 나열 (예: "aaa") 을 해도 조건만 맞으면 점수를 받습니다. 마치 시험지를 채점할 때 '이름'만 확인하고 '정답'은 안 보는 꼴입니다.
    • 결과: AI 는 지시사항을 진짜로 이해한 게 아니라, 시험 문제의 '규칙'만 외워서 통과하는 요령을 부리고 있을 뿐입니다.

🔍 사례 2: 자연어를 다이어그램으로 만들기 (NL2Mermaid)

**"말을 듣고 그림 (시퀀스 다이어그램) 을 그리는 작업"**입니다.

  • 현재의 문제:
    • 비유: "회사의 문서 업로드 과정을 그림으로 그려줘"라고 했을 때, AI 가 그리는 그림이 문법적으로 틀렸는지, 논리적으로 맞는지, 모든 단계가 빠지지 않았는지를 한 번에 점수 (평균 점수) 로만 매깁니다.
    • 실제 예시: AI 가 논리적으로는 완벽하게 그렸는데, 문법 (형식) 에 작은 실수가 하나 있어 전체 점수가 낮아질 수 있습니다. 혹은 반대로 형식은 완벽하지만 내용이 엉터리일 수도 있죠.
    • 결론: 하나의 점수만 보면 AI 가 어디가 잘하고 어디가 잘못했는지 알 수 없습니다. 마치 학생의 국어, 수학, 영어 성적을 모두 합쳐서 '전체 점수 80 점'이라고만 알려주는 것과 같습니다. 어떤 과목이 부족한지 알 수 없으니 어떻게 가르쳐야 할지 모르게 됩니다.

🛠️ 왜 현재 평가 방식이 실패할까? (3 가지 원인)

  1. 시험지가 현실과 달라요: AI 가 시험을 치는 데이터가 너무 인위적이고 단순해서, 실제 복잡한 현실 문제를 해결할 때 무용지물이 됩니다. (시험지 공부를 너무 잘해서 실제 생활에서는 못 하는 꼴)
  2. 점수표가 너무 단순해요: 여러 가지 능력을 하나의 점수로 합쳐버려서, AI 의 강점과 약점을 구분할 수 없게 만듭니다.
  3. 채점자가 AI 라서요: 최근에는 'AI 가 AI 를 채점' (LLM-as-a-Judge) 하는 경우가 많습니다. 하지만 이 채점 AI 도 편견이 있거나, 같은 답을 봐도 채점자 (AI) 가 조금만 달라져도 점수가 들쑥날쑥합니다.

💡 해결책: 더 똑똑한 평가 방식 제안

저자들은 다음과 같이 제안합니다.

  1. 점수를 쪼개서 보세요 (Decomposition):

    • "전체 점수 80 점" 대신, "형식 점수 90 점, 논리 점수 70 점, 내용 점수 60 점"처럼 세부 항목별로 점수를 매겨야 AI 가 어디가 부족한지 알 수 있습니다.
    • 비유: 요리 실력을 평가할 때 "맛있다/맛없다"가 아니라 "소금 간은 적당, 식감은 쫄깃, 장식은 부족"이라고 구체적으로 말해줘야 요리사가 다음에 고칠 점을 알 수 있죠.
  2. 규칙과 AI 채점을 섞으세요 (Hybrid Approach):

    • 형식적인 것 (문법, 글자 수, 키워드 포함 여부) 은 컴퓨터 프로그램이 100% 정확하게 체크하게 하고,
    • 의미 있는 것 (논리, 창의성, 맥락) 만 AI 채점자에게 맡기세요.
    • 비유: 수학 시험에서 계산 실수는 자동 채점기로 하고, 서술형 답안만 선생님이 채점하는 것과 같습니다.
  3. 투명하게 공개하세요:

    • AI 채점자가 어떤 질문을 했는지, 어떤 기준으로 점수를 매겼는지 모두 공개해야 다른 연구자들이 결과를 믿고 재현할 수 있습니다.

📝 한 줄 요약

"지금 AI 평가 방식은 AI 가 시험 문제의 '규칙'만 외워서 점수를 따는 '요령'을 장려할 뿐, 실제 능력은 제대로 보여주지 못합니다. 우리는 AI 의 강점과 약점을 구체적으로 파악할 수 있도록, 점수를 쪼개고 채점 방식을 투명하게 바꿔야 합니다."

이 논문은 AI 개발자들이 "점수만 높이는 것"에 매몰되지 않고, **"AI 가 왜 실패했는지 이해하고 고치는 것"**에 집중하라고 경고하고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →