← 최신 논문
💻 computer science

Estimating Exam Item Difficulty with LLMs: A Benchmark on Brazil's ENEM Corpus

이 논문은 10개의 대규모 언어 모델(LLM)을 브라질의 ENEM 시험을 대상으로 벤치마킹하여, 이들이 문항 난이도를 어느 정도 순위 매길 수는 있으나 체계적으로 문항의 난도를 과소평가하고, 멀티모달 콘텐츠 처리에 어려움을 겪으며, 개인 맞춤형 평가에 필요한 맥락적 가소성이 부족함을 밝힘으로써, 이들이 권위 있는 생성 도구보다는 보정된 스크리너로서 가장 적합하다는 점을 시사한다.

원저자: Thiago Brant, Julien Kühn, Jun Pang

게시일 2026-02-09
📖 4 분 읽기☕ 가벼운 읽기

원저자: Thiago Brant, Julien Kühn, Jun Pang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 새로운 수학 시험지를 만들려고 노력 중인 선생님이라고 상상해 보세요. 당신에게는 질문을 작성할 수 있는 아주 똑똑한 로봇 조수(AI)가 있습니다. 하지만 학생들에게 시험을 치르게 하기 전에, 당신은 반드시 알아야 합니다: 이 질문이 너무 쉬운가? 아니면 너무 어려운가?

전통적으로 선생님들은 먼저 수천 명의 학생들에게 시험을 치르게 한 뒤, 결과를 채점하고, 난이도를 파악하기 위해 복잡한 수학 계산을 수행하여 이 문제를 해결합니다. 이는 시간이 오래 걸리고 많은 비용이 듭니다.

이 논문은 단순한 질문을 던집니다: 우리가 AI에게 "이 질문은 얼마나 어려운가?"라고 물었을 때, 그 답변을 믿어도 될까?

연구진들은 이 아이디어를 테스트하기 위해 브라질의 방대한 국가 고교 졸업 시험인 ENEM(1,000개 이상의 실제 문항 포함)을 사용했습니다. 그들은 10개의 서로 다른 AI 모델에게 이 질문들의 난이도를 추측하게 했고, 그 추측치를 인간 전문가들이 계산한 "공식" 난이도 점수와 비교했습니다.

연구 결과는 다음과 같습니다. 일상적인 비유를 들어 설명하겠습니다.

1. "순위 매기기는 잘하지만, 숫자는 못하는" 문제

AI 모델들은 책의 크기 순서대로 나열하는 데는 능숙하지만, 자로 길이를 재는 데는 서툰 학생과 같습니다.

  • 좋은 소식: 만약 당신이 AI에게 10개의 질문을 "가장 쉬운 것"부터 "가장 어려운 것"까지 정렬하라고 요청한다면, AI는 꽤 괜찮은 성과를 냅니다. AI는 질문 A가 질문 B보다 어렵다는 것을 알아낼 수 있습니다.
  • 나쁜 소식: 하지만 만약 당신이 "1점에서 10점 사이의 척도로 이 질문이 얼마나 어려운가?"라고 묻는다면, AI는 일관되게 틀립니다. AI는 거의 항상 질문이 실제보다 더 쉽다고 생각합니다. 이는 마치 마라톤을 한 번도 뛰어본 적 없는 사람이 마라톤을 보고 "가벼운 조깅 수준"이라고 생각하는 것과 같습니다.

2. "눈가리개" 효과 (시각 자료 vs 텍스트)

많은 시험 문제에는 그림, 그래프 또는 차트가 포함되어 있습니다. 일부 AI는 이미지를 "볼" 수 없기 때문에, 연구진은 그림을 말로 설명해야 했습니다(마치 시각 장애인이 친구에게 그림을 설명하는 것처럼요).

  • 결과: AI가 그림에 대한 텍-스트 설명만을 바탕으로 난이도를 추측해야 했을 때, AI는 혼란에 빠졌습니다. AI는 텍스트만 있는 질문보다 이러한 질문들을 판단하는 데 훨씬 더 서툴렀습니다.
  • 비유: 퍼즐 조각 자체를 보는 대신, 퍼즐 조각에 대한 설명을 읽고 나서 그 퍼즐이 얼마나 어려운지 맞히려고 노력하는 것과 같습니다. 당신은 결정적인 단서를 놓칠 수 있고, 그로 인해 퍼즐이 실제보다 더 쉽거나 혹은 더 어렵게 느껴질 수 있습니다.

3. "일률적인 기준"의 함정 (학생의 배경)

연구진은 AI가 시험을 치르는 사람에 따라 답변을 조정할 수 있는지 확인하고 싶었습니다. 그들은 AI에게 다음과 같이 물었습니다: "핀란드 학생에게는 이 문제가 얼마나 어려운가?" 대 "브라질 학생에게는 이 문제가 얼마나 어려운가?"

  • 결과: AI는 거의 생각을 바꾸지 않았습니다. AI는 이러한 변화에 대해 거의 "무감각"했습니다.
  • 비유: 요리를 하는 요리사를 상상해 보세요. 만약 당신이 "이 수프가 아기에게 너무 짠가요?" 혹은 "보디빌더에게 너무 짠가요?"라고 묻는다면, 요리사는 그냥 어깨를 으쓱하며 "수프는 똑같습니다"라고 답할 것입니다. AI는 이러한 차이를 이해하지 못했습니다. 즉, 학생마다 배경과 지식 수준이 다르다는 것을 이해하지 못했고, 자신의 "난이도 측정기"를 사람에게 맞춰 조정하지 못했습니다.

4. "프롬프트" 게임 (질문 방식이 중요하다)

연구진은 다양한 방식으로 AI에게 질문을 던져보았습니다. 어떤 때는 단순히 "평가하라"고 했고, 어떤 때는 "수학 교사처럼 행동하고, 단계별로 생각한 다음, 이것을 평가하라"고 했습니다.

  • 결과: 질문을 던지는 방식에 따라 답변이 크게 달라졌습니다. "생각하는 과정"을 포함한 프롬프트가 AI가 순위를 맞히는 데는 도움이 되었지만, 모든 것이 너무 쉽다고 생각하는 근본적인 문제는 해결하지 못했습니다.
  • 비유: 친구에게 영화 추천을 받는 것과 같습니다. 만약 "좋은 영화 있어?"라고 물으면 친구는 코미디를 추천할 수도 있습니다. 하지만 "비 오는 화요일 밤에 어울리는 좋은 영화 있어?"라고 묻는다면, 친구는 스릴러를 추천할 수도 있습니다. AI의 답변은 질문을 어떻게 표현하느냐에 따라 달라집니다.

핵심 결론: "스크리닝(선별)" 도구로서의 활용

이 논문은 우리가 이 AI 모델들을 오라클(완벽한 답을 주는 전지전능한 신)로 취급해서는 안 된다고 결론짓습니다. 대신 스크리너(첫 번째 필터)로 취급해야 합니다.

  • 권장 사항: 새로운 질문 더미를 빠르게 훑으며 "이것은 너무 쉬워 보이고, 저것은 너무 어려워 보인다"라고 말해주는 용도로 AI를 사용하십시오.
  • 주의 사항: AI가 내놓는 정확한 숫자는 신뢰할 수 없습니다. 따라서 반드시 AI의 "편향성"(모든 것을 너무 쉽게 생각하는 경향)을 교정해야 하며, 특히 그림이 포함된 질문은 반드시 인간의 검토를 거쳐야 합니다.

요약하자면: AI는 질문들을 "쉬운 것"과 "어려운 것"으로 분류하는 데 도움을 주는 유용한 조수이지만, 질문이 정확히 얼마나 어려운지 최종 판결을 내리거나 다양한 유형의 학생들에게 필요한 요구사항을 이해할 준비는 되어 있지 않습니다. 우리는 AI를 보정해야 하며, 반드시 인간이 과정에 참여해야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →