What Makes a Programming Problem Hard for a Language Model? An Empirical Study of Item Difficulty Across Code LLMs on Two Benchmarks
본 논문은 코드 생성 벤치마크에서의 문제 난이도가 HumanEval의 명세 특징(예: 예시 및 프롬프트 길이)과 MBPP의 솔루션 복잡도에 의해 유도되는 안정적이고 전이 가능한 지표임을 입증하는 실증적 연구를 제시하며, 이는 모델 점수가 포화 상태에 도달함에 따라 벤치마킹, 자동 채점 및 교육 도구 설계의 개선을 위한 결정적인 통찰을 제공한다.