Format Sensitivity Index: Token-Controlled Prompt Wrapper Robustness and Schema Compliance in LLM Benchmarking
이 논문은 프롬프트 래퍼(wrapper)의 미세한 형식 차이가 상당하고 모델 의존적인 점수 변동과 준수 실패를 야기함을 입증하기 위해 포맷 민감도 지수(FSI)와 파싱 가능성 민감도 지수(PSI)를 도입하며, 이러한 변동성을 고려하지 않은 벤치마킹 정확도는 통계적으로 취약하다고 주장한다.
원본 논문은 CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/)에 따라 공공 도메인에 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 오디션 프로그램의 심사위원이라고 상상해 보세요. 하지만 당신은 노래를 듣는 대신, 오직 가사만을 읽을 수 있습니다. 이제 어떤 가수들은 평범한 종이에 가사를 쓰라는 지시를 받고, 다른 가수들은 화려하고 딱딱한 JSON 상자 안에 가사를 써야 하며, 또 다른 가수들은 특정 "BEGIN/END" 샌드위치 구조로 가사를 감싸야 합니다.
가수의 재능은 그대로 유지될 것이라고 기대하겠죠? 종이가 바뀌었다고 해서 노래가 변하지는 않을 테니까요. 하지만 Adobe의 Deep Pankajbhai Mehta가 발표한 이 연구에 따르면, AI 모델의 경우는 정확히 그 반대입니다. "종이"(프롬프트 래퍼)가 너무나 중요해서, 천재를 초보자로 만들고 초보자를 천재로 보이게 만들어 전체 리더보드를 뒤흔들 수 있습니다.
거대한 형식의 대격변
연구진은 네 가지 서로 다른 AI 모델(70억 개에서 720억 개의 '뇌세포' 규모)을 대상으로, 일곱 가지 질문 답변 과업에 대해 140,000개의 답변을 생성하는 대규모 실험을 진행했습니다. 그들은 다섯 가지 다른 "래퍼" 스타일을 테스트했습니다:
- Plain (평문): 그냥 정답만 출력.
- JSON: 엄격한 컴퓨터 코드 형식.
- Structured (구조화): 키-값(key-value) 쌍 형태.
- Structured with Delimiters (구분자가 있는 구조화):
<BEGIN ANSWER>와 같은 특수 태그가 포함된 키-값 쌍. - Deliberate (의도적): 생각을 정리하는 스크래치패드(scratchpad)를 거친 후 정답 출력.
결과는 어땠을까요? 모델들은 이러한 형식 규칙에 매우 민달랐습니다. 어떤 모델은 래퍼를 바꾸는 것만으로 정확도가 크게 요동쳤습니다. Phi-4 모델은 완전한 '드라마 퀸'이었습니다. 래퍼를 바꾸는 것만으로 정확도가 무려 0.763(엄청난 범위)이나 급등락했습니다. 반면, 거대 모델인 Qwen-2.5-72B는 변화 폭이 0.024에 불과할 정도로 아주 차분한 록스타 같았습니다.
"이걸 읽을 수 있나요?" 문제
왜 점수가 이렇게 변했을까요? 논문은 AI가 실제로 질문에 대해 더 똑똑해지거나 멍청해졌기 때문이 아니라고 설명합니다. 그것은 대부분 준수(compliance)의 문제였습니다.
이것을 동전만 받는 자판기에 비유해 봅시다. 만약 당신이 달러 지폐를 넣으려고 한다면(비록 그것이 유효한 달러일지라도), 자판기는 그것을 거부할 것입니다. 연구에서 AI가 엄격한 JSON 규칙을 따르려다가 실수로 마크다운 코드 펜스(예: ``` 기호)를 추가했을 때, 시스템(정답 추출기)은 그것을 읽을 수 없었습니다. 정답은 "파싱 불가능(unparseable)"으로 처리되었고, 이는 오답으로 간 것입니다.
데이터는 강력한 연관성을 보여줍니다. AI가 "파싱 가능(parseable)"하지 못할 때(기계가 읽을 수 없을 때), 정확도는 종종 0에 가깝게 폭락했습니다. 엄격한 JSON 래퍼를 사용한 Phi-4 모델의 경우, 생성된 출력의 **85.3%**가 마크다운 코드 펜스로 시작되었으며, 이로 인해 파싱 가능성은 단 2.8%, 정확도는 **0.7%**에 불과했습니다. 연구진은 "파싱 가능성"이 성공의 강력한 예측 변수였으며, 모델과 과업을 고려한 후 남은 점수 차이의 약 **82%**를 설명한다는 것을 발견했습니다.
미래를 위한 시사점
이 논문은 AI의 정확도를 단 하나의 숫자로 보고하는 것은, 화씨인지 섭씨인지 말하지 않고 온도 하나만 보고하는 것과 같이 오해의 소지가 있다고 주장합니다. 래퍼 선택 하나로 점수가 0.76이나 변할 수 있다면, 그 단일 숫자는 "통계적으로 취약"합니다.
저자들은 AI를 테스트할 때 단순히 하나의 래퍼를 선택하고 운에 맡겨서는 안 된다고 제안합니다. 대신 다음과 같이 해야 합니다:
- 여러 래퍼에 걸친 점수의 범위(예: "민감도 지수")를 보고해야 합니다.
- 답변이 실제로 파싱 가능한지 확인해야 합니다.
- AI가 프롬프트뿐만 아니라 디코더(텍텍스트를 생성하는 부분)에 의해 규칙을 강제받는 상황이 아니라면, 실제 애플리케이션에서 엄격한 형식을 사용하는 것에 주의해야 합니다.
결론
이 연구는 AI가 고장 났다고 말하는 것이 아니라, 우리의 측정 도구가 흔들리고 있다고 말하는 것입니다. "형식 민감도 지수(FSI)"와 "파싱 가능성 민감도 지수(PSI)"는 래퍼가 모델의 점수에 얼마나 의존하는지를 측정하는 새로운 도구입니다. 연구 결과는 일부 모델의 경우, 래퍼의 선택이 모델의 실제 지능보다 더 중요할 수 있음을 시사합니다. 이를 해결하기 전까지, 리더보드 위의 "최고" AI는 단지 그 테스트를 만든 사람이 설정한 특정 형식을 운 좋게 선호했던 모델일 뿐일 수도 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.