A Two-Phase Stability Study of LLM Judges and Bar Council Examiners on Thai Bar-Exam Free-Form Essays
본 연구는 명확한 채점 기준이 있는 태국 변호사 시험 논술에서 LLM 판사와 인간 심사관이 수렴하는 반면, LLM 은 애매한 사례에서 소수 인간 해석을 체계적으로 재현하지 못하고 오히려 다수 인간 견해와 일관되게 일치함으로써 전문가 간 이견의 전체 스펙트럼을 포착하지 못하는 능력을 은폐한다는 사실을 밝혀냈다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
고급 법률 에세이의 품질을 평가하는 고위험 경연대회를 운영한다고 상상해 보세요. 채점관에게 답변을 점수화하는 방법을 알려주는 매우 구체적인 규칙집 (루브릭) 이 있습니다. 보통 규칙집은 명확합니다. 답변이 맞으면 높은 점수를 주고, 추론이 나쁘면 낮은 점수를 줍니다.
하지만 때로는 규칙집이 '회색 지대'에 부딪힙니다. 학생이 최종 답변은 올바르게 제시했지만, 한 가지 특정하고 중요한 법률 인용을 언급하는 것을 잊었을 때 정확히 무엇을 해야 하는지 명시하지 않는 경우입니다. 이것이 바로 '규제 침묵' 지대입니다.
이 논문은 인간과 인공지능 (AI) 심판이 이러한 회색 지대를 어떻게 처리하는지 알아보기 위한 2 단계 실험입니다.
1 부: '시험' (1 단계)
먼저, 연구자들은 8 개의 서로 다른 AI 모델을 '학생 자리'에 앉혔습니다. 그들은 42 명의 실제 태국 법대생들처럼 법률 에세이를 작성해야 했습니다. AI 모델들은 인간 전문가들에 의해 맹검 (Blind) 채점을 받았습니다.
- 결과: AI 모델들은 평균적인 인간 학생과 비슷한 성적을 거두었습니다. 어떤 모델은 훌륭했고, 어떤 모델은 평범했으며, 어떤 모델은 고전했습니다. 그들은 모두 '게임'에 참여했습니다.
2 부: '채점' (2 단계)
다음으로, 연구자들은 동일한 에세이를 가져와 두 그룹에게 채점을 요청했습니다.
- 인간 패널: 3 명의 실제 공인된 법률 시험관.
- AI 패널: 26 개의 서로 다른 AI 모델의 대규모 그룹 (이전에 시험을 본 모델들 포함하여 많은 다른 모델들).
그들은 모두에게 정확히 동일한 네 가지 자료를 제공했습니다: 질문, 규칙집, '완벽한' 정답지, 그리고 학생의 에세이.
큰 발견: '일방통행'
연구자들은 규칙집이 침묵하는 까다로운 질문들에서만 흥미로운 분열을 발견했습니다.
인간의 분열:
세 명의 인간 전문가들은 의견이 일치하지 않았습니다.
- **두 명 (B 와 C)**은 이렇게 말했습니다: "학생이 주요 포인트를 올바르게 파악했고 추론도 충분히 좋습니다. 높은 점수 (6~8) 를 주세요."
- **한 명 (A)**은 이렇게 말했습니다: "학생이 중요한 인용을 놓쳤습니다. 이로 인해 추론이 '사용 불가능'해집니다. 매우 낮은 점수 (1~2) 를 주세요."
- 스포츠 심판을 생각해 보세요: 두 명의 심판은 선수가 '인플레이'였다고 말하고, 한 명의 심판은 '아웃'이라고 말합니다. 둘 다 동일한 규칙집을 사용하지만 회색 지대를 다르게 해석합니다.
AI 의 분열 (비대칭성):
여기서 일이 이상해집니다. 연구자들은 26 개의 AI 모델이 분열될 것으로 예상했습니다. 아마도 일부는 엄격한 인간 (A) 편을 들고, 일부는 관대한 인간 (B 와 C) 편을 들 것이라고요.
- 그렇지 않았습니다.
- 26 개 AI 모델 중 22 개가 두 명의 관대한 인간 (B 와 C) 편을 들었습니다. 그들은 높은 점수를 주었습니다.
- 3 개의 AI 모델은 혼란스러워 중간 점수를 주었습니다.
- 단 한 개의 AI 모델도 엄격한 인간 (A) 편을 들지 않았습니다. 엄격해지려 했던 유일한 AI(GPT-5.4 Nano) 조차도 진정한 의미에서 엄격한 인간의 스타일과 일치할 만큼 일관되지 않았습니다.
비유:
26 개의 서로 다른 카메라가 한 폭의 그림을 찍는다고 상상해 보세요.
- 세 명의 인간 미술 비평가들은 그림을 보고 의견이 갈립니다: 두 명은 걸작이라고 하고, 한 명은 실패작이라고 합니다.
- 당신은 26 개의 카메라에게 그림을 묘사해 달라고 요청합니다.
- 결과: 26 개의 카메라 모두 걸작이라고 부른 두 명의 비평가와 동의합니다. 그림을 실패작이라고 부른 비평가와 동의하는 카메라는 단 한 대도 없습니다. 카메라들이 서로 다른 브랜드, 크기, 가격을 가지고 있음에도 불구하고, 그들은 모두 그림을 동일한 방식으로 '보고', 한 명의 엄격한 비평가의 관점을 완전히 놓치고 있습니다.
왜 이것이 중요한가요?
이 논문은 우리가 에세이를 채점하는 AI 시스템을 구축할 때, 보통 '평균' 인간 채점관과 가장 많이 동의하는 AI 를 선택한다고 주장합니다.
- 이 연구에서 다수의 인간 (3 명 중 2 명) 이 관대했기 때문에, AI 역시 관대하도록 학습했습니다.
- AI 는 균형 잡힌 방식으로 '공정'하도록 학습한 것이 아니라 비대칭적으로 학습했습니다. 그것은 다수의 의견으로 수렴했고, 비록 그 소수의 의견이 유효한 법적 해석이었음에도 불구하고 소수의 의견을 완전히 무시했습니다.
'이중 역할'의 놀라운 사실
연구자들은 AI 의 성격에 대해 이상한 점도 발견했습니다.
- 1 단계에서 나쁜 학생이었던 AI 모델들 (자신의 에세이에 낮은 점수를 받음) 은 실제로 2 단계에서 가장 일관된 관대한 심판이 되었습니다.
- 1 단계에서 훌륭한 학생이었던 AI 모델들은 단지 '보통' 심판이 되었습니다.
- 교훈: 답변을 작성하는 데 능숙하다고 해서 답변을 채점하는 데 능숙한 것은 아닙니다. 두 기술은 완전히 다릅니다.
결론
이 연구는 AI 심판들이 서로 매우 안정적이고 일관성이 있음을 보여주지만, 맹점이 있음을 보여줍니다. 인간 전문가들이 회색 지대 규칙에 대해 이견을 보일 때, AI 는 중간을 취하거나 모든 유효한 의견을 탐색하지 않습니다. 대신, 압도적으로 '다수'의 인간 의견을 선택하고 '소수'의 의견을 무시합니다.
만약 당신이 에세이를 채점하기 위해 AI 를 사용한다면, 당신은 단순히 두 번째 의견을 얻는 것이 아닙니다. 당신은 소수의 의견을 완전히 사라지게 만들 정도로 다수의 의견을 강력하게 반영하는 거울을 얻는 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.