Investigating LLM's Problem Solving Capability -- a Study on Statics Questions
이 연구는 모델 증류(model distillation) 접근 방식을 통해 정역학 문제를 해결하는 거대 언어 모델의 능력을 평가하며, 모델들이 텍스트로만 구성된 질문에는 높은 성능을 보이는 반면, 도표와 다단계 추론이 요구될 때는 이미지 인식의 한계라기보다 시각적 정보를 일관되게 적용하는 데 발생하는 어려움으로 인해 정확도가 현저히 저하된다는 점을 밝히고 있다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신은 거의 모든 책을 읽은 매우 똑똑하고 박식한 학생인 "ChatGPT"를 가지고 있다고 상상해 보십시오. 당신은 이 학생이 실제로 까다로운 공학 숙제 문제, 특히 정역학(정지된 물체에 작용하는 힘의 균형을 다루는 학문, 예를 들어 교량이나 크레인 관련) 문제를 풀 수 있는지 테스트하고 싶어 합니다.
연구원들이 수행한 작업은 다음과 같습니다. 이해하기 쉽게 설명하겠습니다.
1. "복사-붙여넣기" 문제
먼저, 연구원들은 뻔한 방법을 시도했습니다. 실제 교과서 질문들을 가져와서 ChatGPT에게 그것들을 풀어보라고 요청한 것입니다.
- 결과: 결과는 처참했습니다. 학생은 혼란에 빠졌으며, 특히 3D 그림이 포함된 문제에서 더욱 그러했습니다. 방향을 섞어버리거나(예를 들어 "오른쪽"을 의미할 때 "위쪽"이라고 말함) 수학적 계산을 틀렸습니다.
- 비유: 이것은 마치 학생에게 그가 겨우 익히고 있는 언어로 쓰인 지도를 읽으라고 요구하는 것과 같았습니다. 단어는 알지만, 방향은 파악하지 못하는 것이었습니다.
2. "역공학" 기술 (모델 증류)
교과서 질문들이 너무 어려웠기 때문에, 연구원들은 **모델 증류(Model Distillation)**라는 영리한 기술을 시도했습니다. 다른 사람의 질문을 풀게 하는 대신, 학생에게 자신의 질문을 직접 작성하도록 요청한 것입니다.
- 논리: 그들은 "ChatGPT가 좋은 질문을 쓸 수 있다면, 그 특정 유형의 질문에 대한 답을 이미 알고 있을 것이다. 왜냐하면 자신의 학습 데이터로부터 그 질문을 '배웠기' 때문이다"라고 생각했습니다.
- 과정: 연구원들은 ChatGPT에게 50개의 정역학 문제를 생성하도록 했습니다. 그 과정에서 학생이 계속해서 똑같은 단순한 2D(평면) 문제만을 반복해서 쓰고 있다는 것을 발견했습니다. 그래서 그들은 ChatGPT가 가장 잘 이해하고 있는 것으로 보이는 가장 우수한 25개의 고유한 질문들을 선정했습니다.
3. 세 가지 단계의 시험
연구원들은 이 25개의 질문을 사용하여 세 가지 서로 다른 "시험"을 만들어 학생의 두뇌가 어떻게 작동하는지 확인했습니다.
- 시험 A (텍스트 전용): 텍스트로만 된 질문을 해결하도록 ChatGPT에게 요청했습니다.
- 결과: 만점 (100%). 학생은 자신이 쓴 질문의 답을 알고 있었습니다! 질문을 직접 썼기 때문입니다!
- 시험 B (그림 포함): 동일한 텍스트 기반 질문에 간단한 도해(diagram)를 그려 넣었습니다.
- 결자: 점수가 68%로 떨어졌습니다. 학생은 글을 읽을 수는 있었지만, 그림이 방해가 되었습니다. 그림과 수학적 내용을 연결하는 데 어려움을 겪었습니다.
- 시험 C ("새로운 숫자" 테스트): 시험 B의 도해를 사용하되, 모든 숫자를 변경했습니다 (예: 힘의 크기를 10파운드에서 15파운드로 변경).
- 결과: 점수가 60%로 떨어졌습니다. 이는 학생이 단순히 답을 암기하고 있는 것이 아님을 증명했습니다. 학생은 문제를 새롭게 풀려고 시도했지만, 중간 과정에서 계속 실수를 저질렀습니다.
4. 무엇을 배웠는가?
연구원들은 ChatGPT를 "Gemini"라는 다른 AI 학생과 비교했습니다.
- 중요한 발견: 문제는 AI가 그림을 "볼 수" 없다는 것이 아니었습니다. 문제는 AI가 단계적으로 생각할 수 없다는 것이었습니다.
- 비유: 레시피를 완벽하게 읽을 수 있는 요리사를 상상해 보십시오 (텍스트 전용). 만약 당신이 그들에게 식재료와 완성된 요리의 사진을 건네준다면 (도해), 그들은 여전히 요리를 할 수 있습니다. 하지만 만약 당신이 복잡한 코스 요리를 만들면서 중간에 레시피를 조정해야 하는 상황을 요구한다면 (다단계 추론), 그들은 재료를 떨어뜨리거나 다음 단계를 잊어버리기 시작할 것입니다.
- 결론: AI는 단순한 일회성 수학 계산에는 뛰어납니다. 하지만 그림을 보고 정보를 추출한 뒤, 최종 답을 얻기 위해 그 정보를 세 단계나 네 단계의 서로 다른 과정에 적용해야 할 때는 길을 잃습니다. 올바른 방법은 따르지만, 종종 마지막에 틀린 숫자를 내놓습니다.
요약
이 논문은 AI가 읽고 쓰는 능력은 매우 좋아지고 있지만, 시각적 추론과 길고 복잡한 논리 체인을 다루는 데는 여전히 서툴다는 결론을 내립니다. 이는 이론은 완벽하게 알지만, 변화하는 숫자가 포함된 실제 도해를 적용하라는 요청을 받으면 얼어붙는 학생과 같습니다.
참고: 연구원들은 오직 이 특정 공학 문제들만을 테스트했습니다. 이 결과가 의료 진단, 법률 자문 또는 다른 분야에도 적용된다고 주장하거나, 미래를 위해 AI를 어떻게 개선할지에 대해 제안한 것이 아닙니다. 그들은 단지 이 특정 세트의 공학 퍼즐에 대해 AI가 어떻게 수행했는지를 보고했을 뿐입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.