Exploring Agentic Workflows for Generating High Quality Math Visual Aids
이 논문은 대규모 언어 모델과 시각 언어 모델이 공간 추론 및 정확성의 현재 한계를 극복하기 위해 스스로 생성한 품질 보증 질문과 시각적 피드백을 사용하여, K-12 교육을 위한 고품질의 교육학적으로 건전한 수학 도표를 반복적으로 생성하고 개선할 수 있게 하는 에이전트 워크플로를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 로봇에게 보물섬의 완벽한 지도를 그리는 법을 가르치고 있다고 상상해 보세요. 당신은 로봇에게 상세한 설명을 제공합니다. "노란색 육각형, 빨간색 사다리꼴, 초록색 삼각형으로 만들어진 꽃을 그려줘." 하지만 로봇이 그림을 건네주었을 때, 꽃잎은 찌그러져 있고, 색상은 틀렸으며, 도형은 아예 누락되어 있습니다. 이는 마치 맞춤 케이크를 주문했는데 찌그러진 벽돌을 받은 것과 같습니다.
이것이 바로 리즈완 말릭(Rizwaan Malik), 애쉬나 케탄(Ashna Khetan), 이사벨 시(Isabel Sieh), 사민 칸(Samin Khan) 연구진이 해결하고자 하는 문제입니다. 그들은 가장 똑똑한 AI 도구들(대규모 언어 모델, 즉 LLM이라 불리는)조차도 이러한 수학 다이어그램을 그리는 데는 여전히 꽤 서투르다는 것을 발견했습니다. 실제로 중학교 수학 문제를 테스트했을 때, 가장 우수한 AI조차 정답률이 **73.9%**에 불과했습니다. 이는 통과할 만한 점수이긴 하지만, 모든 학생이 완벽하게 학습하기를 원한다면 충분하지 않은 수치입니다.
그래서 연구팀은 새로운 기술을 시도했습니다. 바로 "자기 개선형 로봇 팀"을 구축한 것입니다. 단순히 AI에게 한 번 그려보라고 하고 운에 맡기는 대신, 그들은 AI가 엄격한 미술 선생님, 탐정, 그리고 화가 역할을 동시에 수행하는 루프(loop)를 만들었습니다.
이들의 "에이전틱 워크플로우(agentic workflow)"(여러 AI 에이전트가 협력하는 팀을 뜻하는 멋진 용어입니다)는 다음과 같이 진행됩니다:
- 화가: 먼저, AI가 당신의 설명에 따라 다이어그램을 그립니다.
- 퀴즈 마스터: 다음으로, 두 번째 AI(QA 생성기)가 그림을 살펴보고 이를 테스트하기 위한 네 가지 개방형 질문을 작성합니다. 단순히 "이것이 빨간색인가요?"와 같은 단순한 "예/아니오" 질문을 던지는 대신, "코드가 어떻게 행거 바를 완벽하게 수평으로 유지했나요?"와 같이 더 깊이 있는 질문을 던집니다.
- 탐정: 그다음, AI는 그림을 그리는 데 사용된 컴퓨터 코드를 이 질문들에 비추어 검사합니다. 연구진은 표준적인 "시각" AI들이 복잡한 다이어그램을 분석하는 데 꽤 서투르다는 것(종종 항목의 개수를 잘못 세거나 공간 개념에 혼동을 일으킴)을 발견했고, 따라서 AI가 코드를 읽도록 방식을 바꿨습니다. 코드를 읽는 것이 오류를 찾아내는 데 훨씬 더 신뢰할 수 있기 때문입니다.
- 수정가: 만약 그림이 퀴즈를 통과하지 못하면, AI는 피드백을 받아 다시 그리기를 시도합니다. AI는 그림이 모든 테스트를 통과하거나 시도 횟수를 다 쓸 때까지 이 과정을 반복합니다.
연구진은 이 아이디어를 테스트하여 흥ered한 사실들을 발견했습니다. "탐정"이 최종 그림과 그림을 그리는 데 사용된 컴퓨터 코드를 모두 살펴보게 했을 때, 인간 전문가들은 AI의 채점 결과에 97% 확률로 동의했습니다. 이는 그림만 보았을 때(68%)나 코드만 보았을 때(81%)보다 크게 향상된 수치입니다. 설계도(코드)를 보는 것이 실수를 더 잘 찾아내는 데 도움이 된다는 결론이 나옵니다.
또한, 그들은 단순한 예/아니오 질문보다 개방형 질문을 사용하는 것이 훨씬 효과적이라는 것을 발견했습니다. 이는 학생에게 단순히 "다 했니?"라고 묻는 대신 "네 논리를 설명해 보렴"이라고 묻는 것과 같습니다.
하지만 연구팀은 이것이 모든 것을 해결해 주는 마법 지팡이는 아니라고 주의를 기울였습니다. 실험에서 AI가 그림을 한 번 수정하도록 했음에도 불구하고, **70%**의 다이어그램이 여전히 또 다른 수정 단계가 필요했습니다. 또한 두 번의 수정 과정을 거친 후에도, 그림에 대한 평균적인 인간 점수는 5점 만점에 3.4점에서 3.7점으로 상승하는 데 그쳤습니다.
연구팀은 몇 가지 구체적인 벽에 부딪혔습니다. 예를 들어, "균형 잡힌 행거"(전형적인 수학 도구)를 그리려고 할 때, AI는 행거 박스의 간격을 맞추라는 지시를 받은 후에도 계속해서 불균형하게 배치했습니다. AI는 실수를 인지할 수는 있었지만, 간격을 완벽하게 만들기 위해 코드를 어떻게 수정해야 하는지는 알아내지 못했습니다. 마찬가지로, AI는 정확한 도형의 개수를 세거나 측정값이 맞는지 확인하는 데 어려움을 겪기도 했는데, 이는 AI가 여전히 "공간 추론"(사물이 공간 속에서 어떻게 배치되는지 이해하는 능력)에 서투르기 때문입니다.
연구진은 이 "자기 개선 루프"가 유망한 시작점이긴 하지만, 아직 인간 교사를 대체할 수준은 아니라고 제안합니다. 그들은 미래의 시스템이 올바른 질문을 던지는 더 나은 방법과 공간적 관계를 이해하는 더 나은 "눈"을 갖춰야 한다고 주장합니다. 하지만 현재로서는, 이 접근 방식은 AI에게 자신의 작업을 스스로 점검하고 다시 시도할 기회를 준다면, 학생들이 수학의 길을 찾아가는 데 필요한 지도를 그리는 데 조금 더 나아질 수 있음을 보여줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.