FAU at ImageCLEF 2026 Task on Multimodal Reasoning Robust Candidate Scoring and Concise Multilingual Visual Answering
FAU 팀은 다국어 시각적 추론과 답변 형식을 개선하기 위해 작업별 모델 학습보다 직접적인 후보 점수 산정, 점수 융합, 엄격한 출력 제어와 같은 견고한 추론 엔지니어링을 우선시함으로써 ImageCLEF 2026의 Visual MCQ에서 3위, Visual OpenQA에서 1위를 달성했습니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 고난도의 시험장에 앉아 있다고 상상해 보세요. 하지만 단순히 페이지의 글자를 읽는 것이 아니라, 빽빽한 교과서, 복잡한 도표, 휘갈겨 쓴 공식, 그리고 6개 국어로 된 차트들이 뒤섞인 혼란스러운 콜라주를 마주하고 있습니다. 당신의 임무는 이 시각적 혼돈을 보고 까다로운 질문에 답하는 것입니다. 이것이 바로 컴퓨터가 인간 학생처럼 이미지를 "보고" 그 안의 텍스트를 "읽을" 수 있도록 만드는 분야인 "멀티모달 추론(Multimodal Reasoning)"의 세계입니다. 오랫동안 핵심적인 질문은 "컴퓨터의 뇌가 얼마나 똑똑해야 통과할 수 있는가?"였습니다. 하지만 함정이 있습니다. 설령 슈퍼 컴퓨터가 수학과 과학을 완벽하게 이해하더라도, 너무 말을 많이 하거나, 잘못된 언어를 사용하거나, 채점 기계가 읽을 수 없는 지저한 형식으로 답을 적는다면 시험에서 낙제할 수 있습니다. 이는 마치 천재적인 에세이를 썼지만 정작 이름 쓰는 칸을 깜빡하여 0점 처리를 받는 학생과 같습니다.
이 논문은 독일(FAU) 팀이 정확히 이 문제를 해결하기 위해 ImageCLEF 2026이라는 대회에 참가하며 겪은 이야기를 들려줍니다. 그들은 단순히 더 똑똑한 뇌를 만든 것이 아니라, 더 엄격한 선생님을 만들었습니다. 그들의 주요 발견은 컴퓨터에게 어떻게 답하도록 요청하느냐가 컴퓨터 자체만큼 중요하다는 것이었습니다. 그들은 객관식 질문의 경우, 컴퓨터가 답을 "쓰게" 하는 대신 심판처럼 옵션의 점수를 매기게 하는 것이 더 낫다는 것을 발견했습니다. 주관식 질문의 경우, 컴퓨터가 생각을 밖으로 내뱉지 않도록 강제하고 최종 결과를 제출하기 전에 모든 과정을 간결하고 깨끗하게 다듬어야 한다는 것을 배웠습니다. 또한, 이미지의 텍스트를 참조 시트로 제공하는 것(OCR)이나 새로운 것을 가르치는 것(파인튜닝) 같은 인기 있는 기술들을 시도해 보았지만, 놀랍게도 이러한 기술들은 오히려 컴퓨터의 성능을 떨어뜨렸습니다. 엄격한 규칙과 답변 정리에 집중함으로써, 그들의 시스템은 리더보드 상위권으로 올라갔으며, 이는 약간의 엔지니어링 규율이 강력하지만 무질서한 AI를 신뢰할 수 있는 시험 응시자로 바꿀 수 있음을 증명했습니다.
도전 과제: 시각적 시험
대회에는 두 가지 주요 유형의 질문이 있었습니다. 첫 번째는 **시각적 객관식(Visual MCQ)**이었습니다. 불가리아어로 된 생물학 문제에 데이터 표와 A부터 E까지의 다섯 가지 선택지가 있는 상황을 상상해 보세요. 컴퓨터는 올바른 알파벳을 골라야 합니다. 두 번째는 **시각적 주관식 답변(Visual OpenQA)**이었습니다. 여기에는 선택지가 없습니다. 컴퓨터는 도표(예: 경제 차트)를 보고 질문과 동일한 언어로 짧고 직접적인 답을 작성해야 합니다.
까다로운 점은 이 이미지들이 "밀도 높은" 정보로 가득 차 있다는 것입니다. 단순히 고양이 사진이 아니라, 공식, 단위, 작은 글씨들이 포함된 과학 논문의 페이지들입니다. 만약 컴퓨터가 레이아웃 때문에 혼란을 겪거나, 숫자만 필요한 곳에 긴 설명을 늘어놓는다면 점수를 잃게 됩니다.
전략: "쓰지 말고 점수를 매겨라" 기술
객관식 부분에서 팀은 컴퓨터가 "정답은 A입니다 because..."와 같은 문장을 쓰게 두는 것이 위험하다는 것을 깨달았습니다. 컴퓨터가 정답 알파벳은 맞혔더라도 너무 많은 부연 설명을 붙여 채점 시스템을 혼란스럽게 할 수 있기 때문입니다.
대신, 그들은 게임의 규칙을 바꿨습니다. 컴퓨터에게 옵션 A, B, C, D, E를 보고 각 옵션이 정답일 확률에 따라 단순히 "점수"를 매기라고 요청했습니다. 이는 마치 스포츠 심판이 체조 선수의 연기에 대해 문단을 쓰는 대신 9.5점을 주는 것과 같습니다. 컴퓨터는 텍스트를 생성할 필요 없이, 어떤 알파벳이 가장 높은 점수를 가졌는지만 계산하면 되었습니다. 이 방식은 답변을 매우 깔끔하게 만들고 결합하기 쉽게 해주었습니다. 만약 세 개의 서로 다른 컴퓨터 뇌로 테스트를 실행했다면, 세 모델의 점수를 가져와 평균을 낸 뒤 승자를 뽑을 수 있었습니다. 이 "점수 융합(score fusion)" 덕분에 그들은 0.7108이라는 매우 높은 정확도를 기록하며 전체 3위를 차지했습니다.
정리 팀: 수다스러운 AI 길들이기
주관식 질문의 경우 문제는 정반대였습니다. 컴퓨터들이 너무 수다스러웠습니다. 그들은 추론 과정을 설명하거나, "답은 다음과 같습니다"라고 말하거나, <answer>와 같은 화려한 XML 태그를 사용하는 것을 좋아했습니다. 하지만 채점 시스템은 오직 순수한 정답만을 원했습니다.
팀은 이를 엄격한 편집자처럼 다루었습니다. 그들은 컴퓨터에게 "생각을 밖으로 내뱉지 마세요. 그냥 답만 주세요"라고 지시하는 "간결한 프롬프트(concise prompt)"를 사용했습니다. 그런 다음, 답변을 "정리 팀(cleanup crew, 일련의 규칙들)"에 통과시켜 추가적인 단어, 추론 흔적, 또는 서식 오류를 모두 삭제했습니다. 또한 여러 모델의 답변을 결합하기도 했습니다. 만약 한 모델은 "50 kg"라고 하고 다른 모델은 "50 kilograms"라고 한다면, 시스템은 이들이 동일한 것임을 파악하고 최선의 답을 선택했습니다. 이러한 세심한 정제와 결합 과정을 통해 그들은 COMET이라는 지표로 측정된 0.6488의 점수로 주관식 카테고리에서 1위를 차지했습니다.
놀라운 "하지 말아야 할 것들": 효과가 없었던 것들
팀은 많은 사람들이 도움이 될 것이라고 생각하지만, 실제로는 점수를 떨어뜨린 두 가지 시도를 했습니다.
- 참조 시트 (OCR): 그들은 컴퓨터가 텍스트를 더 잘 읽을 수 있도록 이미지의 텍스트 전사본(OCR 도구 사용)을 제공해 보았습니다. 하지만 이는 역효과를 냈습니다. 전사본에는 오타, 깨진 공식, 혹은 잘못된 단어 순서가 포함되어 있었습니다. 이는 마치 학생에게 오류가 가득한 참조 시트를 주는 것과 같았으며, 컴퓨터를 이미지 자체보다 더 혼란스럽게 만들었습니다.
- 속성 강좌 (파인튜닝): 그들은 LoRA 파인튜닝 방식을 사용하여 컴퓨터에게 시험 문제들을 구체적으로 "가르치려" 했습니다. 이를 통해 컴퓨터를 전문가로 만들 수 있을 것이라 생각했습니다. 그러나 결과는 오히려 성능을 악화시켰습니다. 논문은 컴퓨터가 이미 이미지를 읽을 만큼 충분히 똑똑하며, 작고 지저분한 데이터셋으로 다시 훈련시키는 것이 오히려 타고난 능력을 망가뜨렸다고 시사합니다.
핵심 교훈
이 논문의 큰 교훈은 새로운 초지능 뇌를 발명하는 것에 관한 것이 아닙니다. 그것은 바로 추론 엔지니어링(inference engineering), 즉 "컴퓨터에게 일을 어떻게 시킬 것인가"에 관한 것입니다. 저자들은 강력한 컴퓨터 모델이라도 엄격한 규칙, 깨끗한 입력, 그리고 좋은 정리 프로세스가 주어졌을 때, 무질서하게 방치된 약간 더 똑똑한 모델보다 뛰어난 성능을 낼 수 있다는 것을 발견했습니다.
그들은 항상 AI를 더 크게 만들거나 더 세게 훈련시켜야 하는 것은 아니라는 점을 보여주었습니다. 때로는 그저 입을 다물라고 말하고, 올바른 알파벳을 고르게 하며, 깨끗한 답안지를 제출하게 하는 것이 필요합니다. 이러한 실질적인 디테일에 집중함으로써, 그들은 강력하지만 무질서한 시각-언어 모델을 신뢰할 수 있는 경쟁 우승자로 탈바꿈시켰으며, 때로는 문제를 해결하는 가장 좋은 방법이 엔진을 업그레이드하는 것이 아니라 출력을 관리하는 것임을 증명했습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.