HABIB_TAZ at SemEval-2026 Task 11: Disentangling Formal Logic from Content via Synthetic Training and Multi-Objective Optimization
HABIB_TAZ 시스템은 여러 언어에 걸쳐 형식 논리와 내용 편향을 효과적으로 분리하기 위해 합성 삼단논법 데이터로 학습된 mDeBERTa-v3 모델과 다목적 최적화를 활용함으로써 SemEval-2026 Task 11에서 상위 순위를 달성했습니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 아주 똑똑한 로봇에게 논리 퍼즐을 푸는 법을 가르치고 있다고 상상해 보세요. 당신은 다음과 같은 규칙을 줍니다: "만약 모든 새가 날 수 있다면, 그리고 펭귄은 새라면, 펭귄은 날 수 있다." 인간이라면 잠시 멈춰서 이렇게 말할 것입니다. "잠깐, 펭귄은 날 수 없어! 이 규칙은 현실 세계에서 틀렸어." 하지만 '상식'에 너무 의존하는 로봇은 혼란에 빠질 수 있습니다. 로봇은 "오, 펭귄은 새이고, 새는 날 수 있으니, 결론은 반드시 참이어야 해"라고 생각할 수도 있습니다. 비록 시작된 규칙 자체가 틀렸음에도 불구하고 말입니다. 이것이 바로 과학자들이 거대 언어 모델(LLM)을 통해 해결하려고 노력 중인 까다로운 문제입니다. LLMs은 챗봇과 검색 엔진의 뒤를 받치는 강력한 AI 두뇌입니다. 이들은 이야기를 쓰고 질문에 답하는 데는 놀라운 능력을 보여주지만, '무엇이 논리적으로 참인가'와 '무엇이 그럴듯하게 들리는가'를 구분하는 데는 종종 어려움을 겪습니다. 이들은 단어의 실제 세계적 의미가 논증의 실제 구조를 방해하는 '내용 효과(content effects)'에 속아 넘어가곤 합니다. 이 연구의 목표는 AI가 엄격한 논리학자처럼 행동하도록 만드는 것입니다. 즉, 이야기가 우스꽝스럽거나 상식적이든 상관없이, 그 논증의 수학적 구조가 제대로 작동하는지 확인하는 것입니다.
이 프로젝트의 팀인 HABIB_TAZ는 바로 이 능력을 테스트하기 위해 SemEval-2026 Task 11라는 경진대회에 참가했습니다. 그들의 임무는 12개 언어로 된 삼단논법(두 개의 전제와 하나의 결론으로 이루어진 논리적 논증의 일종)을 보고, 전제가 엉터리이거나 방해되는 문장이 섞여 있더라도 결론이 규칙을 따르는지 판단하는 시스템을 만드는 것이었습니다.
이를 해결하기 위해 연구진은 단순히 AI에게 더 많은 현실 세계의 데이터를 입력한 것이 아닙니다. 대신, 그들은 '합성(synthetic)' 훈련장을 구축했습니다. 상상해 보세요, 그들이 엄격하고 가공의 규칙을 사용하고 실제 동물이나 사물 대신 헛소리 단어들을 사용하여 수백만 개의 논리 퍼즐을 생성하는 거대한 공장을 만든 것을 말이죠. 이는 AI가 현실 세계의 지식에 기반한 지름길을 학습하는 것을 막기 위함이었습니다. 그런 다음, 그들은 강력한 언어 엔진인 mDeBERTa-v3를 기반으로 한 AI 모델을 특별한 3단계 훈련 레시피를 사용하여 훈련시켰습니다. 첫째, 모델이 더 어렵고 까다로운 예시들을 무시하지 않도록 하는 기술을 사용했습니다. 둘째, '편향 페널티(bias penalty)'를 추가했는데, 이는 마치 학생이 이야기가 얼마나 '그럴듯한지'에 의해 주의가 분산될 때마다 선생님이 부드럽게 꾸짖어, 학생이 오직 논리에만 집중하도록 강제하는 것과 같습니다. 셋째, 복잡한 문장이 단순한 문장과 동일한 논리적 의미를 갖는다는 것을 모델이 이해하도록 일관성 검사를 사용했습니다.
결과는 완벽한 점수와 흥미로운 과제들이 섞여 있었습니다. 더 단순한 작업들—영어 전용 퍼즐, 방해 문장이 포함된 영어 퍼즐, 그리고 방해 문장이 없는 12개 언어의 퍼즐—에서 그들의 시스템은 완벽한 100.0점을 기록했습니다. 시스템은 '현실 세계'의 속임수를 완전히 무시하고 매번 논리를 정확히 맞혔으며, 편향도 전혀 없었습니다. 그러나 가장 어려운 과제는 AI가 12개 언어를 다루면서 동시에 방해 문장까지 처리해야 하는 '노이지 멀티링구얼(Noisy Multilingual)' 작업이었습니다. 여기서 시스템은 6위를 차지했습니다. 89.06%의 정답률을 보였으나, 여전히 약간의 편향(2.89%)을 나타냈습니다.
연구진은 자신들의 특별한 훈련 레시피가 더 쉬운 작업들에서 놀라운 효과를 발휘했다는 것을 발견했습니다. 즉, 현실의 지저치 않은 텍스트 대신 합성된 규칙 기반 데이터를 통해 훈련한다면 AI를 순수한 논리학자로 가르칠 수 있다는 것을 증명한 것입니다. 가장 어려운 작업의 경우, 모델이 영어 번역본보다 원래의 다국어 데이터에서 더 어려움을 겪는다는 것을 발견했는데, 이는 모델이 다양한 언어를 처리하는 방식이 아직 불안정하다는 것을 시사합니다. 또한, 특정 '일관성' 검사(KL-Divergence 사용)를 추가하는 것이 모델이 다양한 언어 전반에서 안정성을 유지하는 데 도움이 된다는 것을 발견했지만, 이를 실행하는 데는 많은 컴퓨터 자원이 필요했습니다. 궁극적으로, 이 논문은 우리가 매우 뛰어난 순수 논리 AI를 구축할 수는 있지만, 모든 언어와 모든 유형의 노이즈에 대해 견고하게 만드는 것은 여전히 진행 중인 과제임을 시사합니다. 팀은 다른 이들이 더 나은, 더 논리적인 AI를 구축하는 데 사용할 수 있도록 자신들의 코드와 데이터 생성 도구를 공개했습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.