← 최신 논문
💬 NLP

UFAL-CUNI at SemEval-2026 Task 11: An Efficient Modular Neuro-symbolic Method for Syllogistic Reasoning

UFAL-CUNI 팀은 실증적 추론에서 경쟁력 있는 정확도를 달성하고 제로샷 베이스라인을 능가하면서도 소규모 모델의 다국어 능력에 한계가 있음을 드러내는 40 억 파라미터 LLM 파서와 심볼릭 정리 증명기를 결합한 효율적인 모듈형 신경-상징 시스템을 SemEval-2026 태스크 11 을 위해 제시합니다.

원저자: Ivan Kartáč, Kristýna Onderková, Jan Bronec, Zdeněk Kasner, Mateusz Lango, Ondřej Dušek

게시일 2026-05-07
📖 3 분 읽기☕ 가벼운 읽기

원저자: Ivan Kartáč, Kristýna Onderková, Jan Bronec, Zdeněk Kasner, Mateusz Lango, Ondřej Dušek

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 똑똑하지만 약간 산만한 학생 (대형 언어 모델) 이 삼단논법이라고 불리는 논리 퍼즐을 푸는 법을 가르치려 한다고 상상해 보세요. 이러한 퍼즐은 다음과 같습니다:

  • 전제 1: 모든 고양이는 동물이다.
  • 전제 2: 일부 동물은 폭신하다.
  • 결론: 따라서 일부 고양이는 폭신하다.

문제는 이 학생이 나쁜 버릇을 가지고 있다는 점입니다. 그들은 현실 세계의 지식이 방해가 되게 합니다. 퍼즐이 "모든 고양이는 폭신하다"고 말하면, 학생은 퍼즐의 논리가 실제로 그 결론을 지지하지 않더라도 고양이가 폭신하다는 사실을 알고 있다는 이유만으로 "참"이라고 말할 수 있습니다. 이를 **"내용 효과 (content effect)"**라고 합니다. 학생은 퍼즐의 규칙이 말하는 것이 아니라, 그들이 진실이라고 생각하는 것에 의해 편향됩니다.

이 논문의 저자들은 이를 수정하기 위해 특별한 "튜터링 시스템"을 구축했습니다. 그들의 시스템이 어떻게 작동하는지 간단히 설명하면 다음과 같습니다:

1. 번역기 (이중 언어 통역사)

먼저, 퍼즐이 포르투갈어나 러시아어와 같은 외국어로 되어 있다면, 시스템은 대형 언어 모델을 사용하여 이를 영어로 번역합니다. 이는 논리 게임이 시작되기 전에 모두가 같은 언어를 말하도록 보장하는 통역사와 같습니다.

2. 표기법 전문가 (LaTeX 작성자)

이것이 시스템의 교묘한 트릭입니다. 시스템은 학생에게 퍼즐을 직접 풀도록 요청하는 대신, **1 차 논리 (FOL)**라는 특정 "코드"로 문장을 다시 쓰도록 요청합니다. 이는 LaTeX 형식으로 작성되며 (수학 공식처럼 보입니다).

  • 왜 LaTeX 일까요? 저자들은 학생에게 컴퓨터의 "모국어" (Prover9 구문) 로 직접 쓰도록 요청하는 것은 인간에게 이진 코드로 말하도록 요청하는 것과 같다고 깨달았습니다. 이는 너무 많은 실수를 초래했습니다.
  • 비유: 이는 학생에게 계산기에 직접 입력하는 대신, 먼저 표준 기호 (\forall, \exists, \rightarrow) 를 사용하여 화이트보드에 수학 문제를 쓰도록 요청하는 것과 같습니다. 학생은 훈련 데이터에서 본 적이 있기 때문에 "화이트보드" 버전을 작성하는 데 훨씬 능숙합니다.

3. 번역기 (코드 변환기)

학생이 논리를 "화이트보드" (LaTeX) 형식으로 작성하면, 간단한 컴퓨터 스크립트 ("트랜스파일러") 가 엄격한 편집자처럼 작동합니다. 이는 깔끔한 LaTeX 코드를 증명 실행에 필요한 특정이고 엄격한 코드 (Prover9 구문) 로 즉시 변환합니다. 이 단계는 순전히 기계적이며 "산만한" 학생이 관여하지 않으므로 실수를 거의 하지 않습니다.

4. 심판자 (자동 증명기)

마지막으로, 시스템은 그 엄격한 코드를 정리 증명기 (Prover9 라는 소프트웨어) 에게 넘깁니다. 이는 감정이나 현실 세계의 지식이 전혀 없는 로봇 심판자입니다. 고양이가 폭신한지, 달이 치즈로 만들어졌는지에 관심이 없습니다. 오직 확인하는 것은 다음과 같습니다: 결론이 전제에서 수학적으로 도출되는가? 수학이 맞으면 "유효 (Valid)"라고 말합니다. 그렇지 않으면 "무효 (Invalid)"라고 말합니다.

5. 탐정 (중요한 단서 찾기)

불필요한 문장이 섞여 있는 더 어려운 퍼즐의 경우, 시스템은 "탐욕 알고리즘"을 사용합니다. 이는 한 번에 하나의 단서를 제거해 보는 탐정처럼 행동합니다. 특정 단서가 없어도 퍼즐이 여전히 의미가 있다면, 그 단서는 관련이 없습니다. 퍼즐이 무너지면 그 단서는 필수적이었습니다. 이를 통해 시스템은 실제로 중요한 사실에만 집중하도록 보장합니다.

그들은 무엇을 발견했는가?

  • 작은 것이 아름답다: 그들은 "학생" 부분에 상대적으로 작은 AI 모델 (40 억 개의 매개변수) 을 사용했습니다. 작은 모델들은 일반적으로 복잡한 논리에 어려움을 겪지만, 이 시스템은 실제 추론을 로봇 심판자에게 위임함으로써 그들을 매우 훌륭하게 만들었습니다.
  • 편향을 이기는 것: AI 에게 먼저 논리로 번역하게 한 다음 로봇이 결과를 심판하게 함으로써, 그들은 AI 가 현실 세계의 사실에 의해 편향되는 것을 성공적으로 막았습니다. "내용 효과"가 크게 감소했습니다.
  • 지표의 문제: 이 논문은 또한 경쟁의 점수 매기기 방식에 결함이 있음을 지적합니다. 점수 매기기 시스템이 너무 민감하여 아주 작고 무작위적인 실수조차 팀의 점수를 떨어뜨릴 수 있어, 시스템이 정말로 "훌륭한" 것인지 아니면 단순히 "운이 좋은" 것인지 구분하기 어렵게 만들었습니다.

결론

이 논문은 논리 퍼즐을 풀기 위해 거대하고 초지능적인 AI 가 필요하지 않음을 보여줍니다. 대신, 작은 AI 를 번역기로 사용하여 인간 언어를 수학으로 변환한 다음, 바보 같지만 완벽한 로봇에게 실제 사고를 맡기면 됩니다. 이 조합은 AI 가 세계에 대해 "알고 있는" 것에 의해 산만해지는 것을 막고, 논리 규칙에 엄격하게 충실하도록 강제합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →