Distilling Answer Set Programming Theories from Large Language Models
이 논문은 시각적 질의응답 작업을 위해 한 시간 이내에 완전하고 정확한 답변 집합 프로그래밍(Answer Set Programming) 이론을 자율적으로 추출하는 대규모 언어 모델의 능력을 조사하며, Claude Sonnet 4.6, Claude Opus 4.7, DeepSeek V4 Pro와 같은 프런티어 모델들은 여러 벤치마크에서 완벽에 가까운 정확도를 달anim는 반면, GPT-5는 상당한 성능 변동성과 참조 데이터에 대한 민감성을 보인다는 점을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
컴퓨터가 매우 서로 다른 두 가지 일을 아주 잘하는 세상을 상상해 보십시오. 한편으로, 컴퓨터는 엄격한 규칙을 따라 논리 퍼즐을 풀 수 있는 초고속 계산기 같지만, 무질서하고 모호한 주변 세상을 이해하는 데는 서툽니다. 다른 한편으로는, 거의 모든 것을 읽고 시를 쓸 수 있는 천재적이고 창의적인 이야기꾼 같지만, 엄격한 지침을 따르라는 요청을 받으면 사실을 지어내거나 길을 잃곤 합니다. 과학자들은 이 두 가지 기술의 결합을 "뉴로심볼릭(neurosymbolic)" 컴퓨팅이라고 부릅니다. 이것은 마치 시인의 상상력과 수학자의 정밀함을 모두 갖춘 로봇을 만드는 것과 같습니다. 연구자들이 던지는 큰 질문은 이것입니다. "거대 언어 모델(LLM)이 스스로 엄격한 규칙집을 처음부터 작성하도록 가르쳐서, 인간이 일일이 규칙을 손으로 쓰지 않고도 복잡한 퍼즐을 풀게 할 수 있을까?" 이는 규칙집을 쓰는 작업이 느리고 지루하며 정확하게 수행하기 어렵기 때문에 중요합니다. 하지만 컴퓨터가 이를 할 수 있다면, 기계가 세상을 추론하는 새로운 방식을 열 수 있을 것입니다.
이 논문에서 한 연구팀은 거대 언어 모델이 '시각적 질의응답(VQA)'이라는 비디오 게임 같은 퍼즐을 위한 완전한 "규칙집"을 작성하는 지치지 않는 도제로 기능할 수 있는지 확인하고자 했습니다. VQA는 컴퓨터에게 어떤 장면의 사진을 보여주고 "노란색 프리스비가 사람의 왼쪽에 있습니까?"라고 묻는 것을 상정한 것입니다. 이에 답하기 위해 컴퓨터는 사진을 이해하고, 질문을 분해한 다음, 논리적 검사를 실행해야 합니다. 연구진은 컴퓨터에게 빈 파일과 도구 세트를 주었는데, 여기에는 규칙이 타당한지 확인하는 엄격한 심판인 "솔버(solver)"가 포함되었습니다. 컴퓨터의 임무는 몇 개의 연습 예제를 읽고, 규칙을 작성하고, 심판에게 검사를 요청하고, 어디서 실패했는지 확인한 뒤, 규칙을 다시 쓰는 것이었습니다. 컴퓨터에게는 이 과정을 최대한 잘 해낼 때까지 반복할 수 있는 한 시간이 주어졌습니다.
연구진은 이를 세 가지 다른 "퍼즐 레벨"에서 테스트했습니다: CLEVR(단순하고 컴퓨터로 생성된 도형), GQA(많은 물체가 포함된 실제 사진), 그리고 CLEVRER(인과 관계를 포함한 짧은 영상). 이들은 최신형의 강력한 "프런티어" 모델부터 작고 오래된 모델에 이르기까지 아홉 가지의 서로 다른 컴퓨터 모델을 사용했습니다. 결과는 놀라운 성공과 놀라운 실패가 섞여 있었습니다. 상위 4개 모델 중 3개가 이 게임의 달인이 되었습니다. 단순한 CLEVR 퍼즐에서 이들은 100%의 완벽한 점수에 도달했습니다. 더 어려운 GQA 퍼즐에서는 92.8%에서 98.8% 사이의 점수를 기록했는데, 이는 해당 데이터셋에 대해 존재하는 최고의 인간 작성 규칙집보다도 뛰어난 성적입니다. 영상 퍼즐(CLEVRER)에서는 92.7%에서 95.3% 사이의 점수를 기록했습니다.
하지만 모든 모델이 성공한 것은 아니었습니다. 가장 유명한 모델 중 하나인 GPT-5는 단순한 퍼즐에서는 훌륭한 성적(98.7%)을 냈지만, 실제 사진 퍼즐에서는 41.8%로 급락하며 무너졌습니다. 연구진은 이것이 모델이 추론을 못 해서가 아니라, 모델이 모든 유형의 질문을 커버할 만큼 충분한 규칙을 작성하지 않았기 때문이라는 것을 발견했습니다. 연구진이 모델들에게 도움을 주기 위해 "치트 시트"(다른 퍼즐 유형에서 가져온 참조 규칙집)를 제공했을 때, 상위 모델들은 거의 비슷한 수준을 유지했지만, GPT-5는 오히려 성적이 나빠졌습니다. 이는 치트 시트를 보는 것이 모델을 산만하게 만들거나 메모리를 소모했을 가능성을 시사합니다. 작고 덜 강력한 모델들은 작동하는 규칙을 거의 작성하지 못했으며, 종종 막히거나 심판이 이해할 수 없는 규칙을 작성하곤 했습니다.
이 연구는 적절한 설정이 뒷받항된다면, 컴퓨터가 실제로 스스로 높은 품질의 논리 규칙집을 처음부터 학습하여 작성할 수 있으며, 여러 벤치마크에서 인간의 성능에 도달하거나 심지어 능가할 수 있음을 보여줍니다. 그러나 이는 능력이 보장되는 것은 아니며, 사용되는 특정 모델에 크게 의존한다는 점 또한 시사합니다. 때로는 모델에게 더 많은 정보(예: 참조서)를 주는 것이 오히려 혼란을 줄 수도 있습니다. 연구진은 이 "뉴로심볼릭" 도제 시스템을 개선할 수 있도록 모든 코드와 컴퓨터가 작성한 규칙집을 공개하며 다른 이들의 참여를 권고했습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.